跳到正文
AI 图鉴

目标检测

在图上框出每个物体并说出是什么

视觉理解入门 #12
输入图像表格

这项能力指什么

输入一张图像,输出一组边界框,每个框带类别标签和置信度。与「图像分类」的区别是它不满足于整图一个标签,而要逐一指出「什么在哪里」;与「分割」的区别是它只给矩形框,不给逐像素轮廓。同一张图里可以检出多个同类物体。

技术上如何做到

主流是单阶段检测器:在特征图上密布预设锚框或直接预测中心点,一次前向就同时回归框位置与类别,YOLO 一路与 SSD 属于此类,速度适合实时场景。两阶段检测器先用候选区域再逐个精分类,精度略高但更慢。训练损失同时优化定位与分类,推理末尾用非极大值抑制合并重叠框。

代表产品

4

相关机构

典型用途

  • 自动驾驶的车辆与行人感知
  • 视频监控与周界告警
  • 零售货架与库存盘点
  • 遥感影像的目标普查

怎么评价它好不好

mAP
各类别平均精度再平均,常按 IoU 阈值报告
IoU
预测框与真值框的交并比,判定是否算命中
推理速度 FPS
实时场景里与精度同等重要的指标

边界与难点

  • 遮挡、截断与极小目标的召回明显偏弱
  • 密集场景中非极大值抑制会误抑制相邻物体,两个挨着的人可能只留一个
  • 训练类别之外的物体要么被漏掉,要么被硬套成最像的已知类别

背后的概念