目标检测
在图上框出每个物体并说出是什么
视觉理解入门 #12
输入图像表格
这项能力指什么
输入一张图像,输出一组边界框,每个框带类别标签和置信度。与「图像分类」的区别是它不满足于整图一个标签,而要逐一指出「什么在哪里」;与「分割」的区别是它只给矩形框,不给逐像素轮廓。同一张图里可以检出多个同类物体。
技术上如何做到
主流是单阶段检测器:在特征图上密布预设锚框或直接预测中心点,一次前向就同时回归框位置与类别,YOLO 一路与 SSD 属于此类,速度适合实时场景。两阶段检测器先用候选区域再逐个精分类,精度略高但更慢。训练损失同时优化定位与分类,推理末尾用非极大值抑制合并重叠框。
代表产品
4相关机构
典型用途
- 自动驾驶的车辆与行人感知
- 视频监控与周界告警
- 零售货架与库存盘点
- 遥感影像的目标普查
怎么评价它好不好
- mAP
- 各类别平均精度再平均,常按 IoU 阈值报告
- IoU
- 预测框与真值框的交并比,判定是否算命中
- 推理速度 FPS
- 实时场景里与精度同等重要的指标
边界与难点
- 遮挡、截断与极小目标的召回明显偏弱
- 密集场景中非极大值抑制会误抑制相邻物体,两个挨着的人可能只留一个
- 训练类别之外的物体要么被漏掉,要么被硬套成最像的已知类别