图像分割
给每个像素标上它属于哪个物体
视觉理解入门 #13
输入图像图像
这项能力指什么
输入一张图像,输出与原图同尺寸的掩膜,逐像素标明它属于哪一类或哪一个实例。它比检测更细,给出的是轮廓而非方框。语义分割只区分类别(都是「人」),实例分割还要区分个体(甲和乙是两个不同的人),二者常被统称为分割。
技术上如何做到
经典做法是编码器-解码器:编码器逐层下采样提取语义,解码器逐层上采样恢复分辨率,并用跳跃连接把浅层的高分辨率细节引回来,U-Net 与全卷积网络是代表。实例分割常先检测再在框内预测掩膜(Mask R-CNN 一路),或用可提示的分割模型(如 SAM)通过点或框提示分割任意物体。
代表产品
4相关机构
典型用途
- 医学影像的器官与病灶勾画
- 遥感的地物分类
- 自动驾驶的可行驶区域与障碍物
- 图像编辑中的选区生成
怎么评价它好不好
- IoU / mIoU
- 预测掩膜与真值的交并比,按类平均
- Dice 系数
- 医学影像常用,对小目标比 IoU 更敏感
- 边界 F 值
- 只看轮廓贴合度,不奖励内部大面积正确
边界与难点
- 细长结构与边界(发丝、电线、血管末端)常常断裂或丢细
- 同类实例相互贴近或重叠时会粘连成一整块
- 透明、反光与低对比度材质下掩膜边界不准确