跳到正文
AI 图鉴

图像分割

给每个像素标上它属于哪个物体

视觉理解入门 #13
输入图像图像

这项能力指什么

输入一张图像,输出与原图同尺寸的掩膜,逐像素标明它属于哪一类或哪一个实例。它比检测更细,给出的是轮廓而非方框。语义分割只区分类别(都是「人」),实例分割还要区分个体(甲和乙是两个不同的人),二者常被统称为分割。

技术上如何做到

经典做法是编码器-解码器:编码器逐层下采样提取语义,解码器逐层上采样恢复分辨率,并用跳跃连接把浅层的高分辨率细节引回来,U-Net 与全卷积网络是代表。实例分割常先检测再在框内预测掩膜(Mask R-CNN 一路),或用可提示的分割模型(如 SAM)通过点或框提示分割任意物体。

代表产品

4

相关机构

典型用途

  • 医学影像的器官与病灶勾画
  • 遥感的地物分类
  • 自动驾驶的可行驶区域与障碍物
  • 图像编辑中的选区生成

怎么评价它好不好

IoU / mIoU
预测掩膜与真值的交并比,按类平均
Dice 系数
医学影像常用,对小目标比 IoU 更敏感
边界 F 值
只看轮廓贴合度,不奖励内部大面积正确

边界与难点

  • 细长结构与边界(发丝、电线、血管末端)常常断裂或丢细
  • 同类实例相互贴近或重叠时会粘连成一整块
  • 透明、反光与低对比度材质下掩膜边界不准确

背后的概念