跳到正文
AI 图鉴

图像分类

判断这张图整体属于哪一类

视觉理解入门 #11
输入图像文本

这项能力指什么

输入一张图像,输出一个类别标签或各类别的概率。它给出的是整张图的判断,不给位置信息,这是它与「目标检测」和「分割」的分界。类别集合在训练时固定,常见的有上千类通用分类,也有细到某个物种或缺陷类型的专用分类。

技术上如何做到

卷积网络曾长期主导,残差连接让网络第一次能稳定地做深,是这一任务的转折点。做法是把图像缩成固定尺寸,逐层提取特征,最后接分类头输出概率。近年视觉 Transformer 用切块加注意力取代卷积,在大规模预训练下表现相当;自监督预训练也让标注很少时仍能拿到较好结果。

代表产品

4

相关机构

典型用途

  • 商品与图片的自动归类
  • 医学影像的病变筛查
  • 工业质检的缺陷判别
  • 内容审核与安全过滤

怎么评价它好不好

Top-1 / Top-5 准确率
最高分或前五名中含正确类的比例
F1 与混淆矩阵
看清具体哪两类被互相混淆
校准误差 ECE
预测概率与实际正确率是否一致

边界与难点

  • 长尾与罕见类别样本少,模型几乎总是漏判
  • 分布外样本与细微对抗扰动会让判断大幅偏移
  • 细粒度区分(相近车型、相似鸟种)依赖纹理细节,准确率明显低于粗类

背后的概念