图像分类
判断这张图整体属于哪一类
视觉理解入门 #11
输入图像文本
这项能力指什么
输入一张图像,输出一个类别标签或各类别的概率。它给出的是整张图的判断,不给位置信息,这是它与「目标检测」和「分割」的分界。类别集合在训练时固定,常见的有上千类通用分类,也有细到某个物种或缺陷类型的专用分类。
技术上如何做到
卷积网络曾长期主导,残差连接让网络第一次能稳定地做深,是这一任务的转折点。做法是把图像缩成固定尺寸,逐层提取特征,最后接分类头输出概率。近年视觉 Transformer 用切块加注意力取代卷积,在大规模预训练下表现相当;自监督预训练也让标注很少时仍能拿到较好结果。
代表产品
4相关机构
典型用途
- 商品与图片的自动归类
- 医学影像的病变筛查
- 工业质检的缺陷判别
- 内容审核与安全过滤
怎么评价它好不好
- Top-1 / Top-5 准确率
- 最高分或前五名中含正确类的比例
- F1 与混淆矩阵
- 看清具体哪两类被互相混淆
- 校准误差 ECE
- 预测概率与实际正确率是否一致
边界与难点
- 长尾与罕见类别样本少,模型几乎总是漏判
- 分布外样本与细微对抗扰动会让判断大幅偏移
- 细粒度区分(相近车型、相似鸟种)依赖纹理细节,准确率明显低于粗类