跳到正文
AI 图鉴

图像理解与视觉问答

看图回答关于它的任意问题

视觉理解入门 #17
输入图像文本文本

这项能力指什么

输入一张图(可附带文字问题),输出对图像内容的自然语言描述或回答,如「图中的人在做什么」「这个场景可能发生在哪里」。它与「OCR」的区别是关注语义而非字符,与「图像分类」的区别是可以回答开放式问题而不是从固定标签里选一个。

技术上如何做到

主流是多模态大模型:用视觉编码器把图像切成图块并编码成若干视觉 token,再与文本 token 一起送入同一个 Transformer,由语言模型部分生成回答。对齐训练常用「图像-描述」配对做对比学习,随后的指令微调让它学会按问题作答。图中的小字与细节靠更高分辨率的图块切分来保留。

代表产品

9

相关机构

典型用途

  • 无障碍与图片朗读
  • 电商与二手商品的图文描述
  • 工业与医疗图像的辅助判断
  • 相册管理与内容检索

怎么评价它好不好

VQA 准确率
在带标注的问题集上答对的比例
图像描述 CIDEr / SPICE
描述与参考答案的语义匹配程度
幻觉率
描述中出现图中并不存在物体的比例

边界与难点

  • 精确计数与空间关系不可靠,数错人数、说反左右是常见错误
  • 图上的小字、图表读数与密集表格容易被读错
  • 模型会用常识补全图中没有的物体,把「应该有的」描述成「看到的」

背后的概念