图像理解与视觉问答
看图回答关于它的任意问题
视觉理解入门 #17
输入图像文本文本
这项能力指什么
输入一张图(可附带文字问题),输出对图像内容的自然语言描述或回答,如「图中的人在做什么」「这个场景可能发生在哪里」。它与「OCR」的区别是关注语义而非字符,与「图像分类」的区别是可以回答开放式问题而不是从固定标签里选一个。
技术上如何做到
主流是多模态大模型:用视觉编码器把图像切成图块并编码成若干视觉 token,再与文本 token 一起送入同一个 Transformer,由语言模型部分生成回答。对齐训练常用「图像-描述」配对做对比学习,随后的指令微调让它学会按问题作答。图中的小字与细节靠更高分辨率的图块切分来保留。
代表产品
9GPT-4o
2024OpenAI
原生多模态的通用模型,文本、图像与音频走同一个入口
模型 闭源
文本图像音频文本音频
Gemini
2023Google DeepMind
原生多模态、可处理超长上下文的通用模型
模型 闭源
文本图像音频视频文本
Claude
2023Anthropic
以长上下文与安全对齐见长的通用对话模型
模型 闭源
文本图像文本
Qwen
2023Alibaba (Qwen)
覆盖多规格、含多模态版本的开放权重模型家族
模型 开放权重
文本图像文本
Doubao
2023ByteDance (Seed)
字节跳动的通用对话模型与应用
模型 闭源
文本图像文本
Kimi
2023Moonshot AI
以长上下文处理见长的中文对话助手
模型 闭源
文本文本
GLM
2023Zhipu AI
以自回归填空预训练起步的中文通用模型
模型 闭源
文本文本
Gemini
2024Google DeepMind
把搜索、办公与多模态模型收进一个对话入口
应用 免费增值
文本图像音频文本图像音频
ChatGPT
2022OpenAI
把大模型变成一个人人可用的对话窗口
应用 免费增值
文本图像音频文本图像音频
相关机构
典型用途
- 无障碍与图片朗读
- 电商与二手商品的图文描述
- 工业与医疗图像的辅助判断
- 相册管理与内容检索
怎么评价它好不好
- VQA 准确率
- 在带标注的问题集上答对的比例
- 图像描述 CIDEr / SPICE
- 描述与参考答案的语义匹配程度
- 幻觉率
- 描述中出现图中并不存在物体的比例
边界与难点
- 精确计数与空间关系不可靠,数错人数、说反左右是常见错误
- 图上的小字、图表读数与密集表格容易被读错
- 模型会用常识补全图中没有的物体,把「应该有的」描述成「看到的」