文档解析与版面理解
把 PDF 和图档还原成有结构的数据
数据与文档进阶 #38
输入图像表格
这项能力指什么
输入一份文档(PDF 版面图像或扫描件),输出结构化的内容:段落、标题层级、表格、图表标题以及正确的阅读顺序。与「OCR」的区别是它不止转写字,还要判定「哪块是什么」以及「先读哪块」;与「信息抽取」的区别是它先恢复版面骨架,通常不针对特定字段。
技术上如何做到
流程通常是先用目标检测或分割把页面切成文本块、标题、表格、图片等区域,再分别处理:文本块做识别,表格识别行列与合并单元格结构,公式与图表单独建模。阅读顺序靠版面模型预测块之间的先后,多栏与跨栏内容需要专门排序。近年也有把整页图像交给多模态模型直接输出结构化标记的路线。
代表产品
7GPT-4o
2024OpenAI
原生多模态的通用模型,文本、图像与音频走同一个入口
模型 闭源
文本图像音频文本音频
Gemini
2023Google DeepMind
原生多模态、可处理超长上下文的通用模型
模型 闭源
文本图像音频视频文本
Claude
2023Anthropic
以长上下文与安全对齐见长的通用对话模型
模型 闭源
文本图像文本
Qwen
2023Alibaba (Qwen)
覆盖多规格、含多模态版本的开放权重模型家族
模型 开放权重
文本图像文本
ERNIE
2019Baidu
以知识增强预训练起步的中文模型,早期的代表版本
模型 闭源
文本文本
Hunyuan
2023Tencent (Hunyuan)
腾讯的通用模型家族,含开放权重版本
模型 开放权重
文本图像文本
NotebookLM
2023Google DeepMind
只用你给它的资料作答,并逐条给出出处
应用 免费增值
文本表格音频文本音频
相关机构
典型用途
- 发票、合同与申报表的字段化
- 财报与研究报告中表格提取
- 档案与卷宗的数字化整理
- 论文入库与知识库构建
怎么评价它好不好
- 版面元素 F1
- 标题、表格、正文等区域划分的正确度
- 表格 TEDS
- 表格结构树与真值的相似度,衡量行列还原
- 阅读顺序准确率
- 块序列与原文档逻辑顺序的一致程度
边界与难点
- 跨页表格与合并单元格还原困难,行列会错位或丢失层级
- 手写批注、印章与贴纸覆盖会干扰版面切分并造成漏读
- 扫描件的歪斜、透视与装订阴影会让栏与表的边界判错