跳到正文
AI 图鉴

文档解析与版面理解

把 PDF 和图档还原成有结构的数据

数据与文档进阶 #38
输入图像表格

这项能力指什么

输入一份文档(PDF 版面图像或扫描件),输出结构化的内容:段落、标题层级、表格、图表标题以及正确的阅读顺序。与「OCR」的区别是它不止转写字,还要判定「哪块是什么」以及「先读哪块」;与「信息抽取」的区别是它先恢复版面骨架,通常不针对特定字段。

技术上如何做到

流程通常是先用目标检测或分割把页面切成文本块、标题、表格、图片等区域,再分别处理:文本块做识别,表格识别行列与合并单元格结构,公式与图表单独建模。阅读顺序靠版面模型预测块之间的先后,多栏与跨栏内容需要专门排序。近年也有把整页图像交给多模态模型直接输出结构化标记的路线。

代表产品

7

相关机构

典型用途

  • 发票、合同与申报表的字段化
  • 财报与研究报告中表格提取
  • 档案与卷宗的数字化整理
  • 论文入库与知识库构建

怎么评价它好不好

版面元素 F1
标题、表格、正文等区域划分的正确度
表格 TEDS
表格结构树与真值的相似度,衡量行列还原
阅读顺序准确率
块序列与原文档逻辑顺序的一致程度

边界与难点

  • 跨页表格与合并单元格还原困难,行列会错位或丢失层级
  • 手写批注、印章与贴纸覆盖会干扰版面切分并造成漏读
  • 扫描件的歪斜、透视与装订阴影会让栏与表的边界判错

背后的概念