文字识别(OCR)
把图里的文字读成可编辑的文本
视觉理解入门 #15
输入图像文本
这项能力指什么
输入一张含文字的图像(扫描件、照片、截图),输出其中的字符序列,通常还带位置框。它是「看字」而不是「看懂内容」:输出的是转写结果,不解释含义。与「文档解析」的区别是后者还关心版面结构(表格、栏、阅读顺序),OCR 只负责把字认对。
技术上如何做到
经典流程是检测加识别两步:先用文本检测网络找出行或词的四边形框,再把每个框内的图像送进序列识别模型解码成字符。识别侧从 CNN 加循环网络再接到连接时序分类,演进到注意力解码与纯卷积/Transformer 结构。近年多模态大模型可直接端到端转写,对不规则排版的适应性更好。
代表产品
5相关机构
典型用途
- 发票、票据与证件的字段录入
- 纸质档案与书籍数字化
- 街景与车牌的文字识别
- 截图与拍照即时取字
怎么评价它好不好
- 字符错误率 CER
- 替换、删除、插入字符占真值字符的比例
- 词错误率 WER
- 以词为单位的错误率,含分词影响
- 检测 F1
- 文本区域的定位准确度
边界与难点
- 手写体与低质量扫描(模糊、倾斜、污损)的错误率显著升高
- 竖排、多语言混排与艺术字体常常漏检或错认
- 表格与公式只被读成字符流,行列结构和上下标关系会丢失