信息抽取与命名实体识别
从自由文本里挑出人名、地点与关系
语言与知识进阶 #06
输入文本文本
这项能力指什么
输入一段自然语言文本,输出结构化的片段:带类型的实体(人名、机构、时间、金额)以及它们之间的关系或事件。它与「文本分类」的区别是不给出整体标签,而是逐段定位;与「结构化输出」的区别是抽取对象由文本本身决定,而不是由外部 schema 指定全部字段。
技术上如何做到
早期用条件随机场或基于规则的序列标注,按 BIO 方案逐 token 打标签;此后预训练编码器加序列标注头成为常态。关系与事件抽取常建模为「实体对分类」或生成式抽取,直接输出三元组。近年更常见的是让大模型按给定 schema 做少样本或零样本抽取,免去逐类标注。
代表产品
5相关机构
典型用途
- 合同与财报中的条款、金额抽取
- 简历解析与人才库构建
- 医疗病历中的药物与症状识别
- 新闻事件与知识图谱构建
怎么评价它好不好
- 实体级 F1
- 边界与类型同时正确才算命中
- 关系 F1
- 三元组(头、关系、尾)完全匹配的比例
- 精确匹配率
- 整条记录字段全部正确的比例
边界与难点
- 嵌套与重叠实体(机构名中再含地名)在按 token 标注的方案里会被压平
- 跨句指代难处理,代词与前文实体的绑定常出错
- 领域术语与新词缺乏标注,模型会漏掉训练中没见过的类型