跳到正文
AI 图鉴

信息抽取与命名实体识别

从自由文本里挑出人名、地点与关系

语言与知识进阶 #06
输入文本文本

这项能力指什么

输入一段自然语言文本,输出结构化的片段:带类型的实体(人名、机构、时间、金额)以及它们之间的关系或事件。它与「文本分类」的区别是不给出整体标签,而是逐段定位;与「结构化输出」的区别是抽取对象由文本本身决定,而不是由外部 schema 指定全部字段。

技术上如何做到

早期用条件随机场或基于规则的序列标注,按 BIO 方案逐 token 打标签;此后预训练编码器加序列标注头成为常态。关系与事件抽取常建模为「实体对分类」或生成式抽取,直接输出三元组。近年更常见的是让大模型按给定 schema 做少样本或零样本抽取,免去逐类标注。

代表产品

5

相关机构

典型用途

  • 合同与财报中的条款、金额抽取
  • 简历解析与人才库构建
  • 医疗病历中的药物与症状识别
  • 新闻事件与知识图谱构建

怎么评价它好不好

实体级 F1
边界与类型同时正确才算命中
关系 F1
三元组(头、关系、尾)完全匹配的比例
精确匹配率
整条记录字段全部正确的比例

边界与难点

  • 嵌套与重叠实体(机构名中再含地名)在按 token 标注的方案里会被压平
  • 跨句指代难处理,代词与前文实体的绑定常出错
  • 领域术语与新词缺乏标注,模型会漏掉训练中没见过的类型

背后的概念