跳到正文
AI 图鉴

文本分类与情感分析

给一段文字贴上预设的标签

语言与知识入门 #05
输入文本文本

这项能力指什么

输入一段文本,输出它所属的类别,如情感正负、主题、意图或是否违规。标签集合在训练时就固定,因此它回答的是「属于哪一类」而不是「写了什么」。一句话可同时打多个标签(多标签),也可在标签集合上给出概率分布。

技术上如何做到

早期用词袋加线性分类器,随后基于预训练编码器(如 BERT 一路的模型)微调,成为标注数据有限时的主流。做法是在编码器顶部接一个分类头,用交叉熵训练。标签多但样本少时,可改成「句子对」式的蕴含判断,或直接用大模型按提示做零样本分类。

代表产品

5

相关机构

典型用途

  • 评论与舆情的情感极性判断
  • 垃圾邮件与违规内容过滤
  • 客服工单的主题与优先级路由
  • 用户意图识别以驱动对话

怎么评价它好不好

F1
精确率与召回率的调和平均,类别不平衡时比准确率更可信
ROC-AUC
排序质量,与阈值无关
混淆矩阵
逐类查看误判方向,定位系统性偏差

边界与难点

  • 类别极不平衡时,少数类常被整体忽略而准确率仍显得很高
  • 训练领域之外的措辞与用语漂移会让判断退化
  • 反讽、否定与双重否定容易判反,字面词恰好指向相反情感

背后的概念