文本分类与情感分析
给一段文字贴上预设的标签
语言与知识入门 #05
输入文本文本
这项能力指什么
输入一段文本,输出它所属的类别,如情感正负、主题、意图或是否违规。标签集合在训练时就固定,因此它回答的是「属于哪一类」而不是「写了什么」。一句话可同时打多个标签(多标签),也可在标签集合上给出概率分布。
技术上如何做到
早期用词袋加线性分类器,随后基于预训练编码器(如 BERT 一路的模型)微调,成为标注数据有限时的主流。做法是在编码器顶部接一个分类头,用交叉熵训练。标签多但样本少时,可改成「句子对」式的蕴含判断,或直接用大模型按提示做零样本分类。
代表产品
5相关机构
典型用途
- 评论与舆情的情感极性判断
- 垃圾邮件与违规内容过滤
- 客服工单的主题与优先级路由
- 用户意图识别以驱动对话
怎么评价它好不好
- F1
- 精确率与召回率的调和平均,类别不平衡时比准确率更可信
- ROC-AUC
- 排序质量,与阈值无关
- 混淆矩阵
- 逐类查看误判方向,定位系统性偏差
边界与难点
- 类别极不平衡时,少数类常被整体忽略而准确率仍显得很高
- 训练领域之外的措辞与用语漂移会让判断退化
- 反讽、否定与双重否定容易判反,字面词恰好指向相反情感