异常检测
在海量正常数据里挑出不对劲的那几条
数据与文档进阶 #40
输入表格文本
这项能力指什么
输入数据记录或时间序列,输出每条记录偏离常态的程度或是否告警。它通常在有标注异常很少、甚至完全没有标注的情况下工作,靠对「正常」建模、把偏离者判为异常。与「文本分类」的区别是异常类别不固定,训练时常常根本不知道异常长什么样。
技术上如何做到
无监督路线对正常数据建模:自编码器重建误差大者为异常,孤立森林按随机切分把易被孤立的点视作异常,统计方法则拟合分布再算低概率点。时间序列场景常用预测式方法,把实际值与预测值的残差作为异常分数。有少量标注时改用半监督或对比学习,并用代价敏感阈值来控制漏报与误报的平衡。
代表产品
3相关机构
典型用途
- 设备与产线的故障预警
- 金融交易与洗钱的异常识别
- 网络入侵与异常流量监测
- 质量抽检与数据录入纠错
怎么评价它好不好
- AUROC
- 与阈值无关的排序质量,在极不平衡数据上仍可用
- PR-AUC
- 异常极稀少时比 AUROC 更能反映实用水平
- 检测延迟
- 从异常发生到告警之间的时间,实时场景的关键指标
边界与难点
- 异常样本极少,阈值一变误报率就陡增,运维人员很快对告警麻木
- 概念漂移使原本正常的行为被判为异常,季节性与业务变化需要持续再校准
- 高维与强相关特征下基于距离的度量失效,正常点之间的距离差异被稀释