跳到正文
AI 图鉴

异常检测

在海量正常数据里挑出不对劲的那几条

数据与文档进阶 #40
输入表格文本

这项能力指什么

输入数据记录或时间序列,输出每条记录偏离常态的程度或是否告警。它通常在有标注异常很少、甚至完全没有标注的情况下工作,靠对「正常」建模、把偏离者判为异常。与「文本分类」的区别是异常类别不固定,训练时常常根本不知道异常长什么样。

技术上如何做到

无监督路线对正常数据建模:自编码器重建误差大者为异常,孤立森林按随机切分把易被孤立的点视作异常,统计方法则拟合分布再算低概率点。时间序列场景常用预测式方法,把实际值与预测值的残差作为异常分数。有少量标注时改用半监督或对比学习,并用代价敏感阈值来控制漏报与误报的平衡。

代表产品

3

相关机构

典型用途

  • 设备与产线的故障预警
  • 金融交易与洗钱的异常识别
  • 网络入侵与异常流量监测
  • 质量抽检与数据录入纠错

怎么评价它好不好

AUROC
与阈值无关的排序质量,在极不平衡数据上仍可用
PR-AUC
异常极稀少时比 AUROC 更能反映实用水平
检测延迟
从异常发生到告警之间的时间,实时场景的关键指标

边界与难点

  • 异常样本极少,阈值一变误报率就陡增,运维人员很快对告警麻木
  • 概念漂移使原本正常的行为被判为异常,季节性与业务变化需要持续再校准
  • 高维与强相关特征下基于距离的度量失效,正常点之间的距离差异被稀释

背后的概念