跳到正文
AI 图鉴
01 数学与统计基础进阶本域第 5 篇

贝叶斯定理

先相信一点,看到证据,再修正一点——这就是贝叶斯

定义

贝叶斯定理给出一个精确的更新规则:把“看到数据之前对某假设的相信程度”(先验)与“该假设下这条数据出现的可能性”(似然)相乘,再归一化,就得到“看到数据之后”的相信程度(后验)。它把概率解释为可随证据调整的信念,而不只是长期频率。

直观理解

一种罕见病在人群中发病率是千分之一。检测很准:患病者 99% 呈阳性,健康者仅有 1% 误报阳性。你检测呈阳性——真患病的概率其实只有约 9%。原因很朴素:健康人基数太大,他们那 1% 的误报,数量上压过了患病者的真阳性。直觉被基础率打败,这正是贝叶斯定理要纠正的错觉。

图 1

把 1000 人按“是否患病—检测结果”展开:阳性总数里,绝大多数来自健康人的误报——这就是基础率谬误的算术

1000 人1000 人患病 0.1%(1 人)患病 0.1%(1 人)阳性 99%(约 0.99 人)阳性 99%(约 0.99 人…阴性 1%(约 0.01 人)阴性 1%(约 0.01 人)健康 99.9%(999 人)健康 99.9%(999 人…阳性 1%(约 9.99 人)阳性 1%(约 9.99 人)阴性 99%(约 989 人)阴性 99%(约 989 人)
图 2

同一份准确率 99% 的检测,在不同基础率下结论截然不同:阳性后的患病概率由先验主导

  • 检测前(先验)
  • 阳性后(后验)

工作原理

  1. 01

    先验:看到数据之前你相信什么

    先验 P(H) 是你在看数据之前对假设 H 的相信程度。它可能来自历史统计、领域知识,也可能只是建模者的主观判断——贝叶斯的诚实之处,就是把这份主观假设摆到台面上,而不是藏着。

  2. 02

    似然:每种假设下这条数据有多常见

    似然 P(E|H) 问的是“假如 H 为真,看到证据 E 有多常见”。注意它与 P(H|E) 方向相反:患病者里 99% 阳性(似然),并不等于阳性者里 99% 患病(后验)。混淆这两者,是绝大多数推理错误的根源。

  3. 03

    后验:按证据加权后的新信念

    后验 P(H|E) = P(E|H)·P(H) / P(E),其中分母 P(E) 是在所有假设下证据出现的总概率,起归一化作用,保证更新后的信念仍然是一组合法的概率。

  4. 04

    序贯更新:今天的后验成为明天的先验

    多份证据可以逐条吸收:把这一次的后验当作下一次的先验,效果与一次性用上全部证据相同。这让贝叶斯特别适合在线学习。朴素贝叶斯分类器正是把“条件独立”的简化假设套进这个框架,以极低的成本完成垃圾邮件过滤。

关键公式

P(H | E) = P(E | H) · P(H) / P(E)
H 为假设,E 为证据。先验 P(H) 乘以似然 P(E|H),再除以证据 P(E) 归一化,即得后验。
图 4

连续多次阳性检测下信念的序贯更新:每多一次阳性,患病后验就乘以同一个似然比,迅速趋近确定

  • 患病的概率
  • 健康的概率

应用场景

  • 垃圾邮件过滤:朴素贝叶斯按词的出现逐条更新“这封是垃圾邮件”的概率
  • 医疗诊断:把患病率(先验)与检测灵敏度和特异度(似然)结合,解读阳性结果
  • A/B 测试与贝叶斯优化:用后验分布指导下一次实验把资源投在哪里
  • 在线学习与校准:每来一条数据就微调信念,同时给出不确定性的度量

常见误区

  • 忽视基础率。只盯着似然(“检测准确率 99%”)而忘了先验,就会把罕见病的阳性结果误读成 99% 患病——这是最普遍、也最昂贵的推理错误。
  • 对先验敏感。数据很少时,先验的选择会显著影响后验;先验越强,需要越多的证据才能把它推翻。
  • 后验不等于因果。贝叶斯更新的是“你的信念”,不是世界本身;它说明在现有假设下该怎么相信,而不说明世界为何如此。

关键术语

先验
看到数据之前对假设的相信程度
似然
假设为真时,观测到这份数据的概率
后验
结合证据更新后的相信程度
证据
所有假设下数据出现的总概率,起归一化作用

延伸阅读