概率与概率分布
模型从不给出“答案”,它给出的是每个可能答案的把握程度
定义
概率量化“不确定事件发生可能性”,取值在 0 与 1 之间。随机变量把随机试验的结果映射成数值,概率分布则说明这些数值各自出现的可能性有多大。机器学习把预测建模为分布:模型不去断言唯一答案,而是给出所有可能答案的概率。
直观理解
天气预报说“明天降水概率 70%”。它并没有替你决定要不要带伞——它给出的是一整套可能性及其权重。你要做的,是把带伞的麻烦与淋雨的风险按这个权重权衡。模型做的也是同一件事:它把“下一个词是什么”变成一张概率表,让下游的决策去承担后果。
离散分布与连续分布:前者把概率放在一个个点上,后者用密度描述一整段区间
从正态分布里抽取 800 个身高并统计频次:样本越多,柱形越贴近那条光滑的钟形曲线
工作原理
- 01
随机变量:把结果变成数值
掷一次硬币的结果是“正/反”,不是数字;随机变量 X 把它映射为 1 或 0。离散随机变量取有限或可数多个值,连续随机变量取一段区间上的任意值,后者用“概率密度”而非单点概率来描述。
- 02
常见分布:为不同场景选好模板
伯努利分布描述一次成功/失败试验;类别分布(softmax 输出的那个)描述一次多选一;多项分布是“抛 n 次骰子”的计数;正态分布是大量独立小因素叠加后的极限形态。选对分布,往往比选对模型更影响结果。
- 03
条件概率与独立:信息如何改变判断
P(A|B) 是在已知 B 发生的前提下 A 发生的概率。若 P(A|B)=P(A),说明 B 没有携带关于 A 的任何信息,二者独立。条件概率是所有“看到证据再更新判断”的起点,也是贝叶斯定理的骨架。
- 04
最大似然:让数据显得最不意外的参数
给定一个模型,我们问:哪组参数最可能生成眼前这份数据?把所有样本的概率相乘得到似然,取对数后乘变加(即对数似然),再最大化它。交叉熵损失正是负对数似然——这是概率论与深度学习相接的那道缝。
一个语言模型在某一刻对“下一个词”的预测:它不是选出一个词,而是给整个词表分配概率(此处为局部示意)
- the · 31%
- a · 18%
- this · 12%
- one · 7%
- 其他词 · 32%
应用场景
- 语言模型的下一词预测:在完整词表上给出一张概率分布
- 分类器的 softmax 输出:把打分变成带置信度的概率
- 医疗检测、A/B 测试与风险定价:用概率描述并管理不确定性
- 生成模型采样:从分布里抽一个样本,就得到一个具体的图像或句子
常见误区
- 概率高不等于因果。两个事件高度相关,可能同时受第三个因素驱动,也可能纯属巧合;概率只描述共现,不指认谁导致了谁。
- 分布形状选错比模型选错更致命。把长尾数据(收入、词频)硬套正态分布,会让极端事件被严重低估,从而在风险与损失估计上系统性失准。
- 高置信度不等于正确。softmax 概率常被过度自信,一个训练充分的网络可以对错误答案给出 99% 的概率;因此概率需要校准,而不能直接当可信度使用。
关键术语
- 随机变量
- 把随机试验结果映射为数值的函数
- 概率密度
- 连续变量的“概率浓淡”,区间上的积分才是概率
- softmax
- 把一组实数打分变成和为 1 的概率分布
- 似然
- 在给定参数下,观测到这份数据的概率