跳到正文
AI 图鉴
02 机器学习专家本域第 6 篇

偏差-方差权衡

每一个预测误差都能拆成三份:模型太简单、模型太抖动,以及世界本身的随机

定义

偏差-方差分解把模型在某个样本上的期望预测误差拆成三部分:偏差²衡量模型的平均预测偏离真实规律多远(欠拟合的来源),方差衡量模型对训练集扰动的敏感程度(过拟合的来源),不可约误差是数据本身噪声造成的、任何模型都无法消除的下限。经典理论认为前两者此消彼长,构成一条 U 形误差曲线。

直观理解

想象一群射手瞄同一个靶心。偏差是整组弹孔偏离靶心的距离——瞄错方向,再稳也没用;方差是弹孔彼此之间的散布——手抖得厉害,平均再准也打不中。靶纸本身还有无法消除的抖动(不可约误差)。好的模型是“既瞄得准、手又稳”,但这两件事常常不能同时做到。

图 1

期望泛化误差的分解:偏差²、方差与不可约噪声各占一份,三者相加才是总误差

期望泛化误差期望泛化误差偏差² Bias²偏差² Bias²模型过于简单模型过于简单方差 Variance方差 Variance模型过于复杂模型过于复杂不可约误差 σ²不可约误差 σ²数据本身的噪声数据本身的噪声
图 2

双下降现象(示意):随模型复杂度上升,测试误差先降后升,越过插值阈值后再次下降——经典 U 形曲线被打破

工作原理

  1. 01

    偏差:模型的系统性偏离

    用不同训练集训练同一个模型族,看它们的平均预测离真实函数有多远。模型太简单(如用直线拟合曲线)时偏差大,导致欠拟合。

  2. 02

    方差:模型的抖动

    看这些预测彼此之间有多分散。模型太复杂时,训练集里换掉几个样本,学到的函数就大变样,方差大,导致过拟合。

  3. 03

    不可约误差:数据的上限

    即使拿到真实函数,只要标签带噪声,误差也不会归零。这是问题的内在下限,与模型无关,也无法通过调模型消除。

  4. 04

    权衡与反例

    传统结论是复杂度升高时偏差降、方差升,总误差呈 U 形。但现代过参数化模型(参数量远超样本数)却出现“双下降”——误差先降后升,又在插值点之后重新下降。

关键公式

E[(y − f̂(x))²] = Bias²(f̂) + Var(f̂) + σ²
期望泛化误差的三项分解:偏差平方 + 方差 + 不可约噪声,三者相加才是总误差。

应用场景

  • 模型选择:解释为什么中等复杂度往往优于两个极端
  • 集成方法:Bagging 主要降方差,Boosting 主要降偏差,据此理解随机森林与梯度提升的差别
  • 正则化设计:权重衰减、Dropout 通过增加偏差换取方差的下降
  • 现代视角:解释为何超大模型仍不过拟合,推动了对经典理论的修正

常见误区

  • 方差大不总是坏事。双下降现象表明,在过参数化区间里增加容量反而能降低测试误差,经典的 U 形曲线并非普遍规律。
  • 偏差-方差是期望意义下的分解。单个模型、单次训练无法直接测量这两个量,它更像一个解释框架,而非可操作的计算公式。
  • “更复杂=更差”是误读。现代实践反复显示,在数据与算力允许时,更大、更过参数化的模型往往泛化更好。

关键术语

偏差 Bias
模型平均预测与真实规律的偏离量
方差 Variance
模型对训练集扰动的敏感程度
不可约误差
标签噪声带来的、无法消除的误差下限
双下降
过参数化区测试误差先升后降的现代反例

延伸阅读