跳到正文
AI 图鉴
02 机器学习入门本域第 1 篇

监督学习

用「问题—答案」的成对样本,让模型学会从问题直接给出答案

定义

监督学习是从带标签样本中学习一个映射函数的范式:给定大量「输入 x → 标签 y」的成对数据,在一个候选函数族(假设空间)中寻找使预测与真实标签差异最小的那个函数。标签是离散类别时称为分类,是连续数值时称为回归。它依赖两个前提——存在一个可学到的映射,以及我们手里有足够多且足够干净的标签。

直观理解

这像一位学生做厚厚的「习题+标准答案」练习册:每做一题就对一次答案,久而久之内化出这类题的解法,而不是背下某一题的答案。真正的瓶颈不在做题,而在答案从哪来——老师批一份卷子很便宜,但请医生逐张标注几百万幅影像,成本可能高到项目做不下去。因此在本项目里,「有标签」往往比「有数据」稀缺得多。

图 1

监督学习流水线:从采集、标注,到在假设空间中拟合,最后用未见数据验收

图 2

监督学习的进展:同一份 ImageNet 数据、同一套标签,不同模型族的单裁剪 top-1 准确率

工作原理

  1. 01

    采集并标注成对样本

    为每个输入配上正确标签,再划分训练、验证、测试三份数据。划分必须在下手调模型之前完成,且三类样本不能互相污染。

  2. 02

    指定假设空间与损失

    选定模型族(线性模型、决策树、神经网络),并明确“错多少”如何度量,即损失函数。假设空间决定能表达的上限,损失决定优化的方向。

  3. 03

    经验风险最小化

    在训练集上寻找一组参数,使平均损失最小。这一步通常交给梯度下降或其变体完成,是整个训练流程里唯一真正“在算”的环节。

  4. 04

    在未见数据上检验泛化

    训练集上的低损失并不等于学会了规律。真正的验收标准是模型在从未见过的样本上是否依然准确,这直接连到过拟合与模型评估。

关键公式

min_θ (1/n) Σᵢ L( f_θ(xᵢ), yᵢ )
经验风险最小化:在所有参数 θ 上最小化训练样本的平均损失,是监督学习训练循环的通用写法。

应用场景

  • 垃圾邮件与内容分类:把一段文本映射到类别标签
  • 医学影像判读:从 X 光、病理切片预测是否存在病灶
  • 价格与需求回归:用历史特征预测房价、销量、能耗
  • 语音识别与机器翻译的微调阶段:用人工转写或双语对齐语料精调

常见误区

  • 标签噪声与标注偏差:标注者的疏忽或系统性偏好会直接变成模型的天花板,模型学到的可能正是标注者的偏见。
  • 分布偏移:训练数据来自旧环境,部署环境却变了,映射关系随之失效。离线指标再漂亮,也可能上线即崩。
  • 相关不等于因果:模型学到的是特征与标签之间的统计关联,未必是你以为的因果机制,据此做干预可能南辕北辙。

关键术语

输入 x
喂给模型的特征向量
标签 y
每个样本的正确输出,监督信号的来源
假设空间
模型能够表示的全部函数构成的集合
经验风险
模型在训练样本上的平均损失

延伸阅读