跳到正文
AI 图鉴
03 深度学习进阶本域第 4 篇

卷积神经网络

用“局部看、到处用同一把尺”取代全连接,让图像识别第一次真正可用

定义

卷积神经网络是一类专为网格状数据(如图像)设计的网络。它用一组小的卷积核在输入上滑动,在每个位置做同样的加权求和,从而提取局部特征,并逐层把简单特征(边缘、角点)组合成复杂特征(纹理、部件、物体)。由于同一卷积核在全图复用,参数数量与图像大小无关,且天然具备平移等变性。

直观理解

要在一块大拼图上找图案,你不需要把整块拼图一次性看全,而是拿一个小放大镜一格格扫过去,看到“直角”“弧线”就记下来;再换更大的放大镜,把刚才记下的小形状拼成“眼睛”“轮子”。关键洞察是:同一个图案无论出现在左上角还是右下角,都用同一把尺去认——这就是权值共享,也是卷积比全连接更省参数的根本原因。

图 1

一个卷积网络的典型层级堆栈:从原始像素出发,卷积与池化交替,感受野逐层扩大,最后汇总为类别判断

浅层提取边缘与纹理,深层组合成部件与物体;深度决定了特征的抽象层级。
图 2

ImageNet 分类的 top-5 错误率(越低越好):从 16.4% 降到 2% 量级,卷积架构十年间的真实演进,人类水平约 5.1% 作为参照

工作原理

  1. 01

    局部感受野:每个输出只看一小块

    每个输出只连接输入的一个局部窗口,而非全部像素。图像里相邻像素高度相关,局部连接足以捕捉边缘、角点这类基础特征,同时大幅削减连接数。

  2. 02

    权值共享:同一把尺滑过全图

    同一个卷积核在整张图上滑动复用,参数数量与图像大小无关。这既减少了参数量,也带来了平移等变性——猫平移几个像素之后仍然是猫。

  3. 03

    池化下采样:压缩尺寸、扩大感受野

    最大池化等操作在局部取最强响应,压缩空间尺寸、保留显著激活,同时扩大后续层的有效感受野,并增强对小幅位移的鲁棒性。

  4. 04

    堆叠与感受野扩大:从边缘到物体

    多个卷积层叠加,每层的感受野层层变大——浅层看到边缘,深层看到整张脸。最后用全连接层或全局池化把特征汇总成类别判断。

图 3

卷积架构的演化:每一代都在回答同一个问题——如何让网络更深、更有效地利用图像的空间结构

1998LeNet-5卷积 + 池化 + 全连接的最早成熟范例,用于手写数字2012AlexNetReLU + GPU + Dropout,ImageNet top-5 错误率 16.4%2014VGG / GoogLeNet统一的 3×3 堆叠与 Inception 模块,错误率降至 6.7%2015ResNet残差连接使 152 层可训练,错误率 3.57%2019EfficientNet用复合缩放统一调节深度、宽度与分辨率

应用场景

  • 图像分类:从手写数字到 ImageNet 的千万级图片
  • 目标检测与语义分割的骨干网络,提供层次化特征
  • 医学影像、遥感与工业质检中的缺陷识别
  • 一维卷积也用于音频频谱图与传感器信号

常见误区

  • 卷积的“平移不变”是近似的。大幅旋转或缩放仍会失效,通常需要数据增强或专门的结构来弥补。
  • 深度本身不是目的:在残差连接出现之前,单纯加深网络反而使训练误差升高(退化问题),而不是过拟合。
  • 参数量少不等于计算量小。卷积在空间分辨率高的早期层计算开销很大,这也是推理优化关注的重点。

关键术语

卷积核
一组在输入上滑动的可学习权重
感受野
某个输出在原始输入上所覆盖的区域大小
权值共享
同一组权重在所有空间位置复用
等变性
输入平移时输出也随之平移,而非改变

延伸阅读