03 深度学习进阶本域第 4 篇
卷积神经网络
用“局部看、到处用同一把尺”取代全连接,让图像识别第一次真正可用
定义
卷积神经网络是一类专为网格状数据(如图像)设计的网络。它用一组小的卷积核在输入上滑动,在每个位置做同样的加权求和,从而提取局部特征,并逐层把简单特征(边缘、角点)组合成复杂特征(纹理、部件、物体)。由于同一卷积核在全图复用,参数数量与图像大小无关,且天然具备平移等变性。
直观理解
要在一块大拼图上找图案,你不需要把整块拼图一次性看全,而是拿一个小放大镜一格格扫过去,看到“直角”“弧线”就记下来;再换更大的放大镜,把刚才记下的小形状拼成“眼睛”“轮子”。关键洞察是:同一个图案无论出现在左上角还是右下角,都用同一把尺去认——这就是权值共享,也是卷积比全连接更省参数的根本原因。
一个卷积网络的典型层级堆栈:从原始像素出发,卷积与池化交替,感受野逐层扩大,最后汇总为类别判断
ImageNet 分类的 top-5 错误率(越低越好):从 16.4% 降到 2% 量级,卷积架构十年间的真实演进,人类水平约 5.1% 作为参照
工作原理
- 01
局部感受野:每个输出只看一小块
每个输出只连接输入的一个局部窗口,而非全部像素。图像里相邻像素高度相关,局部连接足以捕捉边缘、角点这类基础特征,同时大幅削减连接数。
- 02
权值共享:同一把尺滑过全图
同一个卷积核在整张图上滑动复用,参数数量与图像大小无关。这既减少了参数量,也带来了平移等变性——猫平移几个像素之后仍然是猫。
- 03
池化下采样:压缩尺寸、扩大感受野
最大池化等操作在局部取最强响应,压缩空间尺寸、保留显著激活,同时扩大后续层的有效感受野,并增强对小幅位移的鲁棒性。
- 04
堆叠与感受野扩大:从边缘到物体
多个卷积层叠加,每层的感受野层层变大——浅层看到边缘,深层看到整张脸。最后用全连接层或全局池化把特征汇总成类别判断。
卷积架构的演化:每一代都在回答同一个问题——如何让网络更深、更有效地利用图像的空间结构
应用场景
- 图像分类:从手写数字到 ImageNet 的千万级图片
- 目标检测与语义分割的骨干网络,提供层次化特征
- 医学影像、遥感与工业质检中的缺陷识别
- 一维卷积也用于音频频谱图与传感器信号
常见误区
- 卷积的“平移不变”是近似的。大幅旋转或缩放仍会失效,通常需要数据增强或专门的结构来弥补。
- 深度本身不是目的:在残差连接出现之前,单纯加深网络反而使训练误差升高(退化问题),而不是过拟合。
- 参数量少不等于计算量小。卷积在空间分辨率高的早期层计算开销很大,这也是推理优化关注的重点。
关键术语
- 卷积核
- 一组在输入上滑动的可学习权重
- 感受野
- 某个输出在原始输入上所覆盖的区域大小
- 权值共享
- 同一组权重在所有空间位置复用
- 等变性
- 输入平移时输出也随之平移,而非改变