05 计算机视觉入门本域第 2 篇
卷积运算
同一块小模板扫过全图,找出边缘、纹理与形状
定义
卷积是让一个小矩阵(卷积核)在图像上逐位置滑动,每个位置做逐元素相乘再求和,从而得到一个输出值的过程。它把「局部加权求和」这一个操作在所有空间位置上重复共享,因此能用极少的参数检测边缘、纹理等局部模式。
直观理解
想象用一块刻着 -1、0、+1 的小镂空模板贴着照片的一小块区域看:如果这块区域正好是一条竖直边缘,透过模板得到的加权和会很大;如果是一片平坦天空,结果接近零。同一块模板扫过整张照片,就得到一张「哪里有这种边缘」的响应图。 网络要学的,就是这些模板上的数字。
卷积的几何直觉:一个 5×5 的局部小片,经 3×3 核(步长 1、无填充)后得到 3×3 的响应图,亮物的边界被提取出来
为什么图像用卷积而不用全连接:在局部连接、权重共享、平移等变性等维度上的典型对比
- 卷积层
- 全连接层
工作原理
- 01
滑动与加权求和
卷积核覆盖输入的一个小窗口,逐元素相乘后求和,得到输出图上对应位置的一个值。核越大,感受野越大,但参数与计算也随之增加。
- 02
步长与填充控制输出尺寸
步长决定滑动的间隔(即下采样),填充在边界补零以保住尺寸。二者加上核大小共同决定输出的高宽:out = ⌊(in + 2·pad − kernel)/stride⌋ + 1。
- 03
空洞卷积与转置卷积
空洞卷积在核元素之间插入空隙,不增加参数就扩大感受野,广泛用于分割;转置卷积则反向地把特征图上采样,用于恢复分辨率与生成。
- 04
多层堆叠:从边缘到物体
浅层核学出边缘与色块,中层组合成纹理与部件,深层组合成物体。关键结论是:这些核并非人手工设计,而是反向传播从数据里学出来的。
关键公式
out = ⌊(H + 2P − K) / S⌋ + 1一个边缘检测核的权重:中心为正、八邻为负,对亮度突变格外敏感(悬停看每个权重)
应用场景
- 特征提取主干:几乎所有 CNN 的底层,取代了手工设计的 SIFT / HOG 等算子
- 边缘与梯度检测:Sobel、Laplacian 等经典核至今用于图像处理与工业质检
- 上采样与生成:转置卷积用于分割、超分辨率与解码器
- 大感受野建模:空洞卷积用于语义分割与音频、时序建模
常见误区
- 卷积并不等于「模糊」。模糊只是众多核中的一种;同样的滑动机制配上不同权重,可以做锐化、边缘检测甚至特定方向检测。
- 参数少不等于计算少。权重共享让参数量骤减,但每个位置都要计算,计算量仍与图像面积成正比。
- 核越大不一定越好。现代设计更倾向于堆叠多个 3×3 小核来获得相同感受野,同时减少参数、增加非线性。
关键术语
- 卷积核 / 滤波器
- 被学习的小权重矩阵
- 步长
- 每次滑动跨过的像素数
- 填充
- 在边界补零以控制输出尺寸
- 感受野
- 输出上一个像素对应回输入的区域大小