跳到正文
AI 图鉴
05 计算机视觉入门本域第 2 篇

卷积运算

同一块小模板扫过全图,找出边缘、纹理与形状

定义

卷积是让一个小矩阵(卷积核)在图像上逐位置滑动,每个位置做逐元素相乘再求和,从而得到一个输出值的过程。它把「局部加权求和」这一个操作在所有空间位置上重复共享,因此能用极少的参数检测边缘、纹理等局部模式。

直观理解

想象用一块刻着 -1、0、+1 的小镂空模板贴着照片的一小块区域看:如果这块区域正好是一条竖直边缘,透过模板得到的加权和会很大;如果是一片平坦天空,结果接近零。同一块模板扫过整张照片,就得到一张「哪里有这种边缘」的响应图。 网络要学的,就是这些模板上的数字。

图 1

卷积的几何直觉:一个 5×5 的局部小片,经 3×3 核(步长 1、无填充)后得到 3×3 的响应图,亮物的边界被提取出来

图 2

为什么图像用卷积而不用全连接:在局部连接、权重共享、平移等变性等维度上的典型对比

  • 卷积层
  • 全连接层

工作原理

  1. 01

    滑动与加权求和

    卷积核覆盖输入的一个小窗口,逐元素相乘后求和,得到输出图上对应位置的一个值。核越大,感受野越大,但参数与计算也随之增加。

  2. 02

    步长与填充控制输出尺寸

    步长决定滑动的间隔(即下采样),填充在边界补零以保住尺寸。二者加上核大小共同决定输出的高宽:out = ⌊(in + 2·pad − kernel)/stride⌋ + 1。

  3. 03

    空洞卷积与转置卷积

    空洞卷积在核元素之间插入空隙,不增加参数就扩大感受野,广泛用于分割;转置卷积则反向地把特征图上采样,用于恢复分辨率与生成。

  4. 04

    多层堆叠:从边缘到物体

    浅层核学出边缘与色块,中层组合成纹理与部件,深层组合成物体。关键结论是:这些核并非人手工设计,而是反向传播从数据里学出来的。

关键公式

out = ⌊(H + 2P − K) / S⌋ + 1
H 为输入边长,K 为核大小,P 为填充,S 为步长。步长大于 1 时输出变小,即下采样。
图 3

一个边缘检测核的权重:中心为正、八邻为负,对亮度突变格外敏感(悬停看每个权重)

-1-1-1-18-1-1-1-1

应用场景

  • 特征提取主干:几乎所有 CNN 的底层,取代了手工设计的 SIFT / HOG 等算子
  • 边缘与梯度检测:Sobel、Laplacian 等经典核至今用于图像处理与工业质检
  • 上采样与生成:转置卷积用于分割、超分辨率与解码器
  • 大感受野建模:空洞卷积用于语义分割与音频、时序建模

常见误区

  • 卷积并不等于「模糊」。模糊只是众多核中的一种;同样的滑动机制配上不同权重,可以做锐化、边缘检测甚至特定方向检测。
  • 参数少不等于计算少。权重共享让参数量骤减,但每个位置都要计算,计算量仍与图像面积成正比。
  • 核越大不一定越好。现代设计更倾向于堆叠多个 3×3 小核来获得相同感受野,同时减少参数、增加非线性。

关键术语

卷积核 / 滤波器
被学习的小权重矩阵
步长
每次滑动跨过的像素数
填充
在边界补零以控制输出尺寸
感受野
输出上一个像素对应回输入的区域大小

延伸阅读