跳到正文
AI 图鉴
05 计算机视觉入门本域第 1 篇

图像的数字化表示

照片在机器眼里,是一层叠着一层的数字方阵

定义

数字图像是由像素值构成的多维数组:灰度图是二维矩阵,彩色图在此基础上增加通道维(通常是 R、G、B 三个),一批图再堆成四维张量 (N, C, H, W)。像素的数值范围(位深)、颜色空间(sRGB / HSV / Lab)与归一化方式,共同决定了网络实际看到的输入长什么样。

直观理解

一张 1000×1000 的彩色照片,在计算机里就是 1000×1000×3 ≈ 300 万个数字。放大到像素级别,照片变成马赛克瓷砖铺成的墙,每块瓷砖上写着三个 0–255 的数。你看到的「一只猫」,机器看到的只是三张叠在一起、分别描述红绿蓝强度的数字表格。计算机视觉的第一步,永远是坦然承认这一点,而不是绕过它。

图 1

灰度图像就是一个二维矩阵:每个格子的数字是 0–255 的亮度,中间一条亮带构成竖直边缘

12121014902101113801820512147019212116018521520519551822211951817225215218517
图 2

一张「暗背景 + 亮物体」图像的灰度直方图:明显的双峰对应背景与主体的两级亮度

工作原理

  1. 01

    采样与量化:把连续的世界切成网格

    现实中的光是连续分布的,传感器在每个格点上采样颜色,再把强度量化为整数(8 位即 0–255)。分辨率决定网格有多密,位深决定每个像素能表达多少级明暗。

  2. 02

    通道与颜色空间:同一块像素的三套坐标系

    RGB 面向显示设备,HSV 把「颜色」与「明暗」解耦,Lab 追求感知上的均匀。做颜色阈值、白平衡或风格迁移之前,选对颜色空间往往比换一个更大的模型更有效。

  3. 03

    张量形状:把图像喂进网络

    单张图是 (C, H, W),一批图是 (N, C, H, W)。多数框架默认通道在前(NCHW),而很多数据管线给出的是通道在后(H, W, C)——形状对不上是初学者最常见的报错来源。

  4. 04

    归一化与数据增强:进入网络前的最后一步

    减去均值、除以标准差让各通道尺度一致,有助于优化稳定;随机裁剪、翻转、颜色抖动等增强在不改变语义的前提下人为扩增数据,是抑制过拟合的第一道防线。

图 3

一张彩色图从「二维」长成「四维」:空间两维 + 通道维 + 批量维,即张量 (N, C, H, W)

框架默认 NCHW;若数据来自 (H, W, C),需要显式转置。

应用场景

  • 图像预处理管线:解码 → 缩放 → 归一化 → 张量化,几乎所有视觉模型共享的第一步
  • 医学与遥感影像:16 位高动态范围与伪彩色映射,位深选择直接决定能否看清病灶与地物
  • 颜色相关任务:肤色检测、红绿灯识别、白平衡校正依赖 HSV / Lab 空间
  • 数据增强:训练前统一扩增样本,是提升泛化最低成本的手段

常见误区

  • 归一化参数必须与训练时一致。用 ImageNet 均值训练、却拿原始 0–255 输入做推理,输出会完全失真——这类错误不会报错,只会悄悄拉低效果。
  • 分辨率不是越高越好。下采样会抹掉小目标,但盲目放大既不增加信息,又平方级地抬高算力。
  • RGB 不等于「人眼看到的颜色」。sRGB 是显示标准的约定,Lab 才更接近感知均匀;讨论颜色距离时要分清用的是哪一套。

关键术语

像素
图像的最小采样单元,携带一个或多个通道的数值
位深
每个通道用多少比特表示,8 位对应 256 级
通道
同一空间位置上的不同测量量,如 R/G/B 或 Alpha
颜色空间
组织颜色数值的一套坐标系统,如 sRGB、HSV、Lab

延伸阅读