图像的数字化表示
照片在机器眼里,是一层叠着一层的数字方阵
定义
数字图像是由像素值构成的多维数组:灰度图是二维矩阵,彩色图在此基础上增加通道维(通常是 R、G、B 三个),一批图再堆成四维张量 (N, C, H, W)。像素的数值范围(位深)、颜色空间(sRGB / HSV / Lab)与归一化方式,共同决定了网络实际看到的输入长什么样。
直观理解
一张 1000×1000 的彩色照片,在计算机里就是 1000×1000×3 ≈ 300 万个数字。放大到像素级别,照片变成马赛克瓷砖铺成的墙,每块瓷砖上写着三个 0–255 的数。你看到的「一只猫」,机器看到的只是三张叠在一起、分别描述红绿蓝强度的数字表格。计算机视觉的第一步,永远是坦然承认这一点,而不是绕过它。
灰度图像就是一个二维矩阵:每个格子的数字是 0–255 的亮度,中间一条亮带构成竖直边缘
一张「暗背景 + 亮物体」图像的灰度直方图:明显的双峰对应背景与主体的两级亮度
工作原理
- 01
采样与量化:把连续的世界切成网格
现实中的光是连续分布的,传感器在每个格点上采样颜色,再把强度量化为整数(8 位即 0–255)。分辨率决定网格有多密,位深决定每个像素能表达多少级明暗。
- 02
通道与颜色空间:同一块像素的三套坐标系
RGB 面向显示设备,HSV 把「颜色」与「明暗」解耦,Lab 追求感知上的均匀。做颜色阈值、白平衡或风格迁移之前,选对颜色空间往往比换一个更大的模型更有效。
- 03
张量形状:把图像喂进网络
单张图是 (C, H, W),一批图是 (N, C, H, W)。多数框架默认通道在前(NCHW),而很多数据管线给出的是通道在后(H, W, C)——形状对不上是初学者最常见的报错来源。
- 04
归一化与数据增强:进入网络前的最后一步
减去均值、除以标准差让各通道尺度一致,有助于优化稳定;随机裁剪、翻转、颜色抖动等增强在不改变语义的前提下人为扩增数据,是抑制过拟合的第一道防线。
一张彩色图从「二维」长成「四维」:空间两维 + 通道维 + 批量维,即张量 (N, C, H, W)
应用场景
- 图像预处理管线:解码 → 缩放 → 归一化 → 张量化,几乎所有视觉模型共享的第一步
- 医学与遥感影像:16 位高动态范围与伪彩色映射,位深选择直接决定能否看清病灶与地物
- 颜色相关任务:肤色检测、红绿灯识别、白平衡校正依赖 HSV / Lab 空间
- 数据增强:训练前统一扩增样本,是提升泛化最低成本的手段
常见误区
- 归一化参数必须与训练时一致。用 ImageNet 均值训练、却拿原始 0–255 输入做推理,输出会完全失真——这类错误不会报错,只会悄悄拉低效果。
- 分辨率不是越高越好。下采样会抹掉小目标,但盲目放大既不增加信息,又平方级地抬高算力。
- RGB 不等于「人眼看到的颜色」。sRGB 是显示标准的约定,Lab 才更接近感知均匀;讨论颜色距离时要分清用的是哪一套。
关键术语
- 像素
- 图像的最小采样单元,携带一个或多个通道的数值
- 位深
- 每个通道用多少比特表示,8 位对应 256 级
- 通道
- 同一空间位置上的不同测量量,如 R/G/B 或 Alpha
- 颜色空间
- 组织颜色数值的一套坐标系统,如 sRGB、HSV、Lab