01 数学与统计基础入门本域第 1 篇
向量与向量空间
AI 把一切——词、图、声音、用户——都变成同一件事:一串数字
定义
向量是一串有序的数字,例如 (0.21, −0.83, 0.47)。向量空间是这些向量所在的集合,其中任意两个向量可以相加、可以与数字相乘,结果仍在集合内。机器学习的几乎所有输入、输出、参数与中间结果,都是某个向量空间里的一个点。
直观理解
把「描述一个人」缩到三个维度:身高、体重、年龄。三个人就是三个点,站在同一个三维空间里。真实模型里维度可能是一千甚至一万,但几何直觉完全一样——两点的距离越近,它们所代表的东西就越像。现代 AI 最核心的一步,就是学会把「语义」翻译成「位置」。
从「原始对象」到「可比较的坐标」:编码器是这一转换的唯一入口
词嵌入的经典结构:国王、女王、男人、女人在二维投影中自动形成平行四边形关系(悬停看坐标)
工作原理
- 01
编码:把对象变成坐标
先定义一组可度量的特征(或让网络自己学出来),再逐项给出数值。一句话、一张图、一段音频,都先被压成固定长度的数字数组。这一步决定了后续一切的上限。
- 02
度量:用距离和夹角比较
欧氏距离衡量“差多远”,余弦相似度衡量“方向像不像”。文本检索几乎只用余弦,因为句子的“长短”不该影响它的含义。
- 03
组合:加法与线性变换
向量相加与矩阵乘法可以表达“叠加概念”和“整体改写”。神经网络的一层,本质上就是一次线性变换外加一个非线性挤压。
应用场景
- 语义检索:把文档和提问编码到同一空间,直接算最近邻
- 推荐系统:用户向量与商品向量做内积,得分越高越可能喜欢
- 图像检索与去重:视觉特征向量的近邻往往就是视觉上相似的图
- 聚类与可视化:把高维向量投影到二维,观察数据有没有天然分组
常见误区
- 维度高不等于信息多。许多维度高度相关,真正有效的自由度往往远低于表面维数(降维与主成分分析要解决的正是这一点)。
- 距离只在同一套编码下可比。换了模型、换了版本,两个向量的坐标就通往完全不同的语义,不能混用。
- “有意义的维度方向”通常不可解释。除了极少数被刻意设计的可解释维度,“第 137 维代表什么”往往没有人类可读的答案。
关键术语
- 维数
- 向量里数字的个数
- 范数
- 衡量向量“长度”的函数,常用 L2
- 内积
- 两个同维向量逐项相乘再求和,余弦相似度的分子
- 嵌入
- 把离散对象映射到连续向量的那一层或那一结果