跳到正文
01 数学与统计基础入门本域第 1 篇

向量与向量空间

AI 把一切——词、图、声音、用户——都变成同一件事:一串数字

定义

向量是一串有序的数字,例如 (0.21, −0.83, 0.47)。向量空间是这些向量所在的集合,其中任意两个向量可以相加、可以与数字相乘,结果仍在集合内。机器学习的几乎所有输入、输出、参数与中间结果,都是某个向量空间里的一个点。

直观理解

把「描述一个人」缩到三个维度:身高、体重、年龄。三个人就是三个点,站在同一个三维空间里。真实模型里维度可能是一千甚至一万,但几何直觉完全一样——两点的距离越近,它们所代表的东西就越像。现代 AI 最核心的一步,就是学会把「语义」翻译成「位置」。

图 1

从「原始对象」到「可比较的坐标」:编码器是这一转换的唯一入口

图 2

词嵌入的经典结构:国王、女王、男人、女人在二维投影中自动形成平行四边形关系(悬停看坐标)

工作原理

  1. 01

    编码:把对象变成坐标

    先定义一组可度量的特征(或让网络自己学出来),再逐项给出数值。一句话、一张图、一段音频,都先被压成固定长度的数字数组。这一步决定了后续一切的上限。

  2. 02

    度量:用距离和夹角比较

    欧氏距离衡量“差多远”,余弦相似度衡量“方向像不像”。文本检索几乎只用余弦,因为句子的“长短”不该影响它的含义。

  3. 03

    组合:加法与线性变换

    向量相加与矩阵乘法可以表达“叠加概念”和“整体改写”。神经网络的一层,本质上就是一次线性变换外加一个非线性挤压。

应用场景

  • 语义检索:把文档和提问编码到同一空间,直接算最近邻
  • 推荐系统:用户向量与商品向量做内积,得分越高越可能喜欢
  • 图像检索与去重:视觉特征向量的近邻往往就是视觉上相似的图
  • 聚类与可视化:把高维向量投影到二维,观察数据有没有天然分组

常见误区

  • 维度高不等于信息多。许多维度高度相关,真正有效的自由度往往远低于表面维数(降维与主成分分析要解决的正是这一点)。
  • 距离只在同一套编码下可比。换了模型、换了版本,两个向量的坐标就通往完全不同的语义,不能混用。
  • “有意义的维度方向”通常不可解释。除了极少数被刻意设计的可解释维度,“第 137 维代表什么”往往没有人类可读的答案。

关键术语

维数
向量里数字的个数
范数
衡量向量“长度”的函数,常用 L2
内积
两个同维向量逐项相乘再求和,余弦相似度的分子
嵌入
把离散对象映射到连续向量的那一层或那一结果

延伸阅读