图灵测试
数学与统计基础图灵在《计算机器与智能》中把“机器能思考吗”换成了一个可操作的问题:如果一段对话无法分辨对方是人还是机器,我们还有什么理由说它不能思考?这个提问方式影响了此后七十年的争论。
TIMELINE
从图灵测试到扩散模型:那些真正改变了方向的事件。
图灵在《计算机器与智能》中把“机器能思考吗”换成了一个可操作的问题:如果一段对话无法分辨对方是人还是机器,我们还有什么理由说它不能思考?这个提问方式影响了此后七十年的争论。
麦卡锡、明斯基、香农等人用一个夏天的研讨会为这个领域命名,并乐观地认为十来个聪明人一个夏天就能解决大部分问题。这既是一个学科的起点,也是第一次高估的起点。
罗森布拉特给出第一个可从数据中调整权重的学习机器,并能用硬件实现。它证明了“从样本中学习”在物理上是可行的——这是神经网络路线的第一块基石。
明斯基与派珀特证明单层感知机无法表达异或(XOR)这类线性不可分函数。结论本身正确,但被广泛误读为“神经网络此路不通”,直接导致该方向 funding 中断十余年。
以规则库加推理机的专家系统进入工业界(如 DEC 的 XCON)。它证明了 AI 能带来真实收益,也暴露了纯符号路线的天花板:规则要靠人手写,且无法从数据中学习。
鲁梅尔哈特、辛顿与威廉姆斯展示了用链式法则把误差逐层回传,可以让含隐藏层的网络真正训练起来。异或问题被解决,神经网络路线重新开放。
LeCun 把卷积与权值共享用在手写数字识别上,并在真实邮政系统中部署。今天所有视觉模型的核心结构,三十多年前就已经被想清楚了。
这一年发生了两件事:Hochreiter 与 Schmidhuber 提出 LSTM,用门控机制缓解了循环网络的梯度消失;IBM 深蓝以暴力搜索战胜国际象棋世界冠军卡斯帕罗夫——后者是搜索的胜利,不是学习的胜利。
辛顿提出深度信念网络与逐层预训练,证明深层网络可以被训练。虽然预训练这一具体做法后来被更好的初始化与归一化取代,但“深”这件事从此回到了舞台中央。
李飞飞团队发布了含一千四百万张标注图像的 ImageNet,并配套建立竞赛。事后看,这个数据集的规模——而不是任何算法——才是引爆点。
AlexNet 在 ImageNet 上把 top-5 错误率从 26% 拉到 15.3%,第二名还停留在传统特征方法上。GPU、大数据、深度网络三件事在这一刻合流,深度学习正式成为主流。
Goodfellow 提出生成对抗网络,用两个网络互相博弈来逼近数据分布;同年 Seq2Seq 与注意力机制出现,解决了长序列翻译中信息被压进单一向量而丢失的问题。
残差连接让梯度可以绕过若干层直接回传,使得训练百层以上网络不再退化。它在 ImageNet 上把 top-5 错误率压到 3.57%——低于人类的约 5%。深度从此不再是一个需要解释的变量。
围棋的状态空间远超国际象棋,暴力搜索失效。AlphaGo 用深度网络评估局面、用蒙特卡洛树搜索做决策,并以自我对弈持续改进。第四局的“神之一手”说明:它学到的不是人类的棋。
《Attention Is All You Need》用纯注意力替换了循环结构,使训练可以并行、序列依赖可以被显式建模。今天几乎所有的大模型都建立在这个架构上——它是本世纪 AI 领域影响最大的单篇论文。
BERT 用双向掩码建模做理解任务,GPT 用自回归生成做生成任务。两条路线的分歧其实是同一个问题的两种答案:模型该看完整句话再输出,还是一个词一个词地往外吐?
AlphaFold 2 在蛋白质结构预测上达到实验精度,被评价为“解决了五十年的问题”。同年 GPT-3 以 1750 亿参数展示出上下文学习能力——不更新参数,仅靠提示中的几个示例就能完成新任务。
CLIP 用四亿对图文在对比学习目标下对齐图像与文本的表示。结果是模型可以做零样本分类:无需任何训练样本,仅凭类别名称的文本描述就能分类。多模态由此成为主流范式。
Stable Diffusion 把扩散过程放进潜空间并开源,使任意消费级显卡都能生成图像。生成式 AI 从研究演示变成了一种大众工具,争议也随之而来。
ChatGPT 的关键并不只是更大的模型,而是用人类偏好训练奖励模型、再用强化学习调整输出倾向。同一个基础模型,对齐之后从“会续写”变成了“会帮忙”。这是对齐技术第一次产生大众可感的产品差异。
LLaMA 系列与众多开源权重模型把可用的语言模型带到本地,量化和 LoRA 让消费级硬件也能微调。同时模型开始调用外部工具与检索——语言模型从“文本生成器”变成“系统的一个部件”。
生成对象从图像扩展到视频与三维;另一条线上,模型开始在推理时“多想一会儿”——用更多采样与搜索换取更可靠的答案。规模定律之外,第二条提升路径出现了。