自然语言处理与大模型
从分词到 Transformer,再到“会说话”的大模型
OVERVIEW
- 全部词条
- 6
- 入门
- 2
- 进阶
- 3
- 专家
- 1
语言被切开成 token、压进向量、再用注意力互相“看”一遍——这个朴素得几乎过分的循环,把文本预测推到了通用助手的程度。本域按时间顺序讲清这条路径:词袋、词嵌入、RNN、注意力、Transformer、预训练与对齐。
这一域要回答的问题
- Q1
模型看到的“词”到底是什么?
- Q2
注意力比循环强在哪里?
- Q3
为什么“预测下一个词”能催生对话能力?
从分词到 Transformer,再到“会说话”的大模型
OVERVIEW
语言被切开成 token、压进向量、再用注意力互相“看”一遍——这个朴素得几乎过分的循环,把文本预测推到了通用助手的程度。本域按时间顺序讲清这条路径:词袋、词嵌入、RNN、注意力、Transformer、预训练与对齐。
模型看到的“词”到底是什么?
注意力比循环强在哪里?
为什么“预测下一个词”能催生对话能力?