对话与指令遵循
在一来一往中理解意图并照做
这项能力指什么
把一段带有角色(系统、用户、助手)的多轮消息作为输入,输出下一轮的助手回复。它要求的不只是续写,而是在多轮上下文里保持设定、记住先前约束、并遵循格式与语气要求。与「文本生成」的区别是有明确的角色结构和对指令的服从要求。
技术上如何做到
底座是同样的自回归语言模型,关键在对话模板与后训练:把系统提示、历史消息拼成固定的特殊标记序列,再经指令微调让模型学会「回答问题」而非「续写网页」。之后用人类偏好数据做强化学习(RLHF 或 DPO 一类方法),把有用、无害、诚实的取向压进参数。工具与记忆则通过外部系统在提示里注入。
代表产品
30ChatGPT
2022把大模型变成一个人人可用的对话窗口
Claude
2023以长上下文与安全对齐见长的通用对话模型
Gemini
2024把搜索、办公与多模态模型收进一个对话入口
Kimi
2023以长上下文处理见长的中文对话助手
Doubao
2023字节跳动的通用对话模型与应用
Character.AI
2022自定角色、可以长期聊下去的角色扮演式对话
Microsoft Copilot
2023把对话式 AI 嵌进操作系统与办公软件
MiniMax-M
2025采用混合注意力、上下文达百万 token 的开放权重推理模型
o3
2025回答前先生成长的推理链,用推理时的算力换更稳的正确率
DeepSeek-R1
2025用强化学习训练推理链、权重以 MIT 许可开放的推理模型
DeepSeek-V3
2024671B 总参数、每 token 只激活 37B 的开放权重 MoE 模型
Apple Intelligence
2024端侧与私有云协同的系统级 AI 功能
GPT-4o
2024原生多模态的通用模型,文本、图像与音频走同一个入口
Command R
2024为检索增强与工具调用设计的商用模型
Jamba
2024把状态空间模型与 Transformer 混合的开放权重模型
DBRX
2024Databricks 的开放权重 MoE 语言模型
Mistral Large
2024欧洲开源实验室的旗舰商用模型
Gemini
2023原生多模态、可处理超长上下文的通用模型
Grok
2023与社交平台数据绑定的对话模型
Yi
2023中英双语、提供超长上下文版本的开放权重模型
Hunyuan
2023腾讯的通用模型家族,含开放权重版本
Qwen
2023覆盖多规格、含多模态版本的开放权重模型家族
Phi
2023用小体量和精选数据做成的高效小模型
Step
2023面向多模态与端侧的通用模型系列
Baichuan
2023面向中文场景的开放权重通用模型
GLM
2023以自回归填空预训练起步的中文通用模型
Llama
2023把开放权重路线做成主流的通用模型家族
Pangu
2020华为的盘古系列基础模型
ERNIE
2019以知识增强预训练起步的中文模型,早期的代表版本
Siri
2011把语音助手带进主流手机的早期产品
相关机构
典型用途
- 通用助手与客服机器人
- 编程与学习辅导
- 角色扮演与陪伴应用
- 企业内知识问答入口
怎么评价它好不好
- 人工偏好对战 Elo
- 盲测成对比较的胜率排序
- 指令遵循率
- 可验证约束(格式、字数、禁用词)的达标比例
- 安全违规率
- 在红队提示下的越界比例
边界与难点
- 多轮之后会遗忘或软化早先的约束,尤其是长对话中的格式要求
- 倾向于顺从用户,即便用户的前提有误也不反驳,即谄媚倾向
- 精心构造的提示可以绕过安全策略,越狱难以根治