文本生成与续写
给定前文,一个词一个词地往下写
这项能力指什么
给定一段文本作为上下文,模型接着往下写。输入与输出都是文本,没有指定的转换目标——可以续写故事、补完一段说明、起草一封邮件。它与「对话」的区别在于不要求指令格式,与「摘要」「翻译」的区别在于目标不是压缩或换语言,出发点和落点都在同一模态里。
技术上如何做到
主流路线是自回归 Transformer 语言模型:文本先切成 token,模型逐位预测下一个 token 的概率分布,训练目标是最大化语料上的似然。GPT、Llama、Qwen 都走这条路,差别在规模、数据与后训练配方。推理时用温度、top-k、top-p 控制多样性,长输出靠 KV cache 复用已算过的键值以降低开销。
代表产品
27GPT-4o
2024原生多模态的通用模型,文本、图像与音频走同一个入口
Llama
2023把开放权重路线做成主流的通用模型家族
Qwen
2023覆盖多规格、含多模态版本的开放权重模型家族
DeepSeek-V3
2024671B 总参数、每 token 只激活 37B 的开放权重 MoE 模型
Mistral Large
2024欧洲开源实验室的旗舰商用模型
Gemini
2023原生多模态、可处理超长上下文的通用模型
Claude
2023以长上下文与安全对齐见长的通用对话模型
MiniMax-M
2025采用混合注意力、上下文达百万 token 的开放权重推理模型
DeepSeek-R1
2025用强化学习训练推理链、权重以 MIT 许可开放的推理模型
Apple Intelligence
2024端侧与私有云协同的系统级 AI 功能
Command R
2024为检索增强与工具调用设计的商用模型
Jamba
2024把状态空间模型与 Transformer 混合的开放权重模型
DBRX
2024Databricks 的开放权重 MoE 语言模型
Gemini
2024把搜索、办公与多模态模型收进一个对话入口
Grok
2023与社交平台数据绑定的对话模型
Yi
2023中英双语、提供超长上下文版本的开放权重模型
Kimi
2023以长上下文处理见长的中文对话助手
Hunyuan
2023腾讯的通用模型家族,含开放权重版本
Microsoft Copilot
2023把对话式 AI 嵌进操作系统与办公软件
Doubao
2023字节跳动的通用对话模型与应用
Phi
2023用小体量和精选数据做成的高效小模型
Step
2023面向多模态与端侧的通用模型系列
Baichuan
2023面向中文场景的开放权重通用模型
GLM
2023以自回归填空预训练起步的中文通用模型
ChatGPT
2022把大模型变成一个人人可用的对话窗口
Character.AI
2022自定角色、可以长期聊下去的角色扮演式对话
ERNIE
2019以知识增强预训练起步的中文模型,早期的代表版本
相关机构
典型用途
- 写作初稿与改写润色
- 邮件、公文与文案起草
- 代码注释与接口文档
- 构造测试数据与合成语料
怎么评价它好不好
- 困惑度 Perplexity
- 模型对测试文本的预测不确定度,越低越好
- 人工偏好 Elo
- 成对比较得出的偏好排序
- 受约束任务 ROUGE/BLEU
- 当存在参考答案时用重叠度衡量
边界与难点
- 流畅不等于真实:模型会给出自信但错误的事实,即幻觉
- 长文中前后设定容易漂移,人物与参数设定会自相矛盾
- 采样参数设置不当会陷入重复或退化的循环