跳到正文
AI 图鉴

文本生成与续写

给定前文,一个词一个词地往下写

语言与知识入门 #01
输入文本文本

这项能力指什么

给定一段文本作为上下文,模型接着往下写。输入与输出都是文本,没有指定的转换目标——可以续写故事、补完一段说明、起草一封邮件。它与「对话」的区别在于不要求指令格式,与「摘要」「翻译」的区别在于目标不是压缩或换语言,出发点和落点都在同一模态里。

技术上如何做到

主流路线是自回归 Transformer 语言模型:文本先切成 token,模型逐位预测下一个 token 的概率分布,训练目标是最大化语料上的似然。GPT、Llama、Qwen 都走这条路,差别在规模、数据与后训练配方。推理时用温度、top-k、top-p 控制多样性,长输出靠 KV cache 复用已算过的键值以降低开销。

代表产品

27

GPT-4o

2024
OpenAI

原生多模态的通用模型,文本、图像与音频走同一个入口

模型 闭源
文本图像音频文本音频

Llama

2023
Meta AI (FAIR)

把开放权重路线做成主流的通用模型家族

模型 开放权重
文本文本

Qwen

2023
Alibaba (Qwen)

覆盖多规格、含多模态版本的开放权重模型家族

模型 开放权重
文本图像文本

DeepSeek-V3

2024
DeepSeek

671B 总参数、每 token 只激活 37B 的开放权重 MoE 模型

模型 开放权重
文本文本

Mistral Large

2024
Mistral AI

欧洲开源实验室的旗舰商用模型

模型 闭源
文本文本

Gemini

2023
Google DeepMind

原生多模态、可处理超长上下文的通用模型

模型 闭源
文本图像音频视频文本

Claude

2023
Anthropic

以长上下文与安全对齐见长的通用对话模型

模型 闭源
文本图像文本

MiniMax-M

2025
MiniMax

采用混合注意力、上下文达百万 token 的开放权重推理模型

模型 开放权重
文本文本

DeepSeek-R1

2025
DeepSeek

用强化学习训练推理链、权重以 MIT 许可开放的推理模型

模型 开放权重
文本文本

Apple Intelligence

2024
Apple

端侧与私有云协同的系统级 AI 功能

应用 闭源
文本图像音频文本图像

Command R

2024
Cohere

为检索增强与工具调用设计的商用模型

模型 开放权重
文本文本

Jamba

2024
AI21 Labs

把状态空间模型与 Transformer 混合的开放权重模型

模型 开放权重
文本文本

DBRX

2024
Databricks

Databricks 的开放权重 MoE 语言模型

模型 开放权重
文本文本

Gemini

2024
Google DeepMind

把搜索、办公与多模态模型收进一个对话入口

应用 免费增值
文本图像音频文本图像音频

Grok

2023
xAI

与社交平台数据绑定的对话模型

模型 闭源
文本图像文本

Yi

2023
01.AI

中英双语、提供超长上下文版本的开放权重模型

模型 开放权重
文本文本

Kimi

2023
Moonshot AI

以长上下文处理见长的中文对话助手

模型 闭源
文本文本

Hunyuan

2023
Tencent (Hunyuan)

腾讯的通用模型家族,含开放权重版本

模型 开放权重
文本图像文本

Microsoft Copilot

2023
Microsoft

把对话式 AI 嵌进操作系统与办公软件

应用 免费增值
文本图像音频文本图像

Doubao

2023
ByteDance (Seed)

字节跳动的通用对话模型与应用

模型 闭源
文本图像文本

Phi

2023
Microsoft

用小体量和精选数据做成的高效小模型

模型 开放权重
文本文本

Step

2023
StepFun

面向多模态与端侧的通用模型系列

模型 闭源
文本图像文本

Baichuan

2023
Baichuan AI

面向中文场景的开放权重通用模型

模型 开放权重
文本文本

GLM

2023
Zhipu AI

以自回归填空预训练起步的中文通用模型

模型 闭源
文本文本

ChatGPT

2022
OpenAI

把大模型变成一个人人可用的对话窗口

应用 免费增值
文本图像音频文本图像音频

Character.AI

2022
Character.AI

自定角色、可以长期聊下去的角色扮演式对话

应用 免费增值
文本音频文本音频

ERNIE

2019
Baidu

以知识增强预训练起步的中文模型,早期的代表版本

模型 闭源
文本文本

相关机构

典型用途

  • 写作初稿与改写润色
  • 邮件、公文与文案起草
  • 代码注释与接口文档
  • 构造测试数据与合成语料

怎么评价它好不好

困惑度 Perplexity
模型对测试文本的预测不确定度,越低越好
人工偏好 Elo
成对比较得出的偏好排序
受约束任务 ROUGE/BLEU
当存在参考答案时用重叠度衡量

边界与难点

  • 流畅不等于真实:模型会给出自信但错误的事实,即幻觉
  • 长文中前后设定容易漂移,人物与参数设定会自相矛盾
  • 采样参数设置不当会陷入重复或退化的循环

背后的概念