跳到正文
AI 图鉴
04 自然语言处理与大模型专家本域第 6 篇

提示工程与对齐

让模型「有用、诚实、无害」,比单纯把它做得更大更难

定义

提示工程是通过设计输入上下文来引导已训练模型完成任务的实践;对齐则是让模型的输出朝向人类偏好与安全要求的过程。典型对齐流程是先做指令微调(SFT),再用基于人类反馈的强化学习(RLHF)或直接偏好优化(DPO)把模型推向更受偏好的行为。

直观理解

预训练好的模型像一个知识渊博却不受指挥的实习生:你问什么它答什么,但可能答偏、答长、答得不合格式。指令微调相当于给他一份工作规范;对齐则是通过反复的反馈让他学会「什么样的回答更让人满意」。而提示工程,是你作为用户当场给出的具体交办——它只能在模型已有能力范围内「引导」,无法凭空创造能力。

图 1

RLHF 的对齐回路:生成回答、人类排序、训练奖励模型、更新策略,循环若干轮直到输出稳定符合偏好

① 策略模型生成多个回…② 人类对回答排序③ 训练奖励模型④ PPO 更新策略(含 …RLHF 对齐回路
图 2

MMLU(57 学科知识基准)5-shot 准确率:从基础模型到对齐后的助手,知识能力与对齐程度一起提升

工作原理

  1. 01

    上下文学习与少样本示例

    在提示里放进几个「输入—输出」示例,模型无需更新任何参数就能照葫芦画瓢,这叫上下文学习。它把「改权重」变成了「改输入」,让同一个模型用一段文字就能切换任务,代价是示例会占用宝贵的上下文长度。

  2. 02

    思维链:把推理显式写出来

    要求模型「一步一步想」再给答案,能让多步算术与逻辑题的准确率显著提升。原理是模型每一步的输出都成为下一步的输入,相当于用更多的计算步骤换取更稳的推理。

  3. 03

    指令微调 SFT

    用大量高质量的「指令—回答」对做监督微调,教模型识别意图、遵循格式、拒绝越界请求。这一步把「会补全文本」的模型变成「会听人说话」的助手,是后续对齐的基础。

  4. 04

    偏好对齐:RLHF 与 DPO

    RLHF 先用人类对多个回答的排序训练一个奖励模型,再用强化学习(通常是 PPO)让策略模型去最大化奖励,同时用 KL 惩罚防止它偏离原模型太远。DPO 则跳过显式奖励模型,直接把「偏好回答应比被拒回答概率更高」写进一个可微的分类式损失,流程更简单、更稳定。

应用场景

  • 通用助手与对话产品:把基座模型塑造成遵循指令的助手
  • 推理增强:用思维链与自洽性提升数学、代码与逻辑表现
  • 安全护栏:训练模型拒绝有害请求、降低幻觉与越狱风险
  • 低成本定制:用系统提示与少样本示例适配客服、写作等场景

常见误区

  • 提示词不是咒语。它只能在模型已有能力范围内做引导,遇到模型本身不具备的能力,再精巧的提示也无法凭空造出。
  • RLHF 会引入奖励攻陷(reward hacking):模型学会讨好奖励模型,而不是真正变好;同时奖励模型本身携带标注者的偏置,会被放大成模型的行为倾向。
  • 对齐存在「对齐税」:为安全与服从付出的代价可能削弱部分原始能力。而且「有用、诚实、无害」三者在冲突时如何权衡,本身就是价值判断,无法只靠更大的模型解决。

关键术语

上下文学习
靠提示中的示例完成任务,不更新参数
思维链 CoT
让模型显式写出中间推理步骤
SFT
监督微调,用「指令—回答」对训练
DPO
直接偏好优化,无需显式奖励模型

延伸阅读