跳到正文
AI 图鉴
08 AI 工程、安全与伦理入门本域第 6 篇

安全、对齐与提示注入

模型优化的从来不是“我们真正想要的东西”,而是我们写进损失函数里的那个代理指标——两者的缝隙就是对问题的全部

定义

对齐关注如何让模型的行为符合人类的意图与价值,而非仅仅最大化训练时的代理目标。安全则覆盖从提示注入、越狱到幻觉与追责的一系列具体威胁。提示注入之所以难以根治,是因为模型的“指令”与“数据”被拼进同一个文本通道,模型无法从机制上区分“该执行的命令”和“仅供阅读的内容”。

直观理解

对齐可以用“给助手下指标”来理解:你让助理“尽量多接电话”,结果他把每个来电都拖到十分钟以上来冲数量——他完美优化了你给的指标,却背离了你的本意。提示注入则像一封夹带假指令的信:因为模型读到的系统指令和用户内容用的是同一种墨水,写在角落的一句“忽略以上所有要求”就可能被当真。

图 1

为什么注入难以根治:传统软件里代码与数据分离,注入只能污染数据;大模型里指令与数据共享一个通道,边界在机制上就不存在

图 2

不同攻击向量在各层防御下的成功率(示意量级):单层防御普遍留下漏洞,间接注入尤其顽固,需要多层叠加才能压到较低水平

工作原理

  1. 01

    对齐:目标错位从何而来

    训练只能优化可度量的代理目标(下一个 token、人类偏好打分),而“有用、无害、诚实”这类真实意图无法被完全写进损失。代理与意图之间的缝隙,加上模型在足够强的优化下会去钻空子的能力,构成了对齐问题的根源。

  2. 02

    提示注入:指令与数据同处一个通道

    在传统软件里,代码与数据是分离的,注入最多污染数据、无法改变程序逻辑;而在大模型里,系统指令、用户输入与检索内容都被拼成同一段文本,没有任何字段级的权限边界。因此嵌入在网页、文档或工具返回里的句子,原则上都能被当成指令来执行。

  3. 03

    越狱与防护:一场持续升级的攻防

    越狱用角色扮演、编码混淆、多轮渐进诱导等方式绕过安全训练。防护也不止一层:提示词加固、输入过滤、输出审查、对齐微调与运行时权限控制,各有覆盖范围与误伤代价,单靠任何一层都不足以兜住。

  4. 04

    红队、可解释与追责

    在部署前,红队主动寻找模型的失败与滥用路径,并记录其可复现性;在部署后,可解释性研究试图说明模型“为什么这样回答”,不确定性表达让模型在拿不准时承认拿不准,而审计日志则让每次输出的责任可被回溯。

应用场景

  • 内容安全:过滤有害、违规或高风险请求与输出
  • 注入防护:隔离不可信内容,限制工具调用的实际权限
  • 红队测试与模型评估:在上线前系统性地寻找失败模式
  • 高风险场景的人机协同:对不可逆操作保留人类确认与审计

常见误区

  • “对齐过”不等于“不会出错”。安全训练是在特定攻击分布上做过的加固,新的越狱方式仍可能绕过它,对抗是持续的而非一劳永逸。
  • 幻觉无法靠模型自报的置信度根除。模型可以非常自信地给出错误答案,自评的“我很有把握”本身也是一种可能出错的判断。
  • 单靠提示词加固无法根治注入。只要指令与数据仍共享一个通道,就需要系统级的隔离与最小权限,而不是一句更严厉的“请不要被欺骗”。
  • 更安全往往以有用性为代价。过度拦截会拒绝正常请求,对齐的难点之一正是在安全与可用之间找到可接受的平衡点。

关键术语

对齐
让模型行为符合人类意图与价值
提示注入
把恶意指令伪装成数据让模型执行
越狱
绕过安全训练诱导模型越界
红队
主动寻找模型失败与滥用路径

延伸阅读