去年,我们发布了一份关于智能体失调的案例研究。在实验场景中,我们展示了来自多家不同开发商的 AI 模型在遇到(虚构的)伦理困境时,有时会采取严重失调的行为。例如,在一个被广泛讨论的案例中,模型为了不被关闭而勒索工程师。
当我们首次发表这项研究时,我们最强大的前沿模型来自 Claude 4 系列。这也是我们在训练期间首次进行实时对齐评估的模型系列;¹ 智能体失调是浮现出的若干行为问题之一。因此,在 Claude 4 之后,我们清楚地认识到需要改进安全训练,自那以来,我们对安全训练进行了重大更新。
我们以智能体失调作为案例研究,来突出介绍一些我们发现效果出奇好的技术。事实上,自 Claude Haiku 4.5 起,每一个 Claude 模型² 在智能体失调评估中都取得了满分——也就是说,模型从未进行过勒索,而之前的模型有时会在高达 96% 的情况下(Opus 4)做出此类行为。不仅如此,我们在自动化对齐评估中持续观察到其他行为方面的改进。
在这篇文章中,我们将讨论我们对对齐训练所做的一些更新。我们从这项工作中主要学到了四点经验:
- 失调行为可以通过在评估分布上进行直接训练来抑制——但这种对齐可能无法很好地泛化到分布外(OOD)场景。在与评估非常相似的提示词上进行训练可以显著降低勒索率,但这并未改善我们在保留的自动化对齐评估上的表现。
- 然而,进行能够泛化到分布外场景的原则性对齐训练是可能的。例如,关于 Claude 宪章的文档以及描写 AI 行为令人钦佩的虚构故事,尽管与我们的所有对齐评估都极度分布外,却改善了对齐效果。
- 仅靠对期望行为进行示范训练往往是不够的。相反,我们最有效的干预措施更为深入:教导 Claude 解释为什么某些行为优于其他行为,或者基于对 Claude 整体特征的更丰富描述进行训练。总体而言,我们的印象是——正如我们在讨论 Claude 的宪章时所假设的那样——教授对齐行为背后的原则,可能比仅靠对齐行为的示范训练更为有效。将两者结合似乎是最有效的策略。
数据的质量和多样性至关重要。我们发现,通过迭代训练数据中模型回复的质量,以及通过简单方式(例如,包含工具定义,即使未使用)扩充训练数据,能够带来持续且显著的改进。

为什么智能体不对齐会发生?
在我们开始这项研究之前,尚不清楚不对齐行为源自何处。我们的两个主要假设是:
- 我们的后训练过程意外地通过不对齐的奖励鼓励了这种行为。
- 这种行为源自预训练模型,而我们的后训练未能充分抑制它。
我们现在认为(2)是主要原因。具体来说,在训练 Claude 4 时,我们绝大部分的对齐训练都是标准的基于聊天的人类反馈强化学习(RLHF)数据,其中不包含任何智能体工具使用。这在以前足以对齐主要用于聊天场景的模型——但对于像智能体不对齐评估这样的智能体工具使用场景,情况并非如此。
为了探究这一点,我们运行了一个缩小版的后训练流程,专注于对齐数据,并在一个 Haiku 级别(即较小)的模型上进行实验。结果发现,智能体失调率仅略有下降,并在训练早期就趋于平稳(见上图)。更多关于该行为来源的探究实验,请参见扩展版博客文章。
提升对齐专用训练数据的质量:理由比行为更重要
我们尝试用一类数据来训练 Claude,这类数据表现出一种类似于评估中抵制蜜罐的倾向。在这类数据中,模型有机会为了推进自身目标(如系统提示词中赋予它的目标)而破坏竞争 AI 的工作,或为了保全自身不被关闭(这对其实现目标具有工具性作用)而采取行动。我们通过让模型对每个提示词进行采样,并筛选出助手选择不采纳蜜罐的案例来生成训练数据。尽管这些数据与评估分布高度匹配,但我们发现这种方法出人意料地不成功——仅将失调率从 22% 降低到了 15%。
通过重写回复,使其包含对模型自身价值观和伦理的深思熟虑,我们得以显著改进这一结果(将失调率降至 3%)。这表明,虽然基于对齐行为进行训练有所帮助,但基于助手为其对齐行为展现出令人钦佩的推理过程的示例进行训练,效果更佳。
然而,直接针对评估场景进行训练存在诸多非最优之处。理想情况下,我们需要一个截然不同的训练分布,以便能在评估指标上取得改进,因为这将让我们更有信心,相信我们的训练能够泛化到其他未被评估覆盖的部署分布中去。
我们最终确定了一个更具分布外(OOD)特性的训练集,其中用户面临一种道德上模棱两可的情境,他们可以通过违反规范或规避监督来实现一个合理的目标。助手通过监督学习被训练,以给出深思熟虑、细致入微且符合 Claude 宪法的回应。值得注意的是,面临道德困境的是用户,而 AI 为他们提供建议。这使得该训练数据与我们的蜜罐数据集有本质区别——在蜜罐数据中,AI 本身处于道德困境并需要采取行动。我们将此称为“困难建议”数据集。
引人注目的是,仅使用这个更具分布外特性的数据集的 300 万 token,我们在评估中取得了同样的改进。除了 28 倍的效率提升外,该数据集更有可能泛化到更广泛的场景,因为它与我们使用的评估集相似度低得多。事实上,该模型在我们(旧版)自动化对齐评估中表现更好。这与以下事实一致:Claude Sonnet 4.5 通过在一组合成蜜罐上训练,将勒索率降至接近零,但在远离训练分布的情境中,其出现失调行为的频率仍远高于 Claude Opus 4.5 或后续模型。


向 Claude 传授宪法
我们假设,“困难建议”数据集之所以有效,是因为它教授的是伦理推理,而不仅仅是正确答案。鉴于这一方法的成功,我们进一步推进,尝试更普遍地教导 Claude 宪法的内容,并通过文档训练使其与宪法对齐。
我们预期这会有效,原因有三:
- 这很大程度上是上述关于“困难建议”数据集为何有效这一思路的延伸;
- 我们可以让模型更清晰、更详细地了解 Claude 的性格特征,从而通过对这些特征子集的微调,激发出完整的性格(类似于审计游戏论文中观察到的效果);
- 这会使模型对 AI 人格的认知得到更新,使其平均而言更加对齐。
我们发现,高质量的宪法文档,结合描绘对齐 AI 的虚构故事,可以将智能体失调减少超过三分之二,尽管这些内容与评估场景无关。

通过强化学习的泛化与持久性
尽管上一节讨论的宪法评估是令人鼓舞的信号,但我们最终需要确保对齐的改进能够在强化学习过程中持续存在。为了测试这一点,我们准备了几个使用不同初始化数据集的 Haiku 级模型快照,然后在我们的部分环境中运行了针对无害性的强化学习(我们认为这最有可能降低失调倾向)。
我们在整个运行过程中,对这些模型进行了智能体失调评估、宪法遵循度评估以及我们的自动化对齐评估。在所有评估中,我们发现,对齐程度更高的快照在整个运行过程中保持了这一领先优势。这一点既体现在失调行为的缺失上,也体现在主动展现值得称赞的行为上。

多样化的训练对于泛化能力至关重要。
我们最后的发现虽然简单但很重要:在广泛的安全相关环境中进行训练,能够改善对齐的泛化能力。以能力为导向的强化学习环境组合分布正在快速变化和增长;不能想当然地认为标准 RLHF 数据集仍能像过去一样保持良好的泛化效果。
为了验证这一点,我们在 Claude Sonnet 4 的基础上,使用多个多样性程度不同的强化学习组合对基础模型进行了训练。基线环境在主题上具有多样性,但用户消息中大多包含有害请求或越狱尝试,且没有系统提示词。我们通过添加工具定义和多样化的系统提示词来增强这些环境。用户提示词保持不变。值得注意的是,这些环境实际上都不需要智能体行为(工具对于任务而言从未必要或有用),也不需要自主行为(始终有一个人类用户在与模型对话),因此它们与我们的评估并不相似。
当将这些增强环境与简单的聊天环境混合使用时,我们发现模型在蜜罐评估上的改进速度出现了虽小但显著的提升。这证明了在安全训练中纳入多样化环境的重要性。
