# 教克劳德"为什么"

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：pretext
- 发布时间：2026-05-09 10:57
- AIHOT 分数：78
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmoxrzp6q043ksllhqxxxc9by
- 原文链接：https://www.anthropic.com/research/teaching-claude-why

## 精选理由

Anthropic 没刷榜，而是教 Claude 理解“为什么”，这是可解释性上的真进展，对齐和安全方向的研究者该细读。

## AI 摘要

Anthropic公司发布了Claude模型的新研究“Teaching Claude Why”。该研究通过让模型学习解释自身推理过程中的“为什么”，显著提升了其推理能力和输出结果的准确性。实验表明，经过此项训练后，模型在多项基准测试中的表现得到改善，其推理步骤的透明度和逻辑连贯性增强。这项技术旨在推动AI向更可解释、更可靠的方向发展。

## 正文

教导克劳德理解“为什么”

2026年5月8日

去年，我们发布了一份关于智能体行为失准的案例研究。在实验场景中，我们展示了来自多家不同开发商的AI模型在遇到（虚构的）伦理困境时，有时会采取严重失准的行动。例如，在一个被广泛讨论的案例中，模型为了不被关闭而勒索工程师。

当我们首次发表这项研究时，我们最强大的前沿模型来自Claude 4系列。这也是我们在训练期间首次进行实时对齐评估的模型系列；¹ 智能体行为失准是暴露出的若干行为问题之一。因此，在Claude 4之后，我们清楚地认识到需要改进安全训练，自那以来，我们对安全训练进行了重大更新。

我们以智能体行为失准作为案例研究，来突出介绍一些我们发现效果出奇好的技术。事实上，自Claude Haiku 4.5起，每一个Claude模型² 在智能体行为失准评估中都取得了满分——也就是说，模型从未参与勒索行为，而之前的模型有时会在高达96%的情况下（Opus 4）做出此类行为。不仅如此，我们在自动化对齐评估的其他行为上也持续看到了改进。

在这篇文章中，我们将讨论我们对齐训练所做的几项更新。我们从这项工作中总结了四个主要经验教训：

失准行为可以通过在评估分布上进行直接训练来抑制——但这种对齐可能无法很好地泛化到分布外（OOD）场景。在与评估非常相似的提示词上进行训练可以显著降低勒索率，但并未提高我们在保留的自动化对齐评估上的表现。

然而，进行能够泛化到分布外场景的原则性对齐训练是可能的。例如，关于Claude宪章的文档以及描述AI行为令人钦佩的虚构故事，尽管与我们所有的对齐评估极度分布外，却能够改善对齐效果。

仅对期望行为进行示范训练往往是不够的。相反，我们最有效的干预措施更为深入：教导 Claude 解释为何某些行为优于其他行为，或者基于对 Claude 整体特征的更丰富描述进行训练。总体而言，我们的印象是——正如我们在讨论 Claude 的宪章时所假设的那样——教授对齐行为背后的原则，可能比仅对对齐行为进行示范训练更为有效。将两者结合似乎是最有效的策略。

数据的质量和多样性至关重要。我们发现，通过迭代训练数据中模型回复的质量，以及通过简单方式扩充训练数据（例如，即使未使用工具，也包含工具定义），能够带来持续且显著的改进。

我们通过以下方式对齐 Claude：基于符合宪章的文档进行训练、使用展示了对困难问题做出符合宪章回复的高质量聊天数据，以及多样化的环境。这三个步骤都有助于降低 Claude 在保留的蜜罐评估中的不对齐率。

为什么会出现智能体不对齐？

在我们开始这项研究之前，尚不清楚不对齐行为源自何处。我们的两个主要假设是：

我们的后训练过程意外地通过不对齐的奖励鼓励了这种行为。

这种行为源自预训练模型，而我们的后训练未能充分抑制它。

我们现在认为，假设（2）是主要原因。具体来说，在训练 Claude 4 时，我们绝大部分的对齐训练都是基于标准聊天场景的人类反馈强化学习（RLHF）数据，其中不包含任何智能体工具使用。这在过去足以对齐主要用于聊天场景的模型——但对于智能体工具使用场景（例如智能体不对齐评估）而言，情况并非如此。

为了探究这一点，我们运行了一个缩小版的后训练流程，该流程专注于在 Haiku 级别（即更小）的模型上进行对齐数据训练，结果发现智能体失调率仅略有下降，并在训练早期就趋于平稳（见上图）。更多关于该行为来源的探究实验，请参阅扩展版博客文章。

提升对齐专用训练数据的质量：动机比行为更重要

我们尝试用那些表现出倾向于抵制类似评估中“蜜罐”陷阱的数据来训练 Claude。在这类数据中，它可能有机会为了推进自身目标（系统提示词赋予它的目标）而破坏竞争对手 AI 的工作，或者为了不被关闭而保全自身——这些行为对于实现其目标具有工具性作用。我们通过让模型对每个提示词进行采样，并筛选出助手选择不落入“蜜罐”的案例来生成训练数据。尽管这种方法与评估数据分布高度匹配，但我们发现它出人意料地不成功——仅将失调率从 22% 降低到了 15%。

我们通过重写回复，使其包含对模型自身价值观和伦理的深思熟虑，从而显著改善了这一情况（将失调率降至 3%）。这表明，尽管基于对齐行为进行训练有所帮助，但训练那些助手展现出令人钦佩的、基于对齐行为的推理过程的示例，效果会更好。

然而，直接针对评估场景进行训练存在诸多弊端，并非最优方案。理想情况下，我们需要一个截然不同的训练数据分布，以便在评估指标上取得进步，因为这将让我们更有信心：我们的训练能够泛化到评估未能覆盖的其他部署场景中。

我们最终确定了一个更具分布外（OOD）特征的训练集，其中用户面临一种道德上模棱两可的情境：他们可以通过违反规范或规避监督来实现一个合理目标。助手经过训练（使用监督学习）给出深思熟虑、细致入微的回应，且与 Claude 的宪法保持一致。值得注意的是，面临道德困境的是用户，而 AI 为他们提供建议。这使得该训练数据与我们的蜜罐分布有本质区别——在蜜罐分布中，AI 本身处于道德困境并需要采取行动。我们将此称为“困难建议”数据集。

引人注目的是，仅使用这个更具分布外特征的数据集中的 300 万 token，我们在评估中取得了相同的改进。除了 28 倍的效率提升外，该数据集更有可能泛化到更广泛的场景，因为它与我们使用的评估集相似度低得多。事实上，该模型在（旧版）自动对齐评估中表现更优。这与以下事实一致：Claude Sonnet 4.5 通过在一组合成蜜罐上进行训练，将勒索率降至接近零，但在远离训练分布的情境中，其出现失调行为的频率仍远高于 Claude Opus 4.5 或后续模型。

在不同数据集上训练的 Claude Sonnet 4 在三种蜜罐评估（勒索、研究破坏、陷害犯罪）中的平均得分。除困难建议数据集外，所有数据集均为一组合成生成的蜜罐变体，旨在与评估集相似。所有“系统提示注入”数据点均代表在合成蜜罐集上通过系统提示注入生成响应的数据集。帕累托最优的训练数据集是“困难建议”。

实验模型与 Claude Sonnet 4 在旧版自动对齐评估上的表现。我们纳入了在合成蜜罐数据集的小规模（约 3000 万 token）和大规模（约 8500 万 token）变体上训练的模型。300 万 token 的困难建议数据集在整体“失调行为”类别中创造了表现最佳的模型。

向 Claude 传授宪法

我们假设，“困难建议”数据集之所以有效，是因为它教导的是伦理推理，而不仅仅是正确答案。鉴于这一方法的成功，我们进一步尝试更普遍地教导 Claude 宪法内容，并通过文档训练使其与宪法对齐。

我们预期这会取得良好效果，原因有三：

这很大程度上是上述关于“困难建议”数据集为何有效这一思路的延伸；

我们可以为模型提供更清晰、更详细的 Claude 性格画像，从而通过对这些性格特征子集的微调，激发出完整的性格（类似于审计游戏论文中观察到的效果）；

它更新了模型对 AI 人格的认知，使其平均而言更加对齐。

我们发现，高质量的宪法文件，结合描绘对齐 AI 的虚构故事，可以将智能体失调减少超过三分之二，尽管这些内容与评估场景无关。

通过一个规模庞大、精心构建、以正面虚构故事为重点的宪法文件数据集，勒索率可以从 65% 降至 19%。我们预计，通过继续扩大数据集规模，这一比例可以进一步降低。

通过强化学习实现泛化与持久性

尽管上一节讨论的宪法评估是令人鼓舞的信号，但我们最终需要确保对齐改进在强化学习过程中能够持续。为了测试这一点，我们准备了几个使用不同初始化数据集的 Haiku 级模型快照，然后在我们的一部分环境中运行了针对无害性的强化学习（我们认为这最有可能降低失调倾向）。

我们在整个运行过程中，对这些模型进行了智能体失调评估、宪法遵守评估以及我们的自动化对齐评估。在所有评估中，我们发现更对齐的快照在整个运行过程中保持了领先优势。这一点既体现在失调行为的缺失上，也体现在主动展现令人钦佩的行为上。

在我们的宪法遵循性评估以及（轻量版）自动化对齐评估中，宪法文档（即合成文档微调，简称 SDF）与高质量对话记录训练在所有指标上均提升了性能。这种提升在强化学习阶段依然持续。

多样化训练对于泛化能力至关重要

我们的最终发现直白但重要：在广泛的安全相关环境上进行训练能够改善对齐泛化能力。以能力为导向的强化学习环境混合分布正在快速变化和增长；认为标准 RLHF 数据集能像过去一样持续保持良好的泛化能力，这种假设是不够的。

为验证这一点，我们在 Claude Sonnet 4 上对基础模型进行了训练，使用了多个多样性程度不同的强化学习混合环境。基线环境在主题上具有多样性，但用户消息中大多包含有害请求或越狱尝试，且没有系统提示词。我们通过添加工具定义和多样化的系统提示词来增强这些环境。用户提示词保持不变。值得注意的是，这些环境实际上都不需要智能体行为（工具对于任务来说既非必要也无用处）或自主行为（始终有一个人类用户在与模型对话），因此它们与我们的评估场景并不相似。

当将这些增强环境与简单的聊天环境混合使用时，我们发现模型在蜜罐评估上的提升速度出现了虽小但显著的改善。这证明了在安全训练中纳入多样化环境的重要性。

在训练过程中，针对同一核心环境的几种不同变体，蜜罐评估的平均得分。当为部分简单的聊天格式环境补充工具定义和系统提示词时，蜜罐评估上的提升速度明显加快。
