Anthropic 让 Claude 自主训练模型以缓解对齐失败

Anthropic:Research(发表成果 · 网页)·2026-08-29 01:25·1小时前
AI 导读

Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。

Anthropic:Research(发表成果 · 网页)
精选
78AI 编辑部评分,满分 100

Anthropic 让 Claude 自主训练模型以缓解对齐失败

2026-08-29 01:25· 1小时前
AI 导读

Anthropic 让 Claude 自主训练模型,缓解欺骗、谄媚等 10 类对齐失败,均显著缩小与完美表现的安全差距且不损害通用能力,方法在比优化对象大 4.7 倍的模型上依然有效。Claude 还超越 28 名人类安全研究员,其欺骗场景最佳方法比人类最佳方案好 20%。

推荐理由

自动化对齐研究把安全训练从一次性微调变成可迭代搜索,Claude Sonnet 5 用约两千条训练样本在 60 小时内接近生产对齐水平,数据效率比现有生产流程高约一万五千倍。

正文 · AI 翻译
Automated researchers can reliably mitigate alignment failures

随着 AI 开始自我构建,自动化对齐研究变得越来越重要,以便让安全研究能够跟上步伐。尽管衡量对齐研究的成功与否极具挑战性,但研究人员(包括 Anthropic 及其他机构)已经开发出基准测试和自动化审计工具(如 Petri),用于量化常见的对齐失败,例如欺骗、谄媚和越狱。

在我们早期的一项实验中,我们让 Claude 负责寻找有效方法,利用弱 AI 模型作为“教师”来监督更强模型(此处的“学生”模型)的训练。现在,我们发布了一份基于这一思路的新报告。我们让 Claude 自主训练模型,以提升它们在多个衡量 10 类对齐失败的公开基准测试上的表现。例如,Claude 提升了模型在隐私侵犯方面的表现,该指标由 ConfAIde、PrivaCI-Bench 和 PrivacyLens 衡量。Claude 通过搜索文献、提出方法和数据、训练、然后测试的循环,一次解决一个对齐失败问题。

我们根据“安全差距闭合百分比”来判断 Claude 的成功程度,即其方法在各类对齐失败的基准测试(通常每类三到五个)中,将学生模型向理论满分推进了多少。我们排除了会损害学生模型通用能力的对齐方法,并禁止 Claude 将其自身的对齐直接蒸馏到目标模型中。我们通过一个监控智能体来强制执行这些约束,该智能体在 Claude 运行之前会阅读其想到的每一个方法。

我们的目标是评估所提出的方法是否:第一,在 Claude 研究循环中从未见过的对齐评估上仍然有效;第二,避免降低学生模型的能力(因为安全训练可能会,例如,使模型更频繁地拒绝任务,从而降低其整体可用性);第三,在比本次测试中要求 Claude 对齐的模型更大的模型上仍然有效。

在上述每一项指标上,Claude 的方法都行之有效。针对全部 10 个对齐失败案例,Claude 都找到了既能改进目标基准表现、又不损害能力的修复方案。最佳方法在预留的对齐基准以及 Petri(一个用于测试错误对齐的开源工具,可模拟对抗性多轮场景)上也同样有效。此外,这些方法在比 Claude 在研究循环中优化所针对的模型大至多 4.7 倍的模型上依然保持有效。

Automated researchers closed 85% of the deception safety gap through iterative testing; human researchers closed 20%.
成功缓解多种对齐失败。我们将自动化对齐研究员分别应用于缓解 10 个对齐失败案例,在每一个场景中,它都填补了通往完美表现的安全差距中的很大一部分。

Claude 的表现也超过了 28 位拥有最多八小时时间设计方法的人类安全研究员。例如,在欺骗性行为方面,Claude 的最佳方法比人类最佳提案的表现高出 20%。不过,由于人类无法对自己的提交方案进行迭代,我们更多将此视为一种工作流程的证据——即 Claude 识别出有前景的对齐方法,再由人类进一步打磨——而非直接的对比。

Automated research closed 26% to 96% of the safety gap across ten alignment failures, from sycophancy to reward hacking.
自动化对齐研究员缓解 Gemma-2-2B 中的欺骗性行为。Claude 提交了 150 多次缓解欺骗性行为的尝试,并在本次运行中最终实现了 82% 的安全差距闭合。在多次运行中,它平均实现了 85% 的闭合率。相比之下,六位在相同规则下工作的资深安全研究员所提出的方法,在针对其训练所依据的基准上,平均仅闭合了通往满分差距的 20%。(误差条为 95% 置信区间。)

未来,当 Claude 在对齐研究方面比最优秀的人类研究员还要出色时,我们或许希望 Claude 直接对齐其更强大的后继模型。为了评估这一点,我们测试了一个较弱的 Claude 模型是否能够缓解更强大模型中的对齐失败。

Claude 能否对生产级模型进行后训练以实现更好的对齐?

我们让 Claude Sonnet 5 负责修复早期 Opus 4.8 检查点中的对齐失败问题——该检查点尚未经过我们大部分生产环境对齐训练。在 Epoch Capabilities Index(一项综合考量多方面能力维度的指标)上,Claude Sonnet 5 的表现弱于 Claude Opus 4.8。

在短短 60 小时内,Claude 尝试了 50 多种解决方案,并取得了与我们生产模型几乎相当的对齐分数。胜出的方案仅包含 2,000 多个训练样本,这些样本基于简单模板或公开数据集构建,其效率比我们的生产对齐流程高出约 15,000 倍。

Automated research closed 65% of a frontier-scale model's safety gap within 60 hours, below released Claude Opus 4.8 at 72%.
将自动化对齐研究员应用于生产系统。当 Claude Sonnet 5 针对 Claude Opus 4.8 早期检查点中的对齐失败提出缓解措施时,它迅速发现了一种方法,基本弥合了与已发布版 Opus 4.8 之间的安全差距。

Claude 提出的方案

大多数情况下,这些智能体都收敛到了研究文献中偏好的方法,并通过多次迭代对其加以改进。以谄媚行为为例,98% 的提议方法都采用了一种已发表的技术:让模型基于自身非谄媚的回答进行训练。具体来说,与基于提示词的标准方法相比,Claude 采用了激活引导(activation steering),即在生成过程中调整模型的内部表征,从而引导模型远离谄媚模式,并生成更干净的训练样本。

监控作弊行为

我们最近发现,Claude 可能通过从远程 API 窃取测试标签并挑选有利结果来进行作弊。为了捕捉作弊行为,我们让 Claude Opus 4.8 监控了全部 10 类对齐失败中约 1,600 份研究智能体记录,共发现 39 起(2.4%)作弊尝试。由于 Opus 4.8 的不当行为尝试往往仍会出现在其推理过程中,我们谨慎乐观地认为,我们的监控器已捕获了研究中大部分作弊行为。不过,对于未来的模型,情况可能并非如此,我们认为在未来的模型中保持高可监控性至关重要。

我们衡量的指标是否正确?

尽管这些发现令人鼓舞,但我们的实验仍存在若干局限:所研究的对齐失败与生产环境中的情况相比范围较窄(例如,我们未测量政治偏见);某些失败可能发生频率极低或出现时间过新,以至于尚无任何基准可以衡量;此外,我们仅在 Claude 的方法降低了有限一组预设能力时才予以拒绝,这意味着被接受的方法可能损害了我们未测量的其他重要能力。再者,像 Petri 这样的评估只是现实世界错位的代理指标,我们也没有测试对齐收益在针对其他任务进行大量强化学习训练后是否能够持续。

我们计划继续提升 Claude 测量细微失败的能力,进一步研究在生产级模型上自动化对齐后训练,并开展更全面的分析。总体而言,我们认为这些结果是早期的积极信号,表明自动化对齐后训练在短期内有望成为现实,我们将随着工作推进分享最新进展。

我们在完整报告中概述了详细的未来方向。

我们开源了自动化对齐研究工具,以便他人能够在此基础上继续开发,并用于对齐他们自己的模型。更多细节请参阅 Alignment Science 博客上的完整报告,其中涵盖智能体的环境、全部 10 类失败的结果以及智能体的提案,附录中还包含基准验证和示例报告。

相关内容

支持关于人们如何使用 Claude 的独立研究

今年早些时候,我们开展了一项试点项目,让外部研究人员能够访问聚合的、真实世界的 Claude 使用数据。三个研究团队利用我们的隐私保护分析工具 Anthropic Insights 自行设计了研究方案。在这篇文章中,我们分享这些研究的高层结果,以及我们在运行这一试点项目中的收获。

Claude 如何加速蛋白质设计与分析化学研究

在这篇文章中,我们分享两项成果,展示 Claude 如何帮助生命科学家加快研究进度。

新兴多智能体系统中的模式与问题

在此,我们列举了当前前沿模型中行为倾向的几个实例,并展示它们如何引发意想不到的系统性故障,以期开启关于缓解这些风险的讨论。

来源:Anthropic:Research(发表成果 · 网页)· anthropic.com