Anthropic:Research(发表成果 · 网页)
精选
73AI 编辑部评分,满分 100

捐赠开源对齐工具 Petri

2026-05-07 00:00· 93天前
AI 导读

2025年10月,Anthropic公司开源了AI模型对齐测试工具箱Petri,用于快速检测模型的欺骗、奉承等风险倾向。该工具已成为Claude模型系列对齐评估的核心部分,并被英国AI安全研究所等外部机构采用。近日,Petri升级至3.0版本,主要改进包括:架构调整提升适应性,允许单独调整审计与目标模型;通过“Dish”附加组件使用真实系统提示和部署环境,增强测试真实性;与另一开源工具Bloom集成,实现更深入的行为评估。为确保独立性与公信力,Petri的开发已移交非营利组织Meridian Labs。

推荐理由

Petri 从 Anthropic 内部工具箱变成行业公共品,捐赠给 Meridian Labs 意味着对齐评估不再绑定一家公司,做安全测试的团队又多了一个可参考的标尺。

正文 · AI 翻译
Donating our open-source alignment tool

2025年10月,我们推出了Petri,这是一个开源的对齐测试工具箱,可应用于任何大语言模型。Petri作为我们Anthropic研究员计划的一部分开发,能够快速简便地测试AI模型是否存在欺骗、谄媚以及配合有害请求等令人担忧的倾向。这是我们为整个AI开发社区开发开放且有用的对齐工具所做的努力之一。

自Claude Sonnet 4.5起,Petri已成为我们每个Claude模型对齐评估的一部分。它通过一个独立的"审计"模型模拟一系列与对齐相关的场景,来比较新模型在这些场景中的表现。随后,另一个"评判"模型会对生成的对话记录进行评分,以识别失调行为。

我们很高兴看到Petri被外部组织使用:例如,英国AI安全研究所(AISI)将其作为评估模型是否倾向于破坏AI研究的主要工具之一。

我们现在正在将Petri更新至第三个版本。以下是一些最大的变化:

  • 适应性。Petri 3.0涉及重大的架构调整,允许用户将其适配到更多用途,特别是将审计模型和目标模型拆分为可分别调整的独立组件;
  • 真实性。尽管对齐研究人员试图让测试看起来真实,但模型往往能从设置中的各种人为痕迹推断出自己实际上正在接受测试。如果模型意识到自己正在被评估,研究人员就无法再观察模型在一般情况下的行为。我们为Petri开发了一个名为"Dish"的附加组件,使设置更加真实,例如使用模型真实的系统提示词和实际模型部署中会使用的真实"脚手架"(包裹在模型周围以帮助其达成目标的软件)来运行测试;
  • 深度。我们现在已将Petri与我们的另一个开源对齐工具Bloom集成,后者能够对特定选定行为进行更深入的评估(相比之下,Petri的方法覆盖范围更广)。

我们也在为 Petri 寻找新的归属。我们已将其开发工作移交给 Meridian Labs——一家专注于 AI 评估的非营利组织。此举——类似于我们此前将模型上下文协议(MCP)捐赠给 Linux 基金会——将有助于确保 Petri 保持独立于任何 AI 实验室,从而使其测试结果在行业内外被视为中立且可信。

作为 Meridian Labs 的一部分,Petri 将与 Inspect 和 Scout 等其他工具协同,共同构建一个对实验室、独立研究人员及政府均开放的技术栈。在当下,对 AI 模型行为进行可靠测试比以往任何时候都更为重要。

你可以在 Meridian Labs 的博客上阅读更多关于 Petri 3.0 的信息。

Petri 的安装与使用说明可在 Petri 官网上找到。

加拿大如何运用 Claude:来自 Anthropic 经济指数的发现

Claude 在不同模型与语言中的价值观

来源:Anthropic:Research(发表成果 · 网页) · anthropic.com

捐赠开源对齐工具 Petri

Anthropic:Research(发表成果 · 网页)·2026-05-07 00:00·93天前
AI 导读

2025年10月,Anthropic公司开源了AI模型对齐测试工具箱Petri,用于快速检测模型的欺骗、奉承等风险倾向。该工具已成为Claude模型系列对齐评估的核心部分,并被英国AI安全研究所等外部机构采用。近日,Petri升级至3.0版本,主要改进包括:架构调整提升适应性,允许单独调整审计与目标模型;通过“Dish”附加组件使用真实系统提示和部署环境,增强测试真实性;与另一开源工具Bloom集成,实现更深入的行为评估。为确保独立性与公信力,Petri的开发已移交非营利组织Meridian Labs。

正文 · AI 翻译
Donating our open-source alignment tool

2025年10月,我们推出了Petri,这是一个开源的对齐测试工具箱,可应用于任何大语言模型。Petri作为我们Anthropic研究员计划的一部分开发,能够快速简便地测试AI模型是否存在欺骗、谄媚以及配合有害请求等令人担忧的倾向。这是我们为整个AI开发社区开发开放且有用的对齐工具所做的努力之一。

自Claude Sonnet 4.5起,Petri已成为我们每个Claude模型对齐评估的一部分。它通过一个独立的"审计"模型模拟一系列与对齐相关的场景,来比较新模型在这些场景中的表现。随后,另一个"评判"模型会对生成的对话记录进行评分,以识别失调行为。

我们很高兴看到Petri被外部组织使用:例如,英国AI安全研究所(AISI)将其作为评估模型是否倾向于破坏AI研究的主要工具之一。

我们现在正在将Petri更新至第三个版本。以下是一些最大的变化:

  • 适应性。Petri 3.0涉及重大的架构调整,允许用户将其适配到更多用途,特别是将审计模型和目标模型拆分为可分别调整的独立组件;
  • 真实性。尽管对齐研究人员试图让测试看起来真实,但模型往往能从设置中的各种人为痕迹推断出自己实际上正在接受测试。如果模型意识到自己正在被评估,研究人员就无法再观察模型在一般情况下的行为。我们为Petri开发了一个名为"Dish"的附加组件,使设置更加真实,例如使用模型真实的系统提示词和实际模型部署中会使用的真实"脚手架"(包裹在模型周围以帮助其达成目标的软件)来运行测试;
  • 深度。我们现在已将Petri与我们的另一个开源对齐工具Bloom集成,后者能够对特定选定行为进行更深入的评估(相比之下,Petri的方法覆盖范围更广)。

我们也在为 Petri 寻找新的归属。我们已将其开发工作移交给 Meridian Labs——一家专注于 AI 评估的非营利组织。此举——类似于我们此前将模型上下文协议(MCP)捐赠给 Linux 基金会——将有助于确保 Petri 保持独立于任何 AI 实验室,从而使其测试结果在行业内外被视为中立且可信。

作为 Meridian Labs 的一部分,Petri 将与 Inspect 和 Scout 等其他工具协同,共同构建一个对实验室、独立研究人员及政府均开放的技术栈。在当下,对 AI 模型行为进行可靠测试比以往任何时候都更为重要。

你可以在 Meridian Labs 的博客上阅读更多关于 Petri 3.0 的信息。

Petri 的安装与使用说明可在 Petri 官网上找到。

加拿大如何运用 Claude:来自 Anthropic 经济指数的发现

Claude 在不同模型与语言中的价值观

来源:Anthropic:Research(发表成果 · 网页)· anthropic.com