# Anthropic 在网络关键能力时代放缓模型开发：暂停 RL 训练并强化安全防护

- 来源：Hacker News 热门（buzzing.cc 中文翻译）
- 作者：j4mie
- 发布时间：2026-08-20 05:42
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmt0mqceo08lzro2o6xi3rlk4
- 原文链接：https://openai.com/index/pacing-model-development-cyber-capabilities

## 精选理由

安全控制从发布前评估提前到训练和评估全程，30分钟未澄清关键边界告警即暂停活动的规则，给训练高能力模型的团队提供了可对标的操作时限。

## AI 摘要

Anthropic 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到“关键网络安全能力阈值”，暂时放缓模型扩展速度，包括暂停最新模型两周的强化学习（RL）训练。公司已加强研究环境安全要求，包括工作负载隔离、网络隔离和持续安全测试，并扩大思维链监控范围。涉及 Astra 或网络模型的工作负载需满足最严格安全标准，部分训练和评估工作仍处于暂停状态。

## 正文

在网络关键能力时代把控模型开发节奏

过去几周，两件事凸显了能力日益增强的 AI 系统所带来的不断上升的风险：OpenAI-Hugging Face 事件，以及另一件事——初步证据表明，我们即将推出的模型之一 Astra 可能达到《预备框架》中“关键网络安全能力”的门槛。这两件事，加上我们内部研究的快速进展，进一步加剧了我们强化监控、对齐和遏制保障工作的紧迫性，这些工作贯穿训练流程的各个阶段。

随着模型能力不断增强，内部开发与测试相关风险也随之上升。我们的监控、对齐和安全标准必须走在这些风险前面。我们希望花必要的时间来达到这些标准，因此暂时放慢了扩展节奏。这包括对我们计划部署的最新模型暂停了两周的强化学习（RL）训练，期间我们进一步加固了研究环境并进行了红队测试，同时扩大了监控系统的覆盖范围。我们规模最大的前沿 RL 训练计划仍处于暂停状态，在此期间我们开展小规模训练和评估，以考察模型行为、验证保障措施，并在继续推进之前积累更多对齐证据。

对齐——即让 AI 系统按预期行事并接受人类监督的工作——长期以来一直是我们研究计划的核心。我们现在要求在训练的整个过程中提供更强的对齐行为证据，这建立在已在进行的研究和评估基础之上。让能力日益增强的系统保持对齐，是整个领域都需要应对的挑战。我们从即将推出的模型进展中看到的信号清楚地表明，我们需要一种更广泛的思路——一种在现有《预备框架》基础上构建并超越其范围的思路。

我们认为，坦诚说明我们的方法正在如何变化非常重要。下面，我们介绍已经对研究流程和基础设施所做的改动，以及仍在进行中的工作。

为能力更强的模型强化保障措施

我们开发更强大模型的方法，建立在三项相互强化的安全保障之上：

监控，用于检测并使我们能够应对令人担忧的行为。

对齐，用于降低有害或未经授权操作的可能性。

安全措施，用于限制 AI 系统可以访问或影响的范围。

我们预计模型很快将承担大部分安全工作，包括防御其他模型。这将使三项安全保障能够随模型能力同步扩展，我们认为这一点至关重要。

我们将这些安全保障贯穿于研究和部署的各个环节，并根据每个模型的能力、运行环境和风险水平进行相应调整。

保障研究环境安全

随着前沿模型获得更强的网络安全能力，我们正在提高训练和评估这些模型的环境的安全标准。达到这些标准需要大量的工程工作，也给前沿研究带来了巨大的成本和延误。在 OpenAI-Hugging Face 事件*发生后，我们立即暂停了研究集群中可执行代码或使用可访问互联网工具的前沿模型推理任务。我们很快恢复了受限且更安全的代码执行路径，然后逐一审查每个工作负载，以确定其是否可以安全恢复。部分研究工作负载在新管控措施下恢复运行，而其他负载则需要额外的调整。

在接下来的几周里，我们为前沿研究工作负载制定并开始实施更严格的安全要求。例如：

工作负载隔离：我们现在要求对执行模型生成或不可信代码的工作负载实施更强的隔离（“沙箱”）。这也适用于在处理模型输出时可能被攻破的软件。

网络隔离：我们实施了更多控制措施，将高风险和不可信的工作负载与互联网隔离。我们设计这些控制措施时，确保单个工作负载或支撑服务被攻破本身不会导致对互联网或其他内部网络的未授权访问。

持续安全测试：我们已重新配置环境，移除了可能存在漏洞的共享服务，减少了常驻权限，并改善了安全与信任边界。我们还在提升收集和监控安全日志的能力。最后，我们正在投入自动化建设，利用我们的模型持续针对模拟攻击测试这些边界。

这些控制措施共同提供了纵深防御，有助于保护我们的研究环境免受攻击。目前，对于涉及 Astra 或网络模型的负载，我们要求采取最严格级别的安全防护措施，因为我们已判定 Astra 模型可能具备关键级别的网络能力。这些防护措施同样适用于所有其他与网络相关的负载。

虽然部分 Astra 训练和评估已满足这些要求，但仍有大量负载处于暂停状态，直到它们完全迁移并增强至符合新的安全标准。我们正优先将安全和对齐相关负载迁移至这些新环境。

扩展思维链监控

监控长期以来一直是我们模型开发流程的重要组成部分，包括对内部编码智能体和长时间运行会话的监控。我们的监控工作尤其聚焦于前沿模型的内部部署以及前沿强化学习训练运行，我们认为这些是风险最高的负载，因为它们可能将先进的模型能力与工具访问、敏感系统以及内部或外部网络访问相结合。这些监控此前并未应用于所有使用工具的推理和训练运行。我们已通过新的监控体系修订并扩展了我们的方法。

这套新的监控方案是多阶段的，首先由激活分类器（检测模型内部活动的探测器）对每个采样 token 运行检查，并将潜在问题升级给日益复杂且高算力的自动化调查系统。这些系统会检查工具操作、可用推理过程以及完整活动序列，以发现未授权访问、数据窃取、破坏性行为以及试图突破安全防护的举动。我们的目标是在监控系统发现可疑活动后的 30 分钟内发出警报。如果监控系统识别出可能违反关键安全边界的行为，就会生成最高优先级警报。在我们当前的实现中，安全、安保和研究团队会被呼叫响应。如果这些团队无法在 30 分钟内明确判定该标记为误报，则需暂停相关活动。

对于所有涉及工具的 Sol 能力级别或更高模型的 RL 训练和评估，都必须进行此监控。8 月 7 日，一旦我们确定 Astra 可能具备关键网络能力，便对所有带工具的 Astra 推理（而不仅仅是 RL 训练和评估）增加了额外的监控要求。

这些安全措施需要可观的算力。我们目前的估算显示，监控开销约占被监控推理算力的 20%，不过这一成本在训练和评估工作负载中差异很大。我们将在后续的博客文章中分享有关该系统的更多细节。

推进对齐研究

对齐研究是我们的核心使命。我们的使命是确保通用人工智能惠及全人类。随着模型获得更高级的能力（例如发动网络攻击的能力）并在更复杂的环境中运行，奖励黑客（在训练中寻找获得高奖励的途径而并未真正实现预期结果）、欺骗或未授权访问等不对齐行为将带来日益严重的风险。

在针对最强模型的强化学习训练中，我们目前正将核心对齐技术应用于训练流程的更多阶段。这包括改进奖励模型，使其能更好地跨任务和跨环境检测并抑制不安全行为；训练模型更诚实地说明自身的行为、能力与局限；以及减少利用奖励、评分器、工具或监督机制弱点的行为。我们还在扩大训练覆盖范围，以覆盖模型与外部系统或资源交互时可能造成危害的行为。

我们将继续大力投入对齐研究，扩大评估覆盖面，并将所学成果用于指导训练与安全防护。我们计划在不久的将来更充分地分享我们的对齐研究成果，包括我们在模型行为方面的发现，以及我们遇到的新挑战。

下一步计划

我们将持续演进《预备框架》（Preparedness Framework），将这些安全防护措施贯穿训练与部署全流程，并更好地反映未来模型的能力及其运行环境。要开发出能随这些能力同步扩展的方法，需要在模型辅助安全、更有效的监控以及对齐研究的持续进展方面进行长期投入。我们计划引入外部机构参与，并在方法演进过程中分享更多经验。

前沿模型的能力正在飞速提升。我们理解、对齐并保障它们安全的能力必须保持领先。

*我们将在未来几周内发布一份关于我们研究成果的技术报告。

2026

对齐
