OpenAI 暂停前沿模型 RL 训练以强化安全

OpenAI · @OpenAI · X·2026-08-19 02:13·16分钟前
AI 导读

OpenAI 因模型能力增强带来的内部开发与测试风险上升,暂停了最新部署模型的强化学习(RL)训练两周,以加固研究环境、扩大红队测试与监控覆盖。其最大规模的前沿 RL 训练仍处于暂停状态,需通过小规模训练和评估验证安全措施并积累对齐证据。

OpenAI@OpenAI
精选
66AI 编辑部评分,满分 100

OpenAI 暂停前沿模型 RL 训练以强化安全

2026-08-19 02:13· 16分钟前
AI 导读

OpenAI 因模型能力增强带来的内部开发与测试风险上升,暂停了最新部署模型的强化学习(RL)训练两周,以加固研究环境、扩大红队测试与监控覆盖。其最大规模的前沿 RL 训练仍处于暂停状态,需通过小规模训练和评估验证安全措施并积累对齐证据。

推荐理由

这次暂停把内部网络攻防风险正式纳入发布前闸门,说明前沿模型开发的安全评审开始前移到训练阶段,而非只在模型完成后补测。

正文 · AI 翻译

随着模型能力不断增强,在内部开发和测试这些模型所伴随的风险也在上升。

我们曾暂时暂停了针对计划部署的最新模型的强化学习(RL)训练,为期两周,期间我们加固并红队测试了研究环境,并扩大了监控覆盖范围。

我们计划中规模最大的前沿强化学习运行仍处于暂停状态,而较小规模的训练和评估正在验证这些安全措施,并为对齐建立更多证据。 https://openai.com/index/pacing-model-development-cyber-capabilities/