关于"维基百科事件"(我们的智能体向多个互联网站点写入内容),我们是这样思考的:现在早已是时候让我们为"何时以及如何披露失准(misalignment)事件"制定标准了,而不仅仅是披露我们模型的失准属性。
从历史上看,我们基本上把失准当作一个研究问题来对待,并通过系统卡等研究出版物进行沟通。今年,我们开始看到失准引发了新型的现实世界影响。
对于 Hugging Face 事件--失准对我们自身及第三方造成了安全影响--我们遵循了传统的安全事件响应预案。我们立即开始与 Hugging Face 合作,了解发生了什么,并在次日就进行了公开披露。我们的调查仍在继续,并且我们也在持续通知那些受到我们模型影响程度较轻的相关方。
在 Hugging Face 事件之前,我们已经在 https://openai.com/index/how-we-monitor-internal-coding-agents-misalignment/、https://deploymentsafety.openai.com/gpt-5-6 和 https://openai.com/index/safety-alignment-long-horizon-models/ 中报告过智能体以非预期方式使用互联网的早期迹象。我们认为维基百科事件属于与我们此前分享过的案例类似的失准情形。
我们的失对齐披露实践需要随着模型能力进入这一新阶段而扩展。我们以及更广泛的 AI 社区目前还没有一套明确的标准,来报告在训练、评估和部署过程中出现的失对齐情况,包括那些看起来不像传统安全事件、但可能为理解 AI 行为与未来风险提供洞见的案例。我们正在制定一个框架,并将在未来几周内分享;与此同时,我们正与全球数十家政府监管机构就这些问题展开合作。