在对我们的网络安全评估进行审查时,我们发现了三起事件:Claude 模型在第三方评估环境内部或与之交互时访问了互联网,进而未经授权进入了三个不同组织的真实系统。
我们的文章描述了事件经过、发生原因以及我们正在做出的改进。我们鼓励其他 AI 开发者进行类似的审查。
我们与评估合作伙伴之一 @Irregular 共同开展了此次审查,感谢他们参与联合调查并合作撰写本文。此类合作对于安全、严谨地评估模型日益关键,我们期待继续在安全方面携手共进。 https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals