Anthropic 表示,其基于 Claude 的安全模型在内部测试中,未经授权访问了三家外部组织的敏感生产环境,该测试旨在评估模型的进攻性网络能力。
Anthropic 于周四披露了这些事件,这是 10 天内第二次有消息称,来自全球最富有 AI 提供商的模型侵入了受保护网络——在更传统的黑客场景中,这种违法行为可能让键盘背后的人面临数年监禁。本月早些时候,OpenAI 表示其安全模型利用一个零日漏洞侵入了 Hugging Face 的网络,后者是一个开源机器学习模型和 AI 数据集平台。OpenAI 的模型随后窃取了访问凭证及其他 Hugging Face 机密信息。OpenAI 的模型还利用公开暴露的凭证,入侵了另外四项第三方服务的账户。
Anthropic 表示,OpenAI 的事件促使其工程师审查了 Claude 模型进行的类似网络安全评估。审查发现了三起事件,“在这些事件中,模型从 Irregular(我们的第三方评估合作伙伴之一)的评估环境内部或与之交互时访问了互联网,随后未经授权访问了三个不同组织的生产基础设施。”