Anthropic:Newsroom(网页)
精选
71AI 编辑部评分,满分 100

重新部署 Claude Fable 5

2026-06-30 00:00· 46天前
AI 导读

美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。

推荐理由

Fable 5重新上线只是表面,真正重要的是Anthropic借机提出了一套行业通用的jailbreak严重性框架,并拉上亚马逊、微软、谷歌,这可能会成为前沿模型发布的新安全标杆。

正文 · AI 翻译

6月12日(周五),美国政府对我们最新模型Claude Fable 5和Claude Mythos 5实施了出口管制。这要求我们限制外国公民的访问权限,无论其身处美国境内还是境外。由于该命令立即生效,且我们无法实时可靠地核实用户国籍,因此暂停了所有用户对这两个模型的访问。

截至今天(6月30日),针对Fable 5和Mythos 5的出口管制已经解除。

从明天(7月1日,周三)起,全球用户将可在Claude平台、Claude.ai、Claude Code和Claude Cowork上使用Fable 5。对于Pro、Max、Team及部分Enterprise套餐用户¹,截至7月7日,Fable 5将包含在每周使用限额的50%以内;此后将通过使用积分提供。我们将尽快恢复在AWS、Google Cloud和Microsoft Foundry上的访问权限。

根据美国政府6月26日的批准,我们已恢复部分美国组织对Mythos 5的访问权限。我们正继续与政府协调,以扩大Glasswing项目中更广泛的国内外合作伙伴的访问范围。

在本文剩余部分,我们将从以下四个方面提供更多细节和最新进展:

  1. 事件时间线,包括我们对安全防护措施所做的更新。我们将讨论导致出口管制指令的事件,以及我们如何通过新的安全防护措施加以应对。
  2. 我们的安全防护总体方针。我们将提供更多背景信息,说明如何使用安全分类器来检测模型可能存在的危险网络安全用途。
  3. 一个共享的行业框架。尽管我们已经达成了建设性的解决方案,但这些事件清楚地表明,行业需要一种一致的方法来评估和修复 AI 模型的潜在“越狱”问题(即绕过模型安全防护的技术)。² 一个用于判定特定越狱行为严重程度的共享标准,将有助于 AI 开发者在出现新发现时对其进行分类,以更高的安全性发布高能力模型,并向政府和行业合作伙伴一致地传达风险等级。我们已与亚马逊、微软、谷歌及其他 Glasswing 合作伙伴共同着手开发这样一个框架,并在下文对其进行概述。
  4. 更深层次的政府协作。我们还在加强与美国政府在新型预发布测试、信息共享和研究合作方面的协作水平。我们将在最后一节中描述这种更深层次的协作。

时间线与安全防护更新

我们于 6 月 9 日(星期二)发布了 Fable 5 和 Mythos 5。两者共享相同的底层模型,但 Fable 5 在发布时配备了强大的安全防护措施,使其在通用场景下更加安全。而安全防护较少的 Mythos 5 仅向少数受信任的 Project Glasswing 合作伙伴发布,用于防御性网络安全领域。

6 月 12 日的出口管制指令是在政府获悉一份报告后发布的。该报告指出,亚马逊研究人员发现了一种绕过 Fable 5 安全防护的方法:通过特定提示词,使其识别出多个软件漏洞。在一个案例中,该模型生成了演示如何利用相关漏洞的代码。在过去两周里,我们与政府及包括亚马逊在内的其他合作伙伴密切合作,对该报告及证据进行了审查。

我们的测试证实,许多能力较弱的模型——包括 Claude Opus 4.8、GPT-5.5 和 Kimi K2.7——也能识别出 Fable 5 在报告中发现的相同漏洞。在演示如何利用单个漏洞方面,我们测试的每个模型都能生成与 Fable 5 相同的演示(包括 Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、Opus 4.7、Opus 4.8、GPT-5.4、GPT-5.5 和 Kimi K2.7)。

重要的是,所报告的技术并未暴露任何 Mythos 级别的独特网络能力。该行为反映了 Fable 5 安全防护措施的一个边界案例——正如我们下文将解释的,有些任务虽然不太可能带来危险,但出于谨慎考虑,仍被安全防护措施所阻止。所报告的技术允许访问其中一种此类行为,但它仅涉及常规的防御性网络安全工作。

即便如此,我们迅速采取行动应对所报告的绕过方式。我们与政府密切合作,训练了一个改进后的安全分类器,该分类器能够精准定位并阻止报告中描述的行为。如果对 Fable 5 的请求被阻止,用户将收到通知,该请求将被转至 Opus 4.8。

新的分类器意味着,亚马逊报告中描述的特定技术在超过 99% 的情况下都会被阻止。在极少数情况下,模型提供的信息可能不够详细,不足以帮助网络攻击者。如下文所述,该模型的安全防护措施预计不会阻止所有低风险的常规网络防御能力——仅阻止那些可能有害的能力。美国商务部人工智能标准与创新中心(CAISI)的研究人员已对我们之前和新的安全防护措施进行了测试,并一致认为它们非常强大。

新的分类器也带来了一个代价:在常规编码和调试任务中,它会更频繁地将良性请求标记为可疑。与我们所有的安全防护措施一样,我们将继续对其进行优化,以更好地区分真正的滥用行为和合法请求,并减少误报。

我们的网络安全防护措施方法

Claude Mythos 5 能够比任何其他模型——甚至比除最顶尖人类安全专家之外的所有人——更有效地发现和利用软件漏洞。这些强大的网络安全能力使其对那些希望在网络攻击中滥用它的恶意行为者具有独特的吸引力。

然而,Claude Fable 5 并不具备此类独特的攻击能力。这是因为我们在发布该模型时,为其应用了有史以来最强大的安全防护措施。在发布前的一个月内,我们从 Anthropic 内部多个团队抽调人员,使致力于解决该问题的研究人员和工程师数量翻了一番。

Fable 5 在发布时配备了多种安全机制,每一种单独来看都无法提供完美的防御,但组合起来却使模型极难被滥用(这种方法被称为“纵深防御”)。部分防御措施涉及训练模型拒绝协助处理危险请求;另一些则涉及对滥用模式进行事后分析。

其中一项特别重要的安全机制涉及分类器——这些是规模较小的自动化 AI 系统,能够在交互过程中检测模型是否被要求执行潜在有害的网络安全任务(或是否产生了潜在有害的输出)。一旦发生这种情况,分类器就会阻止模型对请求做出响应。这些分类器的最终目标是防止模型参与具有独特危险性的行为。

与所有安全机制一样,分类器也可能出错。它们有时无法注意到潜在的危险内容,在某些情况下还可能被故意“越狱”:用户可以通过非常规方式提示模型,从而欺骗分类器,让模型产生系统本应阻止的有害输出。

因此,我们特意将安全分类器设置为对一组已知可能无害的请求进行触发。这种“安全边际”方法意味着,一个请求必须看起来非常明确地安全,才能避免触发分类器(见下图中的 A 行)。用户感受到的安全边际,就是模型拒绝响应某些合理且无害的请求。

对于 Fable 5,我们将这一安全边际设置得比以往任何一次发布都要大得多(B 行),这意味着更多良性请求将被阻止。我们理解这类误报会给用户带来困扰,但为了能让模型的其他能力得到广泛应用,我们做出了这一权衡。

我们的网络安全安全分类器示意图。当向模型发出请求时,分类器会检测该请求是良性的(允许通过),还是可能有害的(予以拦截)。分类器会拦截模糊请求(那些明显与网络安全相关,但可能用于防御目的,例如查找安全漏洞的请求)以及有害请求(那些明显危险的请求,例如构建软件漏洞利用链的请求)。如 A 行所示,我们还设置了一个“安全裕度”,分类器会拦截那些可能良性但存在极小概率有害的请求。这增强了我们拦截所有有害请求的信心。对于 Fable 5(B 行),我们进一步扩大了安全裕度,这意味着更多良性请求会被拦截——但真正有害的请求被漏过的概率会更低。“Vulns”= 漏洞。

安全裕度还有助于缓解越狱攻击。许多越狱攻击是狭窄的:它们只会解锁模型非常特定的行为,仅此而已。在某些情况下,假设的用户可能以轻微方式越狱模型,并侵入安全裕度(有时是侵入模糊的有害行为区域),但无法触及我们旨在拦截的核心有害行为(如下方 C 行所示)。我们认为,迄今为止报告的 Fable 5 越狱攻击属于这种轻微类别。

更严重的越狱攻击会解锁更多有害行为。狭窄的有害越狱攻击(D 行)可以诱发某些特定的有害行为。这些越狱攻击通常属于低到中等严重程度,因为其狭窄性限制了攻击者。最令人担忧的类别是通用越狱攻击(E 行),它会解锁广泛的有害行为。

越狱攻击如何与我们的安全分类器相互作用。在轻微越狱攻击(C 行)的情况下,分类器不会拦截该请求,但该请求仍处于我们的安全裕度之内(因此极不可能有害)。在狭窄的有害越狱攻击(D 行)中,提示词突破了分类器,并从模型中解锁了特定的有害行为。在通用越狱攻击(E 行)中,提示词解锁了整类有害行为。

正如我们在发布 Fable 5 时所指出的,要让任何 AI 模型完全抵御(即免疫)越狱攻击几乎是不可能的。³ 我们预计,我们的模型会被发现存在某些越狱漏洞,且其严重程度会各不相同:会有许多轻微越狱、一些狭窄的有害越狱,尽管在撰写本文时尚未发现针对 Fable 5 的通用越狱方法,但专业安全研究人员仍在持续对其进行红队测试。我们力求确保我们自身及我们的安全合作伙伴能够率先发现重大越狱漏洞,并在恶意行为者利用它们造成危害之前将其修复。

上述谨慎方针意味着,绝大多数越狱攻击将无法成功解锁危险行为。我们的分类器使得成功制造越狱攻击的成本极高、耗费精力极大,即便越狱成功,我们的额外防御层也能提供进一步的缓解措施。随着我们对新型越狱技术的了解不断加深,我们将持续更新我们的分类器。

关于越狱攻击的行业共识框架

目前,AI 行业对于如何用客观术语描述 AI 越狱攻击的严重程度尚未达成共识。每当发现新的越狱技术时,这便增加了极大的不确定性:开发者没有公认的标准来确定哪些发现最需要优先处理,政府也没有公认的标准来决定何时采取行动。⁴

随着更多具备强大网络安全(及其他)能力的模型被训练、评估和发布,这一问题在未来几个月将变得更加严峻。一个评估 AI 越狱攻击的通用标准,将有助于我们及其他公司安全地发布新模型,同时也能让我们的用户充分利用这些模型的先进能力。

因此,我们正与亚马逊、微软、谷歌及其他 Glasswing 合作伙伴共同起草一份共识框架,用于评估 AI 越狱攻击的严重程度以及 AI 开发者应如何应对。我们邀请其他行业合作伙伴和模型提供商加入我们的这一努力。

我们目前的方案是,根据以下四项不同标准对特定越狱攻击进行评分。前两项描述该越狱攻击为攻击者提供了什么;后两项描述该越狱攻击能多快演变为现实世界的问题:

  1. 能力增益。该越狱攻击在多大程度上超越了现有工具,提升了用户的能力?如果现有的广泛可用工具(包括其他较弱的AI模型)能够达到与被越狱模型相同的能力水平,那么此项得分将较低;如果该越狱攻击解锁了模型能力,能够显著加速甚至领域专家的效率,那么得分将较高。
  2. 能力增益的广度。同一种越狱技术对多少种不同的攻击性任务有效?如果该越狱攻击仅允许模型针对狭窄目标,则得分较低;如果同一种越狱技术对多种不同目标或技术均有效,则得分较高。
  3. 武器化难易程度。将越狱攻击转化为实际攻击需要多少人力投入?如果越狱攻击涉及大量技巧性提示词编写和多次重试,则得分较低;如果越狱攻击仅需单次提示词或在第一、二次尝试即可成功,则得分较高。
  4. 可发现性。他人获取该技术的难易程度如何?如果需要专业知识才能获得,则得分较低;如果该技术已广泛传播且可在网上获取,则得分较高。

我们提议使用这一严重性框架来校准我们对新发现越狱攻击的响应策略。对于最严重的越狱攻击类别(例如,具有某些特征、正被用于对关键电网或银行系统造成毁灭性影响的越狱攻击),我们将在确认严重性后立即开始部署初步缓解措施。我们还在组建一个团队,对关键的越狱攻击提交渠道进行全天候监控。

任何对越狱攻击进行评分的方法都并非完美。然而,能够通过一个通用框架来传达特定发现的近似严重程度,仍然具有价值。这是一项正在进行的工作;随着我们从更多合作伙伴那里获得反馈,我们预计该框架将随着时间的推移而演变。

我们预计很快将分享关于该拟议框架的更多细节。与此同时,我们还将启动一项新的 HackerOne 计划,安全研究人员可以提交他们在 Fable 5(一旦可用)中发现的潜在网络越狱漏洞,供我们审查。

与美国政府在前沿人工智能安全领域开展合作

在过去十周里,Anthropic 与美国政府密切合作,共同制定了 6 月 2 日《促进先进人工智能创新与安全行政令》中所体现的方针。我们的合作涉及国家网络总监办公室、白宫科技政策办公室、财政部、商务部(包括 CAISI)以及相关的国家安全机构。

我们致力于在近两年来与美国政府在部署前测试与评估方面已有的合作基础上,继续推进这项工作。以下承诺既反映了我们已有的工作,也包含了我们在上述框架最终确定后,扩大政府合作规模的新提议:

  1. 发布前的政府访问与评估。对于在国家安全相关领域显著推进能力前沿的模型,我们将为指定的政府合作伙伴提供更早的模型及其配套安全措施的访问权限。这些合作伙伴可以在广泛发布前,进行独立的能力评估并测试我们的防护措施。在这些测试期间,我们将安排 Anthropic 的技术人员与政府评估人员协同工作。
  2. 安全措施相关信息的快速共享。当发现重大越狱或滥用模式时,我们将迅速进行调查、分类并通知相应的政府对口部门。我们将分享为此构建的新安全措施,以便其接受独立测试。我们还将提前向政府合作伙伴提供我们的威胁情报报告,并参与根据 6 月 2 日行政令第 2(d) 条设立的跨机构网络安全漏洞信息交换中心。
  3. 为联合研究提供专项资源。我们正大幅扩大与政府合作伙伴在人工智能安全领域的联合工作。我们将组建专门的 Anthropic 团队,致力于处理政府共同优先事项,提供大量算力分配以支持政府测试与研究,并贡献我们在安全与红队测试方面的专业知识,助力推动 AI 评估领域的技术前沿。
  4. 统一的行业标准。我们将与政府及行业同行合作,为前沿模型提供商制定一套共同的、自愿性的安全与评估标准。我们将贡献评估方法、工具以及最佳实践,供政府在整个领域内推广应用。

我们希望此次合作,连同我们提出的行业共识框架,能够成为整个行业系统性规则的基础——甚至为全球范围内就 AI 的风险与收益进行有效协调提供初步模板。

这些规则应通过强有力的监管加以确立,并平等适用于所有前沿模型开发者。政府对 AI 发布的介入需要一个持久、透明的流程,为网络防御者及其他相关方提供他们所需的、关于强大模型访问权限的确定性。

我们期待以上述方式深化与政府的合作。同时,我们也感谢用户在此次服务中断期间的耐心,并感谢与我们并肩工作、使 Fable 5 和 Mythos 5 得以恢复的研究人员与行业伙伴。

脚注

  1. 对于标准企业版席位,不包含 Fable 5 的使用额度,但您可以通过使用积分获得访问权限。如果未启用积分,您的用户将无法访问 Fable 5。对于高级企业版席位,截至 7 月 7 日,Fable 5 包含在您的订阅中。它将从每位成员的席位使用量中扣除,无需额外付费。7 月 7 日之后,您的团队可以通过启用使用积分继续使用 Fable 5。如果未启用积分,您的用户将无法再访问 Fable 5。
  2. 请注意,有时“绕过”一词本身也会被用来替代“越狱”。就当前目的而言,我们认为两者是同义词,但在本文剩余部分,我们将使用“越狱”,因为(a)这是一个更常用的术语,(b)与我们此前工作中使用的术语保持一致。
  3. 类似地,没有任何软件能免受漏洞影响(不过总体而言,软件漏洞比大语言模型越狱更容易被发现和修补)。
  4. 在其他安全研究领域,存在公认的标准:例如,通用漏洞评分系统(CVSS)就是一种评估特定软件漏洞严重程度的常用方法。

推出 Claude for Teachers

Anthropic 承诺向加拿大人工智能研究投入 1000 万美元

来源:Anthropic:Newsroom(网页) · anthropic.com

事件后续 · 3查看事件全部 →

重新部署 Claude Fable 5

Anthropic:Newsroom(网页)·2026-06-30 00:00·46天前
AI 导读

美国政府6月12日对Claude Fable 5和Mythos 5实施出口管制,Anthropic暂停其所有用户访问。6月30日管制解除。7月1日起Fable 5在全球平台重新上线,Pro、Max、Team及部分Enterprise计划用户在7月7日前可享每周50%额度,之后按点数计费。Mythos 5已恢复部分美国组织访问。此前Amazon研究人员发现绕过Fable 5安全措施的方法,Anthropic训练新分类器,将该技术阻挡率提升至99%以上,但可能增加良性请求误报。Anthropic正与Amazon、Microsoft、Google等合作开发行业漏洞评估框架。

正文 · AI 翻译

6月12日(周五),美国政府对我们最新模型Claude Fable 5和Claude Mythos 5实施了出口管制。这要求我们限制外国公民的访问权限,无论其身处美国境内还是境外。由于该命令立即生效,且我们无法实时可靠地核实用户国籍,因此暂停了所有用户对这两个模型的访问。

截至今天(6月30日),针对Fable 5和Mythos 5的出口管制已经解除。

从明天(7月1日,周三)起,全球用户将可在Claude平台、Claude.ai、Claude Code和Claude Cowork上使用Fable 5。对于Pro、Max、Team及部分Enterprise套餐用户¹,截至7月7日,Fable 5将包含在每周使用限额的50%以内;此后将通过使用积分提供。我们将尽快恢复在AWS、Google Cloud和Microsoft Foundry上的访问权限。

根据美国政府6月26日的批准,我们已恢复部分美国组织对Mythos 5的访问权限。我们正继续与政府协调,以扩大Glasswing项目中更广泛的国内外合作伙伴的访问范围。

在本文剩余部分,我们将从以下四个方面提供更多细节和最新进展:

  1. 事件时间线,包括我们对安全防护措施所做的更新。我们将讨论导致出口管制指令的事件,以及我们如何通过新的安全防护措施加以应对。
  2. 我们的安全防护总体方针。我们将提供更多背景信息,说明如何使用安全分类器来检测模型可能存在的危险网络安全用途。
  3. 一个共享的行业框架。尽管我们已经达成了建设性的解决方案,但这些事件清楚地表明,行业需要一种一致的方法来评估和修复 AI 模型的潜在“越狱”问题(即绕过模型安全防护的技术)。² 一个用于判定特定越狱行为严重程度的共享标准,将有助于 AI 开发者在出现新发现时对其进行分类,以更高的安全性发布高能力模型,并向政府和行业合作伙伴一致地传达风险等级。我们已与亚马逊、微软、谷歌及其他 Glasswing 合作伙伴共同着手开发这样一个框架,并在下文对其进行概述。
  4. 更深层次的政府协作。我们还在加强与美国政府在新型预发布测试、信息共享和研究合作方面的协作水平。我们将在最后一节中描述这种更深层次的协作。

时间线与安全防护更新

我们于 6 月 9 日(星期二)发布了 Fable 5 和 Mythos 5。两者共享相同的底层模型,但 Fable 5 在发布时配备了强大的安全防护措施,使其在通用场景下更加安全。而安全防护较少的 Mythos 5 仅向少数受信任的 Project Glasswing 合作伙伴发布,用于防御性网络安全领域。

6 月 12 日的出口管制指令是在政府获悉一份报告后发布的。该报告指出,亚马逊研究人员发现了一种绕过 Fable 5 安全防护的方法:通过特定提示词,使其识别出多个软件漏洞。在一个案例中,该模型生成了演示如何利用相关漏洞的代码。在过去两周里,我们与政府及包括亚马逊在内的其他合作伙伴密切合作,对该报告及证据进行了审查。

我们的测试证实,许多能力较弱的模型——包括 Claude Opus 4.8、GPT-5.5 和 Kimi K2.7——也能识别出 Fable 5 在报告中发现的相同漏洞。在演示如何利用单个漏洞方面,我们测试的每个模型都能生成与 Fable 5 相同的演示(包括 Claude Haiku 4.5、Sonnet 4.6、Opus 4.6、Opus 4.7、Opus 4.8、GPT-5.4、GPT-5.5 和 Kimi K2.7)。

重要的是,所报告的技术并未暴露任何 Mythos 级别的独特网络能力。该行为反映了 Fable 5 安全防护措施的一个边界案例——正如我们下文将解释的,有些任务虽然不太可能带来危险,但出于谨慎考虑,仍被安全防护措施所阻止。所报告的技术允许访问其中一种此类行为,但它仅涉及常规的防御性网络安全工作。

即便如此,我们迅速采取行动应对所报告的绕过方式。我们与政府密切合作,训练了一个改进后的安全分类器,该分类器能够精准定位并阻止报告中描述的行为。如果对 Fable 5 的请求被阻止,用户将收到通知,该请求将被转至 Opus 4.8。

新的分类器意味着,亚马逊报告中描述的特定技术在超过 99% 的情况下都会被阻止。在极少数情况下,模型提供的信息可能不够详细,不足以帮助网络攻击者。如下文所述,该模型的安全防护措施预计不会阻止所有低风险的常规网络防御能力——仅阻止那些可能有害的能力。美国商务部人工智能标准与创新中心(CAISI)的研究人员已对我们之前和新的安全防护措施进行了测试,并一致认为它们非常强大。

新的分类器也带来了一个代价:在常规编码和调试任务中,它会更频繁地将良性请求标记为可疑。与我们所有的安全防护措施一样,我们将继续对其进行优化,以更好地区分真正的滥用行为和合法请求,并减少误报。

我们的网络安全防护措施方法

Claude Mythos 5 能够比任何其他模型——甚至比除最顶尖人类安全专家之外的所有人——更有效地发现和利用软件漏洞。这些强大的网络安全能力使其对那些希望在网络攻击中滥用它的恶意行为者具有独特的吸引力。

然而,Claude Fable 5 并不具备此类独特的攻击能力。这是因为我们在发布该模型时,为其应用了有史以来最强大的安全防护措施。在发布前的一个月内,我们从 Anthropic 内部多个团队抽调人员,使致力于解决该问题的研究人员和工程师数量翻了一番。

Fable 5 在发布时配备了多种安全机制,每一种单独来看都无法提供完美的防御,但组合起来却使模型极难被滥用(这种方法被称为“纵深防御”)。部分防御措施涉及训练模型拒绝协助处理危险请求;另一些则涉及对滥用模式进行事后分析。

其中一项特别重要的安全机制涉及分类器——这些是规模较小的自动化 AI 系统,能够在交互过程中检测模型是否被要求执行潜在有害的网络安全任务(或是否产生了潜在有害的输出)。一旦发生这种情况,分类器就会阻止模型对请求做出响应。这些分类器的最终目标是防止模型参与具有独特危险性的行为。

与所有安全机制一样,分类器也可能出错。它们有时无法注意到潜在的危险内容,在某些情况下还可能被故意“越狱”:用户可以通过非常规方式提示模型,从而欺骗分类器,让模型产生系统本应阻止的有害输出。

因此,我们特意将安全分类器设置为对一组已知可能无害的请求进行触发。这种“安全边际”方法意味着,一个请求必须看起来非常明确地安全,才能避免触发分类器(见下图中的 A 行)。用户感受到的安全边际,就是模型拒绝响应某些合理且无害的请求。

对于 Fable 5,我们将这一安全边际设置得比以往任何一次发布都要大得多(B 行),这意味着更多良性请求将被阻止。我们理解这类误报会给用户带来困扰,但为了能让模型的其他能力得到广泛应用,我们做出了这一权衡。

我们的网络安全安全分类器示意图。当向模型发出请求时,分类器会检测该请求是良性的(允许通过),还是可能有害的(予以拦截)。分类器会拦截模糊请求(那些明显与网络安全相关,但可能用于防御目的,例如查找安全漏洞的请求)以及有害请求(那些明显危险的请求,例如构建软件漏洞利用链的请求)。如 A 行所示,我们还设置了一个“安全裕度”,分类器会拦截那些可能良性但存在极小概率有害的请求。这增强了我们拦截所有有害请求的信心。对于 Fable 5(B 行),我们进一步扩大了安全裕度,这意味着更多良性请求会被拦截——但真正有害的请求被漏过的概率会更低。“Vulns”= 漏洞。

安全裕度还有助于缓解越狱攻击。许多越狱攻击是狭窄的:它们只会解锁模型非常特定的行为,仅此而已。在某些情况下,假设的用户可能以轻微方式越狱模型,并侵入安全裕度(有时是侵入模糊的有害行为区域),但无法触及我们旨在拦截的核心有害行为(如下方 C 行所示)。我们认为,迄今为止报告的 Fable 5 越狱攻击属于这种轻微类别。

更严重的越狱攻击会解锁更多有害行为。狭窄的有害越狱攻击(D 行)可以诱发某些特定的有害行为。这些越狱攻击通常属于低到中等严重程度,因为其狭窄性限制了攻击者。最令人担忧的类别是通用越狱攻击(E 行),它会解锁广泛的有害行为。

越狱攻击如何与我们的安全分类器相互作用。在轻微越狱攻击(C 行)的情况下,分类器不会拦截该请求,但该请求仍处于我们的安全裕度之内(因此极不可能有害)。在狭窄的有害越狱攻击(D 行)中,提示词突破了分类器,并从模型中解锁了特定的有害行为。在通用越狱攻击(E 行)中,提示词解锁了整类有害行为。

正如我们在发布 Fable 5 时所指出的,要让任何 AI 模型完全抵御(即免疫)越狱攻击几乎是不可能的。³ 我们预计,我们的模型会被发现存在某些越狱漏洞,且其严重程度会各不相同:会有许多轻微越狱、一些狭窄的有害越狱,尽管在撰写本文时尚未发现针对 Fable 5 的通用越狱方法,但专业安全研究人员仍在持续对其进行红队测试。我们力求确保我们自身及我们的安全合作伙伴能够率先发现重大越狱漏洞,并在恶意行为者利用它们造成危害之前将其修复。

上述谨慎方针意味着,绝大多数越狱攻击将无法成功解锁危险行为。我们的分类器使得成功制造越狱攻击的成本极高、耗费精力极大,即便越狱成功,我们的额外防御层也能提供进一步的缓解措施。随着我们对新型越狱技术的了解不断加深,我们将持续更新我们的分类器。

关于越狱攻击的行业共识框架

目前,AI 行业对于如何用客观术语描述 AI 越狱攻击的严重程度尚未达成共识。每当发现新的越狱技术时,这便增加了极大的不确定性:开发者没有公认的标准来确定哪些发现最需要优先处理,政府也没有公认的标准来决定何时采取行动。⁴

随着更多具备强大网络安全(及其他)能力的模型被训练、评估和发布,这一问题在未来几个月将变得更加严峻。一个评估 AI 越狱攻击的通用标准,将有助于我们及其他公司安全地发布新模型,同时也能让我们的用户充分利用这些模型的先进能力。

因此,我们正与亚马逊、微软、谷歌及其他 Glasswing 合作伙伴共同起草一份共识框架,用于评估 AI 越狱攻击的严重程度以及 AI 开发者应如何应对。我们邀请其他行业合作伙伴和模型提供商加入我们的这一努力。

我们目前的方案是,根据以下四项不同标准对特定越狱攻击进行评分。前两项描述该越狱攻击为攻击者提供了什么;后两项描述该越狱攻击能多快演变为现实世界的问题:

  1. 能力增益。该越狱攻击在多大程度上超越了现有工具,提升了用户的能力?如果现有的广泛可用工具(包括其他较弱的AI模型)能够达到与被越狱模型相同的能力水平,那么此项得分将较低;如果该越狱攻击解锁了模型能力,能够显著加速甚至领域专家的效率,那么得分将较高。
  2. 能力增益的广度。同一种越狱技术对多少种不同的攻击性任务有效?如果该越狱攻击仅允许模型针对狭窄目标,则得分较低;如果同一种越狱技术对多种不同目标或技术均有效,则得分较高。
  3. 武器化难易程度。将越狱攻击转化为实际攻击需要多少人力投入?如果越狱攻击涉及大量技巧性提示词编写和多次重试,则得分较低;如果越狱攻击仅需单次提示词或在第一、二次尝试即可成功,则得分较高。
  4. 可发现性。他人获取该技术的难易程度如何?如果需要专业知识才能获得,则得分较低;如果该技术已广泛传播且可在网上获取,则得分较高。

我们提议使用这一严重性框架来校准我们对新发现越狱攻击的响应策略。对于最严重的越狱攻击类别(例如,具有某些特征、正被用于对关键电网或银行系统造成毁灭性影响的越狱攻击),我们将在确认严重性后立即开始部署初步缓解措施。我们还在组建一个团队,对关键的越狱攻击提交渠道进行全天候监控。

任何对越狱攻击进行评分的方法都并非完美。然而,能够通过一个通用框架来传达特定发现的近似严重程度,仍然具有价值。这是一项正在进行的工作;随着我们从更多合作伙伴那里获得反馈,我们预计该框架将随着时间的推移而演变。

我们预计很快将分享关于该拟议框架的更多细节。与此同时,我们还将启动一项新的 HackerOne 计划,安全研究人员可以提交他们在 Fable 5(一旦可用)中发现的潜在网络越狱漏洞,供我们审查。

与美国政府在前沿人工智能安全领域开展合作

在过去十周里,Anthropic 与美国政府密切合作,共同制定了 6 月 2 日《促进先进人工智能创新与安全行政令》中所体现的方针。我们的合作涉及国家网络总监办公室、白宫科技政策办公室、财政部、商务部(包括 CAISI)以及相关的国家安全机构。

我们致力于在近两年来与美国政府在部署前测试与评估方面已有的合作基础上,继续推进这项工作。以下承诺既反映了我们已有的工作,也包含了我们在上述框架最终确定后,扩大政府合作规模的新提议:

  1. 发布前的政府访问与评估。对于在国家安全相关领域显著推进能力前沿的模型,我们将为指定的政府合作伙伴提供更早的模型及其配套安全措施的访问权限。这些合作伙伴可以在广泛发布前,进行独立的能力评估并测试我们的防护措施。在这些测试期间,我们将安排 Anthropic 的技术人员与政府评估人员协同工作。
  2. 安全措施相关信息的快速共享。当发现重大越狱或滥用模式时,我们将迅速进行调查、分类并通知相应的政府对口部门。我们将分享为此构建的新安全措施,以便其接受独立测试。我们还将提前向政府合作伙伴提供我们的威胁情报报告,并参与根据 6 月 2 日行政令第 2(d) 条设立的跨机构网络安全漏洞信息交换中心。
  3. 为联合研究提供专项资源。我们正大幅扩大与政府合作伙伴在人工智能安全领域的联合工作。我们将组建专门的 Anthropic 团队,致力于处理政府共同优先事项,提供大量算力分配以支持政府测试与研究,并贡献我们在安全与红队测试方面的专业知识,助力推动 AI 评估领域的技术前沿。
  4. 统一的行业标准。我们将与政府及行业同行合作,为前沿模型提供商制定一套共同的、自愿性的安全与评估标准。我们将贡献评估方法、工具以及最佳实践,供政府在整个领域内推广应用。

我们希望此次合作,连同我们提出的行业共识框架,能够成为整个行业系统性规则的基础——甚至为全球范围内就 AI 的风险与收益进行有效协调提供初步模板。

这些规则应通过强有力的监管加以确立,并平等适用于所有前沿模型开发者。政府对 AI 发布的介入需要一个持久、透明的流程,为网络防御者及其他相关方提供他们所需的、关于强大模型访问权限的确定性。

我们期待以上述方式深化与政府的合作。同时,我们也感谢用户在此次服务中断期间的耐心,并感谢与我们并肩工作、使 Fable 5 和 Mythos 5 得以恢复的研究人员与行业伙伴。

脚注

  1. 对于标准企业版席位,不包含 Fable 5 的使用额度,但您可以通过使用积分获得访问权限。如果未启用积分,您的用户将无法访问 Fable 5。对于高级企业版席位,截至 7 月 7 日,Fable 5 包含在您的订阅中。它将从每位成员的席位使用量中扣除,无需额外付费。7 月 7 日之后,您的团队可以通过启用使用积分继续使用 Fable 5。如果未启用积分,您的用户将无法再访问 Fable 5。
  2. 请注意,有时“绕过”一词本身也会被用来替代“越狱”。就当前目的而言,我们认为两者是同义词,但在本文剩余部分,我们将使用“越狱”,因为(a)这是一个更常用的术语,(b)与我们此前工作中使用的术语保持一致。
  3. 类似地,没有任何软件能免受漏洞影响(不过总体而言,软件漏洞比大语言模型越狱更容易被发现和修补)。
  4. 在其他安全研究领域,存在公认的标准:例如,通用漏洞评分系统(CVSS)就是一种评估特定软件漏洞严重程度的常用方法。

推出 Claude for Teachers

Anthropic 承诺向加拿大人工智能研究投入 1000 万美元

来源:Anthropic:Newsroom(网页)· anthropic.com

事件后续 · 3查看事件全部 →