我们正在对 Claude Fable 5 的生物学安全防护措施进行更新,以大幅减少误报。Fable 5 用户现在将体验到更少的“回退”——即系统在用户提出生物学相关问题后切换到能力较弱的模型。在我们的测试中,这一更新使各产品端的生物学相关回退减少了约 85%。¹
因此,Fable 5 将能够协助处理更广泛的生物学任务。
在实际使用中,用户在常见的健康和科普类问题上应会看到回退大幅减少——例如解读化验结果、理解症状,以及在教育场景中学习生物学知识。医疗专业人员也将在临床任务上获得 Fable 5 更多的支持。
我们相信,AI 对世界产生积极影响的最大机遇在于生物学和医学领域,我们正在大力投入,以负责任的方式为生物学家提供前沿访问权限。目前,对于我们认为具有双重用途的请求——包括病毒学、毒理学和分子设计——Fable 仍会回退到 Opus 5,因此它尚不能用于专业生物学研究和药物开发。我们致力于通过可信访问路径来弥合这一差距,以提供前沿生物学能力。
我们为何构建强大的生物学安全防护
我们的目标是以最快速度,让尽可能多的用户用上 Fable 5 的前沿能力。然而,要做到这一点,我们需要管控伴随如此强大模型而来的日益增长的风险。其中一个风险出现在生物学领域:Fable 5 如今在一些高度复杂的生物学任务上可以超越专家水平,并在其他任务上提供操作层面的支持。这意味着,它能为正在研发新疗法的研究人员提供切实帮助(这也是我们如此迫切希望通过分类器改进和可信访问计划来扩大模型使用范围的原因)。但若落入不当之手,同样的能力也可能被恶意行为者利用,例如用于开发生物武器。我们的能力评估显示,Fable 5 能为这类行为者带来显著的能力提升——也就是说,它能赋予他们在其他任何地方都找不到的能力。
在生物学领域,AI 的有益用途和有害用途往往难以区分。例如,在某些情况下,研究某种疾病的疗法需要科学家先制造出最初导致该疾病的危险化合物。这在活疫苗中最为明显,因为科学家必须培养他们想要预防的同一种病原体。某些药物也是如此。为了开发治疗高血压的药物卡托普利,科学家从蛇毒中分离出了会使人血压骤降的毒性成分。随着 AI 前沿不断涌现新的生物学能力,我们需要保持谨慎,确保这些新风险不会先于其潜在的科研价值而成为现实。
那些意图利用我们模型作恶的老练行为者,深知如何利用这种模糊性来掩盖其真实意图,让危险任务看起来像是普通的研究探索。美国情报界《2026年度威胁评估》明确指出,此类行为者确实存在,且生物技术(包括合成生物学和基因组编辑)的进步“可能催生新型生物威胁”。该评估还指出,多个国家行为体很可能维持着活跃的进攻性生物与化学武器计划——这些计划若获得前沿AI模型的原始能力加持,可能会加速推进。
出于对这类“双重用途”能力(即既可用于有益目的也可用于有害目的、且二者界限往往难以划清的能力)的担忧,我们有意在发布 Fable 5 时屏蔽了几乎所有生物学相关查询。这使我们能够将该模型开放给其他领域的用户使用。我们深知这会让合法的生物学用户感到沮丧:短期内将出现大量误报,即用户提出与生物学相关的问题时,请求会被拦截并转交给能力较弱的模型。尽管如此,我们仍选择做出这一取舍,因为 Fable 在生物学这类双重用途领域被滥用的代价,可能是灾难性的。
我们的生物学安全防护机制如何运作
我们在生物学领域防范滥用的核心手段之一,是借助安全分类器:即规模较小的自动化AI系统,用于检测 Fable 5 是否被要求执行受保护生物学任务,或是否会产生有害输出(我们此前曾撰文介绍过我们在网络安全领域的同类分类器)。
就 Fable 5 而言,当分类器触发时,模型会将用户的请求重新路由至 Opus 5——这是一款能力较强的模型,但其生物学能力不及 Fable 5,无法为恶意用户提供同等程度的协助。这就是用户在请求被拦截时所看到的备用方案。
开发精确、稳健的分类器并非易事。要让分类器快速且一致地工作,它必须学会区分我们视为“范围内”和“范围外”的、可能具有危害性的主题与查询。调优分类器需要时间和反复迭代,既要避免误报(分类器对范围外内容触发),也要避免漏报(漏掉范围内内容)。我们还要求分类器能够抵御绕过尝试(即所谓的越狱攻击),这需要更进一步的研究和测试。
从一个非常宽泛的生物学分类器入手,意味着我们可以在继续精化研究的同时,让用户使用 Fable 5。另一种选择——在取得更多安全防护进展之前暂缓发布模型——会使模型的普遍可用性及其对用户的潜在益处推迟数周或数月。
在过去几周里,我们仔细重写了分类器的“章程”(由一组规则组成,帮助模型区分受保护内容与允许内容),并详细划定了良性用途的范围。我们就这些变更征求了各类专家(包括 Anthropic 内部和外部)的反馈。随后,我们基于该章程为分类器开发了更新的训练数据,并对其进行了重新训练,同时验证了新分类器仍能普遍针对有害及双重用途的研究性生物学内容触发,但如今能够支持更广泛的良性及有益用途。
如下方图表所示,这些更新意味着——与 Fable 5 发布时相比——分类器对良性生物学相关请求的触发频率将大幅降低。

结论
要完善我们的安全防护措施,仍有大量工作要做。误报将不可避免地继续存在——即那些落在分类器安全边际内、风险极低但仍会触发分类器的请求。如上所述,由于潜在的双重用途风险,Fable 将继续拦截双重用途的专业生物学和药物开发查询。我们完全致力于通过可信访问途径,为研究人员开发一条安全、可扩展的路径,让他们能够使用我们最强大的模型。
我们希望您继续与我们分享反馈,以便我们进一步完善安全防护措施。
脚注
1 因此,我们预计回退(fallback)的总次数——无论是因生物学相关原因还是其他原因——也将减少:在 Claude.ai 上约减少 67%,在 Cowork 上约减少 55%,在 Claude Code 上约减少 17%,在 Claude 平台上约减少 7%。
相关内容
Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic,担任首席全球事务官
Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic,担任其首位首席全球事务官。