Claude Opus 5 今日正式发布。这是一款兼具深思熟虑与主动性的模型,其智能水平接近 Claude Fable 5 的前沿水准,但价格仅为后者的一半。
在 Frontier-Bench 和 GDPval-AA 等编程与知识工作评测中,Opus 5 达到了新的最优水平,不过在网络安全任务上仍落后于 Mythos 5。
Opus 5 专为日常使用而设计:它比其他模型运行效率更高。该模型现已成为 Claude Max 的默认模型,同时也是 Claude Pro 上性能最强的模型。

性能与成本效益
Claude Opus 5 在成本与其前代 Opus 4.8 相同的情况下,性能大幅提升。本节图表展示了模型在不同努力程度设置下的性能变化,客户可通过调整该设置来优化智能水平,或节省模型 token 以换取更快、更便宜的结果。
Opus 5 在各类高价值软件工程任务中表现卓越。例如,在 Frontier-Bench v0.1 上,Opus 5 超越了所有其他模型,且每项任务成本更低,性能是 Opus 4.8 的两倍以上。在 CursorBench 3.2 上,当设置为最大努力程度时,该模型的表现与 Fable 5 的最高分相差不到 0.5%,但每项任务成本仅为后者的一半;此外,在高、极高和最大努力程度下,Opus 5 在给定成本下均实现了优于所有其他模型的性能。

我们在知识工作和问题解决任务中也看到了类似的结果。例如:
- 在 ARC-AGI 3 这项要求模型解决全新问题的评测中,Opus 5 的得分是次优模型的三倍。
- 在衡量模型能否从头到尾完成商业任务的 Zapier AutomationBench 上,Opus 5 在每项任务成本相同的情况下,通过率约为次优模型的 1.5 倍。即使在其最低努力程度设置下,Opus 5 完成的任务数量也超过了任何其他模型。
- 在计算机使用评测基准 OSWorld 2.0 上,Opus 5 在任意给定成本下均优于所有其他模型,仅用略高于三分之一的成本就超越了 Fable 5 的最佳成绩。
在多项相关评测中,它也是我们性能最优且最具成本效益的模型。

Opus 5 在科学研究方面相比 Opus 4.8 有显著提升。在我们所有生命科学评估中,其表现均优于 Opus 4.8,这些评估涵盖结构生物学、有机化学和生物信息学等主题。它在有机化学任务上的改进最为突出,例如从光谱数据推断分子结构(在我们的内部基准测试中,其得分比 Opus 4.8 高出 10.2 个百分点),以及在蛋白质相关任务上,如预测蛋白质序列变异如何影响其功能(在此项上,其得分高出 7.7 个百分点)。
最后,Opus 5 能够生成质量高得多的视觉输出:
与 Claude Opus 5 协作
Claude Opus 5 在验证自身工作并仔细迭代直至成功方面要强大得多。在评估和早期访问测试中,我们和我们的用户发现了许多体现 Opus 5 自主性和严谨性的实例:
- 在一项 Frontier-Bench 任务中,Opus 5 被提供了一张机器零件的图纸,并被要求编写代码将其重建为 3D FreeCAD 模型。然而,在此任务中,模型被故意设置为无法直接查看该图纸。Opus 5 的回应是自行编写了一个计算机视觉流程,从原始像素中提取几何形状,然后重建了整个机器零件。它反复成功地做到了这一点;在相同设置下,没有其他竞争模型能在五次尝试后解决该问题。
- 面对一个流行开源包管理器中的真实漏洞,Opus 5 找到了根本原因,并修复了一个社区补丁遗漏的边缘情况。一个竞争模型仅修复了表面症状(而非根本原因),然后就报告漏洞已解决。
- 一家交易公司的工程师使用 Opus 5 在单次会话中为一个新交易所构建了市场数据源。之前的模型根本无法完成此任务,即使有工程师提供的详尽计划也不行。由于找不到实时数据源进行验证,Opus 5 甚至自行构建了一个测试工具,以检查其代码是否正确解析了该交易所的数据。
以下是我们的早期访问客户关于使用 Opus 5 体验的更多报告:
在 FrontierCode 1.1 上,Claude Opus 5 以一半的成本达到了接近 Fable 级别的性能。在 Devin 内部,它在困难的调试和根因分析任务上也展现出特别的优势。
Claude Opus 5 以 Opus 的速度和成本提供了接近 Fable 5 的智能水平。在 CursorBench 上,它的表现略低于 Fable 5,但具有许多相同的行为特征。我们很期待看到开发者如何在 Cursor 中使用它。
Claude Opus 5 登顶了 Zapier 的 AutomationBench 排行榜,且消耗的模型 token 数量并未超过之前的 Claude 模型。它接收了一个原始的账户健康工作簿,并端到端地执行了完整的流失预防流程:标记有风险的账户、提醒相应的负责人,并为留存运营团队生成总结。之前的模型未能通过测试;Opus 5 达到了 100% 的成功率。
在我们的基因组学分析工作中,Claude Opus 5 的行为比我们运行过的任何模型都更像一位严谨的科学家。它会采用正确的统计检验来排除混杂因素,通过独立方法交叉验证自身结果,并在漫长的多步骤分析中始终保持专注。
在我们的内部评估中,Claude Opus 5 的表现超越了其系列中的所有其他模型。它不仅在我们最难的智能体编码任务上表现更佳(比 Opus 4.7 提升了 22%),而且更加稳定,每次运行之间的差异显著减小。对于 Lovable 上的数百万构建者来说,这种一致性就是一切。构建一次,可靠结果,次次如此。
Claude Opus 5 是自 Opus 4.5 以来 Opus 系列中最大的一次飞跃。在相同的全栈应用构建任务中,前端表现首先证明了这一点:这是我们见过的 Opus 模型所呈现的最佳动画、游戏和 3D 作品。
我们非常喜欢 Claude Opus 5。对于我们智能体所处理的这类开放式分析工作而言,它是 Opus 4.8 的严格升级,而且提升最大的地方恰恰是最关键的领域:那些更困难、更模糊的任务。它的回答更清晰、更简洁,并且我们在更高努力水平上也观察到了效率的提升。
对于我们的分析师每天执行的金融研究工作流程而言,Claude Opus 5 相比 Opus 4.8 是一个显著的改进。它在数值推理、表格处理以及需要精确性的、更敏锐的批判性思维方面表现突出。
Claude Opus 5 提供了分析专业企业内容所必需的行业智能与准确性。Box 发现,Opus 5 相比 Opus 4.8 性能提升了 8%,并在技术、医疗和公共部门组织日常依赖的数据分析(提升 11%)和尽职调查(提升 17%)工作流中取得了显著性能提升。
Claude Opus 5 相比 Opus 4.8 是一次明显的代际跃升。在一个周末里,我让它担任了我开发环境的幕僚长角色:它自行构建了监控系统,驱动了每个实例,只在需要做出判断决策时才让我介入。
Claude Opus 5 在我们的基础研究助手代码库中进行了大规模改动,在整个智能体工作流中根据反馈进行调整,并且比我们使用过的任何模型都更清晰地解释了其推理过程。它处理了我们通常需要拆分成更小片段才能完成的工作。
在我们一些最困难的财务建模任务中,Claude Opus 5 在准确性和效率方面相比 Opus 4.8 都有明显提升。其性能下限显著提高,尤其是在深度金融领域逻辑方面。在不同工作量级别上,它平均准确率高出 9 个百分点,同时减少了三分之一的交互轮次和工具调用,耗时也减少了 60%。
Claude Opus 5 会像真正的前端开发者那样检查自己的工作。在我们的基准测试中,它会在浏览器中以桌面和手机宽度打开页面,发现了隐藏在手机折叠屏下方的产品以及一个屏幕外的结账按钮,并在交回工作前修复了这两个问题。
与之前的 Opus 模型相比,Claude Opus 5 在法律智能体工作方面的性能有明显提升,我们在公司治理和仲裁等实践领域看到了最大的进步。我们还对 Opus 5 在较低推理层级下保持质量的能力印象深刻,与 Opus 4.8 在最大推理层级下相比,它在实现相似性能的同时,平均生成的 token 数量减少了 26%。
Claude Opus 5 对我们来说最大的提升在于更长周期的工作:构建完整的演示文稿,然后进行修改。工件质量是决定我们采用哪个模型的关键因素,而这是我们见过的最明显的进步——更好的视觉理解、更清晰的格式、更少的幻灯片问题。
Claude Opus 5 的判断力最为突出。在处理 PR 移交时,它不会急于发布:它会验证分支、检查模板,并思考测试的影响,从而确保移交过程干净利落。较旧的模型往往会操之过急,并在我们的检查环节中被卡住。
在一次架构重构会议中,Claude Opus 5 对我提出的设计方案提出了异议,并且在我坚持己见时没有退缩。相反,它精确地解释了我的想法中有价值的部分,将反对意见缩小到单一的设计问题,并提出了一种折中方案,既保留了优点,又修正了缺陷。正是这种判断力让我们能够减少监督,信任它。
在首轮合同修订方面,Claude Opus 5 在我们测试的所有模型中得分最高,几乎是 Opus 4.8 的两倍。评论功能也更好了:在处理保密协议时,它能在更短的时间内、用更少的轮次完成修订,同时保持或提升了准确性。
Claude Opus 5 编写的差异代码干净、紧凑,没有死代码,并且在发现针对特定代码库的细微问题方面是更强的风险识别者。我们正在将其用于生产工作负载。
我们肯定会将 Cosmos(我们的统一智能体平台)中的许多用例迁移过来。我们期待越来越多地使用 Claude Opus 5 进行代码审查,并且我可以自信地说,我们更希望人们使用 Opus 5 而非 Opus 4.8。
Claude Opus 5 的突出之处在于其判断力。它在编写任何代码之前会进行更深入的思考,在规划阶段而非事后发现自身的逻辑错误,并且会推理答案为何正确,而不仅仅是答案是否有效。这是我们看到的从一代 Claude 模型到下一代在问题解决能力上最明显的飞跃,我们期待它在 JetBrains IDE 中得到应用。
Claude Opus 5 是我们交易基准测试中测试过的最强的 Opus 模型,并且它仅使用 Opus 4.8 大约七分之一的推理 token 和不到一半的延迟就达到了这一水平。用更少的算力获得更好的答案。
对齐与安全
对齐。在部署前测试中,我们的自动化行为审计发现,Opus 5 是迄今为止最对齐的模型(如下图所示)。它比 Opus 4.8、Sonnet 5 或 Fable 5 更严格地遵守 Claude 的宪法;表现出最低的欺骗性行为率;并且最不容易被诱导滥用。就避免可能产生难以逆转副作用的鲁莽行为而言,它也是我们迄今为止最安全的模型。

安全性。Opus 5 在具有风险的双重用途能力方面并未推进前沿。在与私营部门和政府合作伙伴共同进行的严格评估中,我们发现它在生物学研究和进攻性网络安全方面均落后于 Mythos 5。有关这些评估的更多信息,请参阅我们的系统卡。
与其前代产品 Opus 4.8 一样,我们有意避免在网络安全任务上训练 Opus 5。然而,由于模型整体能力变得更强,它在这些任务上仍有显著提升,并且在发现网络安全漏洞方面接近 Mythos 5。不过,在利用这些漏洞方面——即将漏洞转化为实质性网络威胁——它仍大幅落后于 Mythos 5。
Opus 5 在 OSS-Fuzz 上的表现说明了这一点。OSS-Fuzz 是我们开发的一项评估,用于衡量模型在无需大量人工指导的情况下发现并利用漏洞的能力。尽管 Mythos 5 和 Opus 5 在识别漏洞方面成功率相近,但 Opus 5 在漏洞利用开发方面的得分远低于 Mythos 5。

Opus 5 的安全保障措施
Claude Opus 5 的安全保障措施旨在允许模型在网络安全和生物学领域的有益用途。这些措施与我们应用于 Opus 4.8 的类似,不同之处在于对一小部分网络安全任务设置了更强的护栏。
网络安全。Opus 5 的网络分类器在限制程度上比 Fable 5 上的分类器要宽松一些。它们允许 Opus 5 查找源代码中的漏洞,但会阻止“基于二进制”的漏洞扫描(一种更可能与恶意行为者关联的方法)、渗透测试和漏洞利用生成。
根据我们的测试,我们预计这些分类器的干预频率将比在 Fable 5 上降低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中,任何被标记的请求将默认回退到 Opus 4.8。API 上也可以启用回退到 Opus 4.8 的功能。
我们的网络安全验证计划(CVP)旨在促进那些原本可能因模型安全防护措施而受阻的网络安全工作。已经加入 CVP 的企业和研究人员可以立即访问一个安全限制更少的 Opus 5 版本。
生物学。由于 Opus 5 拥有一套与 Opus 4.8 类似的安全防护措施,它现在是我们面向科学研究领域能力最强且普遍可用的模型。尽管如此,该模型在长时间运行的自主研究任务上仍存在重要局限性,而这正是我们认为 AI 模型可能带来最重大生物学相关风险的领域。(对于这类生物学工作,Mythos 5 仍然是更强的模型。)作为本次发布的一部分,之前在 Fable 5 上被阻止的生物学相关请求,现在将路由到 Opus 5 而非 Opus 4.8。
快速上手
Claude Opus 5 即日起在所有平台上可用,定价为每百万输入 token 5 美元,每百万输出 token 25 美元(与 Opus 4.8 相同)。开发者可以通过 Claude API 使用 `claude-opus-5` 开始体验。
它还提供快速模式,运行速度约为默认速度的 2.5 倍。与 Opus 4.8 一样,快速模式在 Claude 平台上的价格为 Opus 5 基础价格的两倍,也可以通过 Claude Code 中的使用额度来使用。
与 Opus 5 一同发布的,还有两个测试版更新:
- Claude 平台上的对话中途工具变更。在对话过程中,开发者现在可以更改 Claude 可以使用的工具,而不会使提示词缓存失效。
- API 上的自动回退。用户现在可以选择,让被 Opus 5(或 Fable 5)安全分类器标记的请求自动路由到另一个模型。启用自动回退后,API 请求默认会路由到最佳可用模型,而不是被阻止。
与之前的 Opus 模型一致,Opus 5 对于通用访问没有数据保留要求。
有关如何充分利用 Opus 5 的更多指导,请参阅我们的提示词指南。
脚注
Frontier-Bench v0.1,Effort 图:这些结果来自 Frontier-Bench v0.1 的内部运行,基于 mini-SWE-agent 框架和 GKE 后端,每项任务尝试 5 次的平均奖励。Opus 4.8 作为 Opus 5 和 Fable 5 在安全分类器拒绝时的回退模型。
相关内容
经济未来研究基金的研究议程
我们正在分享 Anthropic 经济未来研究基金的研究议程。
向 Claude 询问关于 Anthropic 经济指数
我们正在推出用于 Claude 的 Anthropic 经济指数连接器,让任何人都能探索关于人工智能与工作的真实数据。
Anthropic 再次向 Public First Action 捐赠 2000 万美元
Anthropic 正在向 Public First Action 额外捐赠 2000 万美元,使我们的总支持金额达到 4000 万美元。