# Claude Sonnet 5 发布

- 来源：Anthropic：Newsroom（网页）
- 发布时间：2026-06-30 00:00
- AIHOT 分数：81
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmr0yev3s005cslw8omm20ml6
- 原文链接：https://www.anthropic.com/news/claude-sonnet-5

## 精选理由

Claude Sonnet 5 把代理能力从 Opus 下放到了 Sonnet，性能接近 Opus 4.8 但价格只有三分之一，这对开发者来说性价比飞跃。虽然还不是最强，但已经能让许多复杂任务从勉强可用变成可靠。

## AI 摘要

Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型，具备计划、浏览器和终端工具使用能力，可自主运行。性能接近 Opus 4.8，定价更低：即日起至 2026 年 8 月 31 日，输入 token $2/百万，输出 $10/百万，之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6，在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低，幻觉和谄媚减少，但网络安全能力弱于 Opus 4.8。即日起在所有套餐及 Claude Code、Claude API 中可用。

## 正文

Claude Sonnet 5 被打造为迄今为止最具智能体能力的 Sonnet 模型。它能够制定计划、使用浏览器和终端等工具，并以几个月前还需要更大、更昂贵模型才能达到的水平自主运行。

对许多开发者而言，智能体 AI 时代始于 Sonnet 级别的模型：Claude Sonnet 3.5、3.6 和 3.7 是首批在编程和工具使用方面展现出令人印象深刻技能的模型。不过，最近在智能体能力方面最显著的提升出现在我们的 Opus 级别模型上。

Sonnet 5 缩小了这一差距：其性能接近 Opus 4.8，但价格更低。与上一代 Sonnet 4.6 相比，它在推理、工具使用、编程和知识工作等智能体性能的关键方面有了显著提升：

Sonnet 5 在多项评估中的得分与 Sonnet 4.6 和 Opus 4.8（作为参考，一个能力更全面的模型）的对比。Claude Sonnet 5 系统卡详细报告了更广泛的评估结果。

我们的安全评估发现，Sonnet 5 的不良行为总体发生率低于 Sonnet 4.6，并且在智能体场景中使用通常更安全。评估还显示，其执行网络安全任务的能力远低于我们当前的 Opus 模型。

从今天起，Claude Sonnet 5 在所有套餐中均可使用：它是 Free 和 Pro 套餐的默认模型，并可供 Max、Team 和 Enterprise 用户使用。它也在 Claude Code 和 Claude 平台上可用，上线时提供优惠定价：每百万输入 token 2 美元，每百万输出 token 10 美元，有效期至 2026 年 8 月 31 日，之后定价将调整为每百万输入 token 3 美元，每百万输出 token 15 美元。开发者可以通过 Claude API 使用 claude-sonnet-5。

与 Claude Sonnet 5 合作

下图比较了 Sonnet 5 与 Sonnet 4.6 及 Opus 4.8 在智能体搜索评测 BrowseComp 和计算机使用评测 OSWorld-Verified 上，于不同努力水平下的性能表现。Sonnet 5（橙色线）相比 Sonnet 4.6（灰色线）有显著提升，并且覆盖了比 Opus 4.8（黄色线）更广泛的成本-性能选项。它在中等努力水平下提供了大幅改善的成本效率；其更高努力水平的性能在某些任务上可与 Opus 4.8 匹敌。在 Sonnet 5 和 Opus 4.8 之间，用户可以通过调整努力水平来找到成本与性能的恰当平衡。

不同努力水平下的成本-性能曲线。此前最佳的 Sonnet 模型（Sonnet 4.6）与 Opus 4.8 差距明显。Sonnet 5 提供了比 Sonnet 4.6 更广泛的成本-性能选项，并且在某些情况下达到了 Opus 4.8 的能力水平。图表显示 Sonnet 5 的定价为每百万输入 token 3 美元，每百万输出 token 15 美元。凭借截至 8 月 31 日的首发优惠定价（每百万输入 token 2 美元，每百万输出 token 10 美元），Sonnet 5 的实际成本甚至比图中所示更低。Opus 4.8 的定价为每百万输入 token 5 美元，每百万输出 token 25 美元。xhigh = 超高努力水平。

来自我们早期访问合作伙伴的反馈是一致的：Sonnet 5 比其前代产品更具智能体能力。测试者描述了它如何完成此前 Sonnet 模型会半途而废的复杂任务，如何在没有明确要求的情况下自行检查输出，以及如何以极具吸引力的价格完成所有这些智能体工作：

Claude Sonnet 5 为我们的智能体提供了强大的执行层，用于多步骤软件工程工作。它在处理混乱的技术上下文时，能很好地应对持续编码、工具使用和调试，并且在那些需要跟进到底和技术严谨性的工作流中尤其有用。

我们交给 Claude Sonnet 5 一个两部分的任务——更新 Salesforce 账户层级，并向企业联系人发送产品发布公告——它从头到尾完成了。这在过去往往会中途卡住。对于日常自动化来说，这简直是不假思索的选择。

Claude Sonnet 5 用更少的步骤完成更多工作。输出质量不变，达成目标所需的步骤更少。它还能干净利落地、始终如一地拒绝不安全请求。在 Lovable，我们正在将强大的工具交到数百万开发者手中。一个知道何时该拒绝的模型，与一个知道如何构建的模型同样重要。

我们用几十个最具挑战性的真实 Pull Request 对 Claude Sonnet 5 进行了测试，它独立完成了每一个任务，并给出了经过测试和验证的结果——让我们的工程师能够专注于判断、决策和最终签核。

我让 Claude Sonnet 5 调查一个 Bug。在没有提示的情况下，它编写了复现测试、实施了修复，然后将修复暂存以确认没有该更改时 Bug 会再次出现。所有这些都在一次交互中完成。

使用 Claude Sonnet 5，智能体能够遵循计划、遵守我们的规范，并以高效的成本交付干净的多步骤变更。

Claude Sonnet 5 在存量代码上表现最佳——竞态条件、隐藏测试、那些没人想碰的部分。它能将故障追溯到真正的根本原因，并交付持久的修复方案，而不是仅仅修补症状。

在 Eve 的原告法律任务中，Claude Sonnet 5 处于帕累托前沿。我们在法律研究和分析方面看到了最明显的收益，其性价比使得迁移决策变得轻而易举。

ClickHouse 智能体探索实时数据并即时生成洞察，因此在测试新模型时，获取洞察的时间至关重要。Claude Sonnet 5 以更紧凑的步骤进行推理，让我们的用户明显更快地得到答案。这种速度是我们的客户能够感受到的差异。

在 Pace，我们的计算机使用智能体在我们运营团队已使用的系统上运行保险工作流——提交受理、首次损失通知、损失报告。Claude Sonnet 5 始终能快速采取正确行动，这正是真实保险工作所要求的。

对于管理高容量、复杂工作负载的企业团队而言，Claude Sonnet 5 代表着真正的进步——在关键领域表现出色，同时具备使规模化切实可行的速度和成本。在多项复杂任务上，它超越了当前前沿水平，同时以低成本提供快速响应。对于大规模运营的企业来说，这是真正的运营优势。

Claude Sonnet 5 在我们测试的全部编码任务中表现出色，同时解决了更多问题。这是对质量和效率的双重显著提升。

Claude Sonnet 5 是一款强大的智能体编码模型，其顶级准确率可与 Opus 级别模型媲美，相比 Sonnet 4.6 实现了清晰的阶跃式改进。该模型能够进行深入探索，并在复杂任务上保持明显更持久的专注力。

安全评估

我们的部署前安全评估发现，Sonnet 5 在整体上优于 Sonnet 4.6。在智能体安全方面，该模型能更好地拒绝恶意请求，并抵御提示词注入攻击中的劫持尝试。与 Sonnet 4.6 相比，该模型的模型幻觉和谄媚率更低。在我们测试各类失调行为（如配合滥用和欺骗）的自动化行为审计中，Sonnet 5 总体得分更低（即更安全）。然而，与能力更强的 Opus 4.8 和 Claude Mythos Preview 相比，该模型在此评估中确实表现出略高的失调行为率。

自动化行为审计中的失调行为率，该审计测试了多种情境和上下文中的大量不良行为（完整列表及各项行为结果见 Sonnet 5 系统卡第 6.4 节）。Sonnet 5 的失调行为率整体低于 Sonnet 4.6，但高于 Mythos Preview 和 Opus 4.8。

我们并未刻意对 Sonnet 5 进行网络安全任务训练。它可以执行一些常规、无害的网络任务，但在评估潜在危险网络技能（如开发软件漏洞利用程序）时，其表现明显逊于 Opus 4.8 和 Mythos 5 等模型。下图展示了某项评估的得分，该评估测试了模型针对 Firefox 浏览器漏洞开发利用程序的能力。Sonnet 5 从未能开发出完整可用的漏洞利用程序，但其部分成功率的略高于 Sonnet 4.6。后一变化可能归因于通用智能的提升，而非特定训练。

衡量模型在 Firefox 147 中成功开发软件漏洞利用代码的得分（该评估是与 Mozilla 合作开发的；所有漏洞已在 Firefox 148 中修复）。对于每个模型，左侧柱状图显示模型（在无安全防护措施的情况下）开发出有效利用代码的频率；右侧柱状图显示模型取得部分成功的频率。两款 Sonnet 模型均未能成功开发出有效利用代码（得分均为 0.0%）；Sonnet 5 的部分成功率略高于 Sonnet 4.6。两款 Sonnet 模型的网络能力均明显弱于 Opus 4.8 和 Mythos 5。完整详情请参见 Sonnet 5 系统卡第 3.2.4 节。

由于 Sonnet 5 在这些任务上比其前代模型略强，我们已默认启用网络安全防护措施来发布该模型。这些防护措施——能够实时检测并阻止危险的网络使用行为——与 Claude Opus 4.7 和 4.8 中的防护措施相同（因为我们判断 Sonnet 5 的整体网络安全风险水平较低，所以其防护措施不如 Fable 5 发布时启用的防护措施严格，后者会阻止更广泛的网络安全任务）。¹

我们对 Sonnet 5 在多项安全性和能力评估中的全面评估结果，已在 Claude Sonnet 5 系统卡中报告。

可用性与定价

Claude Sonnet 5 今日起全面上线，在 2026 年 8 月 31 日之前享受优惠价格：每百万输入 token 2 美元，每百万输出 token 10 美元。此后将转为标准定价：每百万输入 token 3 美元，每百万输出 token 15 美元。² 我们已提高了 Chat、Cowork、Claude Code 以及 Claude 平台³ 的速率限制，以适应更高努力水平带来的更高 token 使用量；用户可根据具体项目需求选择相应的努力水平。

更新日志

编辑于 2026 年 6 月 30 日：在本帖原始版本中，我们包含了一张 BrowseComp 评估的成本-性能图表，该图表基于一种更简单的方法论数据，未能反映我们用于智能体搜索评估的标准方法论。这导致低估了 Sonnet 5 在该评估中的表现。

我们现已更新该图表，使其与我们用于 Sonnet 5 系统卡（该卡采用 1000 万 token 预算，并包含压缩与程序化工具调用功能）的方法论保持一致。我们还更新了周围的文字说明。

脚注

1 Sonnet 5 是我们的网络安全验证计划的一部分，该计划现已在原生 Claude 平台、AWS 上的 Claude 平台以及 Microsoft Foundry 中的 Claude（托管于 Azure 和 Anthropic）上可用，并即将在 Google Vertex 上的 Claude 中推出。已注册网络安全验证计划的组织将自动获得对 Sonnet 5 的相同访问权限，无需重新申请。总体而言，对于需要减少防护栏的网络安全工作，我们推荐使用 Claude Opus 4.8。

2 Sonnet 5 是 Sonnet 4.6 的升级版，但它使用了更新的 tokenizer，改变了模型处理文本的方式以提升性能（这与我们在 Claude Opus 4.7 中引入的 tokenizer 变更类似）。其代价是，相同的输入可能会映射为更多的 token：根据内容类型，大约为 1.0 到 1.35 倍。我们设定了入门级定价，以便向 Sonnet 5 的过渡在成本上大致保持中性。

3 2026 年 4 月 26 日，我们提高了每个使用层级中 Sonnet 和 Haiku 的速率限制，并在原生 Claude 平台上将层级简化为三个（起步、构建和扩展）。您可以在 Claude 控制台中查看您的层级和当前限制，或阅读文档以了解更多信息。

人类最后的考试：我们更新了“人类最后的考试”的评分模型，并将 Sonnet 4.6 的分数更新为 34.6%（无工具）和 46.8%（有工具）。这是该分数与 Sonnet 4.6 发布博客中报告分数不同的原因。

OSWorld 验证版：我们更改了运行 OSWorld 验证版评估的方式，以更准确地反映模型在现实世界中的表现，并将 Sonnet 4.6 的分数更新为 78.5%。这是该分数与 Sonnet 4.6 发布博客中报告分数不同的原因。

推出 Claude for Teachers

Anthropic 承诺向加拿大人工智能研究投入 1000 万美元
