# Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1：Terminal-Bench-Science 得分 52.6%，缓存读取降价 75%

- 来源：MarkTechPost（RSS）
- 作者：Asif Razzaq
- 发布时间：2026-09-02 04:30
- AIHOT 分数：77
- AIHOT 标记：同事件
- AIHOT 链接：https://aihot.virxact.com/items/cmtj4g5uc05j1roh9ha71wrk7
- 原文链接：https://www.marktechpost.com/2026/09/01/anthropic-releases-claude-fable-5-1-and-claude-mythos-5-1-52-6-on-terminal-bench-science-and-75-cheaper-cache-reads

## AI 摘要

Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1，两者为同一底层模型加不同安全层，Fable 5.1 全面开放，Mythos 5.1 仅限 Project Glasswing 内经过审核的美国组织。

## 正文

Anthropic 发布了 Claude Fable 5.1 和 Claude Mythos 5.1，距 Fable 5 系列于 2026 年 6 月推出已过去三个月。这两个模型是同一底层模型，只是安全防护层不同。Fable 5.1 已作为 claude-fable-5-1 全面开放；Mythos 5.1 仍仅限经过审核的组织使用。两者均支持 1M token 上下文窗口和 128K 最大输出 token，且自适应思考始终开启。最亮眼的性能数字是在 Terminal-Bench-Science 0.1 上取得 52.6% 的成绩，而 Fable 5 为 24.7%，Opus 5 为 29.0%。最亮眼的商业数字是缓存读取价格下调 75%，从每百万 token 1.00 美元降至 0.25 美元，Anthropic 测算这使典型工作负载成本降低约 25%，智能体类工作负载最高可降低 45%。基础输入和输出定价保持不变，分别为每百万 token 10 美元和 50 美元。

可以部署吗？

可以，Claude Fable 5.1 已作为 claude-fable-5-1 在 Claude API、Amazon Bedrock、AWS 上的 Claude Platform、Google Cloud 和 Microsoft Foundry 全面开放。Claude Mythos 5.1 则不行：它仅限 Project Glasswing 内经过审核的美国组织使用。

基准测试数据

在智能体科学研究基准 Terminal-Bench-Science 0.1 上，Fable 5.1 得分 52.6%，而 Opus 5 为 29.0%，Fable 5 为 24.7%，GPT-5.6 Sol 为 22.4%。Anthropic 报告每个模型的标准误差为 3.5 到 4.5 个百分点，因此应关注差距幅度，而非排名本身。

在 Terminal-Bench 4.0 上，Fable 5.1 达到 55.8%，Mythos 5.1 达到 60.9%。两个相同模型之间的差距就是安全防护干预的成本，这是一次异常坦诚的披露。其他方面：CursorBench 3.2.0 为 73.4%，Humanity's Last Exam 在无工具条件下为 60.9%、有工具条件下为 65.0%，AutomationBench 为 31.4%，OSWorld 2.0 严格模式为 41.7%，GDPval-AA v2 为 1853。

成本削减从何而来

基础输入和输出定价保持不变。缓存读取价格下降 75%，从每百万 token 1.00 美元降至 0.25 美元，即基础输入价格的 0.025 倍，而其他所有 Claude 模型均为 0.1 倍。Anthropic 测算典型工作负载成本降低约 25%，上下文密集的智能体类工作负载最高可降低约 45%。批处理价格为每百万 token 5 美元和 25 美元。

团队将遇到的三个破坏性变更

强制工具调用已取消：将 tool_choice 设为 any 或 tool 会返回 400 错误。请改用 auto 配合严格工具调用或结构化输出。

思考块与模型绑定：Fable 5.1 能读取早期模型的思考内容，但没有任何早期模型能读取它自己的思考。路由器和回退设置在降级切换时会丢失推理能力。

编辑早期对话轮次会使思考块失效：在对话中途注入和删除每轮提醒，或重建系统提示词或工具数组，现在都会报错。此检查仅针对 2026 年 8 月 31 日当天或之后创建的账户生效。修复方案是使用按轮次作用域的系统消息和服务器端上下文编辑。

增量变更：按消息设置推理努力程度、按轮次作用域的系统消息，以及 thinking.display: "updates" 均处于测试阶段，需通过请求头启用。内容溯源为强制要求，所有输出均带有统计文本水印，文件附带 C2PA 凭证。

Anthropic 也记录了真实的性能回退。并行工具调用的稳定性有所下降，因此智能体循环可能每轮只发起一次调用，而 Fable 5 可以批量发起多次。模型叙述性内容减少，在低推理努力程度下更常直接凭记忆作答，并且倾向于整文件重写而非针对性编辑。

安全防护与科学研究

网络安全防护现在允许漏洞发现，但不允许漏洞利用开发，这使得 Claude Code 中的干预次数每会话减少约 60%。生物安全防护在良性请求上的触发频率降低了 85%。渗透测试、漏洞利用生成和基于二进制的漏洞扫描仍会重定向到 Opus。

在研究方面，Mythos 5.1 设计的蛋白质结合剂在 12 个靶点上的命中率约为 50%，而常规水平为 10% 至 15%；Fable 5.1 构建了分辨率为 2 至 3 公里的金星高程图；自定义 GPU 内核将七个开源基因组学模型的速度提升了最高 2.5 倍。

核心要点

Fable 5.1 和 Mythos 5.1 是同一模型外加两层安全防护；只有 Fable 全面开放可用。

在 Terminal-Bench-Science 0.1 上取得 52.6% 的成绩，约为 Fable 5 的 24.7% 的两倍。

缓存读取费用下降 75%，至每百万 token 0.25 美元；基础费率保持不变。

三项破坏性 API 变更会影响所有编辑对话历史的智能体。

数据保留期为 30 天；零数据保留需要明确授权。
