Claude Fable 5.1 更便宜,在多个智能体基准测试上大幅增强,更简洁,而且显然远不那么容易触发安全拦截(Anthropic 的说法)。
简单总结如下。
便宜多少? - 输入/输出定价仍为每百万 token $10/$50。 - 缓存读取价格下降 75%,至 $0.25。 - Anthropic 估计,典型工作负载的成本降低约 25%,而高度智能体化、上下文密集的工作负载成本降低可达约 45%。
但是:Claude 订阅并非便宜 45%。("……凡是按 token 计费的地方")
比 Fable 5 强多少? - 科学智能体基准测试:52.6% 对比 24.7%--超过 2 倍 - AutomationBench:31.4% 对比 17.1%--相对提升 84% - GDPval-AA:1,853 对比 1,723 - CursorBench:73.4% 对比 70.5%
所以:在某些长时间运行的任务上有显著提升,在其他地方则是适度改进,并非统一的智能跃升。
冗长程度似乎也有所改善,尽管没有标准化的评分。Rogo 报告称,在 token 减少 20% 的情况下准确率持平。Red Hat 发现其更新更简洁、更易于跟进。有人说它使用的 token 数量只有 Opus 5 的一半,而运行速度大约是后者的两倍。
而且不必要的安全拦截更少: - 每次 Claude Code 会话中的网络安全防护干预减少约 60% - 据报道,在良性的基础生物学和医学问题上,生物安全防护触发频率降低 85% - 漏洞发现现在被允许,而漏洞利用生成、渗透测试和二进制扫描仍受限制或被重定向
到目前为止,听起来是一次很有前景的发布。尽管它清楚地表明,他们更关心企业和商业用户,而不是我们这些订阅用户。总之:开始测试吧!