Claude Fable 5 恢复上线后性能下滑,安全分类器误触发致回退 Opus 4.8

AYi · @AYi_AInotes · X·2026-07-03 15:13·60天前
AI 导读

Claude Fable 5 恢复上线后性能大幅下滑。BridgeBench 测试显示,调试能力从 86.2 降至 25.9,重构从 73.6 降至 38.4,幻觉指标从 75.9 降至 61.7。原因是新增安全分类器在高风险请求时自动回退到 Opus 4.8,官方称平均触发率不到 5%,但编程调试等灰色地带大面积误触发。Anthropic 已为此道歉。问题本质是闭源前沿模型在能力释放与合规之间的权衡。受冲击最大的开发者和 Agent 构建者或将转向开源或动态多模型调度方案。

AYi@AYi_AInotes
64AI 编辑部评分,满分 100

Claude Fable 5 恢复上线后性能下滑,安全分类器误触发致回退 Opus 4.8

2026-07-03 15:13· 60天前
AI 导读

Claude Fable 5 恢复上线后性能大幅下滑。BridgeBench 测试显示,调试能力从 86.2 降至 25.9,重构从 73.6 降至 38.4,幻觉指标从 75.9 降至 61.7。原因是新增安全分类器在高风险请求时自动回退到 Opus 4.8,官方称平均触发率不到 5%,但编程调试等灰色地带大面积误触发。Anthropic 已为此道歉。问题本质是闭源前沿模型在能力释放与合规之间的权衡。受冲击最大的开发者和 Agent 构建者或将转向开源或动态多模型调度方案。

很多人骂Fable 5被阉割,其实真正的问题比模型本身严重得多。

实际上模型本体并没有被砍,Fable和Mythos用的是同一个底座,真正拉胯的是硬加的安全分类器和降级路由,

检测到高风险请求就自动切回Opus 4.8,官方说平均触发率不到百分之五,实际编程调试这类灰色地带任务大面积误触发。

硬数据摆在这里,调试能力得分从八十六点二直接跌到二十五点九,重构和幻觉指标同步大幅下滑,虽说还没到基准测试作弊的程度,但真实的体验塌方是有的,官方后来也为过激的安全规则公开道了歉。

当然这也不能算做单一的技术失误,更多是四重力量叠加的必然结果。

想快速释放前沿能力又怕被滥用,只能用分类器做分层放行,保守阈值必然带来误杀。

出口管制和地缘博弈把安全从技术问题变成了政策工具,重上线后的规则明显收紧。

商业竞争和用户预期的落差,又把体验问题放大成了舆论事件。

本质上是闭源前沿模型进入了新阶段,能力越强,双重用途风险越高,合规的权重就会压过纯粹的性能释放。

受损最严重的应该是开发者和Agent构建者,本该是利器的模型,很多场景退化回了上一代的水平,平白多了路由开销。

接下来的趋势其实很清晰,西方闭源模型会越来越分层,可信用户拿完整能力,大众拿到的是合规版本,开源模型反而会在可用性上形成错位优势。 真正的赢家,大概率会是能做好动态路由多模型调度的人。

BridgeMindFABLE 5 CAME BACK NERFED. We re-ran the July 1st version of Claude Fable 5 on BridgeBench. The results are brutal: Debugging: 86.2 → 25.9 Refactoring: 73.6 → 38...