AI圈今天因为这张AI大模型天梯榜都吵翻天了,有人喷搞主观偏见,有人拿 SWE-bench 帮 Opus 喊冤,但绝大多数人都看漏了这张图下面最致命的一句话。
Theo 自己在评论区直接回了一句:如果你把这张图当成单纯的智商排名,而忽略了成本、速度和可靠性,那是你自己的问题。
这张图根本不是什么跑分榜,而是一个每周自费几千刀跑推理的重度开发者,用真金白银砸出来的工程账本。
在 2026 年,评价一个 Coding 模型的标准早就变了:
一个是算力效率与单任务成本,同一个复杂任务,Sol 只吃 3k-15k tokens,Fable 要吞 30k+,而 Gemini 动辄拉到 70k-100k。
模型再聪明,如果完成一个任务要多烧 10 倍 token,在生产环境里就根本没法当日常工具用。
这就是为什么 Google 被扔到底层,不是它不聪明,是 token 浪费率太恐怖了。
第二个是代码品味与可合并度,Code Taste。 顶级模型和普通模型的区别,已经从能不能跑通,变成了生成的 PR 需不需要你大改。
→Fable 贵且有时绕路,但它对现有 codebase 的尊重程度和架构品味目前独一档;
→Sol 则是执行力极强的可靠老黄牛,死磕指令、不乱删文件。
第三个是委托级别,Delegation vs Micromanagement,低端模型需要你写一句 Prompt 改一段,顶级模型是你丢一个模糊需求,它直接交付可 Review 的完整 PR。
以前大家争的是谁在榜单上分最高,现在重度用户算的是谁能让我只当 Reviewer,同时月底 API 账单不爆炸。
Fable 是你遇到硬骨头架构时花大钱请的天才顾问,Sol 才是你每天真正带去上班的可靠主力。
所以咱们也别拿实验室跑分去指导真实工程决策,这中间差着一个数量级的真实成本吧 hhh