大模型天梯榜引热议:成本与代码品味成新标准

AYi · @AYi_AInotes · X·2026-08-23 12:18·2天前
AI 导读

一张AI大模型天梯榜引发争议,Theo 回应称榜单反映的是成本、速度与可靠性的工程账本,而非单纯智商排名。2026年评价Coding模型的标准已转向算力效率与单任务成本,如 Sol 仅需 3k-15k tokens,而 Gemini 需 70k-100k。此外,代码品味与可合并度、委托级别成为区分顶级模型的关键,Fable 擅长架构但贵,Sol 是可靠日常主力。

AYi@AYi_AInotes
40AI 编辑部评分,满分 100

大模型天梯榜引热议:成本与代码品味成新标准

2026-08-23 12:18· 2天前
AI 导读

一张AI大模型天梯榜引发争议,Theo 回应称榜单反映的是成本、速度与可靠性的工程账本,而非单纯智商排名。2026年评价Coding模型的标准已转向算力效率与单任务成本,如 Sol 仅需 3k-15k tokens,而 Gemini 需 70k-100k。此外,代码品味与可合并度、委托级别成为区分顶级模型的关键,Fable 擅长架构但贵,Sol 是可靠日常主力。

AI圈今天因为这张AI大模型天梯榜都吵翻天了,有人喷搞主观偏见,有人拿 SWE-bench 帮 Opus 喊冤,但绝大多数人都看漏了这张图下面最致命的一句话。

Theo 自己在评论区直接回了一句:如果你把这张图当成单纯的智商排名,而忽略了成本、速度和可靠性,那是你自己的问题。

这张图根本不是什么跑分榜,而是一个每周自费几千刀跑推理的重度开发者,用真金白银砸出来的工程账本。

在 2026 年,评价一个 Coding 模型的标准早就变了:

一个是算力效率与单任务成本,同一个复杂任务,Sol 只吃 3k-15k tokens,Fable 要吞 30k+,而 Gemini 动辄拉到 70k-100k。

模型再聪明,如果完成一个任务要多烧 10 倍 token,在生产环境里就根本没法当日常工具用。

这就是为什么 Google 被扔到底层,不是它不聪明,是 token 浪费率太恐怖了。

第二个是代码品味与可合并度,Code Taste。 顶级模型和普通模型的区别,已经从能不能跑通,变成了生成的 PR 需不需要你大改。

→Fable 贵且有时绕路,但它对现有 codebase 的尊重程度和架构品味目前独一档;

→Sol 则是执行力极强的可靠老黄牛,死磕指令、不乱删文件。

第三个是委托级别,Delegation vs Micromanagement,低端模型需要你写一句 Prompt 改一段,顶级模型是你丢一个模糊需求,它直接交付可 Review 的完整 PR。

以前大家争的是谁在榜单上分最高,现在重度用户算的是谁能让我只当 Reviewer,同时月底 API 账单不爆炸。

Fable 是你遇到硬骨头架构时花大钱请的天才顾问,Sol 才是你每天真正带去上班的可靠主力。

所以咱们也别拿实验室跑分去指导真实工程决策,这中间差着一个数量级的真实成本吧 hhh

Theo - t3.ggRough tier list of where I'd put every major model right now