# 大模型天梯榜引热议：成本与代码品味成新标准

- 来源：AYi (@AYi_AInotes)
- 发布时间：2026-08-23 12:18
- AIHOT 分数：40
- AIHOT 链接：https://aihot.virxact.com/items/cmt5boywh0ap8ro73mz82fu7j
- 原文链接：https://x.com/AYi_AInotes/status/2091379563070701786

## AI 摘要

一张AI大模型天梯榜引发争议，Theo 回应称榜单反映的是成本、速度与可靠性的工程账本，而非单纯智商排名。2026年评价Coding模型的标准已转向算力效率与单任务成本，如 Sol 仅需 3k-15k tokens，而 Gemini 需 70k-100k。此外，代码品味与可合并度、委托级别成为区分顶级模型的关键，Fable 擅长架构但贵，Sol 是可靠日常主力。

## 正文

AI圈今天因为这张AI大模型天梯榜都吵翻天了，有人喷搞主观偏见，有人拿 SWE-bench 帮 Opus 喊冤，但绝大多数人都看漏了这张图下面最致命的一句话。

Theo 自己在评论区直接回了一句：如果你把这张图当成单纯的智商排名，而忽略了成本、速度和可靠性，那是你自己的问题。

这张图根本不是什么跑分榜，而是一个每周自费几千刀跑推理的重度开发者，用真金白银砸出来的工程账本。

在 2026 年，评价一个 Coding 模型的标准早就变了：

一个是算力效率与单任务成本，同一个复杂任务，Sol 只吃 3k-15k tokens，Fable 要吞 30k+，而 Gemini 动辄拉到 70k-100k。

模型再聪明，如果完成一个任务要多烧 10 倍 token，在生产环境里就根本没法当日常工具用。

这就是为什么 Google 被扔到底层，不是它不聪明，是 token 浪费率太恐怖了。

第二个是代码品味与可合并度，Code Taste。
顶级模型和普通模型的区别，已经从能不能跑通，变成了生成的 PR 需不需要你大改。

→Fable 贵且有时绕路，但它对现有 codebase 的尊重程度和架构品味目前独一档；

→Sol 则是执行力极强的可靠老黄牛，死磕指令、不乱删文件。

第三个是委托级别，Delegation vs Micromanagement，低端模型需要你写一句 Prompt 改一段，顶级模型是你丢一个模糊需求，它直接交付可 Review 的完整 PR。

以前大家争的是谁在榜单上分最高，现在重度用户算的是谁能让我只当 Reviewer，同时月底 API 账单不爆炸。

Fable 是你遇到硬骨头架构时花大钱请的天才顾问，Sol 才是你每天真正带去上班的可靠主力。

所以咱们也别拿实验室跑分去指导真实工程决策，这中间差着一个数量级的真实成本吧 hhh

### 引用推文

> Theo - t3.gg：Rough tier list of where I'd put every major model right now
