说个暴论:你的 AI 编程 Agent 烧钱快,可能不是模型的问题,是脚手架太重了。 一篇西班牙高校的论文刚用实验证明了这件事——7 个 Agent 脚手架 × 5 个模型,跑同一组 GitHub 操作任务(找 issue → 建分支 → 打 patch → commit → 开 PR → 统计文件数),验证方式不是看 Agent 自己说"我完成了",是直接查仓库真实状态。
结果很扎心: 不内置 MCP 的轻量脚手架(Pi、Tau),中位 token 消耗 1.4-1.6 万,全部任务完成。Claude Code 和 qwen-code 呢?26-29 万 token,贵了 5 到 28 倍,干的是同一件事。 同一个本地 27B 小模型,换不同脚手架跑,成本差了 139 倍。一百三十九倍。模型一样,任务一样,纯粹是脚手架带来的差异。
为什么会这样? 重型通用 Agent 为了"什么都能干",默认加载大量工具描述、系统提示、多轮规划上下文。
你以为自己只是在做一个简单的 Git 操作,背后可能被塞了几十个工具 schema。这就是论文说的"通用性税"——你为万能付的隐形账单。
论文标题已经把结论写死了:The Scaffolding Matters More Than the Interface.
脚手架比接口重要。在 Git、gh、docker、kubectl 这些有几十年成熟 CLI 的领域,直接用 CLI 比走 MCP 更直接、更便宜、更可控。MCP 在工具生态碎片化的场景有价值,但在成熟 CLI 面前,它是额外负担。
还有个细节很有意思——Agent 即使被明确提示"不要用 MCP",也经常忍不住去用。只有彻底移除 MCP 选项才能真正阻止。模型对工具的偏好比你想的顽固。
这对当前 Agent 产品设计的含义很直接: 未来的 Agent 可能不是一个巨大的全能体,而是一个轻量调度层,针对不同任务类型切换专用 harness,只在真正需要时才加载重型工具协议。从通用 Agent 中收获任务专用 Agent,这是论文给出的方向。
一句话带走:别让你的 Agent 为了"万能"付 28 倍的钱。任务定义清晰时,小而专注的 harness 完胜大型通用框架