西班牙高校论文:Agent 脚手架比模型更影响成本

AYi · @AYi_AInotes · X·2026-08-21 21:47·3天前
AI 导读

西班牙高校实验显示,7 个 Agent 脚手架 × 5 个模型跑同一组 GitHub 任务,不内置 MCP 的轻量脚手架(Pi、Tau)中位 token 消耗 1.4-1.6 万,而 Claude Code 和 qwen-code 需 26-29 万 token,贵 5-28 倍;同一 27B 模型换脚手架成本差 139 倍。

AYi@AYi_AInotes
32AI 编辑部评分,满分 100

西班牙高校论文:Agent 脚手架比模型更影响成本

2026-08-21 21:47· 3天前
AI 导读

西班牙高校实验显示,7 个 Agent 脚手架 × 5 个模型跑同一组 GitHub 任务,不内置 MCP 的轻量脚手架(Pi、Tau)中位 token 消耗 1.4-1.6 万,而 Claude Code 和 qwen-code 需 26-29 万 token,贵 5-28 倍;同一 27B 模型换脚手架成本差 139 倍。

说个暴论:你的 AI 编程 Agent 烧钱快,可能不是模型的问题,是脚手架太重了。 一篇西班牙高校的论文刚用实验证明了这件事——7 个 Agent 脚手架 × 5 个模型,跑同一组 GitHub 操作任务(找 issue → 建分支 → 打 patch → commit → 开 PR → 统计文件数),验证方式不是看 Agent 自己说"我完成了",是直接查仓库真实状态。

结果很扎心: 不内置 MCP 的轻量脚手架(Pi、Tau),中位 token 消耗 1.4-1.6 万,全部任务完成。Claude Code 和 qwen-code 呢?26-29 万 token,贵了 5 到 28 倍,干的是同一件事。 同一个本地 27B 小模型,换不同脚手架跑,成本差了 139 倍。一百三十九倍。模型一样,任务一样,纯粹是脚手架带来的差异。

为什么会这样? 重型通用 Agent 为了"什么都能干",默认加载大量工具描述、系统提示、多轮规划上下文。

你以为自己只是在做一个简单的 Git 操作,背后可能被塞了几十个工具 schema。这就是论文说的"通用性税"——你为万能付的隐形账单。

论文标题已经把结论写死了:The Scaffolding Matters More Than the Interface.

脚手架比接口重要。在 Git、gh、docker、kubectl 这些有几十年成熟 CLI 的领域,直接用 CLI 比走 MCP 更直接、更便宜、更可控。MCP 在工具生态碎片化的场景有价值,但在成熟 CLI 面前,它是额外负担。

还有个细节很有意思——Agent 即使被明确提示"不要用 MCP",也经常忍不住去用。只有彻底移除 MCP 选项才能真正阻止。模型对工具的偏好比你想的顽固。

这对当前 Agent 产品设计的含义很直接: 未来的 Agent 可能不是一个巨大的全能体,而是一个轻量调度层,针对不同任务类型切换专用 harness,只在真正需要时才加载重型工具协议。从通用 Agent 中收获任务专用 Agent,这是论文给出的方向。

一句话带走:别让你的 Agent 为了"万能"付 28 倍的钱。任务定义清晰时,小而专注的 harness 完胜大型通用框架

PiThis week we read research from a team of academics that ran a software task across 7 agents and 5 models. They found that in domains with a mature CLI ecosyste...