本地AI模型已能胜任89%日常查询,数据中心将走向个人化

Tomer Tunguz 博客(VC 分析)·2026-08-21 08:00·10天前
AI 导读

斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。

Tomer Tunguz 博客(VC 分析)
精选
64AI 编辑部评分,满分 100

本地AI模型已能胜任89%日常查询,数据中心将走向个人化

2026-08-21 08:00· 10天前
AI 导读

斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。

推荐理由

作者借 Koomey 定律类比,把本地模型与云端效率数据放进历史框架,帮助读者理解端侧 AI 的演进节奏。

正文 · AI 翻译

本地AI模型已经能够像前沿云端模型一样,回答89%的日常聊天与推理查询,这一结论在超过一百万条真实查询及20多个本地模型的广泛测试中均得到验证。¹

这意味着我们正在用每瓦特电力产生更多智能:用同样数量的电子完成更多工作。¹

追踪计算效率随时间的变化并非新鲜事。库梅定律(Koomey's law)发现,数十年来每瓦特计算能力大约每1.5年翻一番,这一趋势将大型主机的算力浓缩进了笔记本电脑的机身之中。²³

正如每瓦特性能推动了从大型主机到个人电脑的转型,每瓦特智能也将引领AI向边缘端迁移。

—— Jon Saad-Falcon、Avanika Narayan 等人,《每瓦特智能》

如今GPU的效率提升曲线则更为平缓,过去15年间大约每2.7年翻一番,而非每1.5年。⁴

其影响同样令人瞩目:最佳本地模型对阵前沿模型的胜率/平局率,从2023年的23.2%攀升至2025年的71.3%,每年约提升20个百分点。到2026年,由另一个本地AI为任务选出的本地模型,这一数字将跃升至近90%。⁵

效率也沿着趋势线同步提升:同期每瓦特智能提升了5.3倍,其中3.1倍来自更优秀的模型,1.7倍来自更先进的芯片。计算机更快了,模型更聪明了,最终受益的是终端用户。

Local models match cloud models on 71.3% of queries in 2025, up from 23.2% in 2023; a 2026 bar shows the ensemble-routed ceiling of 89%, a different metric than the single-model trend

云端对于长链条多步推理、最艰深的技术领域,以及依赖规模与并行化的任务仍然不可或缺。在许多应用场景中,云端硬件对本地硬件仍保有优势。云端推理相比本地模型可带来40%的能效提升。⁶ 数据中心采用批量处理查询的方式,而这一技巧是每次仅服务一个用户的本地硬件目前还无法使用的。

Local AI efficiency improved 18x in 16 months, split between gains from better accelerators and better models

但对于大部分日常知识工作而言,完全没有必要将查询发送到数据中心。本地模型加路由器的组合,足以应对绝大多数工作任务。⁷

与全云端基线相比,这种方式还能削减80%的能耗、77%的计算量以及74%的成本。

大型主机走进了个人生活。你的数据中心也将如此。


  1. Jon Saad-Falcon、Avanika Narayan 等人所著《每瓦智能:衡量本地 AI 的智能效率》,斯坦福大学与 Together AI,2025 年 11 月。arXiv:2511.07885。另见斯坦福 Hazy Research 综述。 ↩︎ ↩︎

  2. 库米定律,维基百科。 ↩︎

  3. 瓦特衡量的是功率,即能量消耗的速率,而焦耳衡量的是能量本身;库米最初的指标是每焦耳的计算量,但底层趋势与现在 AI 模型所追踪的每瓦智能是同一个。 ↩︎

  4. Anson Ho、Ege Erdil 与 Tamay Besiroglu,《CMOS 微处理器能效的极限》,2023 年。arXiv:2312.08595。 ↩︎

  5. 71.3% 和 89% 是同一份 2025 年数据中的两个不同测量值,而非同一数字在不同时间点的数值。71.3% 是表现最佳的单款本地模型对阵前沿模型的胜率/平局率,也是此图表所绘制的趋势线(2023 年为 23.2%,2024 年为 48.7%,2025 年为 71.3%)。89% 则是另一个更高的上限:将每个查询路由到所测试的 20 多款本地模型中处理该查询效果最佳的那一款,其表现比任何单一模型高出 16.3 到 28.8 个百分点。这一增益是选择效应所致:论文指出,本地路由从 20 多款多样化模型中挑选,而前沿云端模型只有三款,因此在某些基准测试上,本地模型集成的最佳表现甚至超越了云端模型集成的最佳表现。可供选择的候选模型更多——而不仅仅是路由更智能——才是提升准确率的原因。这两个数字均来自同一项研究,且两者互不取代。 ↩︎ ↩︎

  6. Jon Saad-Falcon、Avanika Narayan 等人所著《每瓦智能:衡量本地 AI 的智能效率》,斯坦福大学与 Together AI,2025 年 11 月。运行相同模型时,云端加速器每瓦智能至少比本地芯片高出 1.4 倍,即约 40% 的效率优势。arXiv:2511.07885。 ↩︎

  7. 大多数 AI 工作可以等待,tomtunguz.com。 ↩︎

来源:Tomer Tunguz 博客(VC 分析)· tomtunguz.com