内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
原文
Tomer Tunguz 博客(VC 分析)
精选61

OpenRouter 上的"AI 超市"效应:GPT-OSS 120b 流量达 Opus 4.8 的 36%,模型市场加速分层

2026-07-23 08:00· 4天前
跳到正文
精选理由

Tomer用OpenRouter数据和自己的本地实验,把模型市场细分讲得很清楚,对选型有直接参考价值,做本地agent的可以看看他换掉Gemma的理由。

AI 摘要

OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。

正文 · AI 翻译

1989年,鲍里斯·叶利钦在休斯顿一家Randalls超市驻足,被琳琅满目的冰淇淋品种所震撼。¹ OpenRouter就是AI领域的那个冰淇淋货架。

而购物者做出了令人惊讶的选择:OpenAI发布已一年的开源模型GPT-OSS 120b²,其流量达到了Anthropic Opus 4.8的36%。³

为什么一个2025年8月的模型,至今仍能拥有数周前才发布的前沿模型三分之一的流量?

模型token市场已经出现了细分。

Daily tokens served on OpenRouter, 7-day average: GLM 5.2 tops the field at 495B, above Claude Opus 4.8 at 199.6B; a year-old GPT-OSS-120b holds 71.3B, roughly a third of Opus, with Gemma 4 26B at 50B & the rest of the open field trailing to Phi-4 at 90M

细分之所以发生,是因为买家的需求各不相同。

在竞争推动下,这种细分正在加速。上周,Anthropic发布了Opus 5,比Fable更小、更便宜,⁴ 明确是为了争夺月之暗面Kimi 3所瞄准的市场。⁵ 在中端模型市场,Poolside推出了Laguna S 2.1,一个美国中端市场模型。⁶

规模(小、中、大、超大)、来源(美国vs中国)、架构(密集vs稀疏)、准确性(专注编程或通用)、速度(每秒token数)、模态(纯文本或视觉)——AI有众多口味可供选择。

我花了一个周末来替换驱动我智能体的模型。原模型是Gemma 4 26b;挑战者是Laguna S 2.1,一个1180亿参数的模型。根据所有我本以为重要的指标,这个118b模型本应更慢。

在我的M5 Max上,两者生成速度相同,因为Laguna采用了混合专家架构:1180亿参数驻留在内存中,但每个token仅激活80亿参数。一个118b模型现在以26b模型的解码成本运行,这便将前沿级别的质量拉低到了本地层级。

准确性在关键之处体现了出来。我的本地技术栈运行一个基于工具调用的编程与邮件智能体,在我轮换测试过的模型中,随着活跃参数的增加,工具调用失败率从29.4%下降到了20.1%。⁷ Laguna相比它所取代的26b模型,将错误率降低了7个百分点。

MCP tool-call failure rate for the local model driving a production automation stack, measured from real traffic: Ornith-1.0 35B at 29.4%, Gemma 4 26B at 27.1%, & Laguna S 2.1 at 20.1%, roughly a quarter fewer failures than Gemma

细分是健康竞争市场的标志。前沿模型仍然服务于世界上最难的token,但它不再需要服务于所有token;而我笔记本电脑上的这一层级,天花板刚刚被大幅抬高——这是一个竞争将不可阻挡地向前推进的趋势。


  1. 鲍里斯·叶利钦1989年参观休斯顿一家杂货店,即Clear Lake的Randalls超市,时间为1989年9月16日。 ↩︎

  2. 介绍 gpt-oss(OpenAI),于 2025 年 8 月 5 日发布。 ↩︎

  3. OpenRouter 模型活动页面,7 天平均值,检索于 2026 年 7 月 27 日:GPT-OSS-120b、GLM 5.2、Claude Opus 4.8。 ↩︎

  4. Anthropic 推出 Claude Opus 5,价格减半,于 2026 年 7 月 24 日发布。 ↩︎

  5. 月之暗面的 Kimi 3 预计将缩小与 Anthropic 的 Opus 4.8 之间的差距(TechCrunch)。 ↩︎

  6. 介绍 Laguna S 2.1(Poolside),一个总参数量 118B、激活参数量 8B 的开放权重模型,于 2026 年 7 月 22 日发布。 ↩︎

  7. 作者的生产数据:来自本地编码与邮件智能体的 MCP 工具调用日志,在五个月内对三个本地模型进行测量。 ↩︎

Tomer Tunguz 博客(VC 分析)
精选61导出 Markdown

OpenRouter 上的"AI 超市"效应:GPT-OSS 120b 流量达 Opus 4.8 的 36%,模型市场加速分层

2026-07-23 08:00·4天前
阅读原文· tomtunguz.com
精选理由

Tomer用OpenRouter数据和自己的本地实验,把模型市场细分讲得很清楚,对选型有直接参考价值,做本地agent的可以看看他换掉Gemma的理由。

AI 摘要

OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。

正文 · AI 翻译

1989年,鲍里斯·叶利钦在休斯顿一家Randalls超市驻足,被琳琅满目的冰淇淋品种所震撼。¹ OpenRouter就是AI领域的那个冰淇淋货架。

而购物者做出了令人惊讶的选择:OpenAI发布已一年的开源模型GPT-OSS 120b²,其流量达到了Anthropic Opus 4.8的36%。³

为什么一个2025年8月的模型,至今仍能拥有数周前才发布的前沿模型三分之一的流量?

模型token市场已经出现了细分。

Daily tokens served on OpenRouter, 7-day average: GLM 5.2 tops the field at 495B, above Claude Opus 4.8 at 199.6B; a year-old GPT-OSS-120b holds 71.3B, roughly a third of Opus, with Gemma 4 26B at 50B & the rest of the open field trailing to Phi-4 at 90M

细分之所以发生,是因为买家的需求各不相同。

在竞争推动下,这种细分正在加速。上周,Anthropic发布了Opus 5,比Fable更小、更便宜,⁴ 明确是为了争夺月之暗面Kimi 3所瞄准的市场。⁵ 在中端模型市场,Poolside推出了Laguna S 2.1,一个美国中端市场模型。⁶

规模(小、中、大、超大)、来源(美国vs中国)、架构(密集vs稀疏)、准确性(专注编程或通用)、速度(每秒token数)、模态(纯文本或视觉)——AI有众多口味可供选择。

我花了一个周末来替换驱动我智能体的模型。原模型是Gemma 4 26b;挑战者是Laguna S 2.1,一个1180亿参数的模型。根据所有我本以为重要的指标,这个118b模型本应更慢。

在我的M5 Max上,两者生成速度相同,因为Laguna采用了混合专家架构:1180亿参数驻留在内存中,但每个token仅激活80亿参数。一个118b模型现在以26b模型的解码成本运行,这便将前沿级别的质量拉低到了本地层级。

准确性在关键之处体现了出来。我的本地技术栈运行一个基于工具调用的编程与邮件智能体,在我轮换测试过的模型中,随着活跃参数的增加,工具调用失败率从29.4%下降到了20.1%。⁷ Laguna相比它所取代的26b模型,将错误率降低了7个百分点。

MCP tool-call failure rate for the local model driving a production automation stack, measured from real traffic: Ornith-1.0 35B at 29.4%, Gemma 4 26B at 27.1%, & Laguna S 2.1 at 20.1%, roughly a quarter fewer failures than Gemma

细分是健康竞争市场的标志。前沿模型仍然服务于世界上最难的token,但它不再需要服务于所有token;而我笔记本电脑上的这一层级,天花板刚刚被大幅抬高——这是一个竞争将不可阻挡地向前推进的趋势。


  1. 鲍里斯·叶利钦1989年参观休斯顿一家杂货店,即Clear Lake的Randalls超市,时间为1989年9月16日。 ↩︎

  2. 介绍 gpt-oss(OpenAI),于 2025 年 8 月 5 日发布。 ↩︎

  3. OpenRouter 模型活动页面,7 天平均值,检索于 2026 年 7 月 27 日:GPT-OSS-120b、GLM 5.2、Claude Opus 4.8。 ↩︎

  4. Anthropic 推出 Claude Opus 5,价格减半,于 2026 年 7 月 24 日发布。 ↩︎

  5. 月之暗面的 Kimi 3 预计将缩小与 Anthropic 的 Opus 4.8 之间的差距(TechCrunch)。 ↩︎

  6. 介绍 Laguna S 2.1(Poolside),一个总参数量 118B、激活参数量 8B 的开放权重模型,于 2026 年 7 月 22 日发布。 ↩︎

  7. 作者的生产数据:来自本地编码与邮件智能体的 MCP 工具调用日志,在五个月内对三个本地模型进行测量。 ↩︎

AnthropicOpenAI大佬观点开源生态
阅读原文导出 Markdown
AnthropicOpenAI大佬观点开源生态部署/工程
阅读原文tomtunguz.com