1989年,鲍里斯·叶利钦在休斯顿一家Randalls超市驻足,被琳琅满目的冰淇淋品种所震撼。¹ OpenRouter就是AI领域的那个冰淇淋货架。
而购物者做出了令人惊讶的选择:OpenAI发布已一年的开源模型GPT-OSS 120b²,其流量达到了Anthropic Opus 4.8的36%。³
为什么一个2025年8月的模型,至今仍能拥有数周前才发布的前沿模型三分之一的流量?
模型token市场已经出现了细分。
细分之所以发生,是因为买家的需求各不相同。
在竞争推动下,这种细分正在加速。上周,Anthropic发布了Opus 5,比Fable更小、更便宜,⁴ 明确是为了争夺月之暗面Kimi 3所瞄准的市场。⁵ 在中端模型市场,Poolside推出了Laguna S 2.1,一个美国中端市场模型。⁶
规模(小、中、大、超大)、来源(美国vs中国)、架构(密集vs稀疏)、准确性(专注编程或通用)、速度(每秒token数)、模态(纯文本或视觉)——AI有众多口味可供选择。
我花了一个周末来替换驱动我智能体的模型。原模型是Gemma 4 26b;挑战者是Laguna S 2.1,一个1180亿参数的模型。根据所有我本以为重要的指标,这个118b模型本应更慢。
在我的M5 Max上,两者生成速度相同,因为Laguna采用了混合专家架构:1180亿参数驻留在内存中,但每个token仅激活80亿参数。一个118b模型现在以26b模型的解码成本运行,这便将前沿级别的质量拉低到了本地层级。
准确性在关键之处体现了出来。我的本地技术栈运行一个基于工具调用的编程与邮件智能体,在我轮换测试过的模型中,随着活跃参数的增加,工具调用失败率从29.4%下降到了20.1%。⁷ Laguna相比它所取代的26b模型,将错误率降低了7个百分点。
细分是健康竞争市场的标志。前沿模型仍然服务于世界上最难的token,但它不再需要服务于所有token;而我笔记本电脑上的这一层级,天花板刚刚被大幅抬高——这是一个竞争将不可阻挡地向前推进的趋势。
-
鲍里斯·叶利钦1989年参观休斯顿一家杂货店,即Clear Lake的Randalls超市,时间为1989年9月16日。 ↩︎
-
介绍 gpt-oss(OpenAI),于 2025 年 8 月 5 日发布。 ↩︎
-
OpenRouter 模型活动页面,7 天平均值,检索于 2026 年 7 月 27 日:GPT-OSS-120b、GLM 5.2、Claude Opus 4.8。 ↩︎
-
Anthropic 推出 Claude Opus 5,价格减半,于 2026 年 7 月 24 日发布。 ↩︎
-
月之暗面的 Kimi 3 预计将缩小与 Anthropic 的 Opus 4.8 之间的差距(TechCrunch)。 ↩︎
-
介绍 Laguna S 2.1(Poolside),一个总参数量 118B、激活参数量 8B 的开放权重模型,于 2026 年 7 月 22 日发布。 ↩︎
-
作者的生产数据:来自本地编码与邮件智能体的 MCP 工具调用日志,在五个月内对三个本地模型进行测量。 ↩︎