市场的魅力在于,大量多元化的独立个体汇聚在一起,能够做出比任何单一专家更明智的判断和决策。OpenRouter 每天处理数万亿个 token,我们一直在探索一种新方式,将数百万人在模型选择上的集体智慧分享出来。
今天,我们推出了 Auto 路由器(openrouter/auto)的重大更新,这一更新基于 OpenRouter 每周超过 55T 的 token 消耗数据。我们发现,由市场消耗驱动的模型选择,在广泛的任务类型和成本层级上,都优于旧版 Auto 路由器的选择。通过参考过去 7 天的 OpenRouter 使用情况,它始终能跟上新模型发布的节奏。
过去几周,我们已让数千人参与该方案的 Beta 测试,今天已将其部署给所有使用 Auto 路由器的用户。现在,只需向我们的任意推理端点发送 `"model": "openrouter/auto"` 即可体验,或阅读文档了解详情。
为驱动这一路由器,我们将对代表性提示词样本执行的任务分类,转化为一条帕累托最优路由曲线。这与我们按任务消耗展示的模型排行榜所依据的数据相同。你可以通过发送 `cost_tier` 参数来指定期望的成本层级,路由器在选择模型时会遵循你账户中的护栏/隐私设置。
我们使用了跨领域的基准测试来验证新 Auto 路由器的性能。
我们为路由器设计了高度的通用性,因此特意用一组多样化的基准进行了评估:MMLU Pro(知识)、τ³-bench Banking(智能体)、WideSearch(搜索)、DSQA(研究)和 SWE-Atlas QnA(编程)。
为了对默认成本层级下新路由器的选择有信心,我们需要看到它在降低成本的同时,达到与旧路由器相同的性能水平。我们在大多数领域都看到了这一结果,少数例外是旧版 Auto 路由器在应对现代低成本模型时表现不佳。在最高成本层级,我们的标准是前沿性能,即便最终成本高于旧路由器也在所不惜。

新路由器的默认设置为 cost_tier=low,而旧路由器的默认设置为 cost_quality_tradeoff=7。Max 模式将 cost_tier=max 与 cost_quality_tradeoff=0 进行对比。
| 基准测试 | 新默认 | 旧默认 | 新 Max | 旧 Max |
|---|---|---|---|---|
| MMLU Pro(知识) | 85.2% ±0.3 | 86.6% ±0.1 | 91.4% ±0.3 | 88.8% ±0.3 |
| τ³-bench Banking(智能体) | 20.6% ±1.0 | 21.0% ±1.0 | 31.6% ±1.6 | 7.2% ±2.7 |
| WideSearch(搜索) | 61.6% ±2.6 | 53.1% ±2.6 | 61.9% ±2.4 | 54.8% ±2.6 |
| DSQA(研究) | 62.9% ±1.6 | 43.2% ±1.7 | 63.0% ±1.6 | 42.3% ±1.7 |
| SWE-Atlas QnA(编程) | 30.4% ±2.0 | 30.4% ±2.3 | 60.7% ±1.7 | 2.4% ±0.0 |
这些结果反映的是某一时间点的情况,并会随着社区偏好的变化而不断改变。我们正在利用基准测试来理解不同路由策略之间的相对性能,以建立信心,相信群体的智慧确实能为您带来更好的结果。我们的假设是,随着越来越多的人采用 OpenRouter,高效的模型选择将随着时间的推移而不断改进。
成本对比
新路由器的默认成本层级将在各种工作负载下都具备成本效益,而 max 模式则允许更广泛的高成本模型,适用于性能比花费更重要的场景。
| 基准测试 | 新默认 | 旧默认 | 新 Max | 旧 Max |
|---|---|---|---|---|
| MMLU Pro(知识) | $140.93 | $393.34 | $255.71 | $449.61 |
| τ³-bench Banking(智能体) | $155.89 | $320.04 | $168.41 | $99.36 |
| WideSearch(搜索) | $30.75 | $31.83 | $36.89 | $31.60 |
| DSQA(研究) | $276.00 | $147.11 | $248.83 | $144.18 |
| SWE-Atlas QnA(编程) | $297.23 | $463.73 | $1,325.08 | $205.52 |
任何在多个模型之间切换的路由策略,在输入缓存重建时都会产生一些额外的成本。通常,为了切换到更适合新任务的模型,这笔成本是值得的,但如果模型切换过于频繁,则可能造成浪费。Auto 路由器实现了“粘性”行为,使多轮对话保持在同一个模型上,直到当前使用的模型不再是您任务的首选方案。
新的 Auto 路由器如何工作
新的 Auto 路由器会根据使用 OpenRouter 的人们在总体上针对您的提示词所代表的确切任务类型正在使用的模型来做决策。您可以把它想象成一个始终保持在最新状态的市场指数,而且使用 OpenRouter 的人越多,它的效率就越高。
下面的模型组合展示了新的 Auto 路由器的路由曲线如何将每种任务类型映射到 cost_tier 设置:low、medium、high、xhigh 和 max。这是一个时点视图:随着新模型的发布以及 OpenRouter 社区使用模式的变化,路由曲线也会随之调整。
此快照的时效截至 8 月 10 日。最新信息请查看排行榜页面。
它使用的排名是根据聚合的匿名消费统计数据计算得出的,保护了我们所有客户的隐私和数据政策。你的提示词会在传输过程中进行分类,无需留存。其工作原理如下:
-
对任务进行分类。一个快速、轻量级的分类器会将每个提示词分配到约 30 种细粒度任务类型之一,例如代码调试、多步骤智能体规划、知识问答、数学、客户支持或研究报告。
-
按真实消费份额排名。对于该任务类型,新的 Auto 路由器会查找过去 7 天内 OpenRouter 社区实际消费最多的模型,类似于我们排行榜页面上的“消费份额”视图。这是一个实时信号:当人们将工作负载迁移到新模型时,路由器会在几天内跟进。
-
应用你的成本层级。cost_tier 设置(low、medium、high、xhigh 或 max)决定你愿意花费的金额,并选择匹配的候选模型成本区间。在 low 档,路由会为每个任务保留最便宜的可用模型;在 max 档,它会从能力最强、价格最高的模型中挑选。
-
带后备方案的路由。选定的模型会成为首选以及后备方案,按使用份额排序。路由会遵循你的请求和账户上的模型及提供商限制,例如允许的模型、护栏和 ZDR 策略。如果分类或排名在任何时候不可用,路由器会回退到默认模型集,因此请求绝不会因为路由问题而失败。
在对话的各个轮次中,路由器会记住某个对话最终选定的模型,并在后续轮次中优先使用该模型。它通过显式提供的 `session_id` 来识别对话,若未提供,则根据消息的指纹进行识别。每一轮仍会从头对候选模型进行排序,且被记住的模型仅在其仍位列顶级候选时才会被复用,因此当任务发生变化时,更合适的模型可以接管。
立即试用新的 Auto 路由器
Auto 路由器可在任何您通常填写模型字符串的位置使用:
{
"model": "openrouter/auto",
"messages": [
{ "role": "user", "content": "Explain quantum entanglement in simple terms" }
]
} 或者设置您的成本层级并限制候选集:
{
"model": "openrouter/auto",
"messages": [{ "role": "user", "content": "..." }],
"plugins": [{
"id": "auto-router",
"cost_tier": "max",
"allowed_models": ["anthropic/*", "openai/*"]
}]
} `cost_tier` 参数接受 `low`、`medium`、`high`、`xhigh` 或 `max`,用于设定您愿意花费的额度:`low` 会路由到最便宜且具备能力的模型,`max` 则始终从能力最强的模型中挑选。旧的 Auto 路由器提供数值型的 `cost_quality_tradeoff` 设置,其中 `0` 代表高质量设置,数值越高表示对成本越敏感,默认值为 `7`。为了向后兼容,`cost_quality_tradeoff` 参数仍被接受,并保留其原有的成本上限行为;如果您同时发送两个参数,该参数将优先。
响应的 `model` 字段会告知您选择了哪个模型,且不收取额外费用;您只需按实际运行模型的标价付费。详情请参阅新的 Auto 路由器文档,其中包含多轮对话的会话粘性说明。
使用 `openrouter/auto-beta` 抢先体验新改进
我们将持续改进此路由器,以优化模型选择和缓存性能。任何希望率先尝试最新路由行为的用户都可以使用 `openrouter/auto-beta`,这些更改会先在该版本中落地,然后才会进入 `openrouter/auto`。新路由器已在此运行数周,已有数千人将其用于实际工作负载。请通过我们的 Discord 或您的客户代表告诉我们您的发现。