OpenRouter:Announcements(RSS)
同事件
56AI 编辑部评分,满分 100

OpenRouter:多模型路由成趋势,成本压力驱动企业从单一LLM转向跨模型推理

2026-06-12 00:00· 66天前· Afzal Jasani
AI 导读

OpenRouter数据显示,企业正从单一LLM转向跨模型族推理,成本压力是推动路由决策的关键。Anthropic的Opus 4.7因tokenizer tax导致输入token增加约35%;新模型Fable($10/M输入,$50/M输出)和OpenAI的GPT-5.5 Pro($30/M输入,$180/M输出)定价更高。3月至4月间有90个新模型发布,进一步增加了可选性。

正文 · AI 翻译
Dinner is Served
  • 选择权的价值
  • 路由是第一等公民
  • 永远追求更好

几周前,我和团队在旧金山参加一个会议。我们原本计划在一家相当普通的美式餐厅吃晚餐,但我另有打算,迅速改变主意,为我们订到了寿司店的位子。临时变卦并不理想,但在展台忙了一整天后,吃一顿平庸的饭菜同样糟糕。再说了,谁不爱寿司呢?

过去十年里,我和妻子每逢庆祝都会去吃寿司 omakase。我闭着眼睛都知道菜单上有什么。大多数缺乏经验的寿司爱好者会直奔大腩,但还有更多美味值得探索。所以很自然地,我告诉大家由我来为全桌点菜。我一直对朋友、家人和同事都这么做。在这种特定情境下,人们百分之百愿意把选择权交给我,只为享受一顿美餐。

关于如何一起用餐,我有一个坚定的看法:每次都吃家庭式分享餐。

选择权的价值

但为什么呢?一方面,这降低了单独点菜的风险,避免你点的夏威夷肋眼牛排难吃得像垃圾。另一方面,它放大了“天哪,那口鱼子酱和牛简直是我今年吃过最棒的一口”的记忆。那个瞬间会一直留在我们心里。我总说,第一次去一家餐厅,就什么都尝尝。之后随时可以再点更多。但只有吃家庭式分享餐,这个办法才行得通。

只用一个 LLM,就跟每个人都各自点自己的主菜一样。你可能是在追求安全的选择,而不是最好的结果。我和数百家公司聊过,它们开始 AI 之旅时都只选了一家供应商,比如 OpenAI、Anthropic 或 Gemini。当只依赖一家供应商时,你是在根据今天已知的信息和今天的需求下注。这就像那个老故事:“没人会因为买了并实施 Salesforce 而被解雇”——只不过,这种情况正在改变。等到我和这些公司交流时,它们已经准备好“升级”,开始使用不止一个模型族和一种模态。新的用例每天都在涌现。通常情况是这样的:

  • 从 OpenAI 企业版开始,向少数几个团队发放部署许可。
  • 监控初始用户群体的使用情况,可以看到数据呈现持续上升的良好趋势。
  • 向更多团队开放访问权限。
  • 出现了新的用例,如图像生成、转录和创意写作。
  • 发现 OpenAI 的模型并不最适合你的用例,你需要 Gemini。
  • 去 Gemini 或其他任何供应商那里设置访问权限,结果可观测性、治理和资源调配都出了问题。

我目前看到的常见模式看似是成本压力,但问题比这更深层。公司已经用完了年度预算,而这才刚到六月。大家强烈希望减少模型 token 用量,我理解这一点。如果你不小心使用了 Opus 4.8,可能会耗尽日预算,然后你就别无选择了。合上笔记本电脑,出去走走吧。

虽然 Opus 4.7 的标价没有变化,但有几个人提到了“分词器税”。这是 Anthropic 做的一个静默改动,导致输入 token 增加了近 35%。这是一个意义重大的变化。更新、更强大的模型价格也在上涨。Anthropic 发布了 Fable,定价为每百万输入 token 10 美元,每百万输出 token 50 美元。还有更贵的:OpenAI 的 GPT-5.5 Pro 定价为每百万输入 token 30 美元,每百万输出 token 180 美元。请谨慎使用!

成本压力是一种强制机制,可能导致更好或更坏的结果。从我的角度来看,我乐观地认为它正带来一些更好的结果。我也很幸运能够促成这些结果。这在我从事数据基础设施工作期间是一个常见主题。很多讨论都围绕着计算成本以及团队在数据仓库上花费了多少。但这过于关注显性成本,而忽视了隐性成本。最具战略眼光的领导者会彻底扭转这种讨论。我经常听到这样的说法:“我每年已经在计算成本上花费了 100 万美元,所以我不在乎再减少 30%。相反,更有价值的是,我那 40 名分析师组成的团队(每年花费我 700 万美元)能否更高效。我需要开发工具的速度和效率。”

路由是一等公民。

在进入下一部分之前,先简单说明一下 OpenRouter 到底是什么。OpenRouter 是访问 AI 的权威市场平台。我们让推理变得简单易行。我们消除了围绕选择提供商、选择模型以及理解延迟、价格、TPS、模型基准等各项指标的所有麻烦。

因此,现在你可以通过 OpenRouter 在一个地方,使用一套简洁标准化的 API 规范,访问数百个大语言模型。这存在是多么不可思议?这一切听起来很棒,几乎像是鱼与熊掌可以兼得,但人们在实际中到底是怎么做的呢?

幸运的是,我能够获取到一些相关数据。而且时机也恰到好处,今天团队正好发布了我们的分析 API!

多模型采用一直是我们持有的假设,但我们能清晰地看到与此相关的增长趋势。这合乎逻辑且在意料之中,但它掩盖了一个事实:大多数人可能只是在尝试每个模型的最新版本。例如,Anthropic 在图表的时间范围内发布了 Opus 4.6、Opus 4.7 和 Opus 4.8。因此,更有趣的是用户如何在不同的模型族之间进行采用。

现在,我们可以捕捉到用户主动将推理分散到不同模型族的真实增长情况。这描绘了一幅更真实的、关于持续进阶的图景。让我们再加入一个关于模型发布的数据点。

这是一个累计图表,因为发布计划并不总是一致的。但我们可以看到从三月到四月有一个巨大的异常值,期间我们有 90 个新模型发布。这太惊人了!可供选择的选项越来越多,且速度越来越快。

这也可能带来一些压力。就像去一家餐厅,菜单上有 225 道菜(我最喜欢的餐厅之一)。即使是家庭聚餐式,你也不可能全部尝遍。我们显然考虑到了这一点,不希望用户必须了解每个模型之间的区别。因此,我们构建了自动路由器和帕累托路由器等功能,让选择使用哪个模型变得更加容易。

这一切都与我之前提到的成本压力息息相关。企业实际上正在以一种有趣的方式使用 OpenRouter。它们能够随着时间的推移,持续降低每个 token 的平均加权成本。这是如何实现的呢?如果你根据所需的结果,将特定的工作负载路由到特定的模型提供商和模型,那么你就可以利用像 DeepSeek V4 Flash 这样的模型,其输入成本仅为每百万 token 约 0.10 美元,输出成本为每百万 token 约 0.20 美元。

更进一步,你可以利用像 Cerebras 这样拥有最佳吞吐量的模型提供商,那么你就如同布拉德利·库珀指挥的乐团大师,只不过我们为你承担了所有繁重的工作。

或者,你也可以将部分流量路由到 Gemini 模型的灵活优先层级,以享受五折优惠。同样,选择权在你手中。

我们即将分享一些关于模型智能的激动人心的内容。总体而言,主题依然不变:我们让推理变得简单可靠。

永远追求更好

感觉推动 AI 应用的顺风正在转向 AI 优化。我们明白,我们在 AI 推理上花费的金额不会出现任何有意义的减少,那么下一个最佳选择是什么?那就是降低每个 token 的平均加权成本。组织正变得更加有意识地在团队间普及 AI 使用,同时降低治理方面的风险。这只有在你不被单一供应商锁定的情况下才能真正实现。当你选择为不同的用例使用不同的模型时,你就能在每一步都获得优势。你终于可以坐在餐桌旁,像吃家庭餐一样,随心所欲地享用了。

来源:OpenRouter:Announcements(RSS) · openrouter.ai

事件后续 · 1查看事件全部 →

OpenRouter:多模型路由成趋势,成本压力驱动企业从单一LLM转向跨模型推理

OpenRouter:Announcements(RSS)·2026-06-12 00:00·66天前·Afzal Jasani
AI 导读

OpenRouter数据显示,企业正从单一LLM转向跨模型族推理,成本压力是推动路由决策的关键。Anthropic的Opus 4.7因tokenizer tax导致输入token增加约35%;新模型Fable($10/M输入,$50/M输出)和OpenAI的GPT-5.5 Pro($30/M输入,$180/M输出)定价更高。3月至4月间有90个新模型发布,进一步增加了可选性。

正文 · AI 翻译
Dinner is Served
  • 选择权的价值
  • 路由是第一等公民
  • 永远追求更好

几周前,我和团队在旧金山参加一个会议。我们原本计划在一家相当普通的美式餐厅吃晚餐,但我另有打算,迅速改变主意,为我们订到了寿司店的位子。临时变卦并不理想,但在展台忙了一整天后,吃一顿平庸的饭菜同样糟糕。再说了,谁不爱寿司呢?

过去十年里,我和妻子每逢庆祝都会去吃寿司 omakase。我闭着眼睛都知道菜单上有什么。大多数缺乏经验的寿司爱好者会直奔大腩,但还有更多美味值得探索。所以很自然地,我告诉大家由我来为全桌点菜。我一直对朋友、家人和同事都这么做。在这种特定情境下,人们百分之百愿意把选择权交给我,只为享受一顿美餐。

关于如何一起用餐,我有一个坚定的看法:每次都吃家庭式分享餐。

选择权的价值

但为什么呢?一方面,这降低了单独点菜的风险,避免你点的夏威夷肋眼牛排难吃得像垃圾。另一方面,它放大了“天哪,那口鱼子酱和牛简直是我今年吃过最棒的一口”的记忆。那个瞬间会一直留在我们心里。我总说,第一次去一家餐厅,就什么都尝尝。之后随时可以再点更多。但只有吃家庭式分享餐,这个办法才行得通。

只用一个 LLM,就跟每个人都各自点自己的主菜一样。你可能是在追求安全的选择,而不是最好的结果。我和数百家公司聊过,它们开始 AI 之旅时都只选了一家供应商,比如 OpenAI、Anthropic 或 Gemini。当只依赖一家供应商时,你是在根据今天已知的信息和今天的需求下注。这就像那个老故事:“没人会因为买了并实施 Salesforce 而被解雇”——只不过,这种情况正在改变。等到我和这些公司交流时,它们已经准备好“升级”,开始使用不止一个模型族和一种模态。新的用例每天都在涌现。通常情况是这样的:

  • 从 OpenAI 企业版开始,向少数几个团队发放部署许可。
  • 监控初始用户群体的使用情况,可以看到数据呈现持续上升的良好趋势。
  • 向更多团队开放访问权限。
  • 出现了新的用例,如图像生成、转录和创意写作。
  • 发现 OpenAI 的模型并不最适合你的用例,你需要 Gemini。
  • 去 Gemini 或其他任何供应商那里设置访问权限,结果可观测性、治理和资源调配都出了问题。

我目前看到的常见模式看似是成本压力,但问题比这更深层。公司已经用完了年度预算,而这才刚到六月。大家强烈希望减少模型 token 用量,我理解这一点。如果你不小心使用了 Opus 4.8,可能会耗尽日预算,然后你就别无选择了。合上笔记本电脑,出去走走吧。

虽然 Opus 4.7 的标价没有变化,但有几个人提到了“分词器税”。这是 Anthropic 做的一个静默改动,导致输入 token 增加了近 35%。这是一个意义重大的变化。更新、更强大的模型价格也在上涨。Anthropic 发布了 Fable,定价为每百万输入 token 10 美元,每百万输出 token 50 美元。还有更贵的:OpenAI 的 GPT-5.5 Pro 定价为每百万输入 token 30 美元,每百万输出 token 180 美元。请谨慎使用!

成本压力是一种强制机制,可能导致更好或更坏的结果。从我的角度来看,我乐观地认为它正带来一些更好的结果。我也很幸运能够促成这些结果。这在我从事数据基础设施工作期间是一个常见主题。很多讨论都围绕着计算成本以及团队在数据仓库上花费了多少。但这过于关注显性成本,而忽视了隐性成本。最具战略眼光的领导者会彻底扭转这种讨论。我经常听到这样的说法:“我每年已经在计算成本上花费了 100 万美元,所以我不在乎再减少 30%。相反,更有价值的是,我那 40 名分析师组成的团队(每年花费我 700 万美元)能否更高效。我需要开发工具的速度和效率。”

路由是一等公民。

在进入下一部分之前,先简单说明一下 OpenRouter 到底是什么。OpenRouter 是访问 AI 的权威市场平台。我们让推理变得简单易行。我们消除了围绕选择提供商、选择模型以及理解延迟、价格、TPS、模型基准等各项指标的所有麻烦。

因此,现在你可以通过 OpenRouter 在一个地方,使用一套简洁标准化的 API 规范,访问数百个大语言模型。这存在是多么不可思议?这一切听起来很棒,几乎像是鱼与熊掌可以兼得,但人们在实际中到底是怎么做的呢?

幸运的是,我能够获取到一些相关数据。而且时机也恰到好处,今天团队正好发布了我们的分析 API!

多模型采用一直是我们持有的假设,但我们能清晰地看到与此相关的增长趋势。这合乎逻辑且在意料之中,但它掩盖了一个事实:大多数人可能只是在尝试每个模型的最新版本。例如,Anthropic 在图表的时间范围内发布了 Opus 4.6、Opus 4.7 和 Opus 4.8。因此,更有趣的是用户如何在不同的模型族之间进行采用。

现在,我们可以捕捉到用户主动将推理分散到不同模型族的真实增长情况。这描绘了一幅更真实的、关于持续进阶的图景。让我们再加入一个关于模型发布的数据点。

这是一个累计图表,因为发布计划并不总是一致的。但我们可以看到从三月到四月有一个巨大的异常值,期间我们有 90 个新模型发布。这太惊人了!可供选择的选项越来越多,且速度越来越快。

这也可能带来一些压力。就像去一家餐厅,菜单上有 225 道菜(我最喜欢的餐厅之一)。即使是家庭聚餐式,你也不可能全部尝遍。我们显然考虑到了这一点,不希望用户必须了解每个模型之间的区别。因此,我们构建了自动路由器和帕累托路由器等功能,让选择使用哪个模型变得更加容易。

这一切都与我之前提到的成本压力息息相关。企业实际上正在以一种有趣的方式使用 OpenRouter。它们能够随着时间的推移,持续降低每个 token 的平均加权成本。这是如何实现的呢?如果你根据所需的结果,将特定的工作负载路由到特定的模型提供商和模型,那么你就可以利用像 DeepSeek V4 Flash 这样的模型,其输入成本仅为每百万 token 约 0.10 美元,输出成本为每百万 token 约 0.20 美元。

更进一步,你可以利用像 Cerebras 这样拥有最佳吞吐量的模型提供商,那么你就如同布拉德利·库珀指挥的乐团大师,只不过我们为你承担了所有繁重的工作。

或者,你也可以将部分流量路由到 Gemini 模型的灵活优先层级,以享受五折优惠。同样,选择权在你手中。

我们即将分享一些关于模型智能的激动人心的内容。总体而言,主题依然不变:我们让推理变得简单可靠。

永远追求更好

感觉推动 AI 应用的顺风正在转向 AI 优化。我们明白,我们在 AI 推理上花费的金额不会出现任何有意义的减少,那么下一个最佳选择是什么?那就是降低每个 token 的平均加权成本。组织正变得更加有意识地在团队间普及 AI 使用,同时降低治理方面的风险。这只有在你不被单一供应商锁定的情况下才能真正实现。当你选择为不同的用例使用不同的模型时,你就能在每一步都获得优势。你终于可以坐在餐桌旁,像吃家庭餐一样,随心所欲地享用了。

来源:OpenRouter:Announcements(RSS)· openrouter.ai

事件后续 · 1查看事件全部 →