- 模型组合在深度研究任务上持续表现更优
- 一次 API 调用即可融合多个模型的最佳输出
- 我们选择 DRACO 来测试推理、工具调用和简洁性
- 防止模型作弊
- 模型与自身融合带来显著提升
- 关于我们 DRACO 实现的说明
- 试试 Fusion
- 6/14 更新:发布时的常见问题解答
我们发现,综合多个模型的结果可以显著超越单个模型的能力。我们推出了 Fusion:一个能像调用单个模型一样轻松获取这些综合结果的工具。它允许你选择一组参与模型,以及一个负责将各个结果融合在一起的裁判模型。
为了理解 Fusion 的优势,我们使用了一个深度研究基准测试,该测试综合考察了推理、工具使用和知识。我们发现:
- 模型组合持续优于单个模型
- 使用前沿模型组合可以实现超越前沿水平的性能
- 经济型模型组合可以超越前沿模型,并接近前沿模型组合的性能
现在就在聊天室中试试 Fusion,或者查看 API 文档将其集成到你的应用中。
模型组合在深度研究任务上持续表现更优
我们在 DRACO 基准测试的 100 个深度研究任务上测试了 Fusion。以下是一些亮点发现:
- Fable 5 + GPT-5.5 融合后得分 69.0%**,超越了所有单个模型,包括单独测试得分 65.3%** 的 Fable 5。
- 一个经济型组合(Gemini 3 Flash、Kimi K2.6 和 DeepSeek V4 Pro)击败了 GPT-5.5 和 Opus 4.8。其得分与 Fable 5 相差不到 1%,而成本仅为后者的一半。
| 类型 | 模型 | 得分 |
|---|---|---|
| 融合 | Fable 5 + GPT-5.5**由 Opus 4.8 合成 | 69.0% |
| 融合 | Opus 4.8 + GPT-5.5 + Gemini 3.1 Pro由 Opus 4.8 合成 | 68.3% |
| 融合 | Opus 4.8 + GPT-5.5由 Opus 4.8 合成 | 67.6% |
| 融合 | Opus 4.8 + Opus 4.8由 Opus 4.8 合成 | 65.5% |
| 单独 | Claude Fable 5** | 65.3% |
| 融合 | Gemini 3 Flash + Kimi K2.6 + DeepSeek V4 Pro由 Opus 4.8 合成 | 64.7% |
| 单独 | DeepSeek V4 Pro | 60.3% |
| 单独 | GPT-5.5 | 60.0% |
| 单独 | Claude Opus 4.8 | 58.8% |
| 单独 | Kimi K2.6 | 53.7% |
| 单独 | Gemini 3.1 Pro | 45.4% |
| 单独 | Gemini 3 Flash | 43.1% |
在 100 个 DRACO 任务中,有 7 个未能完成,原因是 Fable 5 的内容过滤器阻止了它们的执行。我们选择不为这些任务回退到 Opus 4.8,因此 Fable 的结果反映的是 93 个已评分任务,而非完整的 100 个。这能最准确地体现 Fable 自身的性能,但也意味着与完成全部 100 个任务的模型进行直接分数对比时会略有偏差。
我们认为这证明了模型多样性的益处,类似于人类团队协作中观察到的优势。为复杂问题引入多种不同视角,能够产生更优的结果。
一次 API 调用,融合多个模型的最佳输出
当你向 Fusion 发送提示词时,我们会并行地将请求分发给一组模型,每个模型都启用了网络搜索和网页抓取功能。一个评判模型会读取所有模型的响应,并生成结构化分析:共识点、矛盾点、部分覆盖、独特见解、盲区。然后,调用模型会基于该分析撰写最终答案。
整个流程在服务端运行,因此可以像调用单个模型一样调用它。
使用单个模型标识符直接调用 Fusion:
{
"model": "openrouter/fusion",
"messages": [
{ "role": "user", "content": "What are the strongest arguments for and against carbon taxes?" }
]
} 或自定义模型组合:
{
"model": "openrouter/fusion",
"messages": [{ "role": "user", "content": "..." }],
"plugins": [{
"id": "fusion",
"model": "google/gemini-3-flash-preview",
"analysis_models": [
"google/gemini-3-flash-preview",
"moonshotai/kimi-k2.6",
"deepseek/deepseek-v4-pro"
]
}]
} 我们选择 DRACO 来测试推理、工具调用和简洁性
我们需要一个能够区分“听起来很全面”和“实际上很全面”的模型的基准测试。标准基准测试测试的是事实记忆或推理谜题。它们不测试 Fusion 所针对的能力:研究一个复杂问题、综合多个来源、并生成一份全面且引用充分的深度分析。
DRACO(由 Perplexity AI 开发)正是为此而设计。它包含 100 个深度研究任务,涵盖 10 个领域:学术研究、金融、法律、医学、技术、用户体验设计、常识、大海捞针式检索、个性化协助以及产品对比。
每个任务都附带一个评分细则,包含约 39 个加权标准,分为四个类别:
- 事实准确性(约 20 个标准):响应中必须正确无误的可验证声明
- 广度与深度(约 9 个标准):综合质量、权衡分析、可操作建议
- 呈现质量(约 6 个标准):术语使用、格式排版、可读性
- 引用质量(约 5 项标准):要求提供带有可查证参考文献的原始来源引用。
标准可赋予负权重。满足负面标准意味着回答包含错误。例如,危险的医疗建议会受到大幅扣分。这些负面标准也使得通过冗长回答来操纵分数变得困难:一个自信满满却给出错误陈述的模型会受到惩罚。
每个回答由评判模型按每项标准独立评分三次。我们报告了所有任务的平均归一化分数(0-100)。
DRACO 存在作者承认的局限性:它仅评估纯文本、纯英文的交互,其静态任务集可能无法完全泛化到未来的深度研究应用中。绝对分数也取决于评判模型的选择(论文报告称不同评判模型之间分数存在 10-25 个点的差异),不过系统的相对排名保持稳定。
防止模型作弊
当我们为评审模型提供网络搜索功能时,发现了一个令人担忧的问题:它们正在网上查找 DRACO 评分标准。虽然这源于搜索词巧合,并非故意作弊,但仍然暴露了真实的污染风险。
我们通过将结果托管地址从网络搜索和网络抓取中排除来解决此问题,阻止模型访问与基准评分标准相关的页面。OpenRouter 的服务器工具通过使用 Exa 或 Parallel 等第三方提供商,支持对所有模型统一应用这些排除列表,因此只需一行配置更改即可实现,无需逐个模型打补丁。本文中的所有结果均是在排除列表生效后产生的。
如果您正在运行自己的评估,也可以使用相同的机制:在工具定义中向 `web_search` 传递 `excluded_domains`,或向 `web_fetch` 传递 `blocked_domains`,以防止评审模型访问特定来源。
将模型与自身融合带来的显著提升
我们让 Opus 4.8 与自己搭档,组成双模型专家组,同时由 Opus 4.8 担任综合器。结果:得分 65.5%,比单独使用 Opus 4.8(58.8%)高出 6.7 个百分点。这表明 Fusion 的性能提升中,有相当一部分来自综合步骤本身,而不仅仅是结合不同模型架构。对同一提示词运行两次,会产生不同的推理路径、不同的工具调用、不同的来源选择。这虽然不足以超越多样化的模型组合,但有助于我们理解综合步骤本身的影响。
关于我们 DRACO 实现的说明
我们仔细复现了 DRACO 论文中描述的方法,唯一的区别是使用 Gemini 3.1 Pro Preview 作为评判模型,而非论文原版选择的 Gemini 3 Pro。这意味着我们的分数与原始论文公布的结果不具有直接可比性。
我们希望在保留促使原作者选择该评判模型的高人机对齐特性的同时,也能捕捉到新模型的判别能力。在 Gemini 3.1 Pro Preview 自身在基准测试中得分较低后,我们使用 Claude Sonnet 4.6 对评判结果进行了合理性检查,发现它保留了促使原作者选择该模型作为评判者的那些特性。我们的目标是展示 Fusion 与单个模型之间的相对差异。
试试 Fusion
API:发送 `"model": "openrouter/fusion"` 可直接调用 Fusion,或在你的 tools 数组中添加 `{"type": "openrouter:fusion"}`,让模型自行决定何时使用它。Fusion 文档
聊天室:访问 openrouter.ai/fusion,选择一个预设或构建自定义专家组。
6/14 更新:发布后的常见问题解答
Fusion 的反响非常热烈。感谢大家!我们正在审阅所有反馈、建议和错误报告。多项改进已经上线,我们将在接下来几天内继续处理。以下是对一些最常见问题的回答:
Fusion 能否直接替代 Fable?
不。该基准测试表明,将多个模型融合在一起,可以在深度研究任务上达到并超越 Fable 级别的性能。我们只对一类任务(DRACO 深度研究)进行了基准测试,但这种方法很可能也适用于我们尚未测试的许多其他工作流程。我们很乐意听到您发现它在哪些其他用例中表现出色。
DRACO 也不包含长周期任务,而这正是 Fable 的强项。
我应该如何使用 Fusion 进行编码?
Fusion 并非编码模型的直接替代品。相反,它能为您的编码模型提供一个服务器工具。基础模型直接处理常规编码任务,并可以选择性地调用 Fusion 来处理那些值得花费更多时间和金钱以获得详尽答案的问题(例如架构决策或最佳实践方法的研究)。模型会自行判断何时该问题需要多角度分析。
基准测试中的模型可以使用哪些工具?
每个模型,无论是在 Fusion 面板中还是单独运行,都拥有相同的三个服务器工具:
- openrouter:web_search(通过 Exa)
- openrouter:web_fetch(通过 Exa)
- openrouter:bash
在所有配置中保持工具集一致,确保了公平比较。Fusion 面板和单独运行之间的唯一区别在于是否综合了多个模型的输出,而非可用工具的不同。
DeepSeek V4 Pro 的性能令人惊讶。这个结果准确吗?
我们对 DeepSeek 取得的高分感到惊讶。在达到 60.3% 的情况下,其表现与 Opus 4.8 和 GPT-5.5 相当。
一种假设是:如果给予 Opus 4.8 更大的工具调用预算,它的得分会更高。它似乎是一个更“贪婪”的模型,在拥有更多时间和更多工具使用机会时表现更好。相比之下,Fable 更擅长审慎地使用工具调用预算,并在行动前进行更长时间的思考。基准测试中固定的工具调用预算可能压缩了不同工具使用策略模型之间的差距。
它慢吗?慢多少?
您发起请求的模型会像往常一样执行。只有当您的模型遇到它认为能从 Fusion 中受益的问题时,响应才会变慢。当 Fusion 被调用时,它会启动一个多步骤流程,该流程通常比标准调用长 2-3 倍。在此期间,它会将您的提示词发送给多个模型,等待它们全部完成,然后处理结果以生成融合后的响应。我们这样做是为了在正常模型执行速度与您在需要时获得超越前沿答案的能力之间取得平衡。
我可以通过哪些方式使用 Fusion?
有四种使用 Fusion 的方式,它们都基于相同的底层逻辑:
- 聊天室。打开 openrouter.ai/fusion,选择一个预设或构建自定义面板。无需编写代码。
- 模型标识符。将 `"model": "openrouter/fusion"` 发送到我们的任何推理端点,Fusion 插件会自动注入一个包含默认前沿模型面板的配置。您只需切换模型字符串即可使用。文档
- 服务器工具。将 `{ "type": "openrouter:fusion" }` 添加到您的工具数组中。控制力最强:选择您想要执行融合的模型,并将 Fusion 与其他工具结合使用。您发送请求的模型将自行决定何时以及是否调用 Fusion。文档
- 插件。像往常一样调用 completions 或 responses 接口,然后添加 `"plugins": [{ "id": "fusion", ... }]` 并带上您选择的面板。调用中指定的模型将负责融合结果。文档