请将通信邮件发送至 model@minimax.io。
摘要
我们推出 MiniMax-M2 系列,这是一族基于“小激活可释放最大现实智能”原则构建的混合专家语言模型。旗舰版 M2 总参数量为 2299 亿,每个 token 仅激活 98 亿参数。M2 系列专为智能体部署进行端到端设计,其基础由三部分组成:(i) 智能体驱动的数据流水线,可在智能体编程与智能体协作中生成大规模、可验证的轨迹,每条轨迹均基于可执行工作空间和与产物对齐的奖励;(ii) Forge,一个可扩展的智能体原生强化学习系统,能够适应长周期智能体轨迹,并配备窗口式先进先出调度、前缀树合并、推理优化,以及清晰的训练-推理-智能体解耦架构,同时支持白盒与黑盒智能体;(iii) 最新的 M2.7 检查点朝着自我进化迈出了早期一步——能够自主调试训练运行并修改自身框架。从 M2 到 M2.7,这一组合将小激活足迹转化为智能体编程、深度搜索、办公任务和推理基准上的前沿性能。
1 引言
大语言模型正迅速从简短的单轮对话转向长周期智能体工作流:编写并交付生产级代码、浏览开放网络、操作异构工具,以及在数百个交织的推理与行动步骤中生成结构化的办公文档 [openai2025gpt5, anthropic2025claude46, google2025gemini31]。这一转变暴露出两个截然不同的难题。首先,智能体任务固有的超长上下文在训练和推理过程中带来了巨大的效率与成本瓶颈,尤其是在大规模、高可用性生产部署的严苛要求下。其次,实际部署需要解决本质上复杂且高风险的任务,例如生产级软件工程和知识密集型办公自动化。
为应对这两大挑战,我们推出了 MiniMax-M2 系列,这是一系列基于混合专家(MoE)架构的语言模型,其核心设计原则是:极小的激活量可以释放最大的真实世界智能。旗舰模型 M2 是一个 62 层解码器专用 Transformer,总参数量为 2299 亿,每个 token 仅激活 98 亿参数,由 256 个细粒度专家 [dai2024deepseekmoe] 组成,采用 sigmoid 门控、带分组查询注意力(GQA)的全多头注意力 [ainslie2023gqa]、原生 192K token 上下文窗口,以及一个在推理时兼作推测解码草稿路径 [leviathan2023fast] 的多 token 预测(MTP)模块 [gloeckle2024better, deepseekai2024v3]。在 29.2T token 上的预训练奠定了模型基础;M2 的大部分真实世界能力随后通过一个智能体原生的后训练流水线构建,其组件从 M2 到 M2.5 再到最新的 M2.7 共同演进。
主要贡献。MiniMax-M2 系列能力的持续演进和性能提升主要源于以下技术创新:
-
我们设计了高保真、大规模智能体数据流水线,专门针对智能体编程、协作工作、推理及通用知识任务进行定制,其中每个任务都配有相应的静态/运行时环境、可验证奖励或可信反馈信号。我们发现,提升每条被采纳轨迹的奖励质量与可信度——无论是通过可执行的验证信号还是裁判模型的证据核查——对于充分释放基础模型的内在潜力至关重要。
-
我们构建了 Forge,这是一个面向智能体的原生强化学习系统,专为大规模、通用型智能体强化学习而设计,能够在统一的训练循环中无缝接纳白盒与黑盒(仅限 API)智能体。通过解耦关键架构组件——包括训练、推理以及智能体本身——并将这种分离与优先考虑鲁棒性的算法设计及精细的奖励系统相结合,Forge 实现了高度稳定的强化学习时间缩放。此外,Forge 还整合了窗口式先进先出调度以吸收轨迹长度差异、前缀树合并,以及与我们的部署栈协同设计的推理内核,从而显著提升了强化学习的训练效率与可扩展性。
-
我们在 M2.7 中展示了一种早期形式的自我进化:该模型能自主排查我们基础设施上失败的训练运行,跨任务和实验编辑自身的智能体脚手架,并通过在代表性机器学习工程任务上运行多轮自我改进来接受评估。从 M2 到 M2.5 再到 M2.7 在智能体基准测试上的系列内提升已反映了这一点,从而消除了前沿模型开发中最昂贵的人工参与瓶颈之一。
结果。图1预览了MiniMax-M2.7在三个能力领域的核心数据。在智能体编程方面,M2.7在SWE-bench Pro上达到56.2,在SWE-bench Multilingual上达到76.5,在Multi-SWE-bench上达到52.7,在Terminal-Bench 2.0上达到57.0。在智能体协作方面,它在MM Claw上达到62.7,在BrowseComp上达到77.8,在GDPval-AA上达到50.0,在Toolathlon上达到46.3。在推理与知识方面,M2.7在AIME 2026上取得94.2,在GPQA-Diamond上取得89.8。仅凭100亿激活参数,MiniMax-M2.7的性能已接近最强的闭源前沿系统。我们请读者参阅第8节,以获取完整的基准测试套件、逐项基准分析以及系列内部的性能演进。
2 预训练架构
2.1 整体架构
M2是一个基于混合专家(MoE)架构的大规模稀疏语言模型,旨在扩展模型容量的同时保持较低的每token计算预算。它包含2299亿总参数,每token激活98亿参数。该模型实现为一个62层解码器专用Transformer,隐藏维度为3072,词表大小为200064,并在29.2万亿个token上进行了预训练,最大上下文窗口为192K。
M2 中的每个 Transformer 模块均由一个多头自注意力层和一个混合专家(MoE)前馈层组成。在注意力机制方面,M2 在所有层中均采用全多头注意力,使用 48 个查询头和 8 个键值头(GQA)[ainslie2023gqa]。整个模型应用了旋转位置编码(RoPE)[su2024roformer]。这一设计不同于 MiniMax-Text-01 [minimax2025minimax01] 中探索的混合注意力机制,反映了我们在大规模场景下对全注意力的偏好(第 2.2.2 节)。MoE 前馈层包含 256 个细粒度专家 [dai2024deepseekmoe],每个 token 激活 8 个专家。路由采用带可学习专家特定偏置项的 sigmoid 门控实现,这改善了负载均衡,同时大幅减少了对辅助损失的依赖 [wang2024auxfree](第 2.2.1 节)。除了标准的下一 token 预测目标外,我们在预训练阶段还引入了一个多 token 预测(MTP)模块 [gloeckle2024better]。该模块在继续预训练期间通过权重复制进行扩展,以支持多步推测解码 [leviathan2023fast](第 2.3 节)。
2.2 模型设计选择
M2 的设计空间主要由两个架构决策主导:前馈层的稀疏化方式,以及注意力机制在各层间的结构安排。每个决策都通过针对替代方案进行审慎基准测试而做出,其理由和支持证据详述如下。
2.2.1 混合专家
M2 在其前馈层采用了混合专家(MoE)架构,并进行了三项改进,旨在提升表达能力、路由动态性和负载均衡。
细粒度专家。我们采用了一种细粒度专家设计,使用数量更多但规模更小的专家,在增加专家总数的同时减小每个专家的 FFN 大小。这提高了路由的组合多样性,并降低了专家在不同设备上使用情况的方差(表 1)。
| 样本数 | 基线 | 带MTP | 带细粒度 | |
| 模型配置 | ||||
| 激活参数量 | – | 2B | 2B | 2B |
| 总参数量 | – | 17.8B | 17.8B | 17.8B |
| 训练token数 | – | 500B | 500B | 500B |
| 专家数量 | – | 32 | 32 | 128 |
| topk | – | 2 | 2 | 8 |
| 基准测试结果 | ||||
| MATH | 4-shot | 19.6 | 21.3 | 24.1 |
| MMLU | 5-shot | 39.8 | 39.7 | 40.2 |
| ARC-Challenge | 25-shot | 27.4 | 27.5 | 27.8 |
| KorBench | 3-shot | 14.1 | 15.0 | 14.8 |
| HumanEval | 0-shot | 29.7 | 30.1 | 32.5 |
Sigmoid门控。我们采用sigmoid门控进行专家路由,而非基于softmax的top-k门控 [shazeer2017moe]。每个专家获得独立的激活分数,消除了softmax施加的零和约束。这使得多个专家能够同时以高置信度被激活,并在训练过程中产生更平滑的路由动态。
专家偏置。我们在门控函数中引入了可学习的偏置项,作为每个专家的路由分数偏移量。这些偏置与模型参数联合优化,并隐式地调节专家利用率,从而可以大幅减少辅助负载均衡损失。
2.2.2 注意力机制
M2在所有层中采用全多头注意力机制,这与MiniMax-Text-01 [minimax2025minimax01] 中使用的混合设计不同,后者将Lightning Attention [qin2024lightning] 与全注意力交错使用。尽管高效注意力机制在理论上具有吸引力,但我们发现在涉及推理、编码和智能体任务的生产环境中,没有任何变体能够可靠地匹配全注意力的质量。
评估难度。核心挑战在于如何可靠地衡量质量损失。在 MiniMax-Text-01 的开发过程中,我们的混合注意力模型在标准基准测试(MMLU [hendrycks2021mmlu]、BBH [suzgun2023challenging]、MATH [hendrycks2021math]、LongBench [bai2024longbench])上表现与全注意力模型相当,但在更大规模下,复杂的多跳推理中出现了明显的缺陷。我们开发了代理指标来弥补这些差距,但代理指标与实际下游性能之间的相关性很脆弱——在更大规模或未见过的任务分布上可能不成立。此外,用于统计显著评估所需的计算量随任务复杂度大幅增长,不同架构与数据分布及训练策略的交互方式难以预测,这使得可靠的比较变得异常困难。
基础设施差距。线性注意力和稀疏注意力的基础设施仍不如全注意力成熟。许多线性架构即使在训练阶段也受限于内存带宽。在推理方面,关键挑战依然存在:对低精度存储敏感、缺乏原生前缀缓存支持,以及与推测性解码的集成方式尚不明确。
混合滑动窗口注意力实验。我们针对 M2 的注意力层,广泛探索了混合滑动窗口注意力(Sliding Window Attention)[beltagy2020longformer] 的变体,在多种配置下继续预训练了数千亿到数万亿个 token——包括改变 SWA/全注意力的比例、调整 RoPE 设置、探索层内和层间混合、分析注意力模式(归纳头 [olsson2022induction]、检索头 [wu2024retrieval]),以及添加 sink token [xiao2024streamingllm]。在预训练期间,所有变体在检索、多跳推理和上下文学习任务上的表现均有所下降(表 2)。经过 SFT 后,这种差距在长上下文场景下变得更加明显:在超过 32K 上下文的基准测试(智能体任务和复杂长上下文评估)中,SWA 变体的表现明显差于全注意力。在 32K 以内的基准测试中,差异表现不一且绝对值较小——SWA 在某些指令遵循和较短周期的智能体任务(如 IFBench、XBench-ds)上达到甚至超过了全注意力,而全注意力在知识密集型评估(如 GPQA-Diamond、MMLU-Pro)上仍保持优势;详见表 3。这些发现表明,混合 SWA 的注意力覆盖范围限制严重影响了长上下文能力,而对较短上下文场景的影响微乎其微。
展望。随着上下文长度不断增长以及 GPU 计算扩展速度放缓,次二次方注意力将变得越来越重要。我们正在投资于更好的长上下文数据、评估方法和基础设施,以实现这一转变。
| 基线 | 使用 SWA | |
| HELMET ICL | 75.8 | 72.7 |
| MMLU | 85.5 | 85.6 |
| MATH | 60.3 | 60.3 |
| RULER 128K CWE | 90.0 | 72.0 |
| RULER 128K MQ | 99.0 | 93.0 |
| RULER 32K CWE | 99.0 | 99.0 |
| RULER 32K MQ | 99.0 | 99.0 |
| MTOB K-e Bleurt | 60.0 | 45.0 |
| MTOB e-k ChrF | 44.8 | 27.2 |
| 基线 | 使用 SWA | |
| 通用基准测试 | ||
| AIME 2025 | 86.7 | 86.7 |
| ARC-AGI-1 | 38.9 | 39.6 |
| GPQA-Diamond | 75.3 | 72.7 |
| MMLU-Pro | 80.5 | 80.1 |
| IFBench | 23.1 | 27.2 |
| 智能体基准测试 | ||
| SWE-verified | 54.7 | 50.2 |
| Terminal-Bench | 26.7 | 23.8 |
| BrowseComp-zh | 32.8 | 28.7 |
| GAIA-103 | 53.4 | 51.5 |
| XBench-ds | 58.0 | 63.0 |
| -Bench 零售 | 62.3 | 67.5 |
| -Bench 电信 | 32.5 | 21.0 |
2.3 多 token 预测
M2 采用了多 token 预测(MTP)[gloeckle2024better],该方法训练模型联合预测后续的多个 token。这种设计提供了更丰富的训练信号,并能在推理时实现推测解码 [leviathan2023fast]。
预训练阶段。在预训练期间,M2 采用单个 MTP 模块()进行训练,该模块遵循 DeepSeek-V3 [deepseekai2024v3] 的设计(图 2),初始 MTP 损失权重为 0.3,在衰减阶段退火至 0.1。如表 1 所示,我们的消融实验表明,MTP 在各项基准测试中持续提升模型性能,其中在推理密集型任务上的提升最为显著。
通过权重复制进行扩展。为了支持多步推测解码,我们在持续预训练的衰减阶段从单个 MTP 模块扩展到三个。我们并非随机初始化,而是从主模型复制权重来初始化 MTP 模块。这一策略至关重要,原因有二:(1)复制初始化的模块收敛速度显著快于随机初始化的模块,后者会从高损失开始并暂时拖累主模型;(2)它能在过渡期间最小化对主模型表征的干扰。扩展后,我们首先冻结主模型,仅训练 MTP 模块一小段时间,直到其损失稳定,然后切换到所有模块的联合训练。我们还探索了全程保持主模型冻结的方案,但发现在这种仅训练 MTP 的策略下,MTP 模块收敛到的最终质量不如联合训练。
推理。在推理时,三个 MTP 模块生成草稿 token,由主模型在单次前向传播中进行验证,从而在保持与标准自回归解码相同输出质量的同时,提升吞吐量。
3 预训练数据
训练数据。预训练语料库包含一个全面且精心整理的数据集,涵盖了多种来源,包括网络文档、学术文献、书籍、编程代码和结构化问答内容。我们结合基于模型的奖励评分和辅助分类器,从多个维度评估文档质量,并采用平衡采样策略,提升高质量内容的权重,同时保留足够的类别多样性。
数据分布。预训练数据的混合比例在各领域间经过精心平衡,其中代码、数学和 STEM 内容的采样率相对于其自然分布显著提升。其余部分由通用网络内容、书籍和其他特定领域数据组成,确保对世界知识和语言多样性的广泛覆盖。在预训练的恒定阶段,我们总共训练了 19.9T 个 token。
长上下文扩展。在初始预训练阶段之后,我们采用多阶段训练流程,逐步将模型的上下文窗口从 8K tokens 扩展到 32K,最终达到 192K tokens。衰减阶段使用的总数据预算为 9.3T tokens,包含短文本衰减数据和长上下文数据,其中高质量的代码拼接、天然的长篇 PDF 文档以及主题相关的文档打包是长上下文训练样本的主要来源。在衰减阶段,我们混入高质量数据,以巩固模型能力,同时扩展其有效上下文长度。
4 后训练数据收集
4.1 智能体编码
我们在三个互补领域收集智能体编码的后训练数据:软件工程(SWE)、应用程序开发(AppDev)和终端交互任务,涵盖仓库级别的代码演进、全栈开发和交互式终端环境。
4.1.1 真实数据驱动收集:软件工程任务
为编码智能体构建训练数据面临三个相互关联的挑战:实现广泛的任务多样性、确保客观可验证性,以及扩展到大规模训练所需的体量。GitHub 是收集此类数据的丰富且天然结构化的来源:一个结构良好的拉取请求包含描述、相关代码变更以及提供客观正确性信号的测试用例。然而,原始 PR 数据本身存在噪声,无法直接使用,这促使我们构建了一个真实数据驱动的 SWE 扩展流水线:一个基于原始 GitHub 数据的智能体驱动自动化数据流水线,用于生成多样化、可验证的 SWE 风格数据集和环境。具体来说,该流水线依次经过以下六个连续阶段。
-
PR 收集与过滤。该流程的第一阶段涉及大规模爬取采用宽松许可证的公开 GitHub 仓库,以收集拉取请求及其关联的 issue,这些内容共同提供了代码差异、测试文件和问题描述。由于原始 GitHub 数据本身存在大量噪声,我们对最终被合并的 PR 应用了基于规则的质量过滤器,并附加了相关测试用例存在等其他筛选条件。
-
智能体合成的多语言 Docker 环境。在 SWE 扩展流程中,我们旨在为每个 PR 构建一个可运行的 Docker 环境。然而,我们观察到在非 Python 环境下,由于异构依赖关系和版本冲突,环境合成的可靠性较低。为解决此问题,我们引入了一个融入专家知识的智能体驱动执行循环,能够根据执行反馈迭代生成并优化构建脚本。我们主要解决以下几个关键维度:
- –
编译型语言的构建系统编排。Java、Go、Rust 和 C++ 等编译型语言需要复杂的工具链协调,包括编译器版本、构建工具和依赖解析。
- –
异构执行与测试接口。不同语言暴露了不同的构建和测试流程,因此需要统一且可适配的执行接口来进行环境搭建与验证。
- –
仓库级别的结构差异性。不同仓库在项目组织和依赖规范上的差异,要求采用自适应策略来处理代码定位和测试执行。
- –
-
PR 标记与任务多样化。在为每个 PR 构建好 Docker 环境后,我们执行 PR 级别的标记与路由。GitHub PR 涵盖了广泛的任务类型分类,包括错误修复、功能添加、性能优化、代码重构和测试构建。这种路由是必要的,因为不同的任务类型需要不同的下游可验证奖励公式。
-
基于测试的可验证奖励构建。我们设计了基于测试用例执行的、针对特定任务的奖励函数,因为不同的 PR 类型需要根本不同的评估标准。
- –
缺陷修复。针对缺陷修复场景,我们提取 F2P(失败转通过)和 P2P(通过转通过)测试用例。如果黄金补丁能通过这些测试,则该数据被视为有效。随后,我们让模型以智能体身份在沙箱中修复缺陷,并使用 F2P 和 P2P 两种测试来验证正确性。P2P 测试尤其重要,用于确保修复过程中不会引入新的缺陷。
- –
功能新增。对于功能新增,传统的 F2P/P2P 逻辑可能不适用,因为测试通常依赖于新引入的代码。因此,我们专注于提取新增的测试点,并确保黄金补丁能通过它们。
- –
性能优化。由于性能优化没有缺陷修复过程,在此类情况下,我们提取 P2P 测试,用于验证优化前后稳定且显著的性能差异。
- –
-
基于模型的任务验证。原始的 GitHub PR 通常结构松散,其关联的测试用例可能无法完整描述底层问题,从而导致任务定义模糊或不完整。为解决此问题,我们采用模型来验证问题描述与测试用例之间的一致性,并在必要时补充缺失信息,从而生成自包含且可执行的任务规范。
-
任务转换与增强。为最大化数据集多样性,我们对现有 PR 应用转换和增强策略,从单一来源生成多个任务变体。
- –
缺陷注入。向代码库中额外引入缺陷,以增加任务难度并扩展修复场景的分布范围。
- –
提交合并。将相邻的提交或 PR 合并,构建复杂度更高的多步骤修复任务,该方法类似于 SWE-Smith [yang2024swesmith]。
- –
SWE-Test 转换。将缺陷修复 PR 转换为 SWE-Test 任务,在此类任务中,问题定义被反转:智能体不再修复缺陷,而是必须编写一个测试用例,该用例在补丁前的代码上失败,在应用补丁后通过,从而直接锻炼测试编写能力,同时保持完全可验证。
- –
代码审查任务。智能体执行静态分析,检查代码变更,并识别潜在缺陷,无需可运行环境。一致性由辅助大语言模型验证,从而产生大致可验证的任务,这些任务对整体任务多样性做出了有意义的贡献。
- –
SWE 扩展流水线最终生成一个大规模训练数据集,其中每个实例包含一个问题描述、一个基于测试的可验证奖励,以及一个可运行的 Docker 环境。对于 M2 系列模型,该流水线涵盖十多种编程语言,并覆盖广泛的编码任务类别。
4.1.2 专家驱动的数据收集:应用开发任务(AppDev)
虽然 SWE 任务侧重于对现有代码仓库的修改,例如错误修复、功能添加和重构,但应用开发(AppDev)任务要求从头构建完整的应用程序。这带来了独特的挑战:任务无法直接从现有代码库中提取,质量信号需要超越静态分析的运行时验证,并且评估标准涵盖功能正确性和主观设计质量。为应对这些挑战,我们设计了一个专家参与的数据流水线,将领域专业知识与大规模自动化验证相结合。领域专家贡献编码了生产级技术模式的元查询,精心设计用于引导轨迹生成的系统提示词,并制定涵盖执行、交互和美学方面的评估标准。随后,一个“智能体即验证器”(AaaV)框架通过在沙盒环境中部署生成的应用程序,并通过工具辅助交互,依据专家定义的评估标准对其进行验证,来执行自动化的拒绝采样。该流水线使我们能够跨多个领域(例如前端、后端、移动端、桌面端和仿真)合成多样化、高质量的应用开发轨迹。
专家在环查询合成。我们通过结合专家设计的元查询与自动化质量控制,合成多样化、高质量的开发任务查询。来自工程团队的领域专家贡献了经过优化的元查询,这些查询编码了他们的领域知识。每个元查询作为一个模板,捕捉关键的技术模式,指定框架生态系统(例如 React + Zustand + Tailwind)、架构约束以及基于生产经验的真实用例。专家们策划了特定类别的种子池,涵盖 UI 组件库、CSS 框架、构建工具、SaaS 集成以及常见的应用场景。这些元查询注入了可控的变异性:技术栈、样式方法和功能需求均从专家策划的分布中采样,以确保多样性和技术有效性。元查询会根据下游质量信号进行迭代优化,使专家能够修剪那些持续产生低质量输出的模式,并放大那些能生成结构良好的开发任务的模式。
多样化的用户查询是通过将元查询与随机采样的种子相结合来合成的,随后通过高温度参数的大语言模型生成进行处理,以最大化变异性。每个元查询被扩展为多个具体查询,这些查询描述了特定的开发任务,涵盖功能需求、技术选型以及 UI/UX 规范。为了控制冗余,我们应用了基于 MinHash 的去重方法,以线性时间实现近似近重复检测,并支持可配置的阈值。最后,我们采用大语言模型作为评判者,依据领域特定的评估标准对每个查询的质量进行评价,这些标准分为三类:技术栈合理性(兼容性、选型适当性、组合有效性)、功能可行性(技术可实现性、描述具体性、UI/UX 逻辑)以及需求清晰度(有效性、场景真实性、表达连贯性、完整性)。得分低于特定阈值的查询将被剔除。这确保了只有结构良好、技术合理且范围切实可行的开发任务才能进入轨迹采样环节。
基于专家系统提示词的轨迹采样。领域专家通过精心设计的系统提示词,将先验知识直接注入生成过程。这些提示词编码了针对早期模型已知缺陷的最佳实践。例如,对于Web前端任务,专家观察到模型表现出次优的设计习惯,例如过度使用模板化的渐变背景。为了对抗这些倾向,系统提示词阐述了明确的设计指南和质量标准,涵盖功能完整性、代码完整性、内容真实性和美学。除了设计指导,提示词还鼓励开发过程中的最佳实践:在实现前编写规范,为复杂任务维护结构化的待办事项列表,以及通过测试进行自我验证。我们还专门收集针对技能使用和内化的轨迹,使模型能够学习何时以及如何有效利用技能。我们方法的一个关键要素是提示词蒸馏:在轨迹采样期间,模型接收完整的增强系统提示词,而在训练期间,我们选择性地丢弃部分指导。这种部分不对称性促使模型将专家编码的最佳实践内化为默认行为,从而减少其在推理时对显式提示词的依赖。
基于评分标准奖励和智能体即验证者的拒绝采样。与SWE任务中测试用例提供自然正确性信号不同,应用程序开发需要跨多个维度进行整体评估,这无法仅通过静态代码分析来完成。我们通过智能体即验证者(AaaV)框架来解决这个问题,该框架通过在沙盒环境中部署生成的应用程序,并通过工具辅助交互对其进行评估来验证轨迹。评估通过三个层级进行,为每个标准生成带有强制性证据的二元通过/失败判断。
-
执行层验证应用程序是否能够实际运行。具体检查包括:文件存在性与语法正确性、依赖项解析与可安装性、构建成功与服务器初始化、HTTP 状态以及页面加载时无 JavaScript 错误。未通过该层的轨迹会被立即拒绝,因为它们代表无法正常运行的输出。
-
交互层评估核心功能是否按预期工作。验证智能体使用 Playwright 检查:预期交互元素是否存在、按钮和表单的响应性,以及核心功能工作流的端到端完成情况。该智能体会浏览已部署的应用程序,触发用户交互,并观察状态变化,以确定指定的功能是否实际实现。
-
视觉美学层评估主观质量维度:布局的专业性、视觉层次清晰度、配色方案和谐性,以及是否符合现代 UI 设计标准。
各层的总体通过率作为拒绝采样的奖励信号,其中执行层检查充当立即拒绝的硬性门槛。这种三层评估机制将 AaaV 与传统的“大语言模型作为评判者”方法区分开来:验证智能体并非从静态代码或截图评估质量,而是与正在运行的应用程序进行多轮主动交互,并根据专家定义的评分标准对观察到的行为进行打分。关键在于,我们经过严格筛选、多样化的查询分布与这种“智能体作为验证者”的评估范式之间的协同作用,为后续的强化学习奠定了坚实基础,既提供了丰富的探索空间,也提供了可靠、基于环境的奖励信号。
4.1.3 Terminal-Gym:自动化任务合成与环境生成
超越 SWE-bench [jimenez2024swebench],Terminal-Bench [merrill2026terminalbench] 在功能完备的终端环境中评估智能体处理真实复杂任务的能力,对大语言模型的系统操作、调试和命令行能力提出了显著更高的要求。为提升模型在这些能力上的表现,我们提出 Terminal-Gym,这是一个自动化数据合成流水线,能够系统性地将精选的真实编程场景转化为多样化的可验证终端任务语料库。通过生成结构化任务模式、动态演化查询难度以及自动合成基于 Docker 的稳健运行环境,它为终端智能体提供了一个高度可扩展的训练框架。
种子数据集筛选。Terminal-Gym 以完整的 Stack Overflow 数据集为基础,该数据集提供了大规模、高质量的真实编程与系统操作场景。在对原始数据进行时间排序以重构完整帖子后,我们应用严格的基于规则的过滤。我们剔除缺少被采纳答案的帖子、低分帖子以及过长的问答对。为严格聚焦终端场景,我们通过标签进行筛选,仅保留与终端操作、系统配置、调试、脚本编写及相关软件工程工作流相关的线程。随后,每个保留的帖子都会被标注多个属性,包括问题质量、任务类型适用性、可验证性、任务类别、大致复杂度、环境要求及执行特征。我们仅选择满足严格标准的帖子:必须可脚本化、兼容终端、可验证、与 Linux/Docker 相关且难度适中。最后,我们丢弃每个线程中的噪声或冗余内容,并选取一个高质量答案,形成基础的问答对。
查询合成。我们进一步将选定的查询重写为结构化的任务描述。这涉及具体化执行上下文,包括必要的环境、所需工具、预期的输入和输出格式以及成功标准。这些重写后的任务随后根据可测试性、完整性和清晰度被分为四个等级;仅保留属于前两个等级的任务。原始的查询-答案对由此被转化为一个结构化模式,其中包含自然语言指令、任何必要的支持文件或脚本,以及对预期终端行为的简洁描述。
合成流水线。每个结构化模式都会经历一个三阶段转换,最终成为一个完整的终端任务。
-
阶段一:环境与测试生成。一个智能体为每个任务生成一个 Dockerfile 和一个相应的测试脚本。测试被执行以验证功能。如果测试失败,结构化的诊断反馈会返回给智能体进行迭代修复,该过程持续进行,直到测试通过或达到最大重试次数限制。
-
阶段二:查询演化与统一测试。先前步骤生成的任务指令通常包含显式提示、文件路径或预期的环境输出。为解决此问题,我们应用了一个受控的查询演化过程,系统地抽象或移除这些提示,同时确保语义一致性。一个任务的所有衍生变体随后会使用由大语言模型生成的统一测试套件进行评估。这种统一测试方法迫使测试去验证任务背后的逻辑,而不是过度拟合特定的描述风格或显式提示。实验结果证明了该方法在确保稳健评估方面的有效性。
-
阶段三:难度校准。最后,我们严格过滤掉过于简单的任务。我们优先采样那些包含更少提示且零样本通过率更低的任务变体。此过滤过程会考虑参考求解器的历史通过率以及在环境合成期间所需的修复迭代次数,从而确保最终的基准测试保持高难度和高区分度。
最终,Terminal-Gym 为复杂的终端操作提供了一个高度可扩展的训练框架,我们正以此为基础,将其演进为零干预的 Anything2Docker 系统。此外,鉴于代码安全的重要性日益提升,我们正在进一步扩展 CVE-Factory [luo2026cvefactory],以覆盖更广泛的自主网络安全研究前沿,推动由 AI 驱动的漏洞分析与主动防御机制的发展边界。
4.2 智能体协作
除了编程和终端任务中可验证的信号外,实际部署还需要能够在异构专业环境中运行的智能体——在开放网络中搜索原始资料、对金融电子表格进行推理、制作演示文稿,以及生成终端用户实际消费的更广泛的办公文档。智能体协作正是支撑这些能力的数据收集流程,围绕四个领域组织:深度搜索与开放网络研究、知识工作者办公任务、金融分析与电子表格操作,以及幻灯片生成。尽管每个领域都在不同的工作空间上运行并产生不同的产物,但所有四个领域都遵循相同的总体设计。任务在真实、可运行的工作空间上实例化;轨迹从一组轮换的强教师模型在刻意扰动过的脚手架下蒸馏而来;接受与否由与产物格式对齐的验证信号决定,而非由单一的通用评判器决定。对于其结果无法直接通过机器验证的子任务,我们收集多个候选响应,并通过沿两个轴——推理与行动轨迹以及最终产物——进行成对比较来从中选择,随后进行基于评分标准的过滤,以执行严格的准确性和质量标准。下文将描述每个领域如何实例化这一共享流程。
4.2.1 深度搜索与开放网络研究
该领域针对的是需要智能体在开放网络中导航、跨多个来源收集证据并综合出有依据答案的任务。为了大规模生成此类任务,我们采用了一种“引导-改写”合成策略。从一个种子问题出发,我们迭代地改写问题并模糊其依赖的实体,直到任务难度足以区分强智能体与弱智能体。这一过程使我们能够持续控制任务难度,让简单变体用于练习基础检索,而更难的变体则要求进行深度、多步骤的浏览和跨来源相互印证。为防止模型学会编造听起来合理的答案,每个合成任务还配有一份明确的证据规范,并且只有当采样轨迹的答案基于实际检索到的证据(而非从模型记忆中背诵)时,该轨迹才会被接受。对于没有唯一简短答案的更广泛、报告式查询,我们将精确匹配的接受标准替换为基于评分标准的评判器,该评判器会从事实准确性、透明度、不确定性处理以及风险披露等维度进行评分。轨迹是从一组轮换的强教师模型中蒸馏出来的,并且每次运行时都会扰动周围的脚手架,使得最终策略能够泛化到任何单一工具布局之外。
4.2.2 知识工作者办公任务
该领域涵盖了知识工作者在日常工作中产生的端到端专业交付物——报告、幻灯片、备忘录、结构化文档——的广阔空间。我们将语料库锚定在 GDPval [patwardhan2025gdpvalevaluatingaimodel](一个成熟的办公任务基准)上,并通过一个模拟真实专业人士组织工作方式的合成流程对其进行扩展。
种子筛选。我们首先从种子基准中筛选出一组可用的经典任务子集,过滤掉那些超出智能体工具支持范围的项目,从而使种子部分为语料库的其余部分提供一个清晰、可执行的锚点。
层次化合成。在此锚点之上,我们通过一个层次化、多阶段的流程,构建了一个规模大得多的自合成语料库。我们从公开职业数据库中获取广泛的职业类别,并推导出包含文化与地域多样性的细粒度子类别,确保覆盖不同行业、地区和文化背景。针对每个子类别,我们生成具体任务及模拟真实工作场景的详细任务描述,将数据锚定于真实的专业活动,而非抽象或泛化的指令。对于每个任务,我们进一步生成一个包含支持文档的真实工作空间,以及多个不同具体程度的查询版本,将高层任务描述转化为具体、可操作的问题设定,并使模型接触到多样化的用户表达风格。每个任务还附带一份关于预期交付物的结构化规范,从而确保合成、执行与验收均采用相同的工件格式。
多维度评分标准验收。验收由一个涵盖积极行为、消极行为、关键错误、区域适配性及推理深度的多维度评分标准来管控,该标准统一应用于种子部分和自合成部分。此外,一次类型化的清理过程会移除那些捏造数据、引用或实体的轨迹,确保最终语料库中仅保留符合严格事实标准的工件。
4.2.3 财务分析与电子表格操作
该领域涵盖两个互补的任务族,共同覆盖金融专业人士的日常工作:基于真实金融工具进行金融信息检索、计算与推理;以及在真实工作簿上进行电子表格操作。这两个任务族通过不同的任务合成流程构建,但共享相同的下游验收与支撑机制。
证据驱动合成。对于第一类任务,我们采用先前工作 [chen2026dive] 中引入的证据驱动任务合成流程,该流程颠覆了传统的自上而下创作顺序:我们首先执行真实的金融工具来收集有依据的执行轨迹,然后反向推导出这些轨迹严格蕴含的任务。这通过构造方式实现了有据可依——每个任务在设计上既可从可观测的工具输出中执行和验证,参考答案也完全由工具实际返回的内容决定。
工作簿遍历合成。对于第二类任务,我们则通过工作簿遍历来构建语料库,其思路与 [liu2025webexplorer] 等轨迹驱动合成方法一脉相承。智能体针对一个种子工作簿执行一组精选的原子级电子表格操作,其所遍历的中间状态会被回收作为新的种子,并在每条生成的轨迹上以逆序合成任务:从轨迹推导出答案,再从答案推导出问题。最后一步会沿着措辞和难度两个维度对生成的问题池进行多样化处理。
覆盖范围。第一类任务针对的是答案必须基于外部金融数据的检索、计算和推理问题。第二类任务涵盖三个子方向:涉及工作簿结构理解、公式应用和跨工作表操作的通用及竞赛级电子表格操作;涵盖典型私募股权、风险投资和并购场景的金融建模;以及从半结构化源文档重建结构化工作簿。
验收。验收优先采用确定性的数值级匹配。学生作品会被执行,其公式由外部引擎重新计算,得到的单元格数值会与标准答案工作簿进行比对。对于形式可能合理变化的交付物,例如从半结构化文档重建的工作簿或开放式金融推理子任务,我们则退而采用基于评分标准或基于智能体的评判方式。此外,每个任务都会在多种脚手架下进行采样,以确保最终策略对工具接口的变化具有鲁棒性。
4.2.4 幻灯片生成与编辑
该领域同时面向端到端的演示文稿创建和增量式幻灯片编辑,因此合成流程相应地沿着两条并行路径推进。第一条路径将幻灯片创作视为一个开放式生成问题。我们整理了跨商业领域的多样化源文档集合,并为每份文档生成在描述粒度、长度和语域上各不相同的查询,从而使生成的任务能够覆盖用户请求的真实分布。第二条路径将幻灯片编辑视为一个局部干预问题。我们以真实演示文稿为种子样本,沿多个多样性维度生成编辑指令,包括编辑的粒度(从单个元素到页面再到文档级别)、编辑的意图(内容、风格或结构)以及变更的复杂度。轨迹是从一组轮换的强教师模型中蒸馏得到的,优先选择那些生成结果具有我们希望学生模型继承的视觉质量的教师模型。由于幻灯片产物最终是以视觉方式呈现的,因此验收环节融合了多个互补信号:执行成功性、由智能体判断的功能正确性、基于规则的基本布局美学检查,以及最终的视觉评分器——它将交付物渲染为图像并进行评判。为防止策略过度拟合单一渲染工具包,我们额外混合了在替代性幻灯片生成库下产生的轨迹。
4.3 推理密集型任务
推理数据的核心目标是赋予模型对复杂问题进行深度、结构化思考的能力——证明数学定理、推导科学结论、设计算法以及构建逻辑论证。这些任务横跨众多领域,而在每个领域内,单个问题又进一步允许多种有效的解题策略,从而形成了一个任务与方法的组合空间。这种规模与多样性自然催生了以规模驱动为导向的方法。我们沿着三个互补的维度进行扩展,并同时维护一个质量保障管线,以确保大规模数据的正确性。
查询侧扩展。扩展独特问题的集合,尤其是在代表性不足的难度区间内,能直接提升覆盖率和泛化能力。我们结合从现有来源中筛选整理,以及针对通过错误分析识别出的技能缺口,定向合成新问题。
响应侧扩展。为每个查询生成多条正确的解题路径,能提升推理多样性。随着每个查询的响应数量增加,跨领域能力持续提升,其益处主要体现在跨领域泛化上,这表明多样化的解题路径传授的是可迁移的推理策略,而非对解题方案的死记硬背。我们分析了不同难度层级下的饱和特性,并在模型解题多样性仍然较低的区间集中进行额外采样。
训练侧扩展。除了独立扩展查询和响应之外,我们还在固定计算预算下研究了最优数据混合比例——即查询扩展与响应扩展的相对比例。前者提升问题覆盖率和领域广度,而后者则加深模型对解题策略空间的控制力。我们根据当前能力瓶颈所在,通过经验校准每个训练阶段的混合比例,并采用动态分配策略,将资源集中投入到模型的薄弱环节。
质量保障。大规模扩展会引入噪声和错误数据的风险。为确保正确性,我们在流程的每个阶段都强制执行质量控制。对于查询,我们采用多阶段清洗,将直接查询标记与上线响应的交叉比对相结合,以识别模糊或格式有误的问题。对于验证器,我们进行系统性案例分析,覆盖更多边界条件和边缘情况,确保验证逻辑在不同问题类型上保持准确。对于答案,我们通过比较多个模型之间的性能差异来交叉验证正确性,标记出因不一致而可能存在的标注错误。对于回答,我们应用基于结构化评分标准的评估框架,在将推理轨迹纳入训练语料库之前,按照明确定义的质量维度对其进行评估。
4.4 通用对话与写作
该赛道对上述智能体与推理语料库进行补充,提供涵盖写作、通用问答和多轮对话的广泛对话数据。该语料库主要由包含长思维链(long CoT)推理的高质量样本组成,旨在向模型灌输推理能力,同时保持其通用能力,并为后续强化学习提供稳定的冷启动基础。
每个子领域都有其独特的侧重点。在写作方面,主要关注风格:精心筛选高质量查询,使回复遵循特定的风格标准,捕捉语气、结构和表达的细微差别。写作流程中还集成了文件系统,使模型能够读取和写入结构化文档,从而将其写作能力与现实世界的生产力场景对齐。对于通用问答,由于查询通常相对直接,重点则转向从多个候选回复中进行选择,以满足偏好对齐的质量要求。对于多轮对话,重点在于更复杂的交互场景下遵循指令和评分标准——在多轮对话中保持连贯性、跨轮次上下文追踪,以及对长上下文的稳健理解。
为了进一步增强模型的能力和鲁棒性,数据集同时包含工具增强样本和无工具样本。工具增强样本教会模型在适当时有效利用外部工具,如代码解释器和搜索引擎;而无工具样本则确保模型能够在没有外部辅助的情况下独立推理。这种均衡的构成使模型能够在多样化的交互场景中灵活适应。
生成后,所有数据都会通过自动化验证器(基于规则的检查器和基于模型的评估器)进行严格验证,并经过系统性质量检查,以确保正确性和持续的高质量,之后才会纳入训练流程。
4.5 角色扮演与人格一致性
为了支持基于人格设定的长程对话——这是通用对话轨道未涉及的一种主要实际部署模式——我们将角色扮演作为一个独立的数据轨道,拥有其自身的规范化定义、基准测试、合成流程和奖励信号。
我们将角色扮演 [minimax2026deepdive] 形式化为在联合空间上、以条件为约束的长期条件生成。核心目标是在扩展的多轮对话中保持物理、叙事和风格的一致性。基于“对齐错误是客观可检测的,而对齐本身是主观的”这一洞察,我们引入了 Role-Play Bench,它通过惩罚特定的失败模式(例如,角色出戏、逻辑错误)来评估多轮自我对弈轨迹,从而生成与在线互动度高度相关的离线指标。我们通过风格多样的专家模型之间的大规模自我对弈来合成训练数据。为确保质量并防止模式崩溃,我们应用了跨四个维度的分散采样、Best-of-N 过滤,以及由大语言模型作为评判者进行的周期性片段级重写。我们利用来自真实产品交互的隐式和显式反馈,通过 RLHF 优化策略;这些原始信号通过因果推断和分层偏差消除进行去噪,以隔离真正的质量指标,并应用熵监控来缓解奖励破解。
5 监督微调
我们进行监督微调,以在 M2 中注入所需的交错思考行为,为后续的强化学习阶段提供一个强有力的起点。与传统的长思维链数据(其中推理局限于单个连续块)不同,我们的监督微调数据将思考轨迹与中间动作和观察交错在一起,使模型能够在统一的轨迹中进行推理、行动和修正。为了大规模生成此类数据,我们构建了一个系统化的数据流水线,该流水线针对特定领域的奖励信号执行大规模拒绝采样,随后进行多阶段数据清洗,从而产生高质量的交错思考轨迹。由此产生的监督微调语料库涵盖四个核心领域——聊天、推理、代码和协作——包括单轮推理和多轮智能体交互。
6 强化学习
6.1 强化学习算法
6.1.1 智能体强化学习建模
我们将智能体强化学习表述为:将大语言模型视为策略,而将模型生成过程之外的一切——包括上下文管理、记忆访问和智能体状态转换——视为环境。这种分离提供了一种清晰的抽象,能够自然地将标准强化学习框架扩展,以适应智能体系统的复杂性。
6.1.2 马尔可夫决策过程表述
我们将智能体与环境的交互建模为马尔可夫决策过程。在每一步,智能体观察到一个状态——该状态包含当前上下文窗口内容,包括任务指令、先前的对话历史、工具输出以及智能体循环过程中产生的任何产物——并产生一个动作,该动作定义为单步的大语言模型补全。此补全可能包含自然语言推理、工具调用请求、显式的上下文管理操作、与子智能体的通信,或以上任意组合。随后,环境执行所请求的操作并返回一个观测值,该观测值与可能的上下文管理操作共同决定下一个状态:
| (1) |
其中, 表示一个任意的状态转移函数,该函数可能会改变累积的上下文以及智能体循环的内部状态。轨迹构成一个完整的回合,而策略则由大语言模型的权重进行参数化。
一个关键的设计原则是,环境的边界划定在模型的生成接口处。所有处理、转换或响应模型输出的组件都被视为环境动态的一部分:
-
工具环境:外部工具执行(代码解释器、搜索引擎、API),这些工具根据工具调用动作返回结构化的观测值。
-
智能体框架:框架层面的控制流,它控制智能体在大语言模型调用之间的推进过程——包括上下文管理、分支逻辑、子智能体委派以及与外部模块的交互。
6.1.3 训练目标
这种建模的一个关键后果是,不需要显式地对环境及状态转换进行推理或控制。训练以单个(状态-动作)对作为原子单元进行:每个(状态-动作)对构成策略梯度的一个训练样本。这将策略与状态演变的机制解耦——模型无需知晓该(状态-动作)对是由简单的消息追加、激进的上下文截断,还是完整的历史重写所产生。与此同时,信用分配、优势估计和奖励传播仍然可以在整个轨迹的回合层面进行,从而确保每个(状态-动作)对的贡献是在整体任务结果的背景下进行评估的。
6.1.4 策略优化
CISPO。我们将裁剪重要性采样策略优化(CISPO)[minimax2025m1] 适配到 M2 系列的强化学习训练中。目标函数为:
| (2) |
其中, 是每个提示词的 rollout 轨迹数量, 是轨迹 的 token 长度, 表示停止梯度算子,用于阻止梯度流经重要性权重。
重要性采样比率被非对称地裁剪:
| (3) |
上界防止过大的策略更新,而下界为零则允许对在当前策略下变得不太可能的动作进行激进的权重降低。对裁剪后的比率使用停止梯度,确保了重要性权重能够调节梯度幅度,而不会引入二阶项,从而产生稳定的一阶更新规则。
优势估计通过带有轨迹级基线的剩余奖励(reward-to-go)进行计算:
| (4) |
其中, 是步骤 处的复合奖励(定义见下文), 是为降低方差而在轨迹 上计算得到的基线。
6.1.5 奖励设计
在可能长达 192K 个 token 且包含数千个中间动作的智能体轨迹中,标准的基于结果的奖励不足以进行信用分配。我们设计了一个包含三个组成部分的复合奖励框架。
过程奖励。我们分配密集的中间奖励,针对轨迹中的特定行为模式,包括对语言混杂和工具调用格式错误的惩罚,以及对结构良好的中间推理步骤的奖励。这些过程奖励在每个步骤提供细粒度的监督信号,与仅依赖稀疏的最终结果反馈相比,显著提升了信用分配的粒度。
任务完成时间奖励。传统的强化学习目标仅优化正确性,忽略了执行效率。对于智能体任务,由于顺序执行与并行工具执行以及子智能体调用开销的差异,功能上等价的轨迹在挂钟延迟上可能差异巨大。我们将相对完成时间作为一项明确的奖励纳入:
| (5) |
其中 是一个单调递减的整形函数, 是 rollout 所花费的挂钟时间, 是一个参考完成时间。这激励策略发现并利用并行机会,从而产生既正确又高效的解决方案。
带基线的剩余奖励。为了减少长周期任务中的梯度方差,我们采用剩余奖励公式:
| (6) |
结合轨迹级基线,该公式将梯度信号集中在那些后果尚未被考虑的 action 上,从而提高了信用分配的精度并稳定了优化过程。
每个步骤的复合奖励为:
| (7) |
其中 和 是平衡密集行为反馈和效率激励与主要任务性能信号的系数。
6.1.6 混合领域强化学习训练
训练通用智能体的一个关键挑战是避免在任务特定优化与广泛能力保持之间进行权衡。单领域强化学习训练——仅在智能体任务上进行微调——存在灾难性遗忘模型基础推理和通用知识能力的风险。相反,跨领域的顺序多阶段训练会导致负迁移,因为一个领域的提升会侵蚀先前训练领域的性能。
我们采用了一种混合领域强化学习训练策略,同时解决这两个问题。训练过程分为多个阶段,在每个阶段内,训练数据同时从四个领域抽取:推理、编程、智能体和通用领域。这种联合优化确保了策略梯度更新在每一步训练中都能获得多样化任务分布的信息,从而防止优化器过度拟合任何单一领域的奖励函数分布。
在不同阶段之间,我们系统地调整三个维度:
-
领域混合比例。每个领域的数据相对比例会根据阶段进行调整。早期阶段侧重于基础能力(推理和通用领域),以巩固模型的基本能力;而后期阶段则逐步增加智能体和编程任务的比例,以提升特定任务的性能。
-
上下文长度。我们在不同阶段之间,按每个领域的粒度扩展最大上下文长度。这种课程式的渐进方式使模型能够先掌握短时域决策能力,再扩展到复杂智能体任务所特有的长上下文轨迹。
-
难度分布。在每个领域内部,训练任务的难度分布会逐步向更难的实例倾斜。早期阶段包含广泛的混合内容以建立坚实基础,而后期阶段则集中于具有挑战性的场景,以推动策略的能力边界。
这种混合领域策略带来了叠加效益:它同时提升了模型的基础推理能力、所有目标领域的任务特定质量,以及端到端的用户体验——因为实际部署的智能体会遇到横跨所有四个领域的异构请求混合。
6.2 强化学习基础设施
6.2.1 问题形式化
大规模训练强化学习智能体需要同时满足三个本质上相互冲突的需求——即"不可能三角":
-
系统吞吐量:最大化单位时间内处理的原始 token 数量,受限于推理生成延迟、训练迭代时间、数据处理开销以及 I/O 带宽。
-
训练稳定性:对策略梯度更新的方差进行约束,以确保单调改进与收敛,即。
-
智能体灵活性:支持任意智能体架构——从简单的单轮脚手架到具有动态上下文管理的复杂多智能体系统——且无需对训练框架进行针对特定智能体的修改。
我们将基础设施优化目标表述为最大化有效智能体训练产出:
| (8) | ||||
| 满足约束条件 |
这三项目标中的每一对都会产生特定的工程张力。在异构智能体运行时间(从数秒到数小时不等)下最大化吞吐量,与为稳定训练而维持分布一致性相冲突。支持任意智能体架构,与高效数据处理所需的智能体状态与训练逻辑之间的紧密耦合相冲突。在长程轨迹(最长可达192K个token)中实现稳定的信用分配,与偏向短小简单任务的吞吐量最优调度相冲突。Forge基础设施通过下文所述的架构与算法设计解决了这些张力。
6.2.2 系统架构
Forge系统由三个解耦模块组成,这些模块通过中间件抽象层连接(图4)。该架构直接实现了前一节所述的智能体强化学习建模:策略与环境之间的边界——划定在模型的生成接口处——映射到训练/推理侧与智能体侧之间的边界。
智能体侧。该模块封装了任意智能体实现,并协调它们与外部环境的交互。作为纯粹的轨迹生成器,智能体侧完全独立于训练和推理机制。它驱动 MDP 形式化定义中设定的环境动态——执行工具调用、管理上下文、访问记忆——并记录生成的元组,供下游训练使用。
中间件抽象层。两个组件连接了智能体侧与训练侧。网关服务器提供标准化的通信接口,在智能体与大语言模型引擎之间路由补全请求,从而抽象掉不同智能体框架的异构性。数据池则作为分布式轨迹存储,异步收集 rollout 数据,完全解耦了生成与训练流程,使两者能够独立扩展。
训练与推理侧。Rollout 引擎负责高吞吐量的 token 生成,作为响应网关请求的策略。训练引擎则消费来自数据池的已处理轨迹序列,计算 CISPO 策略梯度,并将更新后的权重同步回 Rollout 引擎。
6.2.3 白盒与黑盒智能体支持
上一小节中的 MDP 形式化将上下文管理、工具执行和记忆访问定义为环境动态。基础设施必须支持智能体实现这些动态的两种不同范式,这两种范式在框架对智能体内部状态的可见性上有所区别。
白盒智能体会将其上下文管理逻辑暴露给训练框架。状态转换在框架内部实现,使训练流程能够直接观察并通过上下文转换操作进行反向传播。这种紧密集成使框架能够构建忠实反映由上下文管理(CM)引起的分布的训练序列,确保策略在真实的推理时状态分布上进行优化。白盒集成对于具有明确定义的上下文管理策略(例如滑动窗口截断、周期性摘要)的智能体尤为有效,框架可以据此重建精确的训练状态。
黑盒智能体将智能体视为不透明的轨迹生成器。智能体将补全请求路由到强化学习服务网关,而不暴露其内部上下文管理、记忆压缩或多智能体协调逻辑。框架仅收集外部可见的元组——即每次补全请求中呈现给大语言模型的上下文所在位置——并根据这些观测结果构建训练数据。这种非侵入式范式支持任意内部架构,包括深度思考循环、激进的上下文重写以及分层多智能体系统,无需对智能体端进行任何修改即可实现持续改进。
基于网关的抽象统一了这两种范式:白盒智能体的区别仅在于其上下文管理操作已在框架中注册以便在训练时重建,而黑盒智能体则完全依赖观测到的请求流。该设计已在数百种不同的智能体框架和数千种工具调用格式上得到验证。
6.2.4 窗口式先进先出调度
智能体任务完成时间存在极大差异——从简单 API 调用的数秒到复杂推理链的数小时不等——这就在吞吐量与分布一致性之间造成了根本性矛盾。严格的 FIFO(先进先出)调度能保持数据分布,但会因慢任务引发队头阻塞。完全贪婪调度(优先获取最先完成的轨迹)能最大化吞吐量,但会导致严重的分布偏移:早期训练批次被短小简单的任务主导,而困难任务则堆积在后续批次中,进而引发梯度震荡和优化不稳定。
我们提出窗口化 FIFO(图 5),这是一种介于上述两种极端之间的混合调度策略。给定一个生成队列及其当前队头索引,训练调度器仅允许在滑动窗口内获取已完成的轨迹,其中为窗口大小(例如)。在窗口内部,调度器采用贪婪模式——任何已完成的轨迹均可立即获取,从而缓解队头阻塞。在窗口边界处则强制执行严格排序:超出窗口的轨迹无论完成状态如何均被阻塞,且窗口仅在队头任务被消耗后才会向前推进。
这提供了一种可通过调节的可调权衡:较小的值接近严格 FIFO(最大分布一致性),较大的值则接近贪婪调度(最大吞吐量)。在实践中,在保持接近 FIFO 的分布特性的同时,能显著减少集群空闲时间。
6.2.5 用于训练加速的前缀树合并
在多轮智能体轨迹中,顺序的消息追加和上下文管理操作会在同一 rollout 组内的训练样本间产生大量共享前缀。传统训练方式将每个样本独立处理,重复计算公共前缀——这在长上下文智能体场景中是一种尤为严重的资源浪费来源。
我们提出前缀树合并(图 6),将训练计算从线性样本处理重构为树状结构计算。共享同一前缀的多个补全被合并为单个前缀树:在前向传播中共享前缀仅计算一次,之后计算分支进入各个独立的响应片段。前向传播完成后,利用存储的元数据将树结构分解,并针对每个样本独立计算损失。
这种重构在数学上等价于独立样本训练——对共享前缀的因果注意力计算无论执行一次还是多次,都会产生相同的激活值——从而保证零近似误差。在实践中,前缀树合并可实现高达数倍的训练加速,并相应降低内存消耗,使得在完全不牺牲训练保真度的前提下,能够处理更长的序列和更大的批次规模。
6.2.6 推理加速
我们采用三种架构优化,以最大化智能体强化学习 rollout 的生成吞吐量。
基于 MTP 的推测性解码。多 token 预测(MTP)模块通过 top-KL 散度损失与 RL 策略持续协同训练。这种协同训练确保了在非平稳的 RL 优化过程中,草稿接受率始终保持高位,从而防止了因策略演化导致分布偏移、进而降低推测性解码性能的问题。
异构预填充-解码分离。预填充和解码操作被解耦为独立调度的实例,消除了混合专家(MoE)架构中因混合调度而产生的相互干扰。每个阶段都采用针对其计算特性优化的并行策略,从而在最大化全局吞吐量的同时,最小化尾部延迟。
全局 L3 KV 缓存池。一个基于分布式文件系统(DFS)的全局 KV 缓存池,通过分组级 rollout 调度最大化前缀缓存命中率。一个成本感知的请求路由器动态平衡排队延迟与缓存迁移成本,在最大化缓存局部性的同时,避免单个实例过载,并消除智能体 RL 典型的多轮交互中的冗余预填充。
7 智能体机制
7.1 交错思考
大语言模型智能体必须编排多步骤工作流,在自然语言推理与外部工具调用(如代码执行、网页浏览和 API 调用)之间交替进行。一个关键的设计问题是:模型的思维链(CoT)应如何与工具使用轮次交互,以及先前的推理状态是否应在交互轮次间保留。在 MiniMax-M2 中,我们将交错思考作为一等智能体建模原则:模型在单条轨迹中交替进行显式思考与工具执行,并将完整的推理状态在轮次间向前传递。
交错思维链。我们将交错思考定义为一种生成协议,在该协议中,模型以交替序列生成推理 token 和动作 token:
| (9) |
其中 表示执行动作 后返回的观测结果(工具输出)。每个推理片段都基于完整历史记录进行条件生成,使模型能够在选择下一个动作之前修订计划、更新假设并整合新证据。这与两种常见替代方案形成对比:(1)前置推理,即所有推理 token 在采取任何动作之前生成完毕,从而无法适应中间观测结果;(2)无状态逐轮推理,即生成 之前从上下文中移除先前的推理 token,导致模型无法基于早期分析进行构建。
推理状态持久化。实现交错思考的关键架构决策在于:第 轮完整的模型输出——包括所有思考块——会被追加到消息历史中,并作为第 轮的上下文提供。设 为第 轮的对话历史。在推理状态持久化机制下:
| (10) |
当推理状态被丢弃时,历史记录退化为 ,迫使模型在每一轮重新推导上下文、约束条件和部分结论,导致累积状态漂移和自我修正能力下降。
计划-行动-反思循环。交错思考在每一轮 中实现了一个结构化的认知循环:(1)计划——模型审查来自先前推理和观测的累积状态,然后制定或优化策略;(2)行动——模型选择并执行基于该计划的工具调用;(3)反思——模型将观测结果与预期进行对比,更新其世界模型,并决定是修订计划还是继续推进。这一循环通过以下方式实现自我修正:对意外观测结果进行反思;通过重用假设和中间结论而非重新推导来提高样本效率;以及通过可解释的推理轨迹实现可调试性。图 7 展示了这一过程。
推理状态持久性的影响。我们通过在每个模型调用前移除先前轮次中的思考块来消融推理状态持久性,结果在智能体基准测试中取得了一致的性能提升,尤其是在需要扩展多步推理的任务(如深度搜索和软件工程)上改进尤为显著,这表明当任务需要在多个步骤中持续规划与迭代优化时,交错式思考最具影响力。
7.2 自我进化
我们详细阐述了模型训练向自我进化的转变。这一转变并非突然的飞跃,而是 M2 系列智能体能力稳步增长的最终成果——从常规的调试与报告任务,逐步发展成一个完全集成的流水线,其中 M2.7 能够主动驱动自身的迭代式开发(图 8)。
为实现这一目标,我们开发了模型迭代系统(图 8A),其运作原则是:人类负责引导,模型负责构建。研究人员配置目标,通过聊天引导智能体,并审查输出以决定后续步骤。智能体在一个“智能体框架”内运行——该框架完全由内部 M2.7 模型生成,无需任何人工编写的代码。这个框架为模型配备了用于动作链的分层技能、持久化记忆、安全护栏以及评估基础设施。
在实际应用中,我们的强化学习团队通过一个动态的双循环工作流(图 8B)来使用该系统。在人类主导的实验规划之后,M2.7 进入自主执行阶段,对正在运行的实验进行性能分析、读取日志并诊断指标异常。通过自动调试代码和调整配置,该模型直接干预其自身的训练循环,承担了 30% 到 50% 的日常迭代工作量。人类审查触发主要的迭代决策,而智能体可在审查之间自动继续执行有边界的分析。
最终,该系统实现了递归式脚手架升级。在优化内部编程脚手架的任务中,M2.7 执行了完全自主的 100 轮迭代循环:分析失败原因、修改代码、评估变更。这一探索引入了循环检测等机制,并发现了更优的参数组合,在内部评估中实现了 30% 的性能提升,表明该模型能够改进塑造其后续迭代的基础设施。
8 评估
我们评估了 MiniMax-M2.7 与当前最强的公开部署闭源前沿推理模型——Claude Opus 4.6、Claude Sonnet 4.6 [anthropic2025claude46]、GPT 5.4 [openai2025gpt5] 和 Gemini 3.1 Pro [google2025gemini31]——在三个能力领域的表现,这些领域反映了 M2 系列的设计重点:智能体编程、智能体协作(搜索、多工具智能体和工作空间操作)以及推理与知识。为明确展示系列内部的进展,我们还报告了先前公开发布的版本 MiniMax-M2.5 的得分。在整个过程中,我们有意优先选择那些考验长周期、环境交互行为的基准测试,而非封闭式问答,因为 M2 数据流水线和 Forge RL 系统正是为此类场景而构建的。
8.1 评估设置
模型与推理模式。每个闭源基线模型均以其最强的推理配置进行评估:Claude Opus 4.6 和 Claude Sonnet 4.6 启用扩展思考,GPT 5.4 启用高推理努力度,Gemini 3.1 Pro 启用高推理努力度。M2.7 和 M2.5 在启用思考功能并采用第 7.1 节所述的交错思考轨迹协议下进行评估。除非另有说明,生成过程使用温度参数 1.0 和 top-p 0.95;在智能体基准测试中,所有模型共享相同的脚手架和工具环境。
基准测试。我们将报告的基准测试分为五个板块:
-
软件工程与编码智能体。SWE-bench Pro [swebenchpro2025] 用于工业级仓库修复;SWE-bench Multilingual [rashid2025swebenchmultilingual] 用于跨语言仓库级编辑;Multi-SWE-bench [multiswebench2025] 用于多仓库任务迁移;NL2Repo,我们内部的自然语言到仓库合成基准;Terminal-Bench 2.0 [merrill2026terminalbench] 用于终端和系统操作任务;以及 MLE Bench Lite [chan2025mlebench] 用于自主机器学习工程,我们在 §8.3 中将其作为自我进化案例研究重新审视。
-
应用开发。VIBE-Pro,我们内部的端到端全栈应用开发基准;以及 HyperTask,一个内部的长周期“氛围编码”任务套件,每个任务包含 100 个功能级或步骤级需求。
-
协作——搜索与深度研究。BrowseComp [wei2025browsecomp]、Wide Search [liu2025widesearch],以及我们内部的 RISE 基准,用于在真实网络复杂度下进行多步骤浏览。
-
协作——智能体、办公与工作空间。GDPval-AA [patwardhan2025gdpvalevaluatingaimodel],即 OpenAI 的 GDPval 办公任务套件中由人工智能分析评判的子集;Toolathlon [huang2025toolathlon] 用于异构工具使用;MM Claw,我们内部的多模态办公爪基准;MEWC v2,一个内部困难任务子集,包含从微软 Excel 世界锦标赛题库中抽取的 100 个问题;以及 Finance Modeling Pro,一个内部基于 Excel 的财务建模套件,由专家评分标准进行评分。
-
推理与知识。AIME 2026 [aime2026] 用于竞赛数学;GPQA-Diamond [rein2024gpqa] 用于研究生级别科学;SciCode [tian2024scicode] 用于科学代码生成;IFBench [pyatkin2025ifbench] 用于指令遵循;AA-LCR(人工智能分析长上下文推理)用于长输入上的检索与推理;HLE [phan2025humanity](人类终极考试,无工具子集)用于前沿难度的开放知识;以及 MMLU-Pro [wang2024mmlu] 用于广泛知识。
评估配置。SWE-bench Pro、SWE-bench Multilingual、Multi-SWE-bench 和 NL2Repo 在内部基础设施上运行,除 GPT 5.4 使用其原生 CodeX 脚手架外,所有模型均以 Claude Code 作为统一脚手架(覆盖默认系统提示词);结果取 4 次试验的平均值。Terminal-Bench 2.0 使用 8 vCPU / 16 GB 沙箱,超时时间为 2 小时(挂钟时间),采用 Terminus-2 XML 脚手架和已验证的 2.0 数据集(HuggingFace zai-org/terminal-bench-2-verified);每个模型进行 4 次试验,未重新评估的基线分数引用自官方报告。MLE Bench Lite 在单 A30 沙箱中运行全部 22 项竞赛,时长 24 小时,使用我们内部的自我进化脚手架(Bash + WebSearch);每项任务评分取最佳验证检查点,并报告测试集奖牌率;最终数值为 3 次独立 24 小时试验的平均值。VIBE-Pro 使用 Claude Code 作为交互逻辑和视觉保真度的验证器,通过容器化部署进行端到端评估,取 3 次试验的平均值。HyperTask、MM Claw、MEWC v2 和 Finance Modeling Pro 使用专家定义的评分标准,取 3 次试验的评分结果。BrowseComp、Wide Search 和 RISE 共享 WebExplorer [liu2025webexplorer] 智能体框架,对系统提示词和工具描述进行了少量修改;当 token 使用量超过最大上下文的 30% 时,所有助手回复和工具返回结果将被丢弃以维持搜索运行。RISE 额外启用了基于 Playwright 的浏览器工具。GDPval-AA 是在 OpenAI 开放的 GDPval 数据集上由 Artificial Analysis 进行的重新评估。AIME 2026、GPQA-Diamond、SciCode、IFBench、AA-LCR、HLE 和 MMLU-Pro 在 Artificial Analysis Index v4.0 协议下进行评估,不使用任何工具,采用单样本(pass@1)。
8.2 主要结果
表 4 报告了 M2.7 与四个闭源前沿基线模型(Claude Opus 4.6、Claude Sonnet 4.6、GPT 5.4、Gemini 3.1 Pro)的对比结果。之前的公开 M2 版本(M2.5)作为系列内部参考纳入。每行最强分数以粗体标出;“–”表示该模型在我们的脚手架下尚未报告分数,或截至撰写时尚未发布该基准测试的结果。
| 基准测试 | 我们的模型 | 闭源前沿模型 | |||||
| M2.7 | M2.5 | Opus 4.6 | Sonnet 4.6 | GPT 5.4 | Gemini 3.1 Pro | ||
| 编码智能体 | SWE-bench Pro | 56.2 | 55.4 | 57.3 | 57.2 | 57.7 | 54.2 |
| SWE-bench Multilingual | 76.5 | 74.1 | 77.8 | 75.9 | 70.5 | – | |
| Multi-SWE-bench | 52.7 | 51.3 | 50.3 | 51.0 | 49.0 | – | |
| NL2Repo | 39.8 | 26.6 | 43.7 | 43.3 | 46.8 | 35.9 | |
| Terminal-Bench 2.0 | 57.0 | 51.7 | 65.4 | 59.1 | 75.1 | 68.5 | |
| MLE Bench Lite | 66.6 | 51.5 | 75.7 | 72.7 | 71.2 | 66.6 | |
| 应用开发 | VIBE-Pro | 55.6 | 54.2 | 55.6 | 56.1 | – | 41.0 |
| HyperTask | 67.6 | 59.4 | 75.7 | 74.1 | – | 50.9 | |
| 搜索 | BrowseComp | 77.8 | 76.3 | 84.0 | 74.7 | 82.7 | 85.9 |
| Wide Search | 75.2 | 70.3 | 79.4 | 75.8 | 77.9 | – | |
| RISE | 64.3 | 50.2 | 68.5 | 58.8 | 63.3 | – | |
| 办公与工具 | GDPval-AA | 50.0 | 35.0 | 55.0 | 57.0 | 58.0 | 41.0 |
| Toolathlon | 46.3 | 38.3 | 47.2 | 44.8 | 54.6 | 48.8 | |
| MM Claw | 62.7 | 57.6 | 75.4 | 64.2 | 73.6 | 61.8 | |
| MEWC v2 | 63.3 | 49.8 | 62.0 | 77.2 | 76.5 | 42.2 | |
| Finance Modeling Pro | 57.0 | 33.8 | 69.0 | 66.2 | 75.3 | 35.6 | |
| 推理与知识 | AIME 2026 | 94.2 | 87.2 | 92.5 | 92.7 | 97.0 | 88.7 |
| GPQA-Diamond | 89.8 | 85.2 | 89.6 | 87.5 | 92.0 | 94.1 | |
| SciCode | 47.0 | 43.0 | 51.9 | 46.8 | 56.6 | 58.9 | |
| IFBench | 76.0 | 72.0 | 53.1 | 56.6 | 73.9 | 77.1 | |
| AA-LCR | 72.0 | 65.0 | 70.7 | 70.7 | 74.0 | 72.7 | |
| HLE | 28.0 | 19.0 | 36.7 | 30.0 | 41.6 | 44.7 | |
| MMLU-Pro | 81.8 | 85.2 | 89.1 | 87.3 | 87.5 | 91.2 | |
软件工程与编码智能体。M2.7 在智能体编码套件中整体具有竞争力。它在 SWE-bench Pro 上得分为 56.2,在 SWE-bench Multilingual 上得分为 76.5,在 Multi-SWE-bench 上以 52.7 的成绩位列对比模型之首,并在 Terminal-Bench 2.0 上达到 57.0。在 NL2Repo 上,M2.7 达到 39.8,相比 M2.5(26.6)提升了 13 个点,这反映了第 4.1 节中引入的新全栈仓库数据。在 MLE Bench Lite 上,M2.7 达到 66.6% 的获奖率,相比 M2.5 绝对提升了 15 个点;我们将在第 8.3 节详细讨论这一案例。
应用开发。在 VIBE-Pro 上,M2.7 达到 55.6,与领先的闭源基线持平。在难度更高的长周期 HyperTask 套件上,M2.7 达到 67.6,相比 M2.5 提升了 8 个点。应用开发是 M2 设计理念最契合的领域之一:凭借 100 亿激活参数,针对应用开发的训练数据和智能体即验证器奖励机制(第 4.1 节)缩小了与每个 token 激活参数多一个数量级的前沿模型之间的大部分差距。
Cowork——搜索与深度研究。在开放网络搜索与综合三元组上,M2.7 在 BrowseComp 上达到 77.8,在 Wide Search 上达到 75.2,在我们内部 RISE 基准测试(该测试设计为需要借助 Playwright 浏览器工具进行非平凡的多步浏览和跨来源交叉验证)上达到 64.3。RISE 也是该模块中系列内增幅最大的,从 M2.5(50.2)提升了 14 分。M2.7 在需要更长规划周期和更丰富网络交互的任务上最具竞争力,这与用于构建我们深度搜索训练语料的验证器驱动数据流水线(§4.2)以及跨多轮交织思考的持久推理状态(§7.1)相一致。
Cowork——智能体、办公与工作空间。在异构工具使用基准测试上,M2.7 在 GDPval-AA 上达到 50.0,在 Toolathlon 上达到 46.3。在基于 Excel 的操作上,M2.7 在 MEWC v2 上达到 63.3,在 Finance Modeling Pro 上达到 57.0;在 MM Claw 上,M2.7 达到 62.7。该模块在 M2 系列的所有能力领域中展现出最大的系列内提升空间,在基于 Excel 的基准测试(MEWC v2、Finance Modeling Pro)和 GDPval-AA 上,M2.5 到 M2.7 均有显著提升。
推理与知识。M2.7 在那些评估简化为单一样本且无需工具的推理密集型基准测试上具有竞争力。M2.7 在 AIME 2026 上得分为 94.2,在 GPQA-Diamond 上为 89.8,在 IFBench 上为 76.0,在 AA-LCR 上为 72.0,在每个基准测试中都处于前沿水平。其中 IFBench 的结果尤其反映了第 4.3 节和第 6 节所述的多领域强化学习策略和基于评分标准的响应过滤。在更广泛的知识基准测试上,M2.7 在 MMLU-Pro 上达到 81.8,在 SciCode 上达到 47.0,在 HLE 上达到 28.0。
系列内部演进。为补充表4的跨模型快照,图9追踪了M2系列自身从原始M2版本到M2.5再到当前M2.7的演进轨迹,并限定在采用我们评测框架完成全部三个检查点评估的十一个基准上。两个模式尤为突出。首先,该集合中的每个基准在三个检查点间均有提升,绝对增益从若干分(AA-LCR、GPQA-Diamond)到若干分(BrowseComp)不等。其次,增益大小与§4所述的数据管线投入高度相关:M2.5/M2.7语料库引入新任务族群的基准——深度搜索(BrowseComp、Wide Search)、工具使用(Toolathlon、GDPval-AA)和自主机器学习工程(MLE Bench Lite)——展现出最陡峭的提升幅度,而原始M2已表现强劲的基准(SWE-bench Multilingual、Multi-SWE-bench)则呈现更渐进式的进步。推理基准(AIME 2025、GPQA-Diamond、AA-LCR)遵循一条更平稳的曲线,与推理数据管线的多轴缩放特性一致。综合来看,该图表明M2系列的三个贡献维度——智能体数据、Forge强化学习系统(§6)和自进化(§7.2)——在每次发布中都转化为稳定的改进轨迹,而非集中于某个单一检查点。
8.3 案例研究:MLE Bench Lite上的自进化
表 4 中的 MLE Bench Lite 结果是自我进化能力最直接的证据,其系统设计在第 7.2 节中描述。其底层驱动力是 M2.7 在机器学习工程(MLE)方面的实力:在 OpenAI 的 MLE Bench Lite [chan2025mlebench] 上,M2.7 与 Gemini 3.1 Pro 持平,展示了独立编排机器学习流水线和修改自身训练框架所需的前沿能力。
为了在受控环境下测试这一能力,我们评估了 M2.7 作为独立机器学习工程师在 MLE Bench Lite 的 22 项竞赛中的表现。虽然这些任务计算量较轻,但它们涵盖了标准机器学习工作流程的所有阶段。
为了引导模型,我们实现了一个简单的自主控制框架,该框架由短期记忆和自反馈驱动,且框架本身不含任何人编写的代码。完成一次迭代后,智能体会记录一个记忆文件,并进行严格的自我批评。这种自我反思式的批评为后续运行建立了明确的优化方向,使模型能够基于累积的反馈链进行构建。
我们执行了三次独立的试验,每次运行允许 24 小时的迭代进化。如图 10 所示,M2.7 展现出明显的累积性改进,其奖牌率随时间稳步提升。最佳运行结果获得了 9 枚金牌、5 枚银牌和 1 枚铜牌。M2.7 在三次试验中平均获得 66.6% 的奖牌率,与 Gemini 3.1 Pro 持平,展示了其自主导航和优化复杂端到端机器学习流水线的能力。
我们强调这个案例,不仅是因为其数值结果,更是因为定性的观察:M2.7 愿意调试自己的训练框架、修改配置文件,并迭代数百轮——这些行为闭环了 M2 系列设计所围绕的“小激活,大现实世界智能”循环。
9 结论
我们推出了 MiniMax-M2 系列,这是一族基于混合专家架构的语言模型,其核心论点是:小规模激活能够释放出最大的现实世界智能。旗舰模型 M2 将 98 亿激活参数 / 2299 亿总参数的骨干网络与三个组件相结合,这些组件从 M2 到 M2.5,再到当前的 M2.7 检查点,共同进化:智能体驱动的数据管道,将每一次训练轨迹都锚定在可执行的工作空间和与产物对齐的奖励之上;Forge,一个智能体原生的强化学习系统,可在白盒与黑盒智能体循环中扩展长程训练;以及自我进化的早期运作形态,M2.7 可自主调试自身的训练运行并修改其智能体框架。这些组件共同将 100 亿激活参数的规模,转化为在智能体编程、智能体协作以及推理与知识基准测试中,与每步计算量高出一个数量级的顶尖系统相匹敌的性能。我们将这些成果视为更长远发展路径上的一步:数据、强化学习系统和自我进化这三个维度均远未达到饱和,后续的 M2.x 检查点将继续协同扩展这三者。
参考文献
附录 A 贡献者
本报告的贡献者按字母顺序排列如下:
陈爱丽、李奥年、周柏川、龚邦伟、蒋彬洋、但博基、余常青、王超、马成、钟诚、朱成、肖成军、杨成义、杜成宇、张晨阳、迟张、黄创毅、张春浩、杜春辉、赵春雨、郭丛超、陈达、丁德明、孙殿军、张东宇、杨恩辉、余飞、郑光、郑国栋、李国红、朱海超、周海刚、张海默、丁涵、张浩、孙海海、吕浩林、卢浩南、王浩宇、石华杰、李慧阳、陈嘉诚、张健、庄嘉琪、蔡嘉仁、潘嘉欣、李佳瑶、宋佳媛、张继川、王杰、顾继豪、朱进、董经纬、李静阳、张静宇、庄景泽、田金浩、刘金丽、胡金义、陶俊、张军、阮俊斌、徐俊豪、闫俊杰、刘俊腾、何俊贤、徐康、季珂、杨珂、肖克成、段克宇、李克宇、韩乐、阮乐天、袁丽、余连飞、冯立恒、莫丽洁、李林、鲍凌野、杨凌宇、周凌源、Loki、卢晨、曾伦斌、李明、钟明、陶明亮、迟明远、林穆洁、胡楠、陈宁馨、朱培银、高鹏、高鹏程、李鹏飞、李鹏林、赵鹏宇、任启斌、徐启迪、任启涵、李启乐、王琴、陈全良、曾群鸿、田蓉、董瑞、冷瑞涛、张瑞泽、刘杉奇、陈少宇、贾晟、姚顺、赵硕然、余淑琪、李思辰、潘思成、朱松泉、李腾飞、谢天、秦天成、梁天润、刘伟、徐伟奇、李伟涛、陈伟翔、程伟宇、张伟宇、陈文虎、赵文倩、陈贤才、宋向军、王向远、罗晓、苏晓、李晓波、韩晓东、吴晓杰、宋喜浩、韩兴毅、关新宇、卢璇、邹迅、赖迅豪、李旭桐、龚岩、王阳、徐阳、王阳森、唐烨、陈一诚、邱银然、施一奇、郭一婷、黄一雯、王逸轩、胡永毅、高宇、张宇、应元祥、张元振、王宇博、宋宇辰、杨宇峰、孟宇航、苗宇航、李宇浩、刘宇杰、胡宇林、黄宇楠、李云吉、黄云逸、张宇森、洪宇苏、谢宇韬、张宇彤、廖宇文、石宇轩、温仁宇泽、李泽彬、李泽涵、罗泽健、金泽宇、孙泽远、周展鹏、苏兆晨、李振东、朱正茂、彭正元、范振华、张志、徐志超、吕志恒、徐志康、何志涛、何志伟、李中原、高子博、吴子嘉、宋子健、周子健、孙子君、黄子珊、陈子莹、葛子越