MiniMax:Blog(网页)
精选
67AI 编辑部评分,满分 100

MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造

2026-02-12 00:00· 186天前· MiniMax
AI 导读

MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。

推荐理由

MiniMax M2.5 把 SWE-bench 拉到 80.2%,成本只有 Claude Opus 4.6 的十分之一,速度还翻倍,对做 agent 的团队来说是个高性价比选择。

正文 · AI 翻译
MiniMax M2.5

今天我们正式推出最新模型 MiniMax-M2.5。通过在数十万个复杂真实环境中进行大规模强化学习训练,M2.5 在编程、智能体工具使用与搜索、办公任务以及一系列其他具有经济价值的任务上达到了 SOTA 水平,在 SWE-Bench Verified 上取得 80.2% 的分数,在 Multi-SWE-Bench 上取得 51.3% 的分数,在 BrowseComp(含上下文管理)上取得 76.3% 的分数。经过高效推理与最优任务分解训练,M2.5 在执行复杂智能体任务时展现出极快的速度,完成 SWE-Bench Verified 评估的速度比 M2.1 快 37%,与 Claude Opus 4.6 的速度相当。M2.5 是首个用户无需担心成本的顶尖模型,实现了“智能便宜到无需计量”的承诺。以每秒 100 个 token 的速率连续运行模型一小时,成本仅为 1 美元。若以每秒 50 个 token 的速率运行,成本则降至 0.30 美元。我们希望 M2.5 的速度与成本效益能够催生创新的智能体应用。

编程

在编程评估中,MiniMax-M2.5 相比前代产品取得了显著提升,达到了 SOTA 水平。M2.5 在多语言编程任务上的表现尤为突出。

与前代版本相比,一个显著的改进是 M2.5 能够像架构师一样思考和规划。该模型的规范编写倾向是在训练过程中涌现的:在编写任何代码之前,M2.5 会主动从资深软件架构师的角度,对项目的功能、结构和 UI 设计进行分解和规划。M2.5 在超过 20 万个真实世界环境中,使用超过 10 种编程语言(包括 Go、C、C++、TypeScript、Rust、Kotlin、Python、Java、JavaScript、PHP、Lua、Dart 和 Ruby)进行了训练。其能力远不止于修复错误,而是在复杂系统的整个开发生命周期中提供可靠的性能:从 0 到 1 的系统设计和环境搭建,到 1 到 10 的系统开发,再到 10 到 90 的功能迭代,最后是 90 到 100 的全面代码审查和系统测试。它涵盖了跨多个平台的全栈项目,包括 Web、Android、iOS 和 Windows,涉及服务端 API、业务逻辑、数据库等,而不仅仅是前端网页演示。为了评估这些能力,我们还对 VIBE 基准测试进行了升级,推出了更复杂、更具挑战性的 Pro 版本,显著提升了任务复杂度、领域覆盖范围和评估准确性。总体而言,M2.5 的性能与 Opus 4.5 相当。

我们重点研究了模型在分布外测试框架上的泛化能力。我们使用不同的编码智能体测试框架,在 SWE-Bench Verified 评估集上测试了性能。

  • 在 Droid 上:79.7(M2.5)> 78.9(Opus 4.6)
  • 在 OpenCode 上:76.1(M2.5)> 75.9(Opus 4.6)

搜索与工具调用

有效的工具调用和搜索能力,是模型自主处理更复杂任务的先决条件。在 BrowseComp 和 Wide Search 等基准测试的评估中,M2.5 取得了行业领先的性能。同时,模型的泛化能力也有所提升——M2.5 在面对不熟悉的脚手架环境时,表现更加稳定。在由专业人类专家执行的研究任务中,使用搜索引擎只是整个流程的一小部分;大部分工作涉及在信息密集的网页中进行深度探索。为此,我们构建了 RISE(真实交互式搜索评估),用以衡量模型在真实世界专业任务上的搜索能力。结果显示,M2.5 在实际场景中的专家级搜索任务上表现出色。与前代模型相比,M2.5 在处理智能体任务时也展现出更优的决策能力:它学会了通过更精准的搜索轮次和更好的 token 效率来解决问题。例如,在包括 BrowseComp、Wide Search 和 RISE 在内的多个智能体任务中,M2.5 以更少的轮次取得了更好的结果,相比 M2.1 使用的轮次减少了约 20%。这表明,该模型不再仅仅是得出正确答案,而是能够以更高效的路径推理出结果。

办公室工作

M2.5 经过训练,能够在办公场景中生成真正可交付的成果。为此,我们与金融、法律、社会科学等领域的资深专业人士进行了深入合作。他们设计需求、提供反馈、参与标准制定,并直接贡献于数据构建,将其行业内的隐性知识融入模型的训练流程。基于此基础,M2.5 在 Word、PowerPoint 和 Excel 财务建模等高价值工作场景中实现了显著的能力提升。在评估方面,我们构建了一个内部协作智能体评估框架(GDPval-MM),该框架通过成对比较来评估交付成果的质量以及智能体轨迹的专业性,同时监控整个工作流程中的 token 成本,以估算模型在现实世界中的生产力提升。与其他主流模型的对比中,它实现了 59.0% 的平均胜率。

效率

因为现实世界充满了截止日期和时间限制,任务完成速度是一项实际需求。模型完成任务所需的时间取决于其任务分解效率、token 效率以及推理速度。M2.5 原生服务的速率达到每秒 100 个 token,这几乎是其他前沿模型的两倍。此外,我们的强化学习设置激励模型进行高效推理并以最优方式分解任务。由于这三个因素,M2.5 在完成复杂任务时能显著节省时间。例如,在运行 SWE-Bench Verified 时,M2.5 每个任务平均消耗 352 万个 token。相比之下,M2.1 消耗了 372 万个 token。同时,得益于并行工具调用等能力的改进,端到端运行时间从平均 31.3 分钟减少到 22.8 分钟,速度提升了 37%。这一运行时间与 Claude Opus 4.6 的 22.9 分钟相当,而每个任务的总成本仅为 Claude Opus 4.6 的 10%。

成本

我们在设计 M2 系列基础模型时的目标,是能够驱动复杂的智能体,而无需担心成本问题。我们相信 M2.5 已接近实现这一目标。我们发布了该模型的两个版本:M2.5 和 M2.5-Lightning,两者能力相同,但速度不同。M2.5-Lightning 的稳定吞吐量达到每秒 100 个 token,是其他前沿模型的两倍,成本为每百万输入 token 0.3 美元,每百万输出 token 2.4 美元。M2.5 的吞吐量为每秒 50 个 token,成本是前者的一半。两个模型版本均支持缓存。基于输出价格,M2.5 的成本是 Opus、Gemini 3 Pro 和 GPT-5 的十分之一到二十分之一。以每秒 100 个输出 token 的速率计算,连续运行 M2.5 一小时的成本为 1 美元。以每秒 50 个 token 的速率计算,价格则降至 0.3 美元。换个角度来看,你可以用 10,000 美元让四个 M2.5 实例全年不间断运行。我们相信,M2.5 为经济活动中智能体的开发和运营提供了几乎无限的可能性。对于 M2 系列而言,剩下的唯一问题就是如何持续推动模型能力的前沿。

改进速度

从去年 10 月底至今的三个半月时间里,我们相继发布了 M2、M2.1 和 M2.5,模型改进的速度超出了我们最初的预期。例如,在备受推崇的 SWE-Bench Verified 基准测试中,M2 系列的进步速度明显快于 Claude、GPT 和 Gemini 等模型系列的同级别产品。

强化学习规模化

推动上述进展的关键因素之一是强化学习的规模化。在训练模型的过程中,我们也受益于模型自身的能力。我们在公司内部执行的大部分任务和工作空间,都被打造成了强化学习的训练环境。迄今为止,这样的环境已有数十万个。同时,我们在智能体强化学习框架、算法、奖励信号以及基础设施工程方面做了大量工作,以支持强化学习训练的持续规模化。

Forge——智能体原生强化学习框架

我们在内部设计了一个原生的智能体强化学习框架,名为 Forge。该框架引入了一个中间层,将底层的训练-推理引擎与智能体完全解耦,支持集成任意智能体,并使我们能够优化模型在各类智能体框架和工具上的泛化能力。为了提升系统吞吐量,我们优化了异步调度策略,以平衡系统吞吐量与样本的离策略性,并为训练样本设计了一种树状结构合并策略,实现了约 40 倍的训练加速。

智能体强化学习算法与奖励设计

在算法方面,我们继续使用去年年初提出的 CISPO 算法,以确保 MoE 模型在大规模训练中的稳定性。为了解决智能体长序列 rollout 带来的信用分配难题,我们引入了一种过程奖励机制,用于端到端地监控生成质量。此外,为了与用户体验深度对齐,我们通过智能体轨迹评估任务完成时间,在模型智能与响应速度之间实现了最优权衡。

我们将在近期发布一篇单独的技术博客文章,对强化学习扩展进行更全面的介绍。

MiniMax 智能体:M2.5 作为专业员工

M2.5 已全面部署于 MiniMax Agent,提供了最佳的智能体体验。我们将核心信息处理能力提炼为标准化的 Office 技能,并深度集成在 MiniMax Agent 中。在 MAX 模式下,处理 Word 格式调整、PowerPoint 编辑和 Excel 计算等任务时,MiniMax Agent 会根据文件类型自动加载相应的 Office 技能,提升任务输出质量。此外,用户可以将 Office 技能与特定领域的行业知识相结合,创建针对特定任务场景的可复用专家。以行业研究为例:通过将成熟的研究框架 SOP(标准操作流程)与 Word 技能融合,智能体能够严格遵循既定框架,自动获取数据、组织分析逻辑,并输出格式规范的研究报告——而不仅仅是生成一段原始文本。在财务建模场景中,通过将组织自有的建模标准与 Excel 技能结合,智能体可以遵循特定的风控逻辑和计算标准,自动生成并验证复杂的财务模型,而非仅仅输出一个基础电子表格。截至目前,用户在 MiniMax Agent 上已构建了超过 10,000 个专家,且这一数字仍在快速增长。MiniMax 还在 MiniMax Agent 上为办公、财务、编程等高频率场景构建了多套深度优化、开箱即用的专家套件。MiniMax 自身也率先从 M2.5 的能力中受益。在公司日常运营中,30% 的整体任务由 M2.5 自主完成,涵盖研发、产品、销售、人力资源和财务等职能——且渗透率持续上升。在编码场景中的表现尤为突出,M2.5 生成的代码占新提交代码总量的 80%。

附录

M2.5 的更多基准测试结果:

评估方法:

  • SWE 基准测试:SWE-bench Verified、SWE-bench Multilingual、SWE-bench-pro 和 Multi-SWE-bench 均在内部基础设施上使用 Claude Code 作为脚手架进行测试,覆盖了默认系统提示词,结果取 4 次运行的平均值。此外,SWE-bench Verified 还在 Droid 和 Opencode 脚手架上使用默认提示词进行了评估。
  • Terminal Bench 2:我们使用 Claude Code 2.0.64 作为评估脚手架对 Terminal Bench 2 进行了测试。我们修改了部分问题的 Dockerfile 以确保问题本身的正确性,统一将沙箱规格扩展至 8 核 CPU 和 16 GB 内存,统一将超时时间设置为 7200 秒,并为每个问题配备了基础工具集(ps、curl、git 等)。在不对超时进行重试的同时,我们增加了对空脚手架响应的检测机制,对最终响应为空的任务进行重试,以处理各种异常中断场景。最终结果取 4 次运行的平均值。
  • VIBE-Pro:内部基准测试。使用 Claude Code 作为脚手架来自动验证程序的交互逻辑和视觉效果。所有分数均通过统一流程计算,该流程包括需求集、容器化部署和动态交互环境。最终结果取 3 次运行的平均值。
  • BrowseComp:使用与 WebExplorer(Liu 等人,2025)相同的智能体框架。当 token 使用量超过最大上下文的 30% 时,所有历史记录将被丢弃。
  • Wide Search:使用与 WebExplorer(Liu 等人,2025)相同的智能体框架。
  • RISE:内部基准测试。包含来自人类专家的真实问题,评估模型在结合复杂网页交互时的多步信息检索和推理能力。在 WebExplorer(Liu 等人,2025)智能体框架之上增加了一套基于 Playwright 的浏览器工具套件。
  • GDPval-MM:内部基准测试。基于开源的 GDPval 测试集,使用自定义的智能体评估框架,其中大语言模型作为评判者(LLM-as-a-judge)对完整轨迹进行成对的胜/平/负判断。每个任务的平均 token 成本根据各厂商的官方 API 定价(不含缓存)计算。
  • MEWC:内部基准测试。基于 MEWC(微软 Excel 世界锦标赛)构建,包含 2021 年至 2026 年主要赛区及其他区域 Excel 电子竞技赛事中的 179 道题目。该基准测试评估模型理解竞赛级 Excel 电子表格并使用 Excel 工具完成题目的能力。评分方式为逐一比对输出值与答案单元格中的数值。
  • 金融建模:内部基准测试。主要包含由行业专家构建的金融建模问题,涉及通过 Excel 工具执行的端到端研究与分析任务。每道题目均使用专家设计的评分标准进行评分。最终结果为三次运行的平均值。
  • AIME25 ~ AA-LCR:基于人工智能分析智能指数排行榜所涵盖的公开评测集与评测方法,通过内部测试获得。

来源:MiniMax:Blog(网页) · minimax.io

MiniMax 发布 MiniMax M2.5 模型,专为现实世界生产力打造

MiniMax:Blog(网页)·2026-02-12 00:00·186天前·MiniMax
AI 导读

MiniMax 最新发布的大语言模型 M2.5,通过在数十万个复杂现实环境中进行强化学习训练,在编码、智能体工具调用、搜索和办公工作等多项任务上达到 SOTA。模型推理效率高,完成 SWE-Bench Verified 评估的速度比前代 M2.1 快 37%,与 Claude Opus 4.6 相当。定价方面,以 100 tokens/秒运行时每小时成本仅 1 美元。M2.5 在超过 10 种编程语言和 20 多万个真实环境中训练,具备从系统设计到测试的全流程能力。

正文 · AI 翻译
MiniMax M2.5

今天我们正式推出最新模型 MiniMax-M2.5。通过在数十万个复杂真实环境中进行大规模强化学习训练,M2.5 在编程、智能体工具使用与搜索、办公任务以及一系列其他具有经济价值的任务上达到了 SOTA 水平,在 SWE-Bench Verified 上取得 80.2% 的分数,在 Multi-SWE-Bench 上取得 51.3% 的分数,在 BrowseComp(含上下文管理)上取得 76.3% 的分数。经过高效推理与最优任务分解训练,M2.5 在执行复杂智能体任务时展现出极快的速度,完成 SWE-Bench Verified 评估的速度比 M2.1 快 37%,与 Claude Opus 4.6 的速度相当。M2.5 是首个用户无需担心成本的顶尖模型,实现了“智能便宜到无需计量”的承诺。以每秒 100 个 token 的速率连续运行模型一小时,成本仅为 1 美元。若以每秒 50 个 token 的速率运行,成本则降至 0.30 美元。我们希望 M2.5 的速度与成本效益能够催生创新的智能体应用。

编程

在编程评估中,MiniMax-M2.5 相比前代产品取得了显著提升,达到了 SOTA 水平。M2.5 在多语言编程任务上的表现尤为突出。

与前代版本相比,一个显著的改进是 M2.5 能够像架构师一样思考和规划。该模型的规范编写倾向是在训练过程中涌现的:在编写任何代码之前,M2.5 会主动从资深软件架构师的角度,对项目的功能、结构和 UI 设计进行分解和规划。M2.5 在超过 20 万个真实世界环境中,使用超过 10 种编程语言(包括 Go、C、C++、TypeScript、Rust、Kotlin、Python、Java、JavaScript、PHP、Lua、Dart 和 Ruby)进行了训练。其能力远不止于修复错误,而是在复杂系统的整个开发生命周期中提供可靠的性能:从 0 到 1 的系统设计和环境搭建,到 1 到 10 的系统开发,再到 10 到 90 的功能迭代,最后是 90 到 100 的全面代码审查和系统测试。它涵盖了跨多个平台的全栈项目,包括 Web、Android、iOS 和 Windows,涉及服务端 API、业务逻辑、数据库等,而不仅仅是前端网页演示。为了评估这些能力,我们还对 VIBE 基准测试进行了升级,推出了更复杂、更具挑战性的 Pro 版本,显著提升了任务复杂度、领域覆盖范围和评估准确性。总体而言,M2.5 的性能与 Opus 4.5 相当。

我们重点研究了模型在分布外测试框架上的泛化能力。我们使用不同的编码智能体测试框架,在 SWE-Bench Verified 评估集上测试了性能。

  • 在 Droid 上:79.7(M2.5)> 78.9(Opus 4.6)
  • 在 OpenCode 上:76.1(M2.5)> 75.9(Opus 4.6)

搜索与工具调用

有效的工具调用和搜索能力,是模型自主处理更复杂任务的先决条件。在 BrowseComp 和 Wide Search 等基准测试的评估中,M2.5 取得了行业领先的性能。同时,模型的泛化能力也有所提升——M2.5 在面对不熟悉的脚手架环境时,表现更加稳定。在由专业人类专家执行的研究任务中,使用搜索引擎只是整个流程的一小部分;大部分工作涉及在信息密集的网页中进行深度探索。为此,我们构建了 RISE(真实交互式搜索评估),用以衡量模型在真实世界专业任务上的搜索能力。结果显示,M2.5 在实际场景中的专家级搜索任务上表现出色。与前代模型相比,M2.5 在处理智能体任务时也展现出更优的决策能力:它学会了通过更精准的搜索轮次和更好的 token 效率来解决问题。例如,在包括 BrowseComp、Wide Search 和 RISE 在内的多个智能体任务中,M2.5 以更少的轮次取得了更好的结果,相比 M2.1 使用的轮次减少了约 20%。这表明,该模型不再仅仅是得出正确答案,而是能够以更高效的路径推理出结果。

办公室工作

M2.5 经过训练,能够在办公场景中生成真正可交付的成果。为此,我们与金融、法律、社会科学等领域的资深专业人士进行了深入合作。他们设计需求、提供反馈、参与标准制定,并直接贡献于数据构建,将其行业内的隐性知识融入模型的训练流程。基于此基础,M2.5 在 Word、PowerPoint 和 Excel 财务建模等高价值工作场景中实现了显著的能力提升。在评估方面,我们构建了一个内部协作智能体评估框架(GDPval-MM),该框架通过成对比较来评估交付成果的质量以及智能体轨迹的专业性,同时监控整个工作流程中的 token 成本,以估算模型在现实世界中的生产力提升。与其他主流模型的对比中,它实现了 59.0% 的平均胜率。

效率

因为现实世界充满了截止日期和时间限制,任务完成速度是一项实际需求。模型完成任务所需的时间取决于其任务分解效率、token 效率以及推理速度。M2.5 原生服务的速率达到每秒 100 个 token,这几乎是其他前沿模型的两倍。此外,我们的强化学习设置激励模型进行高效推理并以最优方式分解任务。由于这三个因素,M2.5 在完成复杂任务时能显著节省时间。例如,在运行 SWE-Bench Verified 时,M2.5 每个任务平均消耗 352 万个 token。相比之下,M2.1 消耗了 372 万个 token。同时,得益于并行工具调用等能力的改进,端到端运行时间从平均 31.3 分钟减少到 22.8 分钟,速度提升了 37%。这一运行时间与 Claude Opus 4.6 的 22.9 分钟相当,而每个任务的总成本仅为 Claude Opus 4.6 的 10%。

成本

我们在设计 M2 系列基础模型时的目标,是能够驱动复杂的智能体,而无需担心成本问题。我们相信 M2.5 已接近实现这一目标。我们发布了该模型的两个版本:M2.5 和 M2.5-Lightning,两者能力相同,但速度不同。M2.5-Lightning 的稳定吞吐量达到每秒 100 个 token,是其他前沿模型的两倍,成本为每百万输入 token 0.3 美元,每百万输出 token 2.4 美元。M2.5 的吞吐量为每秒 50 个 token,成本是前者的一半。两个模型版本均支持缓存。基于输出价格,M2.5 的成本是 Opus、Gemini 3 Pro 和 GPT-5 的十分之一到二十分之一。以每秒 100 个输出 token 的速率计算,连续运行 M2.5 一小时的成本为 1 美元。以每秒 50 个 token 的速率计算,价格则降至 0.3 美元。换个角度来看,你可以用 10,000 美元让四个 M2.5 实例全年不间断运行。我们相信,M2.5 为经济活动中智能体的开发和运营提供了几乎无限的可能性。对于 M2 系列而言,剩下的唯一问题就是如何持续推动模型能力的前沿。

改进速度

从去年 10 月底至今的三个半月时间里,我们相继发布了 M2、M2.1 和 M2.5,模型改进的速度超出了我们最初的预期。例如,在备受推崇的 SWE-Bench Verified 基准测试中,M2 系列的进步速度明显快于 Claude、GPT 和 Gemini 等模型系列的同级别产品。

强化学习规模化

推动上述进展的关键因素之一是强化学习的规模化。在训练模型的过程中,我们也受益于模型自身的能力。我们在公司内部执行的大部分任务和工作空间,都被打造成了强化学习的训练环境。迄今为止,这样的环境已有数十万个。同时,我们在智能体强化学习框架、算法、奖励信号以及基础设施工程方面做了大量工作,以支持强化学习训练的持续规模化。

Forge——智能体原生强化学习框架

我们在内部设计了一个原生的智能体强化学习框架,名为 Forge。该框架引入了一个中间层,将底层的训练-推理引擎与智能体完全解耦,支持集成任意智能体,并使我们能够优化模型在各类智能体框架和工具上的泛化能力。为了提升系统吞吐量,我们优化了异步调度策略,以平衡系统吞吐量与样本的离策略性,并为训练样本设计了一种树状结构合并策略,实现了约 40 倍的训练加速。

智能体强化学习算法与奖励设计

在算法方面,我们继续使用去年年初提出的 CISPO 算法,以确保 MoE 模型在大规模训练中的稳定性。为了解决智能体长序列 rollout 带来的信用分配难题,我们引入了一种过程奖励机制,用于端到端地监控生成质量。此外,为了与用户体验深度对齐,我们通过智能体轨迹评估任务完成时间,在模型智能与响应速度之间实现了最优权衡。

我们将在近期发布一篇单独的技术博客文章,对强化学习扩展进行更全面的介绍。

MiniMax 智能体:M2.5 作为专业员工

M2.5 已全面部署于 MiniMax Agent,提供了最佳的智能体体验。我们将核心信息处理能力提炼为标准化的 Office 技能,并深度集成在 MiniMax Agent 中。在 MAX 模式下,处理 Word 格式调整、PowerPoint 编辑和 Excel 计算等任务时,MiniMax Agent 会根据文件类型自动加载相应的 Office 技能,提升任务输出质量。此外,用户可以将 Office 技能与特定领域的行业知识相结合,创建针对特定任务场景的可复用专家。以行业研究为例:通过将成熟的研究框架 SOP(标准操作流程)与 Word 技能融合,智能体能够严格遵循既定框架,自动获取数据、组织分析逻辑,并输出格式规范的研究报告——而不仅仅是生成一段原始文本。在财务建模场景中,通过将组织自有的建模标准与 Excel 技能结合,智能体可以遵循特定的风控逻辑和计算标准,自动生成并验证复杂的财务模型,而非仅仅输出一个基础电子表格。截至目前,用户在 MiniMax Agent 上已构建了超过 10,000 个专家,且这一数字仍在快速增长。MiniMax 还在 MiniMax Agent 上为办公、财务、编程等高频率场景构建了多套深度优化、开箱即用的专家套件。MiniMax 自身也率先从 M2.5 的能力中受益。在公司日常运营中,30% 的整体任务由 M2.5 自主完成,涵盖研发、产品、销售、人力资源和财务等职能——且渗透率持续上升。在编码场景中的表现尤为突出,M2.5 生成的代码占新提交代码总量的 80%。

附录

M2.5 的更多基准测试结果:

评估方法:

  • SWE 基准测试:SWE-bench Verified、SWE-bench Multilingual、SWE-bench-pro 和 Multi-SWE-bench 均在内部基础设施上使用 Claude Code 作为脚手架进行测试,覆盖了默认系统提示词,结果取 4 次运行的平均值。此外,SWE-bench Verified 还在 Droid 和 Opencode 脚手架上使用默认提示词进行了评估。
  • Terminal Bench 2:我们使用 Claude Code 2.0.64 作为评估脚手架对 Terminal Bench 2 进行了测试。我们修改了部分问题的 Dockerfile 以确保问题本身的正确性,统一将沙箱规格扩展至 8 核 CPU 和 16 GB 内存,统一将超时时间设置为 7200 秒,并为每个问题配备了基础工具集(ps、curl、git 等)。在不对超时进行重试的同时,我们增加了对空脚手架响应的检测机制,对最终响应为空的任务进行重试,以处理各种异常中断场景。最终结果取 4 次运行的平均值。
  • VIBE-Pro:内部基准测试。使用 Claude Code 作为脚手架来自动验证程序的交互逻辑和视觉效果。所有分数均通过统一流程计算,该流程包括需求集、容器化部署和动态交互环境。最终结果取 3 次运行的平均值。
  • BrowseComp:使用与 WebExplorer(Liu 等人,2025)相同的智能体框架。当 token 使用量超过最大上下文的 30% 时,所有历史记录将被丢弃。
  • Wide Search:使用与 WebExplorer(Liu 等人,2025)相同的智能体框架。
  • RISE:内部基准测试。包含来自人类专家的真实问题,评估模型在结合复杂网页交互时的多步信息检索和推理能力。在 WebExplorer(Liu 等人,2025)智能体框架之上增加了一套基于 Playwright 的浏览器工具套件。
  • GDPval-MM:内部基准测试。基于开源的 GDPval 测试集,使用自定义的智能体评估框架,其中大语言模型作为评判者(LLM-as-a-judge)对完整轨迹进行成对的胜/平/负判断。每个任务的平均 token 成本根据各厂商的官方 API 定价(不含缓存)计算。
  • MEWC:内部基准测试。基于 MEWC(微软 Excel 世界锦标赛)构建,包含 2021 年至 2026 年主要赛区及其他区域 Excel 电子竞技赛事中的 179 道题目。该基准测试评估模型理解竞赛级 Excel 电子表格并使用 Excel 工具完成题目的能力。评分方式为逐一比对输出值与答案单元格中的数值。
  • 金融建模:内部基准测试。主要包含由行业专家构建的金融建模问题,涉及通过 Excel 工具执行的端到端研究与分析任务。每道题目均使用专家设计的评分标准进行评分。最终结果为三次运行的平均值。
  • AIME25 ~ AA-LCR:基于人工智能分析智能指数排行榜所涵盖的公开评测集与评测方法,通过内部测试获得。

来源:MiniMax:Blog(网页)· minimax.io