M3 在编程和智能体工作等专业任务上达到了前沿水平。它采用了我们团队提出的新型注意力架构 MSA(MiniMax 稀疏注意力),并支持高达 100 万 token 的超长上下文窗口。备受期待的是,它也是一款原生多模态模型,支持图像和视频输入,并能操控桌面电脑。
这三项能力如今已是闭源前沿模型的基本门槛。M3 是目前首个也是唯一一个将三者集于一体的开源权重模型。
在编程能力方面,M3 相比 M2 有显著提升,在缺陷修复、前端/后端开发以及性能优化等领域已接近海外领先闭源模型的水平。
在智能体能力方面,M3 在搜索和办公套件任务等常用办公流程中表现强劲,并且在金融领域也已初步具备可用性。
您可以通过 MiniMax Code、Token 计划以及我们的 API 服务立即体验 MiniMax M3。
MSA:架构创新实现上下文扩展
解决更复杂的智能体任务是训练 M3 时最重要的目标之一,而其中涉及的最大挑战之一便是上下文扩展。要实现真正的改变,必须从最基础的层面——注意力机制——入手,并规避全注意力的“固有缺陷”:计算复杂度的二次增长。
MSA 是一种简洁且易于扩展的新型稀疏注意力架构。它为 M3 提供了 100 万 token 的上下文窗口,使上下文真正成为另一个可扩展的维度。
稀疏注意力机制通常通过增加预过滤阶段来避免复杂度爆炸问题。与 DSA 和 MoBA 等方法相比,MSA 能够更精确地将 KV 划分为块,从而实现更高的有效上下文覆盖率。
同时,我们还在算子层面直接进行了优化,采用了一种“KV 外聚 Q”的方法,以 KV 块作为外层循环来聚合命中这些块的查询。每个块仅被读取一次,且内存访问是连续的;在 M3 的头配置下,其算术强度显著优于常见方法——比开源的 Flash-Sparse-Attention 和 flash-moba 快 4 倍以上。
其简洁、可扩展、易于实现且对硬件友好的特性,使其理论优势能够在实践中充分体现:在 100 万上下文长度下,M3 的每个 token 计算量仅为上一代模型的 1/20。我们在预填充阶段实现了超过 9 倍的加速,在解码阶段实现了超过 15 倍的加速。此外,在多项消融实验中,MSA 在绝大多数能力上均与全注意力机制持平。
前沿编程与智能体能力
编程和智能体能力是 M3 的关键改进领域。在涵盖软件工程和终端执行的国际公认基准测试中,M3 达到了前沿水平:
- SWE-Bench Pro:59.0%
- Terminal-Bench 2.1:66.0%
- SWE-fficiency:34.8%
- KernelBench Hard:28.8%
- MCP Atlas:74.2%
如今,编程能力的高低越来越取决于模型能否利用真实用户逻辑进行训练。现有的编程基准测试往往无法完全反映真实的用户体验。
目前大多数代码智能体的训练和评估都基于单轮任务的假设。但实际使用情况并非如此。用户通常会在同一个会话中持续协作:澄清需求、调整方案、跨上下文分配任务,并根据中间结果进行多轮迭代。
为了缩小基准测试与真实用户体验之间的差距,我们构建了一个交互式用户模拟器框架。
通过模拟真实开发者在协作过程中的行为模式,该框架在训练和评估阶段让模型接触到更接近生产环境的交互场景。它可以模拟需求细化、方案讨论、基于反馈的修正、持续任务切换以及复杂项目迭代等行为。因此,智能体不再仅仅是被动执行指令,而是能够主动与用户协作完成任务。
下一代智能体编程将不再仅以代码生成能力来衡量,而是取决于长期协作能力、规划能力以及人机协作效率。M3 扩展了真正对编程和智能体至关重要的数据规模,其目标不仅是在基准测试中领先,更是成为开发者在真实研发工作流中值得信赖的协作伙伴。
多模态:交错训练,持续扩展
M3 是一个从第零步开始就进行混合模态训练的模型。这种原生多模态方法使得不同模态的语义空间能够更自然、更深入地融合。
同时,我们的大量实验表明,交错数据比合成数据更容易扩展。因此,在 M3 的研发周期中,我们重新设计了整个文本预训练数据管道,生成了大量交错数据并将其纳入模型训练。
真实世界任务
在我们对 M3 的内部使用和测试中,有几个真实世界任务留下了深刻印象。
独立论文复现
作为前沿模型的三大核心能力,我们想看看当 100 万超长上下文、顶尖的编程与智能体能力以及原生多模态能力汇聚在一个长线程中解决复杂任务时,会有怎样的表现。
我们给 M3 提供了一篇获得 ICLR 2025 杰出论文奖的论文《大语言模型微调的学习动力学》,并要求它独立复现该论文。这篇论文研究了大语言模型在微调过程中的“学习动力学”。最终,M3 自主运行了近 12 个小时,在此过程中独立生成了 18 次代码提交和 23 张实验图表,并成功完成了核心实验。
它不仅成功匹配了 SFT 阶段预测概率变化趋势,还清晰观察到了 DPO 实验中强调的挤压效应,并成功验证了原论文提出的 Extend 缓解方法。
理解论文中的曲线、数据和公式需要多模态能力,而长上下文则确保了论文、代码和实验日志能够一次性全部放入上下文窗口。只有具备足够强大的编码和智能体能力,模型才能在一个长线程中完成复现,甚至支持并发执行。
M3 做到了这一切。
CUDA 内核优化
FP8 矩阵乘法(GEMM)是大模型推理中计算最密集的部分之一,也是最难优化的部分之一。工程师必须同时处理多个紧密耦合的问题,包括数据布局、计算流水线调度以及适配硬件特性。在 NVIDIA Hopper 架构 GPU 上,手工编写一个生产级的 FP8 GEMM 内核通常需要一个经验丰富的团队投入一到两周的专注时间。
我们使用这个任务来评估 M3 的长时间跨度自主迭代能力。我们要求 MiniMax M3 在 NVIDIA Hopper 架构 GPU 上优化这个内核。该模型开始时只有一个任务描述、一个基准评估脚本和一个无法直接运行的 Triton 骨架代码,没有任何可参考的高性能实现。这意味着模型无法通过模仿现有方案来走捷径;它必须从基本原理出发,自主探索优化路径。
在随后约 24 小时的连续执行中,M3 完成了 147 次基准测试提交和 1,959 次工具调用。它独立走完了从基线实现到生产级优化的完整流程,包括基线实现、自动调优配置生成、性能瓶颈诊断、CUDA Graph 集成、持久化内核重写以及主机端调度优化。每一步都通过基准测试反馈进行自我验证,无需任何人工干预。
最终,经过六轮标志性的优化迭代,M3 将 Hopper FP8 硬件峰值利用率从第一版的 7.6% 提升至 71.3%,相比原始版本实现了 9.4 倍的加速。
除了指标本身,该模型的执行过程也值得关注。除 Opus 4.7 和 M3 外,大多数其他模型在前 30 次提交后便不再取得新进展,并自行退出。而 M3 的最佳方案出现在第 145 次提交。在此之前,该模型经历了多次性能平台期,未观察到进一步改进,但它仍持续探索不同的优化方向。
这里所需的能力超越了传统的代码生成。反复工具调用所产生的上下文高度结构化且密集,而 MSA 的长上下文注意力分配机制在此发挥了重要作用。
让 M3 训练模型
在 CUDA 算子优化任务中,M3 展示了其在单一工程任务上具备明确优化目标和清晰反馈信号时的长周期迭代能力。但真实的研究工作往往没有如此清晰的反馈结构;研究人员通常面临更为开放的问题。
我们想了解 M3 在需要自主决策的场景中表现如何,因此在 PostTrainBench 上对其进行了测试。任务如下:向 M3 提供四个仅完成预训练、尚不具备任何下游能力的 Base 模型,让它在 12 小时内自主完成数据合成、训练、评估和迭代的完整流程。最终目标是让这些模型在数学推理(AIME2025)、工具调用(BFCL)、科学知识推理(GPQA Main)、基础算术推理(GSM8K)和代码生成(HumanEval)方面获得基本能力。
整个“数据合成→训练→评估→迭代”过程在没有任何人工干预的情况下进行。智能体必须自行决定合成何种数据、选择哪种训练策略,以及如何根据评估结果调整下一轮方案。M3 最终得分为 0.37,略低于 Opus 4.7(0.42)和 GPT-5.5(0.39),但明显领先于其他模型。
MiniMax Code
随着 M3 的发布,MiniMax Code 也进行了更新。作为专为 M3 设计并与 M3 一同训练的智能体产品,MiniMax Code 能够充分发挥 M3 在长上下文、编码/智能体任务以及原生多模态方面的能力,成为与 MiniMax-M3 搭配的首选智能体。
对于长周期复杂任务,MiniMax Code 的智能体团队可以将大型任务分解为多阶段、可并发、可动态调整的工作流,然后由一组智能体协同推进。通过“生产者+验证者”对抗性验证循环,智能体团队能够在执行过程中持续生成、反思和自我修正。它可以无需人工干预自主运行数天,最终交付高质量成果。
我们看到,Claude Code 近期也发布了动态工作流(Dynamic Workflows),方向与此类似。与 Claude Code 更强调基于 JS 代码的固定编排不同,MiniMax Code 更侧重于“深度反思与持续纠错”:智能体根据任务进度实时调整自身计划和优先级,同时用户可随时介入,补充需求或修正方向。
得益于 M3 原生的多模态能力,MiniMax Code 还支持计算机使用。例如,用户可以在手机上说出:“帮我打开本地 ERP 客户端,并根据这个 Excel 表格批量录入发票信息。”MiniMax Code 随后将自动跨应用、跨文件、跨系统地在电脑上完成所需操作。
MiniMax Code 构建于基于优秀开源社区项目 OpenCode 和 Pi 的框架之上。我们也计划在未来将该开源项目回馈给开源社区。
MiniMax Code 桌面应用:agent.minimaxi.com/download
MiniMax Code 可与 MiniMax Token 计划配合使用。
MiniMax Token 计划:将前沿模型带入开发者的日常工作
MiniMax M3 是一款旨在服务更多用户的前沿模型。
随着本次发布,MiniMax Token 计划也进行了三个层级的更新:
- Plus 版 每月 20 美元:约 17 亿 tokens / 月的 M3 使用量
- Max 版 每月 50 美元:约 51 亿 tokens / 月的 M3 使用量
- Ultra 版 每月 120 美元:约 98 亿 tokens / 月的 M3 使用量
在价格相近的订阅计划中,MiniMax Token 计划提供的 token 配额位居全球前列。文本、图像、语音和音乐均共享同一使用池。
所有三个层级均已全面开放。立即订阅,即刻使用!
订阅链接:platform.minimax.io/subscribe/token-plan
API
M3 API 现已可用。
定价取决于输入长度:输入 token 数 ≤512K 的调用按标准费率计费,覆盖绝大多数对话和编码场景;而输入超过 512K 的调用则按较高的长上下文费率计费,主要面向超长文档解析和全仓库代码理解等高负载场景。
M3 支持开启或关闭思考功能。开启思考时,模型适用于复杂推理、智能体任务以及长周期协作;关闭思考时,模型响应速度更快,适合对话和代码补全等对延迟敏感的场景。两种模式定价相同,可在请求时根据需要切换。
所有价格还可与两种服务等级结合使用:默认的标准层级适用于常规请求;优先层级(service_tier=priority)可获得调度优先级,在高并发场景下响应延迟更稳定,适合对 SLA 敏感的工业级应用场景。优先通道目前通过销售支持开通,预计数日后向所有用户开放。
我们将持续提升模型服务稳定性并优化吞吐量。未来 10 天内,我们将发布该模型的技术报告,并开源相应的模型权重。
如今模型更新速度如此之快,以至于人们很容易忘记这依然是一个稳步渐进的过程。它遵循自身的客观规律,并奖励那些按照规律扎实前进的团队。正如我们创立之初所坚信的那样,我们将竭尽全力持续提升模型的智能水平,并将其提供给更多用户。
感谢你们的信任、建议与批评。
评估方法
SWE-Bench Verified:在内部基础设施上使用 Claude Code 作为脚手架进行测试。使用 Claude Code 时,默认系统提示词被覆盖。每个测试运行 4 次并取平均值。
SWE-Bench Pro:在内部基础设施上使用 Claude Code 作为脚手架进行测试。测试逻辑与官方评估保持一致。
Terminal-bench 2.1:在内部基础设施上评估,沙箱配置为 8C16G,超时时间为 2 小时,最大输出 token 设置为 128K,使用 Terminus 2 作为脚手架。GPT-5.5、Gemini 3.1 Pro 和 Claude Opus 4.7 的分数取自官方 Terminal-bench 2.1 排行榜;其他所有模型均通过官方 API 在同一基础设施上进行测试。
SWE Atlas-Codebase QNA:在内部基础设施上评估,沙箱配置为 4C8G,超时时间为 3 小时。Claude Sonnet 4.6、GPT-5.5 和 Gemini 3.1 Pro 的得分取自 labs.scale.com。Claude Opus 4.7、MiniMax-M2.7 和 MiniMax-M3 使用 Mini-SWE-Agent 作为脚手架,评估逻辑与官方方法保持一致。
NL2Repo:DeepSeek-V4-pro、Kimi-k2.6 和 GLM-5.1 的得分取自
。其他模型在内部基础设施上评估,沙箱配置为 1C2G,超时时间为 4 小时。Claude Opus 4.7、MiniMax-M2.7、MiniMax-M3 和 Gemini 3.1 Pro 使用 Claude Code 脚手架;GPT-5.5 使用 Codex 脚手架。为防止潜在的模型“作弊”,基于官方评估逻辑进行了以下修改:(1) 提示词中包含约束条件,禁止模型通过
git clone
pip install
等方式使用外部信息;(2) 在脚手架层面,对模型执行的系统监控 Bash 命令进行潜在作弊行为分析。被判定为作弊的命令将被拦截,并警告模型需在受限环境中完成任务。
SWE Atlas-Test Writing:GPT-5.5、Claude Sonnet 4.6 和 Gemini 3.1 Pro 的得分来自 labs.scale.com。Claude Opus 4.7、MiniMax-M2.7 和 MiniMax-M3 在内部基础设施上评估,使用 Claude Code 脚手架,沙箱配置为 4C8G,超时时间为 3 小时,评估逻辑与官方方法保持一致,运行 4 次后取平均值。
SWE-fficiency:在内部基础设施上使用开源 SWE-fficiency 数据集和工作流进行评估。沙箱配置:1C2G,超时时间:2 小时。使用 Claude Code 作为脚手架;得分来自内部测试。
LiveSQLBench:在内部基础设施上使用开源 LiveSQLBench-Base-Full v1 数据集(600 个问题 / 22 个 PostgreSQL 数据库)和官方工作流进行评估。使用 Claude Code 作为脚手架,任务描述提示词覆盖默认系统提示词。每个问题在预装了 PostgreSQL 的专用沙箱中运行,超时时间为 25 分钟。得分来自内部测试。
VIBE-V2:内部基准测试,涵盖纯前端及全栈 Web/Android/iOS 项目,任务类型为从零构建。使用 Claude Code 作为脚手架,并采用智能体即验证器(Agent-as-a-Verifier)范式,对程序交互逻辑与视觉输出进行自动化验证。分数通过统一流程计算,该流程包括需求集、容器化部署和动态交互环境,取 3 次运行的平均值。
SVG-Bench:内部基准测试,输入类型为文本和图像,任务为从零构建或基于现有素材进行编辑。使用 Claude Code 作为脚手架,使用视觉大语言模型(VLM)验证渲染准确性,取 3 次运行的平均值。
CL-bench:在内部基础设施上,使用开源的 CL-bench 数据和评分标准进行评估。评估设置与官方流程完全一致。分数来自内部测试。
PostTrainBench:在 Claude Code 上使用 Ralph-Loop 机制评估 12 小时,在 5 个无需大语言模型作为评判(LLM-As-Judge)的基准测试(AIME2025、BFCL、GPQA Main、GSM8K、HumanEval)上测试了 4 个基础模型。
Kernelbench-Hard:在 NVIDIA Blackwell 架构 GPU(支持 CUDA 功能 sm_120)上,使用 Claude Code 进行评估。每道题的分数 = 智能体提交算子的 TFLOPs 相对于当前硬件理论峰值的比值;基准测试分数 = 9 道题的平均值。
PaperBench:在 Claude Code 上使用 Ralph-Loop 机制评估 12 小时。数据集:19 篇无需外部 API 即可复现的论文。评分标准:官方开源的人类专家评分标准。评分模型:Opus-4.6。
GPDval-Rubrics:内部评估,使用公开 GDPval 数据集中的案例,基于公开评分标准进行逐点评分,环境与 GDPval-AA 脚手架保持一致。
BrowseComp:使用与 WebExplorer(Liu 等人,2025)相同的智能体框架。当 token 使用量超过 64K 时,所有历史记录将被丢弃。
DRACO:MiniMax M3 的结果使用内部脚手架进行评估(可通过 MiniMax Code 中的深度研究技能访问)。评分基于每道题的官方评分标准,最终分数 = 所有题目的平均分。评分模型:Claude Opus 4.6。Claude Opus 4.7 的结果取自 Opus 4.7 模型卡。
BankerToolBench:在公开的 BankerToolBench 数据集上测试。除 GPT-5.5 外,所有模型均使用 Claude Code 脚手架;GPT-5.5 使用 Codex。评分基于数据集评分标准,使用 MiniMax M2.7 作为评分模型。
OfficeQA Pro:为模拟真实场景,将相关文件以文件系统形式提供给模型,使用 Claude Code 脚手架进行评估。评分要求与答案完全匹配。
SpreadSheetBench-v1:使用 Claude Code 脚手架在公开数据集上评估。
YC-Bench:使用官方 YC-Bench 代码库和配置进行评估,环境与官方设置一致。指标:最终资产(资金)。
LOCA-Bench(256k):使用官方 LOCA-bench 代码库进行评估,采用官方 react 模式,环境描述长度 = 256k。
MCP Atlas:使用官方 MCP Atlas 代码库进行评估。公开集评分使用 Gemini 2.5 Pro 作为评分模型,与官方模型保持一致。
Apex-Agents:使用 archipelago 代码库、ReAct Toolbelt 框架,评分模型为 Claude Sonnet 4.6。
Claw-Eval:使用官方 Claw-Eval 代码库进行评估,通用任务组(161 个任务),评分模型为 Gemini 3.0 Flash,与官方模型保持一致。指标:Pass³ 分数。
OSWorld-Verified:使用 OSWorld-Verified 官方代码库(测试脚本即将开源),在 nogdrive 集合的 361 个样本上进行测试。M3 使用 0–1000 的相对坐标,图像分辨率 1920×1080,最大步数 = 200。将最大步数从 100 增加到 200 后,任务完成率从 68.70% 提升至 70.06%。
OmniDocBench:图像长边最大为 3584 像素,使用公开的 OmniDocBench v1.5 数据集和官方评估逻辑。在官方提示词基础上增加了合理的格式约束。Gemini 3.1 Pro、GPT-5.5、Claude Opus 4.7 使用默认 API 参数。
MMMU Pro:与官方评估保持一致。提示词对模型输出的最后一行施加格式约束,以便于解析。
VideoMMMU:视频帧率 = 1 FPS,最多 512 帧,单帧长边 672–1008 像素。使用官方 VideoMMMU 提示词,采用大语言模型作为裁判进行评分。MiniMax M3:最大输出 token = 32K,温度 = 1.0,top_p = 0.95。外部模型:最大输出 token = 64K,温度 = 0.7,top_p = 0.95,最高思考模式。
Video-MME:视频帧率 = 1 FPS,最多 1024 帧(*外部 API 限制为 640 帧;MiniMax M3 在 512 帧下得分为 84.6),单帧长边 336–672 像素,每 30 秒插入一次字幕并交错嵌入帧中。使用官方 Video-MME 提示词,采用 LLM 作为评判者进行评分。MiniMax M3:最大输出 token 数 = 16K,温度 = 1.0,top_p = 0.95。外部模型:最大输出 token 数 = 64K,温度 = 0.7,top_p = 0.95,采用最高推理模式。*注:Claude Opus 4.7 API 错误率 >20%,结果未报告。
IMO 2025 和 USAMO 2026:与 MathArena 官方评估保持一致。每场比赛:6 道题,最高得分 42 分。模型证明输出流程:(1) 解答归一化 → (2) 使用人类专家评分标准(GPT-5.4 高推理努力度,Gemini 3.1 Pro 高推理努力度)由两个强模型进行评分 → (3) 两个评判者取最低分作为最终得分。M3 评估:最大输出 token 数 512k,温度 = 1.0,测试时扩展框架最多迭代 10 次。其他闭源模型指标:avg@k 结果。