# MiniMax M2.7：自我进化的早期回声

- 来源：MiniMax：Blog（网页）
- 作者：MiniMax
- 发布时间：2026-03-18 00:00
- AIHOT 分数：61
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmpunu0g50005slbro8j0g9i9
- 原文链接：https://www.minimax.io/blog/minimax-m27

## 精选理由

MiniMax M2.7 让模型参与自身进化，在 SWE-Pro 和 VIBE-Pro 上接近 Opus 水平，Agent Teams 设计也值得看，但整体仍是追赶者姿态。

## AI 摘要

M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架，完成精细的生产力任务，尤其在软件工程方面表现突出，其SWE-Pro基准测试得分56.22%，接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先，GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率，处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架，实现了“分析-修改-评估”的自主迭代优化循环，在内部评估中提升了性能。

## 正文

在我们 M2 系列模型首次发布后的几个月里，我们收到了来自热情用户和开发者的大量反馈与建议，这促使我们进一步加快了模型迭代的效率。在人类生产力已被充分释放的基础上，自然而然的下一步便是启动模型与组织的自我进化。M2.7 是我们首个深度参与自身进化的模型。

M2.7 能够构建复杂的智能体框架，并完成高度精细的生产力任务，这得益于其利用的智能体团队、复杂技能以及动态工具搜索等能力。例如，在开发 M2.7 时，我们让模型更新自身的记忆，并在其框架中构建了数十种复杂技能，以辅助强化学习实验。我们进一步让模型根据实验结果改进其学习过程和框架。这一过程开启了模型自我进化的循环。

M2.7 在现实世界的软件工程领域表现出色，包括端到端的完整项目交付、日志分析、故障排查、代码安全、机器学习等。在 SWE-Pro 基准测试中，M2.7 取得了 56.22% 的分数，几乎接近 Opus 的最佳水平。这一能力还延伸至端到端完整项目交付场景（VIBE-Pro 得分 55.6%），以及在 Terminal Bench 2 上对复杂工程系统的深度理解（得分 57.0%）。

我们还增强了模型在专业办公软件领域各个方面的专业知识和任务交付能力。它在 GDPval-AA 上的 ELO 得分为 1495，是开源模型中的最高分。M2.7 在 Office 套件——Excel、PPT 和 Word——中的复杂编辑能力显著提升，并且能够更好地处理多轮修订和高保真编辑。M2.7 能够与复杂环境进行交互：在处理超过 40 种、每种长度超过 2000 个 token 的复杂技能时，其技能遵循率保持在 97%。

M2.7 展现出卓越的角色一致性和情商，为产品创新开辟了更多空间。

基于这些能力，M2.7 也在显著加速我们自身向 AI 原生组织的进化。

构建用于模型自我进化的智能体

我们首先分享一个内部工作流，它使 M2 系列模型能够实现自我进化。该工作流同时也是对模型智能体能力边界的一次探索。

现代智能体工具集利用复杂技能、记忆以及其他外部模块的组合，来帮助提升其对各种工作环境的适应能力。在 MiniMax，我们的智能体日常需要面对跨越多个部门、极其复杂且迥异的工作环境。因此，为了提升智能体在这些异构环境中的鲁棒性，我们让一个内部版本的 M2.7 构建了一个研究型智能体工具集，用于与不同的研究项目组进行交互和协作。该工具集支持数据管道、训练环境、基础设施、跨团队协作以及持久化记忆——使研究人员能够驱动它来交付更好的模型。这个研究型智能体工具集驱动着迭代周期，在研究人员设定的指导下，生产出下一代模型。

一个典型的工作流体现在我们强化学习团队的日常工作中。研究人员首先与智能体讨论一个实验想法，智能体协助进行文献综述、跟踪预设的实验规范、处理数据及其他工件的数据管道，并启动实验。在实验过程中，智能体监控并分析实验进度，自动触发日志读取、调试、指标分析、代码修复、合并请求以及冒烟测试，识别并配置那些微妙但关键的变化。过去，这些工作可能需要来自不同团队的多个研究人员协作完成，而现在，人类研究人员仅在关键决策和讨论时进行交互。这加速了问题发现和实验进程，从而更快地交付模型。在此过程中，M2.7 能够处理 30% 到 50% 的工作流。

在迭代过程中，我们意识到模型递归进化自身能力框架的能力也至关重要。我们的内部能力框架能够自主收集反馈，为内部任务构建评估集，并基于此持续迭代自身的架构、技能/MCP 实现以及记忆机制，从而更好、更高效地完成任务。

例如，我们让 M2.7 优化某个模型在内部脚手架上的编程性能。M2.7 完全自主运行，执行了超过 100 轮的迭代循环：“分析失败轨迹 → 规划变更 → 修改脚手架代码 → 运行评估 → 比较结果 → 决定保留或回退变更”。在此过程中，M2.7 发现了针对该模型的有效优化方法：系统性地搜索温度、频率惩罚和存在惩罚等采样参数的最优组合；为模型设计更具体的工作流指南；以及在脚手架的智能体循环中添加循环检测等优化。最终，这实现了

30% 的性能提升

在内部评估集上。

我们相信，未来 AI 的自我进化将逐步向完全自主化过渡，无需人类参与即可协调数据构建、模型训练、推理架构、评估等各个阶段。

为此，我们在低资源场景下进行了初步探索性测试。我们让 M2.7 参与了 OpenAI 开源的在 MLE Bench Lite 级别上的 22 场机器学习竞赛。这些竞赛可以在单张 A30 GPU 上运行，却几乎涵盖了机器学习工作流程的所有环节。

我们设计并实现了一个简单的框架，用于引导智能体进行自主优化。核心模块包括三个组件：短期记忆、自我反馈和自我优化。具体来说，在每一轮迭代之后，智能体会生成一个短期记忆的 Markdown 文件，同时对当前轮次的结果进行自我批评，从而为下一轮提供潜在的优化方向。我们总共进行了三轮试验，每轮有 24 小时用于迭代演进。表现最好的一轮获得了 9 枚金牌、5 枚银牌和 1 枚铜牌。三轮试验的平均奖牌率为 66.6%，这一结果仅次于 Opus-4.6（75.7%）和 GPT-5.4（71.2%），与 Gemini-3.1（66.6%）持平。

专业软件工程

在软件工程任务中，M2.7 更深入地探索了现实世界的编程能力，包括用于漏洞排查的日志分析、重构、代码安全、机器学习、安卓开发等。

以一个常见的生产场景为例：在线环境调试。这不仅需要代码生成能力，更需要强大的综合推理能力。当面对生产环境中的告警时，M2.7 能够关联监控指标与部署时间线进行因果推理，对链路采样数据进行统计分析并提出精准假设，主动连接数据库验证根因，在代码仓库中定位缺失的索引迁移文件，甚至具备先使用非阻塞索引创建来止血，然后再提交合并请求的意识。从可观测性分析、数据库专业知识到 SRE 级别的决策——这不仅仅是一个能写代码的模型，更是一个真正理解生产系统的模型。与传统的人工故障排查流程相比，使用 M2.7，我们已多次将生产系统在线故障的恢复时间缩短至三分钟以内。

视频 · 前往原文观看

在线生产环境调试

在原始编程能力方面，M2.7 已达到 SOTA 模型的水平。在覆盖多种编程语言的 SWE-Pro 基准测试上，M2.7 取得了

56.22%

准确率与 GPT-5.3-Codex 持平。在更贴近真实工程场景的基准测试中，例如 SWE Multilingual（76.5）和 Multi SWE Bench（52.7），它展现出更为显著的优势。

这一能力还延伸至端到端的完整项目交付场景。在仓库级代码生成基准测试 VIBE-Pro 上，M2.7 获得了

55.6%

的成绩，几乎与 Opus 4.6 持平——这意味着无论是 Web、Android、iOS 还是模拟任务的需求，都可以直接交给 M2.7 来完成。

更值得关注的是它对复杂工程系统的深刻理解。在 Terminal Bench 2（

57.0%

）和 NL2Repo（39.8%）这两项对系统级理解能力要求极高的测试中，M2.7 同样表现稳健。这进一步证实了它不仅擅长代码生成，还能深入理解软件系统的运行逻辑与协作机制。

视频 · 前往原文观看

M2.7 生成的 WildGuard 演示网页

在提升开发效率方面，一个尤为重要的特性是原生

智能体团队

（多智能体协作）。智能体团队对模型提出了范式层面的要求：角色边界、对抗性推理、协议遵循以及行为差异化——这些无法仅通过提示词实现，必须内化为模型的原生能力。在智能体团队场景中，模型需要稳定锚定自身角色身份，主动挑战队友在逻辑和伦理上的盲点，并在复杂状态机中做出自主决策。以下是我们内部用于产品原型开发的智能体团队配置，其中包含构建产品原型所需的最小组织架构。

智能体团队多智能体协作演示

专业工作

除了软件工程领域，智能体在办公场景中也变得越来越有用。我们认为这归结于两项核心能力：

领域专业知识与任务交付能力。

模型需要具备跨领域的专业知识，并理解用户需求。在衡量这一能力的 GDPval-AA 评估中，M2.7 取得了

1495 的 ELO 评分。

在 45 个模型中排名第二，仅次于 Opus 4.6、Sonnet 4.6 和 GPT5.4，并超越了 GPT5.3。针对最常见的办公文档处理任务，我们系统性地优化了模型处理 Word、Excel 和 PPT 的能力。在各种智能体框架中，M2.7 既能基于模板和技能直接生成文件，也能遵循用户的交互式指令对现有文件进行多轮高保真编辑，最终输出可编辑的交付物。

与复杂环境交互的能力。

泛化的日常场景意味着模型必须灵活适应各种上下文，调用多样化的技能和工具，并在长时间交互中保持稳定的指令遵循能力。M2.7 在这些方面取得了实质性改进。在 Toolathon 上，M2.7 达到了 46.3% 的准确率，跻身全球顶尖水平。在 MM Claw 测试中，M2.7 保持了

97% 的技能遵循率

覆盖 40 项复杂技能（每项技能超过 2000 个模型 token）。

我们测试了模型在金融领域的专业能力。例如，在涉及阅读研究报告并建模公司未来收入的场景中，M2.7 能够自主阅读年报和财报电话会议纪要，交叉参考多份研究报告，独立设计假设并构建收入预测模型，然后根据模板生成 PPT 和研究报告。从业者的反馈是，其输出已可作为初稿直接进入后续工作流程。以下是以台积电为例的展示。

任务：

基于台积电的年报和财报电话会议信息，构建台积电的收入模型。阅读多份研究报告，设计相应的假设，根据最新信息对台积电的收入进行建模，然后根据 PPT 模板生成 PPT，并撰写 Word 文档形式的研究报告。

[TSMC_Revenue_Model.xlsx]

[TSMC_Financial_Analysis.pptx]

[TSMC_Equity_Research_Report.docx]

视频 · 前往原文观看

近期 OpenClaw 的迅速流行，是智能体生态蓬勃发展的一个缩影，我们很高兴 M2 系列模型为社区的繁荣做出了贡献。基于 OpenClaw 中的常用任务，我们构建了一个名为

MM Claw 的评估集。

，覆盖了工作和生活中广泛的实际需求。M2.7 在该测试中达到了接近 Sonnet 4.6 的水平，准确率为

62.7%

。

娱乐

在使用 OpenClaw 及类似的个人智能体时，我们注意到，除了完成工作任务外，许多用户还希望模型具备高情商和一致的角色性格。一旦设定了角色形象，用户就会像对待朋友一样与 OpenClaw 互动。我们认为，这为将智能体模型的用途从纯粹的生产力领域扩展到互动娱乐领域提供了机会。为此，我们在 M2.7 中加强了角色一致性及对话能力。

基于此，我们构建了一个初步演示：

OpenRoom

，这是一个基于智能体框架的交互系统，它将 AI 交互从纯文本流中解放出来，置于一个一切皆可交互的 Web GUI 空间内。在这里，角色设定不再是冰冷的提示词块；对话驱动着体验，生成实时的视觉反馈和场景互动，角色会主动与环境互动。我们认为这个框架具有很高的可扩展性，并且能够随着智能体能力的提升和社区的发展而持续演进，探索人类与智能体交互的全新方式。

为了鼓励这一领域的探索，我们已将该初始演示开源（其中大部分代码由 AI 编写）：

• 项目仓库：

github.com/MiniMax-AI/OpenRoom

• 立即体验：

openroom.ai

视频 · 前往原文观看

MiniMax M2.7 现已全面在 MiniMax Agent 和 MiniMax API 平台上可用。我们期待用户和开发者利用 M2.7 探索更多有趣的用例。

MiniMax Agent：

agent.minimax.io

API：

platform.minimax.io

编程计划：
