HuggingFace Daily Papers(社区热门论文)
精选
79AI 编辑部评分,满分 100

MaxProof:面向数学证明的群体级别测试时扩展框架(MiniMax-M3)

2026-06-11 08:00· 67天前
AI 导读

MaxProof 是为 MiniMax-M3 系列设计的群体级别测试时扩展框架,用于竞赛级数学证明。M3 模型训练了证明生成、证明验证和基于 critique 的证明修复三种能力,验证器采用低假阳性率的深度防御生成式架构。这些能力合并到单个 M3 模型。测试时,MaxProof 将模型用作生成器、验证器、精炼器和排序器,在候选证明群体中搜索并通过锦标赛选择返回最终证明。M3 模型在 IMO 2025 达 35/42,USAMO 2026 达 36/42,均超过人类金牌阈值。

推荐理由

MiniMax-M3用生成-验证器RL把数学证明推到了人类金牌水平,IMO 2025 35/42,USAMO 2026 36/42。这篇的意义不只分数,而在于验证-修复-群体搜索的技术路线跑通了最难的人类竞赛。

正文 · AI 翻译

我们提出 MaxProof,这是一种面向 MiniMax-M3 系列竞赛级数学证明的群体级测试时扩展框架。M3 首先训练了三种面向证明的能力——证明生成、证明验证以及基于批判的证明修复——并采用一种专为低误报率设计的纵深防御生成式验证器。这些能力被合并到单个发布的 M3 模型中。在测试时,MaxProof 将该模型同时用作生成器、验证器、精炼器和排序器,在候选证明群体中进行搜索,并通过锦标赛选择返回最终证明。借助 MaxProof 的测试时扩展,M3 模型在 IMO 2025 上达到 35/42,在 USAMO 2026 上达到 36/42,两项成绩均超过人类金牌线。

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org

MaxProof:面向数学证明的群体级别测试时扩展框架(MiniMax-M3)

HuggingFace Daily Papers(社区热门论文)·2026-06-11 08:00·67天前
AI 导读

MaxProof 是为 MiniMax-M3 系列设计的群体级别测试时扩展框架,用于竞赛级数学证明。M3 模型训练了证明生成、证明验证和基于 critique 的证明修复三种能力,验证器采用低假阳性率的深度防御生成式架构。这些能力合并到单个 M3 模型。测试时,MaxProof 将模型用作生成器、验证器、精炼器和排序器,在候选证明群体中搜索并通过锦标赛选择返回最终证明。M3 模型在 IMO 2025 达 35/42,USAMO 2026 达 36/42,均超过人类金牌阈值。

正文 · AI 翻译

我们提出 MaxProof,这是一种面向 MiniMax-M3 系列竞赛级数学证明的群体级测试时扩展框架。M3 首先训练了三种面向证明的能力——证明生成、证明验证以及基于批判的证明修复——并采用一种专为低误报率设计的纵深防御生成式验证器。这些能力被合并到单个发布的 M3 模型中。在测试时,MaxProof 将该模型同时用作生成器、验证器、精炼器和排序器,在候选证明群体中进行搜索,并通过锦标赛选择返回最终证明。借助 MaxProof 的测试时扩展,M3 模型在 IMO 2025 上达到 35/42,在 USAMO 2026 上达到 36/42,两项成绩均超过人类金牌线。

来源:HuggingFace Daily Papers(社区热门论文)· arxiv.org