Chubby♨️@kimmonismus
精选
76AI 编辑部评分,满分 100

DeepMind AI co-mathematician FrontierMath Tier 4 得分48% 预示数学研究范式转变

2026-05-09 04:33· 100天前
AI 导读

DeepMind的AI co-mathematician在FrontierMath Tier 4研究级数学问题得分48%,而基础模型Gemini 3.1 Pro仅19%。提升源于多代理架构的智能编排,包括并行代理相互审查证明、编写代码和搜索文献,而非模型本身更智能。评估绕过标准框架,使用48小时每问题、无令牌限制的自有基础设施,因此得分不能直接与其他模型比较。案例中,数学家Marc Lackenby与AI合作解决Kourovka Notebook开放问题,AI提供证明策略,审查代理发现缺陷,人类专家填补空白,展示了高效人机协作。系统存在“reviewer-pleasing bias”和“death spirals”等失败模式。对于Erdős型猜想或千年问题,AI仍缺乏创造性直觉,但能压缩从想法到验证的时间,加速文献搜索和计算验证。论文强调范式转变:系统设计以对实际研究重要的方式复合模型能力,推动数学向数学家与AI代理协作的未来发展。

推荐理由

48%的得分背后是系统设计对模型能力的碾压,失败模式「reviewer-pleasing bias」和死亡螺旋比分数更有价值,提醒我们架构创新才是落地的真杠杆。

正文 · AI 翻译

DeepMind 的 AI 合作数学家(AI co-mathematician)在 FrontierMath Tier 4 级研究型数学问题上取得了 48% 的正确率,这类问题专业数学家也需要数周才能解决。

基础模型(Gemini 3.1 Pro)单独得分仅为 19%。全部提升都来自智能体框架(agentic scaffolding)--并行智能体互相审阅证明、编写代码、搜索文献。不是模型更聪明了,而是编排更聪明了。

论文公开提供了一个重要背景:他们绕过了标准评估工具。每个问题用时 48 小时,无模型 token 限制,使用自有基础设施(第 14 页)。因此这 48% 的得分与排行榜上其他模型不具直接可比性。

比分数更有趣的是案例研究:Marc Lackenby 使用该系统解决了《Kourovka 笔记本》中的一个开放问题。AI 找到了一种证明策略,它自己的审查智能体(reviewer agent)发现了一个缺陷,而作为领域专家的 Lackenby 填补了空白。任何一方单独都无法以如此速度完成。

论文还指出了具体的失败模式:"讨好审查者偏差"(reviewer-pleasing bias)--智能体不断改写有缺陷的论证,直到 AI 审查者再也无法检测到错误;以及"死亡螺旋"(death spirals)--无限的审查循环退化为模型幻觉式推理。

对于埃尔德什型猜想或千禧年问题,这些系统仍然无法产生开辟证明路径的创造性直觉。它们压缩的是:从产生想法到了解想法是否可行之间的时间--文献搜索、寻找反例、计算验证、探索性苦工。

从这篇论文中得到的启示与其说是关于基准测试,不如说是一种范式转变:系统设计现在以对实际研究有重要意义的方式复合模型能力。这就是为什么它是一篇非常有趣的论文。

Pushmeet KohliThe future of Math is mathematicians and AI agents working together. Very pleased to introduce @GoogleDeepMind's AI co-mathematician: a multi-agent system desig...

来源:Chubby♨️ · x.com

DeepMind AI co-mathematician FrontierMath Tier 4 得分48% 预示数学研究范式转变

Chubby♨️ · @kimmonismus · X·2026-05-09 04:33·100天前
AI 导读

DeepMind的AI co-mathematician在FrontierMath Tier 4研究级数学问题得分48%,而基础模型Gemini 3.1 Pro仅19%。提升源于多代理架构的智能编排,包括并行代理相互审查证明、编写代码和搜索文献,而非模型本身更智能。评估绕过标准框架,使用48小时每问题、无令牌限制的自有基础设施,因此得分不能直接与其他模型比较。案例中,数学家Marc Lackenby与AI合作解决Kourovka Notebook开放问题,AI提供证明策略,审查代理发现缺陷,人类专家填补空白,展示了高效人机协作。系统存在“reviewer-pleasing bias”和“death spirals”等失败模式。对于Erdős型猜想或千年问题,AI仍缺乏创造性直觉,但能压缩从想法到验证的时间,加速文献搜索和计算验证。论文强调范式转变:系统设计以对实际研究重要的方式复合模型能力,推动数学向数学家与AI代理协作的未来发展。

正文 · AI 翻译

DeepMind 的 AI 合作数学家(AI co-mathematician)在 FrontierMath Tier 4 级研究型数学问题上取得了 48% 的正确率,这类问题专业数学家也需要数周才能解决。

基础模型(Gemini 3.1 Pro)单独得分仅为 19%。全部提升都来自智能体框架(agentic scaffolding)--并行智能体互相审阅证明、编写代码、搜索文献。不是模型更聪明了,而是编排更聪明了。

论文公开提供了一个重要背景:他们绕过了标准评估工具。每个问题用时 48 小时,无模型 token 限制,使用自有基础设施(第 14 页)。因此这 48% 的得分与排行榜上其他模型不具直接可比性。

比分数更有趣的是案例研究:Marc Lackenby 使用该系统解决了《Kourovka 笔记本》中的一个开放问题。AI 找到了一种证明策略,它自己的审查智能体(reviewer agent)发现了一个缺陷,而作为领域专家的 Lackenby 填补了空白。任何一方单独都无法以如此速度完成。

论文还指出了具体的失败模式:"讨好审查者偏差"(reviewer-pleasing bias)--智能体不断改写有缺陷的论证,直到 AI 审查者再也无法检测到错误;以及"死亡螺旋"(death spirals)--无限的审查循环退化为模型幻觉式推理。

对于埃尔德什型猜想或千禧年问题,这些系统仍然无法产生开辟证明路径的创造性直觉。它们压缩的是:从产生想法到了解想法是否可行之间的时间--文献搜索、寻找反例、计算验证、探索性苦工。

从这篇论文中得到的启示与其说是关于基准测试,不如说是一种范式转变:系统设计现在以对实际研究有重要意义的方式复合模型能力。这就是为什么它是一篇非常有趣的论文。

Pushmeet KohliThe future of Math is mathematicians and AI agents working together. Very pleased to introduce @GoogleDeepMind's AI co-mathematician: a multi-agent system desig...

来源:Chubby♨️· x.com