DeepMind 的 AI 合作数学家(AI co-mathematician)在 FrontierMath Tier 4 级研究型数学问题上取得了 48% 的正确率,这类问题专业数学家也需要数周才能解决。
基础模型(Gemini 3.1 Pro)单独得分仅为 19%。全部提升都来自智能体框架(agentic scaffolding)--并行智能体互相审阅证明、编写代码、搜索文献。不是模型更聪明了,而是编排更聪明了。
论文公开提供了一个重要背景:他们绕过了标准评估工具。每个问题用时 48 小时,无模型 token 限制,使用自有基础设施(第 14 页)。因此这 48% 的得分与排行榜上其他模型不具直接可比性。
比分数更有趣的是案例研究:Marc Lackenby 使用该系统解决了《Kourovka 笔记本》中的一个开放问题。AI 找到了一种证明策略,它自己的审查智能体(reviewer agent)发现了一个缺陷,而作为领域专家的 Lackenby 填补了空白。任何一方单独都无法以如此速度完成。
论文还指出了具体的失败模式:"讨好审查者偏差"(reviewer-pleasing bias)--智能体不断改写有缺陷的论证,直到 AI 审查者再也无法检测到错误;以及"死亡螺旋"(death spirals)--无限的审查循环退化为模型幻觉式推理。
对于埃尔德什型猜想或千禧年问题,这些系统仍然无法产生开辟证明路径的创造性直觉。它们压缩的是:从产生想法到了解想法是否可行之间的时间--文献搜索、寻找反例、计算验证、探索性苦工。
从这篇论文中得到的启示与其说是关于基准测试,不如说是一种范式转变:系统设计现在以对实际研究有重要意义的方式复合模型能力。这就是为什么它是一篇非常有趣的论文。