关于爆炸式 AI 进步的预测,其核心前提是 AI 智能体能够自动化 AI 研究。然而,关于智能体能否开展开放式 AI 研究的证据还很薄弱。当前的评估方法要么在狭窄、可验证的任务上测试智能体(这排除了开放式研究),要么将 AI 生成的论文提交给盲审(这已不堪重负、随机性强,且评审质量低下)。我们引入了第三种衡量 AI 研发自动化进展的方法。智能体需承担一篇高质量未发表论文的核心开放式研究问题,并由该论文的原作者对其产出进行评分。我们称这种方法为影子评估。我们对两篇未发表的 NeurIPS 2026 投稿论文进行了影子评估,为前沿智能体提供了六天时间和数千美元的计算资源。智能体在无人协助下完成了所有工程任务,但在回答研究问题方面未能取得实质性进展。因此,两篇论文均被作者明确拒绝。我们识别出五种反复出现的失败模式:对可发表研究的门槛判断力差、对研究设计缺陷的应对缺乏创造性、从死胡同中有效回溯的能力不足、资源意识薄弱,以及指令漂移。使用第二个模型和脚手架进行的稳健性检验复现了这些失败。我们公开了专家评审、调查回复、智能体代码仓库和日志。我们的结果提供了早期证据,表明当今的智能体能够完成 AI 研究的工程部分,但在研究生命周期的关键环节上仍存在困难。
AI 智能体能否进行开放式 AI 研究?两项案例的早期证据
阅读原文· arxiv.org这篇论文给「AI即将自我进化」的说法泼了盆冷水,虽然代理能跑通工程,但在解决开放性研究问题上全线溃败,对打算用AI做科研的团队是个重要的现实检验。
一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务,但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展,被原作者明确拒稿。研究识别出五大失败模式,包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。
关于爆炸式 AI 进步的预测,其核心前提是 AI 智能体能够自动化 AI 研究。然而,关于智能体能否开展开放式 AI 研究的证据还很薄弱。当前的评估方法要么在狭窄、可验证的任务上测试智能体(这排除了开放式研究),要么将 AI 生成的论文提交给盲审(这已不堪重负、随机性强,且评审质量低下)。我们引入了第三种衡量 AI 研发自动化进展的方法。智能体需承担一篇高质量未发表论文的核心开放式研究问题,并由该论文的原作者对其产出进行评分。我们称这种方法为影子评估。我们对两篇未发表的 NeurIPS 2026 投稿论文进行了影子评估,为前沿智能体提供了六天时间和数千美元的计算资源。智能体在无人协助下完成了所有工程任务,但在回答研究问题方面未能取得实质性进展。因此,两篇论文均被作者明确拒绝。我们识别出五种反复出现的失败模式:对可发表研究的门槛判断力差、对研究设计缺陷的应对缺乏创造性、从死胡同中有效回溯的能力不足、资源意识薄弱,以及指令漂移。使用第二个模型和脚手架进行的稳健性检验复现了这些失败。我们公开了专家评审、调查回复、智能体代码仓库和日志。我们的结果提供了早期证据,表明当今的智能体能够完成 AI 研究的工程部分,但在研究生命周期的关键环节上仍存在困难。