# AI 智能体能否进行开放式 AI 研究？两项案例的早期证据

- 来源：HuggingFace Daily Papers（社区热门论文）
- 发布时间：2026-07-29 08:00
- AIHOT 分数：72
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cms6x4iu80273rouqra49hny9
- 原文链接：https://arxiv.org/abs/2607.27191

## 精选理由

这篇论文给「AI即将自我进化」的说法泼了盆冷水，虽然代理能跑通工程，但在解决开放性研究问题上全线溃败，对打算用AI做科研的团队是个重要的现实检验。

## AI 摘要

一项新研究通过“影子评估”测试前沿 AI 智能体能否独立完成开放式 AI 研究。智能体在六天和数千美元算力下完成了全部工程任务，但未能对两项未发表的 NeurIPS 2026 论文的核心研究问题取得实质性进展，被原作者明确拒稿。研究识别出五大失败模式，包括对发表标准判断不足、研究设计缺乏创意、无法有效回溯死胡同、资源意识差和指令漂移。

## 正文

关于爆炸式 AI 进步的预测，其核心前提是 AI 智能体能够自动化 AI 研究。然而，关于智能体能否开展开放式 AI 研究的证据还很薄弱。当前的评估方法要么在狭窄、可验证的任务上测试智能体（这排除了开放式研究），要么将 AI 生成的论文提交给盲审（这已不堪重负、随机性强，且评审质量低下）。我们引入了第三种衡量 AI 研发自动化进展的方法。智能体需承担一篇高质量未发表论文的核心开放式研究问题，并由该论文的原作者对其产出进行评分。我们称这种方法为影子评估。我们对两篇未发表的 NeurIPS 2026 投稿论文进行了影子评估，为前沿智能体提供了六天时间和数千美元的计算资源。智能体在无人协助下完成了所有工程任务，但在回答研究问题方面未能取得实质性进展。因此，两篇论文均被作者明确拒绝。我们识别出五种反复出现的失败模式：对可发表研究的门槛判断力差、对研究设计缺陷的应对缺乏创造性、从死胡同中有效回溯的能力不足、资源意识薄弱，以及指令漂移。使用第二个模型和脚手架进行的稳健性检验复现了这些失败。我们公开了专家评审、调查回复、智能体代码仓库和日志。我们的结果提供了早期证据，表明当今的智能体能够完成 AI 研究的工程部分，但在研究生命周期的关键环节上仍存在困难。
