介绍 Science One 框架——一个实验性研究原型,旨在通过原生构建可验证的证据链来消除模型幻觉,以及 CoE Audit——一套用于评估 AI 生成论文完整性的自动化协议。
快速链接
大语言模型(LLM)正越来越多地被部署为不仅仅是编码助手,而是能够执行端到端科学研究工作流的自主智能体。近期的一些系统(例如 Sakana 的 AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher)能够审阅文献、提出假设、执行实验并撰写与人类作者论文水平相当的完整手稿。然而,随着这些 AI 生成手稿的表面质量不断提升,一个关键的结构性问题浮出水面:可验证性。由于当前自主研究流水线是迭代式生成文本的,任何阶段引入的错误都会被放大。一些现有系统会生成不存在的引用,所描述的方法与实际代码之间存在不一致,并且报告的实验分数无法仅凭所提供的代码完全复现。
在我们的论文中,我们通过引入 Chain-of-Evidence(CoE)来解决这一问题,这是一个面向 AI 驱动研究的新型可验证性框架。我们通过 Science One Framework 来实例化 CoE——这是一个原生构建并维护证据链的自主研究原型,同时还有 CoE Audit——一套自动化的评估指标,用于衡量 AI 生成论文与其底层代码和证据之间的一致性。我们的结果表明,基线系统最多会幻觉出 21% 的参考文献,并且经常出现代码与文本不一致的情况,而 Science One Framework 实现了零虚构引用和完全可验证的分数,同时在 MLE-Bench 和 Parameter-Golf 等前沿基准上达到了最先进的性能。
Chain-of-Evidence:一个面向可验证研究的框架
CoE 是一个概念性框架,用于定义什么使研究产物值得信赖,正如 ACID 定义了什么使数据库事务可靠一样。该框架并非规定如何构建研究智能体,而是规定了其输出必须具有的属性。它遵循一个包含两方面的单一原则:研究产物中的每一项主张都必须带有记录在案的证据链(完整性),并且每条证据链都必须真正支持其所附的主张(正确性)。一项主张可以是参考文献、报告的数字、方法描述或结论,它必须链接回相应的证据,例如同行评审的论文、实验日志行、实际运行的代码或结果表格。
幻觉引用指向一篇不存在的论文。不可复现的分数在重新运行代码时不会再次出现。描述错误的方法在论文中声称使用一种算法,而代码实现的却是另一种。每一项都是证据链断裂的主张;CoE 审计使这些断裂变得可衡量。
Science One 框架
为了证明可验证的 AI 研究在不牺牲问题解决性能的情况下是可能的,我们设计了 Science One 框架。与之前生成论文并试图追溯性地关联事实的智能体不同,Science One 框架通过三个主要模块从构造上实例化了 CoE 框架:
- 问题调查器(文献基础):为防止幻觉引用,Science One 框架通过 Semantic Scholar API 构建引文图。它针对每个主题阅读最多 100 篇全文 PDF,以生成结构化的研究简报。最终论文中的每一条参考文献都源自这个有据可依的 API 调用,完全消除了对模型记忆的依赖。
- 发现引擎(并行探索-利用):Science One 框架在多个并行分支中系统地探索和利用想法。在每个隔离的循环中,Solver 智能体实现一个解决方案,任务特定的评估器对其进行评分。表现优异的分支会被迭代优化,所有原始评估器输出都会被编入一个严格的、只读的记录中。
- 论文撰写与主张核验:在渲染手稿之前,Science One 框架会为每一个事实性主张构建结构化表示,并附上内联证据标签,将其绑定到特定的工作区产物上。专门的 Claim Verifier(主张核验器)会对照声明的来源逐一核验每一条主张。超出证据支撑范围的主张会与来源进行调和——以保守的方式重新表述而非删除,从而确保论文始终与工作实际支持的内容保持一致。

Science One 框架流水线。Problem Investigator(问题调查器)通过检索到的 PDF 对文献进行 grounding。Discovery(发现)模块负责探索和评估解决方案。论文撰写与核验模块负责撰写和核验论文,其中 Claim Verifier(主张核验器)确保所有主张与其证据来源相匹配。
CoE 审计:衡量可核验性
为了严格评估 Science One 框架原型与最先进的基线系统(例如 Sakana AI 的 AI Scientist v2、AutoResearchClaw、DeepScientist、AI-Researcher)的对比表现,我们开发了 CoE 审计。这一事后评估协议充当自动化的取证审查员,对生成的产物(论文、解决方案、代码和参考文献)执行四项严格的完整性检查:
- 分数核验:从论文中提取所报告的分数,并与对提交代码进行的完全独立重跑结果进行比较。
- 规范违规检查:检查解决方案代码,确保其确实解决了任务,而非利用评估指标的漏洞或读取 ground-truth 答案文件。
- 参考文献核验:将每一条参考文献条目与学术 API 进行交叉核对,以捕捉不存在的虚构引用。
- 方法与代码一致性:使用 LLM 评判器将论文的方法部分与代码进行并排比较,确保文本忠实描述了所实现的算法。

CoE 审计框架及其四项核心完整性检查的概览。
结果
我们将 CoE 审计应用于来自 Automated Design of Research Systems(ADRS)基准的五个系统优化任务(Prism、Cloudcast、EPLB、LLM-SQL 和事务调度)中生成的 75 篇论文。
Science One Framework 在可验证性方面显著优于现有基线。CoE Audit 对每个系统应用相同的独立协议,对照实时学术数据库逐一复核每条引用,在该协议下,Science One Framework 在全部四项完整性检查中均领先。其引用中没有一条是“幽灵引用”:每条都指向真实、可检索的论文,而基线的幻觉率最高达 21%,这是因为 Problem Investigator 会检索每条引用,而非凭记忆生成。它还实现了完美的分数验证和最高的方法-代码一致性。相比之下,基线系统经常描述复杂的算法(如“混合神经符号求解器”),但其提交的代码却是简单的确定性启发式方法。

五个系统的 CoE Audit 结果。
关键在于,实施严格的可验证性并未损害智能体的科学能力。Science One Framework 在全部五项 ADRS 任务上达到或超过了人类专家水平,并在其中两项任务(Cloudcast 和 EPLB)上取得了所有系统中的最佳总分。

五个 MLE-Bench 任务及 Parameter Golf 上的求解器性能对比。
为测试其泛化能力,我们在六个高度复杂的外部任务上部署了 Science One Framework:
- MLE-Bench:在涵盖医学影像、细粒度识别和 3D 感知的五项高难度 Kaggle 竞赛中,Science One Framework 获得两枚金牌(包括在基线完全失败的 3D Object Detection 上取得获胜分数)和两枚银牌。
- Parameter-Golf:我们在具有严格硬件和文件大小限制的实时 LLM 训练竞赛中测试了 Science One Framework。虽然基线系统未能生成有效提交,但 Science One Framework 成功遵守了所有约束,并取得了最先进的分数(截至 2026 年 4 月 27 日)。值得注意的是,Science One Framework 发现的是真正新颖的算法技术,而不仅仅是调整表面的超参数。
展望未来
随着自主研究系统不断扩展,以解决日益困难的科学问题,仅靠求解器质量本身已不足以形成差异化。真正将它们的产出区分开来的,是最终研究成果是否值得信赖。我们的研究结果表明,可验证性必须被当作一等架构约束来对待。通过在主张产生之时就构建证据链,而非事后试图重建依据,Science One 框架证明了 AI 智能体能够产出严谨、可信且极具竞争力的科学研究。我们希望 Chain-of-Evidence 框架及其审计机制,能够在我们继续构建下一代 AI 科学家的过程中,为社区提供有价值的工具。
致谢
我们要感谢 Bhavana Dalvi Mishra、Jiefeng Chen、Chun-Liang Li、Palash Goyal、Mihir Parmar、Yiwen Song、Yale Song、Raj Sinha、Parthasarathy Ranganathan、Burak Gokturk 和 Jinsung Yoon 对本工作的重要贡献。
免责声明
Science One 框架是实验性研究原型,并非生产就绪工具。
快速链接
其他相关文章
2026 年 7 月 22 日 SymptomAI:迈向面向日常症状评估的对话式 AI 智能体 * 综合科学 · * 健康与生物科学 · * 自然语言处理 · * 负责任 AI
2026 年 7 月 22 日 迈向能从自身错误中学习的量子计算机 * 机器智能 · * 量子
2026 年 7 月 15 日 迈向揭秘扩散模型的创造力 * 算法与理论 · * 生成式 AI · * 机器智能



