# Science One Framework：通过 Chain-of-Evidence 实现可验证的自主科研框架

- 来源：Google Research：Blog（网页）
- 发布时间：2026-07-30 00:00
- AIHOT 分数：76
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsass3b802g4romzntw9ijll
- 原文链接：https://research.google/blog/science-one-framework-a-verifiable-autonomous-research-framework-via-chain-of-evidence

## 精选理由

对自主科研系统而言，可验证性从后置修补变为前置架构，提出的审计方法让生成论文的完整性有了可量化的衡量尺度。

## AI 摘要

Google Research 推出 Science One Framework，一个原生构建证据链的自主科研原型，旨在消除模型幻觉，并配套自动化评估协议 CoE Audit。

## 正文

介绍 Science One 框架——一个实验性研究原型，旨在通过原生构建可验证的证据链来消除模型幻觉，以及 CoE Audit——一套用于评估 AI 生成论文完整性的自动化协议。

快速链接

大语言模型（LLM）正越来越多地被部署为不仅仅是编码助手，而是能够执行端到端科学研究工作流的自主智能体。近期的一些系统（例如 Sakana 的 AI-Scientist、AutoResearchClaw、DeepScientist、AI-Researcher）能够审阅文献、提出假设、执行实验并撰写与人类作者论文水平相当的完整手稿。然而，随着这些 AI 生成手稿的表面质量不断提升，一个关键的结构性问题浮出水面：可验证性。由于当前自主研究流水线是迭代式生成文本的，任何阶段引入的错误都会被放大。一些现有系统会生成不存在的引用，所描述的方法与实际代码之间存在不一致，并且报告的实验分数无法仅凭所提供的代码完全复现。

在我们的论文中，我们通过引入 Chain-of-Evidence（CoE）来解决这一问题，这是一个面向 AI 驱动研究的新型可验证性框架。我们通过 Science One Framework 来实例化 CoE——这是一个原生构建并维护证据链的自主研究原型，同时还有 CoE Audit——一套自动化的评估指标，用于衡量 AI 生成论文与其底层代码和证据之间的一致性。我们的结果表明，基线系统最多会幻觉出 21% 的参考文献，并且经常出现代码与文本不一致的情况，而 Science One Framework 实现了零虚构引用和完全可验证的分数，同时在 MLE-Bench 和 Parameter-Golf 等前沿基准上达到了最先进的性能。

Chain-of-Evidence：一个面向可验证研究的框架

CoE 是一个概念性框架，用于定义什么使研究产物值得信赖，正如 ACID 定义了什么使数据库事务可靠一样。该框架并非规定如何构建研究智能体，而是规定了其输出必须具有的属性。它遵循一个包含两方面的单一原则：研究产物中的每一项主张都必须带有记录在案的证据链（完整性），并且每条证据链都必须真正支持其所附的主张（正确性）。一项主张可以是参考文献、报告的数字、方法描述或结论，它必须链接回相应的证据，例如同行评审的论文、实验日志行、实际运行的代码或结果表格。

幻觉引用指向一篇不存在的论文。不可复现的分数在重新运行代码时不会再次出现。描述错误的方法在论文中声称使用一种算法，而代码实现的却是另一种。每一项都是证据链断裂的主张；CoE 审计使这些断裂变得可衡量。

Science One 框架

为了证明可验证的 AI 研究在不牺牲问题解决性能的情况下是可能的，我们设计了 Science One 框架。与之前生成论文并试图追溯性地关联事实的智能体不同，Science One 框架通过三个主要模块从构造上实例化了 CoE 框架：

问题调查器（文献基础）：为防止幻觉引用，Science One 框架通过 Semantic Scholar API 构建引文图。它针对每个主题阅读最多 100 篇全文 PDF，以生成结构化的研究简报。最终论文中的每一条参考文献都源自这个有据可依的 API 调用，完全消除了对模型记忆的依赖。

发现引擎（并行探索-利用）：Science One 框架在多个并行分支中系统地探索和利用想法。在每个隔离的循环中，Solver 智能体实现一个解决方案，任务特定的评估器对其进行评分。表现优异的分支会被迭代优化，所有原始评估器输出都会被编入一个严格的、只读的记录中。

论文撰写与主张核验：在渲染手稿之前，Science One 框架会为每一个事实性主张构建结构化表示，并附上内联证据标签，将其绑定到特定的工作区产物上。专门的 Claim Verifier（主张核验器）会对照声明的来源逐一核验每一条主张。超出证据支撑范围的主张会与来源进行调和——以保守的方式重新表述而非删除，从而确保论文始终与工作实际支持的内容保持一致。

Science One 框架流水线。Problem Investigator（问题调查器）通过检索到的 PDF 对文献进行 grounding。Discovery（发现）模块负责探索和评估解决方案。论文撰写与核验模块负责撰写和核验论文，其中 Claim Verifier（主张核验器）确保所有主张与其证据来源相匹配。

CoE 审计：衡量可核验性

为了严格评估 Science One 框架原型与最先进的基线系统（例如 Sakana AI 的 AI Scientist v2、AutoResearchClaw、DeepScientist、AI-Researcher）的对比表现，我们开发了 CoE 审计。这一事后评估协议充当自动化的取证审查员，对生成的产物（论文、解决方案、代码和参考文献）执行四项严格的完整性检查：

分数核验：从论文中提取所报告的分数，并与对提交代码进行的完全独立重跑结果进行比较。

规范违规检查：检查解决方案代码，确保其确实解决了任务，而非利用评估指标的漏洞或读取 ground-truth 答案文件。

参考文献核验：将每一条参考文献条目与学术 API 进行交叉核对，以捕捉不存在的虚构引用。

方法与代码一致性：使用 LLM 评判器将论文的方法部分与代码进行并排比较，确保文本忠实描述了所实现的算法。

CoE 审计框架及其四项核心完整性检查的概览。

结果

我们将 CoE 审计应用于来自 Automated Design of Research Systems（ADRS）基准的五个系统优化任务（Prism、Cloudcast、EPLB、LLM-SQL 和事务调度）中生成的 75 篇论文。

Science One Framework 在可验证性方面显著优于现有基线。CoE Audit 对每个系统应用相同的独立协议，对照实时学术数据库逐一复核每条引用，在该协议下，Science One Framework 在全部四项完整性检查中均领先。其引用中没有一条是“幽灵引用”：每条都指向真实、可检索的论文，而基线的幻觉率最高达 21%，这是因为 Problem Investigator 会检索每条引用，而非凭记忆生成。它还实现了完美的分数验证和最高的方法-代码一致性。相比之下，基线系统经常描述复杂的算法（如“混合神经符号求解器”），但其提交的代码却是简单的确定性启发式方法。

五个系统的 CoE Audit 结果。

关键在于，实施严格的可验证性并未损害智能体的科学能力。Science One Framework 在全部五项 ADRS 任务上达到或超过了人类专家水平，并在其中两项任务（Cloudcast 和 EPLB）上取得了所有系统中的最佳总分。

五个 MLE-Bench 任务及 Parameter Golf 上的求解器性能对比。

为测试其泛化能力，我们在六个高度复杂的外部任务上部署了 Science One Framework：

MLE-Bench：在涵盖医学影像、细粒度识别和 3D 感知的五项高难度 Kaggle 竞赛中，Science One Framework 获得两枚金牌（包括在基线完全失败的 3D Object Detection 上取得获胜分数）和两枚银牌。

Parameter-Golf：我们在具有严格硬件和文件大小限制的实时 LLM 训练竞赛中测试了 Science One Framework。虽然基线系统未能生成有效提交，但 Science One Framework 成功遵守了所有约束，并取得了最先进的分数（截至 2026 年 4 月 27 日）。值得注意的是，Science One Framework 发现的是真正新颖的算法技术，而不仅仅是调整表面的超参数。

展望未来

随着自主研究系统不断扩展，以解决日益困难的科学问题，仅靠求解器质量本身已不足以形成差异化。真正将它们的产出区分开来的，是最终研究成果是否值得信赖。我们的研究结果表明，可验证性必须被当作一等架构约束来对待。通过在主张产生之时就构建证据链，而非事后试图重建依据，Science One 框架证明了 AI 智能体能够产出严谨、可信且极具竞争力的科学研究。我们希望 Chain-of-Evidence 框架及其审计机制，能够在我们继续构建下一代 AI 科学家的过程中，为社区提供有价值的工具。

致谢

我们要感谢 Bhavana Dalvi Mishra、Jiefeng Chen、Chun-Liang Li、Palash Goyal、Mihir Parmar、Yiwen Song、Yale Song、Raj Sinha、Parthasarathy Ranganathan、Burak Gokturk 和 Jinsung Yoon 对本工作的重要贡献。

免责声明

Science One 框架是实验性研究原型，并非生产就绪工具。

快速链接

其他相关文章

2026 年 7 月 22 日 SymptomAI：迈向面向日常症状评估的对话式 AI 智能体 * 综合科学 · * 健康与生物科学 · * 自然语言处理 · * 负责任 AI

2026 年 7 月 22 日 迈向能从自身错误中学习的量子计算机 * 机器智能 · * 量子

2026 年 7 月 15 日 迈向揭秘扩散模型的创造力 * 算法与理论 · * 生成式 AI · * 机器智能
