Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体

Hacker News 热门(buzzing.cc 中文翻译)·2026-08-28 20:04·29分钟前·matt_d
AI 导读

斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。

Hacker News 热门(buzzing.cc 中文翻译)
精选
72AI 编辑部评分,满分 100

Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体

2026-08-28 20:04· 29分钟前· matt_d
AI 导读

斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。

推荐理由

70 个专家任务里最强模型仅解决 30%,成本与 token 前沿还显示不同系统取舍,为选择科学智能体提供了比软件基准更接近真实研究的依据。

正文 · AI 翻译

Terminal-Bench-Science 0.1

Terminal-Bench-Science 在研究人员自身的工作流程上评估 AI 智能体。为 AI 的科学能力设定标准的,是科学家,而不是模型开发者或数据供应商。

Terminal-Bench-Science 是一项由斯坦福大学研究人员牵头、由 Terminal-Bench 团队构建的基准测试,并与来自全球多个科学学科和研究机构的领域专家合作完成。它通过一系列来自科学研究、由专家精心挑选的多样化挑战性工作流程,来衡量 AI 智能体的能力。

Terminal-Bench-Science 是一个持续演进的基准测试,与前沿 AI 同步发展,在科学需求与 AI 开发之间形成反馈循环。我们的首个版本包含来自生命科学、物理科学、地球科学、数学和工程科学的 70 项任务。目前评估过的最强模型 Claude Opus 5,在 Terminal-Bench-Science 0.1 上达到了 30% 的解决率。

Terminal-Bench-Science 0.1 排行榜

Terminal-Bench-ScienceTerminal-Bench-Science
Terminal-Bench-Science 0.1 上 70 项科学工作流程任务的解决率

概述

尽管 Terminal-Bench 推动了软件工程领域 AI 智能体的进步,Terminal-Bench-Science 则将同样的雄心带到了科学领域。我们的目标是推动具备科学能力的智能体发展,使其成为有用的研究助手。这些智能体应能执行技术要求高且耗时的流程,让科学家得以将更多时间投入到科学中人类判断最为关键的部分:定义研究问题、形成假设、解释和验证结果,以及传播研究发现。在这一角色中,AI 智能体可以拓展研究人员所能取得的成果,并帮助加速科学发现。

要实现这一目标,需要能够反映真实科学实践、提供可验证的能力证据,并随 AI 前沿同步演进的基准测试。

我们需要从真实科研工作流中提炼的基准。科学能力的评估应基于真实的研究实践,而非教科书式问题或标准化习题,并且要由一线科研人员亲自贡献。Terminal-Bench-Science 让各领域的科学家直接发声,为他们关心的课题提供一个共同平台,以此设定 AI 进步的标准。科学的利害关系太过重大,其基准必须反映科学界的优先事项,而非外部利益。

我们需要可验证的科学能力证据。没有可靠的评估,我们就无法判断智能体能力是否在提升,也无法知道其局限仍在哪里。Terminal-Bench-Science 在真实环境中评估智能体,并用可复现、任务特定的测试来为分析、模拟、证明、代码和数据产品等具体成果打分。

我们需要一个与前沿同步演进的基准。科学基准往往被当作一篇篇论文来发表,而非推动进步的工具。它们发布一次后就被弃置,而模型仍在不断进步,已知局限也依然存在。Terminal-Bench-Science 是一个持续更新的基准,与 AI 前沿共同演进。通过定期发布,科学家可以贡献新的工作流、改进现有任务,并在科学需求与 AI 发展之间建立反馈闭环。

媒体内容 · 前往原文查看

Terminal-Bench-Science 反馈闭环

Terminal-Bench-Science 反馈闭环

任务

Terminal-Bench-Science 0.1 包含 70 项任务,覆盖生命科学、物质科学、地球科学、数学和工程科学。任务涵盖科学数据分析、统计推断、模拟、优化、定理证明、图像重建、信号处理、反问题、传感器校准、模型拟合、分类以及科学机器学习。

媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 任务覆盖范围

覆盖五大科学领域的 70 项专家精选任务

任务由研究人员通过 GitHub 上的开放流程提交,并在 Discord 的 #tb-science 频道中进行讨论和反馈。贡献以提案形式开始,评审人员会讨论每个想法、留下反馈,并批准那些看起来非常契合的提案:即具有科学依据、值得纳入基准进行衡量工作流。获批的提案以拉取请求的形式实现,评审人员会确认每项任务均可客观验证、对 AI 智能体而言确实具有挑战性,并且不是当前前沿系统已经能轻松解决的问题。要合并代码,领域评审人员会评估科学有效性和真实性,技术评审人员会检查任务构建和验证方式,还有一位质量把关人进行最终质量检查。在 920 份提案中,有 464 份获批进入实现阶段,386 个拉取请求被创建,但最终只有 70 项任务进入了 Terminal-Bench-Science 0.1。这种筛选严格程度反映出,要创建既具有科学趣味性、对前沿智能体具有挑战性、又足够明确以支持严格评估的任务是多么困难。提案、拉取请求和评审的进展都在公开任务仪表板上持续跟踪。

Terminal-Bench-Science 0.1 贡献者

媒体内容 · 前往原文查看
从 920 份任务提案到 70 项最终入选 Terminal-Bench-Science 0.1
World map showing the geographic density of Terminal-Bench-Science proposal and implementation authors using public profile locations and affiliationsWorld map showing the geographic density of Terminal-Bench-Science proposal and implementation authors using public profile locations and affiliations
来自 22 个国家的 376 位贡献者参与了提案、评审或拉取请求

结果

Terminal-Bench-Science 0.1 表明,AI 智能体在科学研究领域仍有很大的进步空间。每个被评估的模型在全部 70 项任务上均独立运行了三轮试验。Claude Opus 5 搭配 Claude Code 的解决率最高,达到 30.0%,其次是 GPT-5.6 Sol 搭配 Codex,解决率为 22.4%,Claude Fable 5 搭配 Claude Code 为 21.4%。Claude Opus 4.8 以 10.5% 的解决率位居中游。GPT-5.6 Terra、Kimi K3 和 Grok 4.6 的解决率均低于 10%。GLM 5.3 是最强的开源模型,解决率为 8.1%,GPT-5.6 Luna 以 3.3% 的解决率垫底。

Terminal-Bench-Science 对系统的区分能力与 Terminal-Bench 3.0 大致相当,同时将每个在两个基准上均被评估的模型的解决率压低了超过 10 个百分点。这一差距是刻意设计的:在评审过程中,任务经过校准,旨在挑战最新的前沿模型。

媒体内容 · 前往原文查看

Terminal-Bench-Science 与 Terminal-Bench 对比

在 Terminal-Bench 2.1、Terminal-Bench 3.0 和 Terminal-Bench-Science 0.1 上的解决率

性能只是进步的一个维度。成本-解决率图展示了全部 70 个任务的总评估成本与解决率的关系。GPT-5.6 Luna、Kimi K3 和 GPT-5.6 Terra 位于前沿的低成本端。GPT-5.6 Sol 和 Claude Opus 5 以更高的成本达到了最高的解决率,其中 Opus 5 的成本为 $7.0k。GPT-5.6 Sol 以不到三分之一的成本($4.2k 对比 $14.2k)达到了与 Claude Fable 5 相当的性能。Token 使用量则呈现出不同的前沿。Claude Fable 5 在达到与 GPT-5.6 Sol 相当性能的同时,使用的 token 数量减少了约四分之一(6.4B 对比 8.4B)。Kimi K3 锚定了低 token 端,而 Claude Opus 5 则锚定了高解决率端。只有 Kimi K3 和 Claude Opus 5 同时出现在两条帕累托前沿上。

媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 成本与解决率

各评估系统的成本与解决率帕累托前沿
媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 Token 使用量与解决率

各评估系统的 token 使用量与解决率帕累托前沿

解决率也因科学领域而异。Anthropic 和 OpenAI 的模型在每个领域都占据了前两名,唯独工程科学除外——在该领域,Grok 4.6 以更低的成本和 token 使用量,与 GPT-5.6 Sol 并列第二(14.8%)。Claude Opus 5 在每个领域都领先于 GPT-5.6 Sol 和 Claude Fable 5,唯独数学科学除外——在该领域,Claude Fable 5(33.3%)和 GPT-5.6 Sol(31.4%)占据了前两名。按领域划分的完整细分数据可在排行榜上查看。

媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 按领域划分的解决率

  • Opus 5
  • GPT-5.6 Sol
  • Grok 4.6
各领域解决率:Opus 5、GPT-5.6 Sol 和 Grok 4.6

结论与路线图

Terminal-Bench-Science 0.1 是一项由生命科学、物理科学、地球科学、数学和工程科学领域的研究人员与 Terminal-Bench 和 Harbor 团队共同发起的社区项目。这是我们在开放环境中能够构建的最严格的科学智能体能力基准测试,而且我们才刚刚起步:Terminal-Bench-Science 0.1 是一个持续演进基准测试的首个版本。

定期发布的版本将不断添加任务,扩大五个科学领域的覆盖范围,淘汰智能体已饱和或评审发现定义不明确的任务,并随着新前沿模型的发布保持排行榜的时效性。每个版本都会根据当时的前沿模型进行校准。对于 Terminal-Bench-Science 0.1,校准基准是 Claude Opus 5 和 GPT-5.6 Sol,随着更强大模型的出现,我们将使用它们来评估和校准新的及改进后的任务。任务带有版本号,因此可以通过单条 Harbor 命令重复使用、重新评分或重新运行试验,这降低了更新结果的成本。进展在任务仪表板上公开跟踪,每个版本都会在 GitHub 和 Harbor Hub 上打上标签。

Terminal-Bench-Science 0.2 的工作已经在进行中,拉取请求截止日期为 2026 年 10 月 5 日。如果您是研究人员,拥有前沿智能体应该能够完成但尚无法完成的工作流程,我们希望将其纳入基准测试。贡献流程为:提议 → 构建 → 评审:通过任务提议表提交您的任务,按照贡献指南进行构建,然后任务将经过自动化检查、并行领域和技术评审,以及最终的质量把关审批后才能合并。

欢迎通过 Discord 上的 #tb-science 频道和 GitHub 加入这项工作,并通过项目日历参加我们的每周会议和答疑时间。让我们共同让科学家来定义 AI 中的科学能力应该是什么样子,并对其进行严格衡量。

引用

如果您觉得这项工作有用,请引用它。您可以使用 GitHub 上的“引用此仓库”按钮(由 CITATION.cff 生成),或使用以下信息手动引用。

@software{Terminal-Bench-Science_Team_Terminal-Bench-Science_Evaluating_AI_2026,
  author = {{Terminal-Bench-Science Team}},
  doi = {10.5281/zenodo.22110254},
  license = {Apache-2.0},
  month = aug,
  title = {{Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains}},
  url = {https://github.com/harbor-framework/terminal-bench-science},
  version = {v0.1.0},
  year = {2026}
}

致谢

感谢 Terminal-Bench-Science 背后所有的任务贡献者、评审者和顾问。

特别感谢我们的项目负责人顾问 Ludwig Schmidt 和 Sanmi Koyejo;我们的资深评审 Allen Hart、Ivan Bercovich、Joseph Janssen、Jiaming Hu、Steffen Bollmann 和 Sergey Aganezov;我们的人工智能研究顾问 Ryan Marten、Alex Shaw、Lin Shi、Benjamin Feuer、Mike A. Merrill、Alex Dimakis、Jenia Jitsev、Bodhisattwa Majumder、Peter Clark、Thomas Wolf、Braden Hancock 和 Andy Konwinski;以及我们的科学顾问 Sara Beery、Jo Dunkley、J. Nathan Kutz、Ching-Yao Lai、Scott Linderman、Emma Lundberg、Russ Poldrack、Aviv Regev 和 Risa Wechsler。

Terminal-Bench-Science 是一个由斯坦福大学和 Laude Institute 主办、与斯坦福人工智能实验室(SAIL)、斯坦福以人为中心人工智能研究所(HAI)、斯坦福人工智能测量科学(AIMS)、美国国家科学基金会机器学习基础人工智能研究所(IFML)、Allen Institute 以及艾伦人工智能研究所(Ai2)合作开展的开放学术合作项目。作为 Terminal-Bench 系列的一部分,它由 Terminal-Bench 和 Harbor 团队与科学贡献者社区共同构建。

我们感谢 Laude Institute 通过 Slingshots 项目提供的支持,感谢 Snorkel AI 通过 Open Benchmarks Grants 项目提供的支持,感谢 2077AI 开源基金会提供的用于支持任务审查和整理的 PP API 额度,以及 UniPat AI 和 Modal 对 Terminal-Bench-Science 的支持。我们感谢 Bespoke Labs、Anthropic、Google、Moonshot AI、SpaceXAI 和 Z.ai 提供的用于支持排行榜评估的 API 额度。

作者:Steven Dillmann

来源:Hacker News 热门(buzzing.cc 中文翻译)· terminal-bench-science.ai