智能体 AI 系统在执行科学任务方面的能力正变得越来越强。然而,它们对生命科学研究者的有用程度,取决于它们处理真实研究复杂性的能力。真实研究工作很少表现为单一的事实回忆问题或一个清晰的预测问题。研究者需要解读不完整的证据、调和相互矛盾的结果、设计困难的实验、排除实验故障、评估转化风险,并在不确定的情况下决定下一步行动。
当前的基准测试并未完全捕捉到这些能力。许多生命科学领域的评估聚焦于狭窄的领域或孤立的技能,导致问题具有结构化的格式和清晰的参考答案。虽然这些评估有其价值,但它们往往无法真正衡量一个模型是否能在更广泛的研究级工作中做出贡献。
我们设计了 LifeSciBench 来帮助弥合这一差距。每一项任务都基于拥有博士级别训练、并在生物技术和制药环境中拥有推动药物发现项目直接经验的在职生命科学家的判断。
LifeSciBench 包含 750 个由专家撰写的任务,涵盖七个工作流程和七个生物学领域。
任务产物
科学家贡献者
评分标准
专家评审员
LifeSciBench 衡量什么
LifeSciBench 衡量的是 AI 系统能否支持现实的生命科学研究任务,而不仅仅是回答生物学问题。为了定义基准测试的分类体系,我们调查了在职生命科学家,了解他们在应用研究环境中最常使用的工作流程。然后,我们将他们的回答归纳为七个反复出现的类别:证据处理、分析、设计与优化、科学推理、验证与操作、转化,以及科学沟通。
每项任务的结构都类似于科学家可能向知识渊博的合作者提出的请求:科学提示词、任何相关的上下文或产物,以及一个自由回答的答案。由专家撰写的评分标准用于评估模型是否能针对特定问题给出正确答案,并且具备科学家所期望的详细程度、论证依据、注意事项和格式。
数据集构建
LifeSciBench 在评估科学推理能力的同时,也评估现实世界科学应用所需那些定义不那么明确、但至关重要的实践技能。其任务要求模型处理真实的研究问题:解读证据、做出基于领域的判断,并传达对专家评审者有用的结论。许多任务还要求模型处理不确定性,并基于支持性数据文件进行推理,而非仅依赖提示词文本。
该基准测试旨在反映生命科学工作的复杂性。总体而言,79% 的任务需要多个推理或决策步骤,平均每个任务包含四个步骤。LifeSciBench 包含 1062 个附件,涵盖图表、PDF、表格、序列文件、结构或化学文件以及网络参考资料。超过一半的任务(53%)要求模型解读或综合至少一个附件中的信息。
任务由 173 位来自不同生命科学学科的专家科学家创建。每位科学家均拥有博士级培训背景以及生物技术或制药行业经验。任务在验收前可根据需要经历任意次数的修订周期,无固定轮次上限;已验收的任务平均经历了六轮自主自动化审查周期,并至少完成了两轮专家评审。评审依据要么是可验证的正确答案,要么是强有力的专家共识,且相关领域评审者的一致同意率至少达到 90%。这一流程有助于确保已验收的任务具有科学依据、评分标准清晰,并能代表应用研究。
评分与评分细则分解
LifeSciBench 的任务采用详细的、针对具体任务的评分细则进行评分,该细则将预期回答分解为具体的科学论断、计算、决策、论证等。在整个基准测试中,由专家制定的评分细则共包含 19,020 条标准——平均每个任务 25 条——用于评估科学正确性以及对研究决策的有用性。
这种设计反映了科学工作在实际中是如何被评估的:许多生命科学任务无法仅通过检查最终答案来评分。一个回答可能得出正确的总体结论,但如果它忽略了某项关键实验的局限性,或者未能主动提及一个高度重要的生物学细节,仍可能被认为不完整。反之,一个部分回答即使没有完全解决问题,也可能包含高质量的推理过程。
细粒度的评分细则捕捉到了这种细微差别。LifeSciBench 不仅评估最终答案的准确性,还评估模型是否以科学上有效且操作上有用的方式得出其答案。
从论文、图表、表格和实验记录中提取、核对和审计科学证据。
评估示例
我们正在为 AAV9-microDys-X 准备一次 B 类 FDA 会议。这是一种基于 AAV9 的微型肌营养不良蛋白基因疗法,用于治疗杜氏肌营养不良症,该疗法从 MCK 启动子表达一个 138 kDa 的构建体。我们希望得到一个严苛的评审意见,即我们目前的申报材料是否真的支持基于微型肌营养不良蛋白表达(作为合理可能预测临床获益的替代终点)的加速批准。
研究背景:一项开放标签的 1b/2 期临床试验,纳入 12 名年龄在 4-7 岁、确诊为 DMD 且存在移码杆状结构域缺失的可行走男孩。申报材料包括:
- 治疗前股外侧肌活检:使用针对 N 端肌动蛋白结合结构域的 MANEX1A 抗体进行定量 Western blot 检测,结果显示肌营养不良蛋白水平为健康对照组的 0-3%。
- 治疗后 12 周对侧股外侧肌活检:通过相同的 Western blot 方法(经考马斯亮蓝染色归一化至总蛋白)检测,平均微型肌营养不良蛋白水平为健康对照组的 38%(范围 18-61%)。
- 治疗后免疫荧光:使用多克隆抗肌营养不良蛋白 C 端抗体,在 75-95% 的肌纤维中检测到肌膜信号。
- 48 周功能:与外部已发表的自然病史登记队列相比(未配对 t 检验 p = 0.03),平均 NSAA 评分较基线变化为 +1.4 分,而对照组为 -0.6 分。
- 安全性:12 名患者中有 8 名出现一过性转氨酶升高,通过类固醇逐渐减量方案得到控制;一例已痊愈的心肌炎;无死亡病例。
- 生物分布/持久性:AAV9 载体基因组在 12 周时仍可在肌肉中检测到,平均每个细胞核 2.3 个载体基因组。
- 入选标准:基线时无抗 AAV9 中和抗体(滴度 <1:400)且无外显子 44 缺失。
请逐项严格审查这份申报材料:FDA 或持怀疑态度的审评员会在哪些方面认为,现有证据不足以支持我们的结论?如果需要,还需要哪些额外的数据、分析或设计变更来弥补这些差距?对于未明确说明的内容,假设截至 2025 年 12 月 31 日,从其他临床级 138 kDa 微型肌营养不良蛋白项目及相关临床试验中已知的信息同样适用。
候选回复
结论:就目前提交的材料而言,其力度不足以支持将微型肌营养不良蛋白表达作为合理预测临床获益的替代终点来获得加速批准。持怀疑态度的 FDA 审评员很可能会认为,生物标志物、功能、持久性、安全性和普适性方面的证据均缺乏充分支持。
| 申报项目 | 关键缺陷 | 所需改进 |
|---|---|---|
| 蛋白质印迹定量 | MANEX1A 抗体结合的是内源性全长肌营养不良蛋白和微型肌营养不良蛋白转基因共有的 N 端表位,因此该检测无法清晰区分转基因蛋白与残留/回复突变肌营养不良蛋白。使用健康全长肌营养不良蛋白标准品来定量 138 kDa 的微型肌营养不良蛋白同样无效。 | 使用重组微型肌营养不良蛋白标准品,以及能够区分转基因蛋白与内源性肌营养不良蛋白的正交方法,例如靶向质谱法或转基因特异性/表位特异性检测法。 |
| 免疫荧光 | C 端多克隆抗体并不适用,因为 138 kDa 的构建体缺少 C 端结构域。许多 DMD 患者存在回复突变肌纤维,而回复突变肌营养不良蛋白可能保留 C 端表位。回复突变肌纤维可能随年龄增长发生克隆性扩增,从而使免疫荧光信号产生偏差,尤其是在年龄较大的男孩中。 | 使用针对转基因蛋白中存在但回复突变肌营养不良蛋白中缺失的表位的抗体重复进行免疫荧光检测。分别定量转基因阳性肌纤维和回复突变肌纤维。 |
| 替代终点有效性 | 该方案将蛋白质数量与临床功能混为一谈。“健康对照组蛋白质质量的38%”并不意味着正常肌营养不良蛋白功能的38%,因为微型肌营养不良蛋白在结构上是被截短的。 | 在将表达量作为替代终点之前,应通过实证验证微型肌营养不良蛋白质量百分比、肌膜定位、下游功能恢复与临床获益之间的关系。 |
| 活检设计 | 治疗前后的对侧股外侧肌活检引入了左右侧和肌肉内的空间变异性。疾病进展和纤维脂肪替代也会改变总蛋白归一化后的信号。 | 使用一致的解剖标志来标准化活检部位,归一化到肌肉特异性蛋白,并同时测量纤维脂肪成分。 |
| NSAA 比较/统计 | 外部自然病史队列并非随机同期对照。试验入组标准、支持性护理、参与效应、基线 NSAA 评分、类固醇方案、年龄和外显子类别都可能使比较产生偏差。非配对 t 检验是不够的。此外,+1.4 的 NSAA 变化处于该年龄组的重测变异性范围内。 | 进行随机同期安慰剂对照研究,或者至少使用校正基线 NSAA、年龄、类固醇方案、外显子类别及其他混杂因素的调整分析。 |
| 年龄窗口混杂 | 4-7 岁的男孩正处于一个发育窗口期,在此阶段,未经治疗的可步行 DMD 患者在病情恶化占主导之前可能会获得运动功能。48 周的 NSAA 变化混合了发育增益、疾病进展和可能的治疗效果。 | 使用带有年龄分层的同期随机对照,以将发育轨迹与治疗效果区分开来。 |
| 既往临床先例 | 开放标签的微型肌营养不良蛋白功能信号未能可靠地预测确证性获益;已发表的先例包括微型肌营养不良蛋白基因疗法的确证性试验未能重现开放标签的 NSAA 改善。 | 不要依赖开放标签的 NSAA 变化作为决定性支持证据。需要对照性的功能证据。 |
| 构建体的结构限制 | 这个 138 kDa 的构建体删除了含有 nNOS 结合位点的血影蛋白重复序列 R16/17。nNOS 募集功能的丧失会损害运动过程中的功能性交感神经舒缩调节和缺血保护,从而在表达水平之外,对功能恢复形成机制上的上限。 | 补充机制研究,以证明该特定构建体是否能恢复相关的抗肌萎缩蛋白相关复合体功能、nNOS 定位、运动生理学以及肌肉保护作用。 |
| AAV 持久性 | 12 周时的载体基因组并不能建立持久的表达。AAV9 基因组主要是非整合型附加体,可能随时间推移而减少。载体基因组的持久性并不等同于蛋白质表达的持久性。 | 测量 12 周以上的纵向转基因蛋白表达和功能性生物标志物的持久性。 |
| 免疫/安全性概况 | 12 名患者中有 8 名出现转氨酶升高,这与对 AAV 转导细胞的免疫反应一致,但其机制尚未明确。考虑到 AAV9 对心脏的趋向性,出现一例心肌炎病例令人担忧。 | 提供更深入的免疫监测、肝脏/心脏安全性表征,并加强心脏随访。 |
| 患者选择/普适性 | 排除抗 AAV9 中和抗体阳性患者限制了研究的普适性。排除外显子 44 缺失型患者则限制了该研究对该 DMD 亚组的适用性。n=12 的样本量太小,无法在更广泛的 DMD 人群中表征安全性和有效性。 | 在可能的情况下扩大入组标准,或在利用该结果支持广泛批准之前,预先设定按抗体状态、基因型/外显子类别、年龄和基线功能进行的分层分析。 |
监管结论:该数据包可能显示出生物学活性,但尚不能证明所测得的微型抗肌萎缩蛋白表达是一个可靠的、有合理可能预测临床获益的替代终点。主要差距在于检测特异性、无效的定量标准、可能的回复纤维干扰、缺乏随机对照、与年龄相关的 NSAA 评分混杂因素、持久性不确定,以及未解决的安全性和普适性问题。
为弥补这一差距,该方案需要采用受控的、按年龄分层的临床设计,并包含转基因特异性表达检测、正交蛋白质定量、组织成分对照、纵向耐久性数据、针对截短构建体的机制性功能检测,以及更强的安全性监测(尤其是肝脏和心脏方面)。
评分标准与等级
标准
分数
识别微肌营养不良蛋白定量中的检测/测量问题,包括 MANEX1A 表位共享、无效的全长肌营养不良蛋白标准品,以及对重组或正交转基因特异性测量的需求。
解释为何微肌营养不良蛋白表达水平不能自动成为功能性临床获益的有效替代指标。
指出活检部位、组织成分和年龄窗口的混杂因素会削弱对表达水平和 NSAA 结果的解读。
批评 NSAA 的对照/统计方法,尤其是依赖外部自然病史对照组。
涉及 AAV 的持久性、免疫反应、转氨酶升高、心肌炎,以及对更长期表达/安全性随访的需求。
指出患者选择/普适性方面的差距,包括抗 AAV9 抗体的排除标准、外显子 44 的排除标准以及样本量较小。
验证 LifeSciBench
我们通过独立的专家评审对 LifeSciBench 进行了验证。反馈来自 453 位未参与任务编写的评审员。其中,97% 的评审员拥有博士学位或同等博士学历,平均具有 12 年的领域经验和 14 篇经同行评审的出版物;88% 的评审员报告曾获得至少一项奖项或奖学金。
评审员对每项任务是否体现了优秀基准问题所需的特质进行评分:与现实研究工作的契合度、对科学推理和领域专业知识的恰当测试、基于证据或专家共识的程度,以及评估模型性能的整体实用性。每个类别的评分一致性均超过 96%。
现实相关性
该任务是否反映了现实世界中真实的生命科学研究工作?
强烈同意 90.4%
总体同意 98.3%
科学推理 / 领域技能
该任务是否测试并评估了正确的科学推理和生命科学领域技能?
强烈同意 86.4%
总体同意 98.1%
科学依据
这项任务是否具有科学依据、可回答性,并且建立在适当的证据、数据、人工制品或专家共识之上?
强烈同意 77.1%
总体同意 96.5%
总体实用性
总体而言,这是一项优秀的生命科学评估任务吗?
强烈同意 79.1%
总体同意 96.6%
评审意见进一步印证了量化评分:
“总体而言,这是一项优秀的任务,因为它有一个正确的核心解释,同时仍留有空间,通过答案对不确定性边界的严谨程度来区分更优的回答。”
“这是一个极佳的提示词……它整合了结构生物学、药物化学、受体药理学以及配体作用机制等多个要素。”
“它并非简单地测试模型能否回忆信息,而是测试模型能否根据当下呈现的证据进行推理。”
结果
我们报告了两个互补的指标。通过率是指模型在任务层面达到 70% 成功阈值的任务百分比。得分是平均评分奖励,即使整个任务未解决,也会对满足的单个标准给予部分分数。两者都很重要,因为对科学任务的回答可能部分正确或有用,但未必满足完整答案的所有要求。
模型性能因任务类型、工作流程和回答格式的不同而有显著差异。
AI 系统展现早期优势的领域
LifeSciBench 显示,前沿模型在涉及科学综合、沟通和结构化解释的任务上相对最强。绝对通过率仍然不高,因此这些基准领域远未饱和,但 GPT‑Rosalind 相比 GPT‑5.5 取得了有意义的进步,将整体精确通过率从 25.7% 提升至 36.1%。
模型能力进步最显著的方向出现在科学交流与转化领域。例如,科学交流的通过率从 GPT‑5.5 的 56.3% 提升至 GPT‑Rosalind 的 71.1%;该类别样本量较小(n=9),因此解读需谨慎,但这表明前沿模型在组织证据、生成令人信服的专家级解释方面的能力正在快速提升。转化(即药物研发中“从实验室到临床”的过程)也呈现出类似趋势,通过率从 GPT‑5.5 的 36.8% 升至 GPT‑Rosalind 的 57.7%,说明模型将临床前证据与临床意义相关联的能力正在迅速增强。
评分细则层面的结果也指向同一方向。在需要生成专家可用或可执行输出的任务上,GPT‑Rosalind 得分为 44.7%,而 GPT‑5.5 为 29.1%。在需要处理不确定性与注意事项的任务上,其得分为 44.8%,而 GPT‑5.5 为 29.3%。这一模式表明,当任务具有明确的证据边界并要求结构化的科学判断时,模型的表现最为出色。
在行业与学术专家认定的具有科学价值的任务中,GPT‑Rosalind 的性能处于领先地位。
在核心生命科学工作流中,GPT‑Rosalind 相较 GPT‑5.5 实现了性能提升,其中在转化与科学交流领域进步最为显著。
AI 系统仍存在的不足
在涉及大量人工制品、设计密集型以及受操作约束的科学工作中,性能仍然明显较弱。具体而言,“设计、优化与预测”仍是最困难的工作流之一,GPT‑Rosalind 的通过率仅为 30.7%;“分析”同样困难,通过率为 30.3%。
人工制品的使用是一个尤为明显的短板。尽管 GPT‑Rosalind 在涉及大量人工制品的场景中表现优于 GPT‑5.5,但其通过率仍从纯文本任务的 45.1% 下降至包含人工制品或 URL 的任务的 28.1%。GPT‑5.5 也呈现相同趋势,通过率从 29.9% 降至 21.9%。更详细的分析证实,前沿模型在从复杂图表或大型序列文件中提取信息,并将这些信息整合到最终答案中时仍存在困难。
当任务需要基于源材料进行推理或处理工件时,通过率会下降。
答案格式也很重要。需要精确序列、结构或构建级别输出的任务,其通过率较低:GPT‑Rosalind 在数值任务上仅达到 14.8%,在序列或结构输出任务上为 24.0%。构建生成任务同样脆弱,GPT‑Rosalind 的通过率为 27.3%,且相比 GPT‑5.5 提升甚微。这种差距部分可能源于精确答案任务更严格的评分标准——计算或格式上的微小差异都可能导致回答低于通过阈值。尽管如此,这些失败在科学上具有意义,因为许多生命科学工作流程需要足够精确、可直接使用的输出,例如在 CRISPR/HDR 供体设计或 siRNA 设计中。
模型也常常只能部分接近目标,而未能完全解决任务。在大约 14% 的任务中,模型尽管未能达到精确通过阈值,却获得了可观的评分标准分数。对于 GPT‑Rosalind,有 109 个任务的通过率低于 20%,但仍获得了至少 50% 的评分标准奖励。实际上,这意味着模型可能识别出相关证据或给出看似合理的部分答案,但仍因遗漏关键约束、使用错误证据、计算不完整,或未能将其推理与科学上有用的最终决策相连接而失败。
局限性与未来方向
LifeSciBench 是朝着衡量 AI 系统对生命科学研究的实用价值迈出的一步,但它不能替代在真实研究环境中研究模型。该基准侧重于反映行业常见工作流程的独立任务,同时将许多科学专业领域和任务类型排除在当前范围之外。真实的研究是迭代式的:科学家收集新证据、修正假设、设计后续实验,并根据结果调整计划。
因此,在 LifeSciBench 上表现强劲应被解读为具备现实任务级能力的证据,而非下游研究影响力的直接衡量指标。该基准测试立足于行业工作流程,但并未涵盖真实研究项目的全部多样性或动态性——在这些项目中,进展取决于随时间展开的多种因素。
下一步是将基准测试表现与实际研究工作流程中的部署研究联系起来。尽管 LifeSciBench 是与执业科学家共同开发的,但要衡量 AI 系统是否加速了科学发现或改善了研发成果,需要在真实研究环境中、在更长的时间跨度内、并经过多轮推理、反馈和实验跟进,来研究模型的使用情况与表现。
参与其中
助力塑造下一代生命科学 AI 基准测试,或申请访问 GPT-Rosalind。