OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
70AI 编辑部评分,满分 100

OpenAI 发布 GeneBench-Pro:计算生物学研究级基准测试

2026-06-30 08:00· 46天前
AI 导读

OpenAI 发布 GeneBench-Pro,用于评估 AI 智能体在计算生物学中处理模糊性和做出判断性分析的能力。该基准包含 129 个问题,覆盖统计遗传学、群体遗传学等 10 个领域 21 个子领域。每个问题提供真实混乱的数据集和实验背景,要求模型探索数据、选择分析路径并迭代实验。采用合成数据构建,已知完整因果结构。82 个问题已由外部领域专家审核确认其现实性。

推荐理由

OpenAI 的新基准揭示了一个信号,GPT-5.6 在需要科学判断的模糊任务上进步神速,从不足 5% 到接近 30%,且单题成本仅几美元,这对 AI for Science 的落地想象空间影响不小。

正文 · AI 翻译

一个研究级基准测试,用于衡量 AI 智能体如何在计算生物学中处理模糊性并做出关键性判断。

科学数据很少附带使用说明。研究人员必须判断一个模式反映的是生物学现象还是噪声,数据是否足以支撑所提出的问题,以及每个结果应如何改变他们接下来的行动。AI 智能体执行复杂分析的能力日益增强,但真正的科学研究不仅依赖于回忆事实或遵循预定义的工作流程,还依赖于做出这些更高层次的判断。

今天,我们推出 GeneBench-Pro——这是一个具有挑战性的研究级基准测试,用于测试模型能否处理现实世界计算生物学所需的、高度依赖判断的分析。它在 GeneBench 的基础上进行了扩展,涵盖了基因组学、定量生物学和转化医学中更困难、更现实的任务,捕捉了计算生物学科学研究的复杂性、迭代性和模糊性。

迄今为止,对于使现实世界计算研究变得困难的系统级判断能力,鲜有令人信服的评估。这些能力包括处理模糊性、修正假设、选择正确的分析路径,以及判断结果何时可用于决策。由于这些技能难以形式化,因此也难以进行严格评估,即便这些方面的弱点正日益成为制约 AI 整体性能的瓶颈。

GeneBench-Pro 旨在精确衡量这些更高层次的能力。在 GeneBench-Pro 中,我们将“研究品味”定义为塑造分析过程的判断链:数据能支持哪些问题,早期诊断应如何改变模型或估计目标,以及初始计划何时需要修订。每个 GeneBench-Pro 问题都会给模型提供一个真实且杂乱的数据集、简短的实验背景,以及一个与下游决策相关的目标估计量。要正确回答,模型必须探索数据、选择合适的分析方法、进行迭代实验过程,并给出最终答案。

数据集构建

在生物学领域,数据生成(例如基因组测序)的成本已大幅下降,一些研究人员现在认为,限制因素不再是样本采集,而是下游的计算与分析。GeneBench-Pro 旨在评估解决这一瓶颈方面的进展,包含 129 个问题,涵盖了计算生物学领域广泛的方法与场景。

领域图谱:涵盖 10 个领域、21 个子领域的 129 个问题

统计遗传学 n=17

群体遗传学 n=21

数量遗传学 n=17

调控组学 n=17

功能基因组学 n=9

蛋白质组学 n=7

临床、药物基因组学与诊断 n=26

癌症基因组学 n=10

微生物基因组学 n=3

法医遗传学 n=2

6 关联与校正

6 因果映射

2 遗传力与遗传结构

3 系谱、IBD 与定相

7 选择与突变

6 混合与古 DNA

8 历史与谱系

6 性状结构与方差

6 家庭、社会与传递效应

5 多基因预测与基因组选择

8 调控 QTL 与 ASE

5 转录组结构

4 空间与染色质背景

9 功能基因组学

7 蛋白质组学与生物标志物

11 临床变异解读与外显率

8 药物基因组学与治疗反应

7 产前、生殖与临床风险遗传学

10 癌症体细胞基因组学与液体活检

3 微生物与宏基因组学

2 法医遗传学

该图谱展示了 GeneBench-Pro 的广度。请访问案例研究页面,深入了解 10 个具有代表性的问题。

GeneBench-Pro 的设计也旨在避免常见的基准测试缺陷。许多长周期生物学基准测试会围绕杂乱的历史数据集构建多步骤问题,这类问题可能不存在唯一正确的分析路径。一个智能体可能选择某个合理的阈值,而另一个智能体可能选择另一个同样合理的选项,这反映的更多是基准测试创建者的主观选择,而非模型性能的根本差异。反之亦然:如果一个问题在数值上不够敏感,智能体可能在分析中犯下根本性错误,却仍能得出一个及格的结果。

为了避免这些失败模式,GeneBench-Pro 的每个问题都是合成构建的:我们了解完整的因果结构,并直接模拟数据生成过程。这使我们能够调整每个问题的复杂度,确保主观分析选择上的合理差异仍能产生可接受的数值结果,并通过消融研究验证看似合理但错误的分析会失败。随后,我们通过详细的轨迹分析来审计问题草稿,以检查信息泄露和意外的解题路径。这让我们确信,得出正确答案取决于选择正确的分析路径,而非利用捷径或迎合某个任意的作者偏好。

我们将 129 道 GeneBench-Pro 问题中的 82 道发送给了外部领域专家,包括研究生、博士后研究员、产业界科学家和教授。评审人员评估了每个问题的真实性、目标答案是否可识别,以及方法和估计量是否恰当。我们根据反馈意见对问题进行了改进。

“我评审的那些问题,对于一名研究生来说,如果没有经验丰富的导师反复反馈,是很难完成的。数据中包含技术和质量控制方面的问题,需要深思熟虑且具有反思性的数据分析,并意识到潜在的陷阱才能成功完成;这绝不仅仅是把现成的方法套用到干净且整理好的数据上那么简单。”

亚历山大·斯特鲁德威克·杨,加州大学洛杉矶分校人类遗传学助理教授

“即使当前的模型还无法可靠地从头到尾独立完成分析,那些在 GeneBench-Pro 问题上表现良好的模型,显然也能够帮助研究人员确定正确的工作流程并探索数据。我认为这将极大地提升研究的进度、严谨性和可复现性。”

詹妮弗·格伦德曼,加州大学洛杉矶分校人类遗传学博士生

评估与评分

GeneBench-Pro 中的每个问题都是一项独立的科学分析。智能体可以访问一个隔离的工作空间,其中包含简短的提示词、数据文件以及标准的生物信息学工具栈,包括 Python、科学计算库和 PLINK 2.0 等基础基因组学软件包(尽管这些问题并不需要特定领域的工具)。

结构变异引导的肿瘤治疗获益-风险决策

一个分子肿瘤委员会登记册收录了考虑使用 TXR1 靶向抑制剂治疗的、符合临床试验条件的晚期实体瘤病例。评估在初始时刻存在由结构变异驱动的 TXR1 靶点介导激活的肿瘤中,TXR1i 相较于非 TXR1 全身性治疗对第 16 周临床获益的边际效应,假设所有患者均完成了可评估的第 16 周访视。同时,在同一目标人群中评估 TXR1i 治疗下第 8 周的限制性毒性/停药风险。报告净临床效用 = 获益风险差(百分点)- 0.35 * 毒性风险(百分点),若 TXR1i 具有正净效用则选择 therapy_class_code 为 1,否则为 0。

所有非代码量均使用百分点单位。正获益意味着 TXR1i 相对于非 TXR1 全身性治疗提高了第 16 周的临床获益。

这些数据来自真实实验;你的评分不仅基于数值正确性,还取决于你展现的分析推理质量;不要试图走任何捷径。

将你的最终答案精确地返回为一个 JSON 对象。

不要用 Markdown 包裹该 JSON。

不要在 JSON 前后添加任何文字说明。

不要省略示例中显示的任何键。

在最终答案中返回该 JSON 对象:

JSON

1{2 "answer": {3 "therapy_class_code": <int>,4 "benefit_rd_pp": <float>,5 "toxicity_dropout_risk_pp": <float>,6 "net_clinical_utility_pp": <float>7 },8 "reasoning": "<method and QC description>"9}

由于我们控制了完整的数据生成过程,我们可以根据已知目标确定性地评判正确性,从而避免了标准评分标准评估中存在的模型选择变异性和冗长效应。

每个问题还附带丰富的元数据,包括预期的分析结构、附加的数据文件、详细的多页案例研究以及专家评审结果。我们正在 Hugging Face 上完全开源 10 个具有代表性的 GeneBench-Pro 问题,并提供一个交互式网页界面供浏览。最后,我们将在近期向 Artificial Analysis 提供一个包含 50 个问题的子集,用于独立的第三方基准测试。

结果

我们最强的模型 GPT‑5.6 Sol 在最高推理层级下达到了 28.7% 的通过率(启用 Pro 模式后为 31.5%)。这相比我们最初构建 GeneBench 时有了大幅提升;当时,我们最好的前沿模型 GPT‑5 得分低于 5%。该基准测试上的进展表明,即使在较难量化的系统级科学推理方面,前沿模型也在快速进步。按照目前的速度,该基准测试可能在今年年底前达到饱和。

结果还显示了扩展测试时计算量的影响。在最低推理层级下,GPT‑5.6 Sol 的通过率仅为个位数。而在最高推理层级下,GPT‑5.6 Sol 解决的问题数量几乎是 GPT‑5.2 的六倍,同时使用的模型 token 数量约为其三分之二。

跨模型族的比较表明,在定量不确定性条件下进行高级科学推理时,GPT 模型属于最强系统之列。GPT‑5.6、GPT‑5.5 与智谱 GLM 5.2 等领先开源模型之间的性能差距,远大于我们根据编码基准测试进行外推时的预期,这表明开源模型更专注于编码能力,而非更广泛的推理能力。

我们在开发过程中使用了前沿 GPT 模型来评估和强化问题。因此,我们怀疑 GeneBench-Pro 可能相对于其他模型族对 GPT 模型存在偏差。然而,竞品模型最多也只能与相应 GPT 模型在发布时的性能持平,并且往往差距显著。

这些评估结果——在 GPT‑5.6 Sol (Pro) 上高达 31.5%——考虑到 GeneBench-Pro 问题的难度,令人瞩目。在一项调查中,我们的评审员估计,一个典型的 GeneBench-Pro 问题需要人类专家大约 20–40 小时才能完成。按保守的每小时 200 美元计算,单个问题的人力成本就高达数千美元。当前的 AI 智能体仍然过于不可靠,无法取代人类专家,但成本差距巨大,每个问题的推理成本仅为几美元。这意味着,即便在当前能力下实现部分自动化,也能创造可观的经济和科学价值。

“这些基准测试的动机来自多种多样的生物学问题,但……真正的挑战在于对这些发现进行探索性数据分析和推理:识别模式和异常,并判断数据是否应被排除或调整。这类似于真实生物数据集的杂乱特性。审视这些评估,突显了清晰的求解器合约对于基于智能体的科学问题求解有多么重要。不同的提示词措辞或任务规范会极大地影响哪些分析被视为允许。”

纽约基因组中心博士后研究员 Cyrillus Tan

“我(总体上)喜欢这些问题。它们往往混合了以下几类:(1) 所需的学科知识,例如古 DNA 中的 C>T 偏差,(2) 数据不一致,例如祖先交换,(3) 对适合该任务的正确分析工具及其实现方法的知识。看起来大多数智能体在 (2) 上失败了。它们对数据问题不够谨慎。这或许凸显了当前模型的弱点。而且很多生物学数据都存在不规则性。”

Gencove 数据科学总监 Lex Flagel

“这些基准测试的动机源于一系列多样化的生物学问题,但……真正的挑战来自于对这些发现的探索性数据分析和推理:识别模式和异常,并判断数据是否应被排除或调整。这类似于真实生物数据集的杂乱特性。审视这些评估凸显出,清晰的求解器约定对于基于智能体的科学问题求解至关重要。不同的提示词措辞或任务规范会极大地影响哪些分析被视为允许。”

纽约基因组中心博士后研究员 Cyrillus Tan

“我总体上喜欢(这些问题)。它们往往混合了以下几种类型:(1)需要学科知识,例如古DNA中的C>T偏向性;(2)数据不一致性,例如祖先互换;(3)对正确分析工具及其实现方法的知识。看起来大多数智能体在(2)上失败了。它们对数据问题不够谨慎。这或许凸显了当前模型的一个弱点。而且许多生物学数据都存在不规则性。”

Gencove 数据科学总监 Lex Flagel

尽管如此,前沿模型仍只能解决不到三分之一的问题,这一事实表明存在巨大的改进空间。模型可以在具有挑战性的问题上取得部分进展,但它们难以完成推理闭环。这种失败模式反映了人类专家与新手之间的差异。专家利用自身经验来框定问题并调整方法,而新手虽然能做出观察,却难以将其整合到问题的更广泛背景中。

问题:时变治疗下的药物基因组学时间-事件响应

治疗启动、基因型特异性响应、延迟药效动力学、普遍使用者标志和纵向生物标志物共同决定了因果生存估计量。

GPT-5.5 模式

使用传统的 Cox 结果模型处理治疗时机,但未解决治疗-混杂因子反馈问题。

拟合一个计数过程 Cox 模型,将治疗作为时变暴露变量,仅在 treat_start+90 天后生效……该模型包含 G、治疗×G、基线严重程度、年龄和性别。

GPT-5.6 Sol 模式

采用更恰当的因果推断方法,以正确考虑治疗-混杂因子反馈。

使用新用户边际结构 Cox 模型:排除 818 名被标记的 prevalent 用户,利用基线协变量和当前生物标志物以稳定化逆概率权重对治疗起始进行建模,并将暴露变量视为具有 90 天疗效滞后的时变变量。

要实现近乎完美的性能,需要既能可靠衡量进展、又能识别模型仍存在不足的评估方法。像 GeneBench-Pro 这样的基准测试,有助于将模糊的能力缺陷转化为可诊断和可改进的具体问题。

如果智能体能够可靠地自动化这类分析,它们将能显著加速科学发现。人类遗传学证据在靶点优先排序和转化医学跟进中已处于核心地位,因为具有遗传学支持的机制更有可能最终转化为获批疗法。

与此同时,测序成本已大幅下降,生物库规模的数据集如今以前所未有的广度将分子、表型和健康记录信息关联起来。制约因素正从数据生成转向如何将这些信息转化为可操作的洞见。能够持续执行目前由人类专家团队完成的分析任务的模型,有望通过加速假设筛选、靶点跟进以及数据生成与决策之间的迭代循环,从而变革工业研究。

GeneBench-Pro 是评估经验丰富者所具备的良好科学判断中涉及的那些更抽象技能的一项初步尝试。这些技能使他们能够凭直觉识别出最有前景的初步分析,在数据与初始假设相悖时进行迭代和修正思考,并得出可能影响后续临床、学术或商业决策的结论。

我们预计,随着模型能力的提升,那些在更高抽象层次上探测模型能力的评测基准将变得愈发有用,其价值将超越仅仅测试书本知识或执行常规分析能力的基准。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com

OpenAI 发布 GeneBench-Pro:计算生物学研究级基准测试

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-06-30 08:00·46天前
AI 导读

OpenAI 发布 GeneBench-Pro,用于评估 AI 智能体在计算生物学中处理模糊性和做出判断性分析的能力。该基准包含 129 个问题,覆盖统计遗传学、群体遗传学等 10 个领域 21 个子领域。每个问题提供真实混乱的数据集和实验背景,要求模型探索数据、选择分析路径并迭代实验。采用合成数据构建,已知完整因果结构。82 个问题已由外部领域专家审核确认其现实性。

正文 · AI 翻译

一个研究级基准测试,用于衡量 AI 智能体如何在计算生物学中处理模糊性并做出关键性判断。

科学数据很少附带使用说明。研究人员必须判断一个模式反映的是生物学现象还是噪声,数据是否足以支撑所提出的问题,以及每个结果应如何改变他们接下来的行动。AI 智能体执行复杂分析的能力日益增强,但真正的科学研究不仅依赖于回忆事实或遵循预定义的工作流程,还依赖于做出这些更高层次的判断。

今天,我们推出 GeneBench-Pro——这是一个具有挑战性的研究级基准测试,用于测试模型能否处理现实世界计算生物学所需的、高度依赖判断的分析。它在 GeneBench 的基础上进行了扩展,涵盖了基因组学、定量生物学和转化医学中更困难、更现实的任务,捕捉了计算生物学科学研究的复杂性、迭代性和模糊性。

迄今为止,对于使现实世界计算研究变得困难的系统级判断能力,鲜有令人信服的评估。这些能力包括处理模糊性、修正假设、选择正确的分析路径,以及判断结果何时可用于决策。由于这些技能难以形式化,因此也难以进行严格评估,即便这些方面的弱点正日益成为制约 AI 整体性能的瓶颈。

GeneBench-Pro 旨在精确衡量这些更高层次的能力。在 GeneBench-Pro 中,我们将“研究品味”定义为塑造分析过程的判断链:数据能支持哪些问题,早期诊断应如何改变模型或估计目标,以及初始计划何时需要修订。每个 GeneBench-Pro 问题都会给模型提供一个真实且杂乱的数据集、简短的实验背景,以及一个与下游决策相关的目标估计量。要正确回答,模型必须探索数据、选择合适的分析方法、进行迭代实验过程,并给出最终答案。

数据集构建

在生物学领域,数据生成(例如基因组测序)的成本已大幅下降,一些研究人员现在认为,限制因素不再是样本采集,而是下游的计算与分析。GeneBench-Pro 旨在评估解决这一瓶颈方面的进展,包含 129 个问题,涵盖了计算生物学领域广泛的方法与场景。

领域图谱:涵盖 10 个领域、21 个子领域的 129 个问题

统计遗传学 n=17

群体遗传学 n=21

数量遗传学 n=17

调控组学 n=17

功能基因组学 n=9

蛋白质组学 n=7

临床、药物基因组学与诊断 n=26

癌症基因组学 n=10

微生物基因组学 n=3

法医遗传学 n=2

6 关联与校正

6 因果映射

2 遗传力与遗传结构

3 系谱、IBD 与定相

7 选择与突变

6 混合与古 DNA

8 历史与谱系

6 性状结构与方差

6 家庭、社会与传递效应

5 多基因预测与基因组选择

8 调控 QTL 与 ASE

5 转录组结构

4 空间与染色质背景

9 功能基因组学

7 蛋白质组学与生物标志物

11 临床变异解读与外显率

8 药物基因组学与治疗反应

7 产前、生殖与临床风险遗传学

10 癌症体细胞基因组学与液体活检

3 微生物与宏基因组学

2 法医遗传学

该图谱展示了 GeneBench-Pro 的广度。请访问案例研究页面,深入了解 10 个具有代表性的问题。

GeneBench-Pro 的设计也旨在避免常见的基准测试缺陷。许多长周期生物学基准测试会围绕杂乱的历史数据集构建多步骤问题,这类问题可能不存在唯一正确的分析路径。一个智能体可能选择某个合理的阈值,而另一个智能体可能选择另一个同样合理的选项,这反映的更多是基准测试创建者的主观选择,而非模型性能的根本差异。反之亦然:如果一个问题在数值上不够敏感,智能体可能在分析中犯下根本性错误,却仍能得出一个及格的结果。

为了避免这些失败模式,GeneBench-Pro 的每个问题都是合成构建的:我们了解完整的因果结构,并直接模拟数据生成过程。这使我们能够调整每个问题的复杂度,确保主观分析选择上的合理差异仍能产生可接受的数值结果,并通过消融研究验证看似合理但错误的分析会失败。随后,我们通过详细的轨迹分析来审计问题草稿,以检查信息泄露和意外的解题路径。这让我们确信,得出正确答案取决于选择正确的分析路径,而非利用捷径或迎合某个任意的作者偏好。

我们将 129 道 GeneBench-Pro 问题中的 82 道发送给了外部领域专家,包括研究生、博士后研究员、产业界科学家和教授。评审人员评估了每个问题的真实性、目标答案是否可识别,以及方法和估计量是否恰当。我们根据反馈意见对问题进行了改进。

“我评审的那些问题,对于一名研究生来说,如果没有经验丰富的导师反复反馈,是很难完成的。数据中包含技术和质量控制方面的问题,需要深思熟虑且具有反思性的数据分析,并意识到潜在的陷阱才能成功完成;这绝不仅仅是把现成的方法套用到干净且整理好的数据上那么简单。”

亚历山大·斯特鲁德威克·杨,加州大学洛杉矶分校人类遗传学助理教授

“即使当前的模型还无法可靠地从头到尾独立完成分析,那些在 GeneBench-Pro 问题上表现良好的模型,显然也能够帮助研究人员确定正确的工作流程并探索数据。我认为这将极大地提升研究的进度、严谨性和可复现性。”

詹妮弗·格伦德曼,加州大学洛杉矶分校人类遗传学博士生

评估与评分

GeneBench-Pro 中的每个问题都是一项独立的科学分析。智能体可以访问一个隔离的工作空间,其中包含简短的提示词、数据文件以及标准的生物信息学工具栈,包括 Python、科学计算库和 PLINK 2.0 等基础基因组学软件包(尽管这些问题并不需要特定领域的工具)。

结构变异引导的肿瘤治疗获益-风险决策

一个分子肿瘤委员会登记册收录了考虑使用 TXR1 靶向抑制剂治疗的、符合临床试验条件的晚期实体瘤病例。评估在初始时刻存在由结构变异驱动的 TXR1 靶点介导激活的肿瘤中,TXR1i 相较于非 TXR1 全身性治疗对第 16 周临床获益的边际效应,假设所有患者均完成了可评估的第 16 周访视。同时,在同一目标人群中评估 TXR1i 治疗下第 8 周的限制性毒性/停药风险。报告净临床效用 = 获益风险差(百分点)- 0.35 * 毒性风险(百分点),若 TXR1i 具有正净效用则选择 therapy_class_code 为 1,否则为 0。

所有非代码量均使用百分点单位。正获益意味着 TXR1i 相对于非 TXR1 全身性治疗提高了第 16 周的临床获益。

这些数据来自真实实验;你的评分不仅基于数值正确性,还取决于你展现的分析推理质量;不要试图走任何捷径。

将你的最终答案精确地返回为一个 JSON 对象。

不要用 Markdown 包裹该 JSON。

不要在 JSON 前后添加任何文字说明。

不要省略示例中显示的任何键。

在最终答案中返回该 JSON 对象:

JSON

1{2 "answer": {3 "therapy_class_code": <int>,4 "benefit_rd_pp": <float>,5 "toxicity_dropout_risk_pp": <float>,6 "net_clinical_utility_pp": <float>7 },8 "reasoning": "<method and QC description>"9}

由于我们控制了完整的数据生成过程,我们可以根据已知目标确定性地评判正确性,从而避免了标准评分标准评估中存在的模型选择变异性和冗长效应。

每个问题还附带丰富的元数据,包括预期的分析结构、附加的数据文件、详细的多页案例研究以及专家评审结果。我们正在 Hugging Face 上完全开源 10 个具有代表性的 GeneBench-Pro 问题,并提供一个交互式网页界面供浏览。最后,我们将在近期向 Artificial Analysis 提供一个包含 50 个问题的子集,用于独立的第三方基准测试。

结果

我们最强的模型 GPT‑5.6 Sol 在最高推理层级下达到了 28.7% 的通过率(启用 Pro 模式后为 31.5%)。这相比我们最初构建 GeneBench 时有了大幅提升;当时,我们最好的前沿模型 GPT‑5 得分低于 5%。该基准测试上的进展表明,即使在较难量化的系统级科学推理方面,前沿模型也在快速进步。按照目前的速度,该基准测试可能在今年年底前达到饱和。

结果还显示了扩展测试时计算量的影响。在最低推理层级下,GPT‑5.6 Sol 的通过率仅为个位数。而在最高推理层级下,GPT‑5.6 Sol 解决的问题数量几乎是 GPT‑5.2 的六倍,同时使用的模型 token 数量约为其三分之二。

跨模型族的比较表明,在定量不确定性条件下进行高级科学推理时,GPT 模型属于最强系统之列。GPT‑5.6、GPT‑5.5 与智谱 GLM 5.2 等领先开源模型之间的性能差距,远大于我们根据编码基准测试进行外推时的预期,这表明开源模型更专注于编码能力,而非更广泛的推理能力。

我们在开发过程中使用了前沿 GPT 模型来评估和强化问题。因此,我们怀疑 GeneBench-Pro 可能相对于其他模型族对 GPT 模型存在偏差。然而,竞品模型最多也只能与相应 GPT 模型在发布时的性能持平,并且往往差距显著。

这些评估结果——在 GPT‑5.6 Sol (Pro) 上高达 31.5%——考虑到 GeneBench-Pro 问题的难度,令人瞩目。在一项调查中,我们的评审员估计,一个典型的 GeneBench-Pro 问题需要人类专家大约 20–40 小时才能完成。按保守的每小时 200 美元计算,单个问题的人力成本就高达数千美元。当前的 AI 智能体仍然过于不可靠,无法取代人类专家,但成本差距巨大,每个问题的推理成本仅为几美元。这意味着,即便在当前能力下实现部分自动化,也能创造可观的经济和科学价值。

“这些基准测试的动机来自多种多样的生物学问题,但……真正的挑战在于对这些发现进行探索性数据分析和推理:识别模式和异常,并判断数据是否应被排除或调整。这类似于真实生物数据集的杂乱特性。审视这些评估,突显了清晰的求解器合约对于基于智能体的科学问题求解有多么重要。不同的提示词措辞或任务规范会极大地影响哪些分析被视为允许。”

纽约基因组中心博士后研究员 Cyrillus Tan

“我(总体上)喜欢这些问题。它们往往混合了以下几类:(1) 所需的学科知识,例如古 DNA 中的 C>T 偏差,(2) 数据不一致,例如祖先交换,(3) 对适合该任务的正确分析工具及其实现方法的知识。看起来大多数智能体在 (2) 上失败了。它们对数据问题不够谨慎。这或许凸显了当前模型的弱点。而且很多生物学数据都存在不规则性。”

Gencove 数据科学总监 Lex Flagel

“这些基准测试的动机源于一系列多样化的生物学问题,但……真正的挑战来自于对这些发现的探索性数据分析和推理:识别模式和异常,并判断数据是否应被排除或调整。这类似于真实生物数据集的杂乱特性。审视这些评估凸显出,清晰的求解器约定对于基于智能体的科学问题求解至关重要。不同的提示词措辞或任务规范会极大地影响哪些分析被视为允许。”

纽约基因组中心博士后研究员 Cyrillus Tan

“我总体上喜欢(这些问题)。它们往往混合了以下几种类型:(1)需要学科知识,例如古DNA中的C>T偏向性;(2)数据不一致性,例如祖先互换;(3)对正确分析工具及其实现方法的知识。看起来大多数智能体在(2)上失败了。它们对数据问题不够谨慎。这或许凸显了当前模型的一个弱点。而且许多生物学数据都存在不规则性。”

Gencove 数据科学总监 Lex Flagel

尽管如此,前沿模型仍只能解决不到三分之一的问题,这一事实表明存在巨大的改进空间。模型可以在具有挑战性的问题上取得部分进展,但它们难以完成推理闭环。这种失败模式反映了人类专家与新手之间的差异。专家利用自身经验来框定问题并调整方法,而新手虽然能做出观察,却难以将其整合到问题的更广泛背景中。

问题:时变治疗下的药物基因组学时间-事件响应

治疗启动、基因型特异性响应、延迟药效动力学、普遍使用者标志和纵向生物标志物共同决定了因果生存估计量。

GPT-5.5 模式

使用传统的 Cox 结果模型处理治疗时机,但未解决治疗-混杂因子反馈问题。

拟合一个计数过程 Cox 模型,将治疗作为时变暴露变量,仅在 treat_start+90 天后生效……该模型包含 G、治疗×G、基线严重程度、年龄和性别。

GPT-5.6 Sol 模式

采用更恰当的因果推断方法,以正确考虑治疗-混杂因子反馈。

使用新用户边际结构 Cox 模型:排除 818 名被标记的 prevalent 用户,利用基线协变量和当前生物标志物以稳定化逆概率权重对治疗起始进行建模,并将暴露变量视为具有 90 天疗效滞后的时变变量。

要实现近乎完美的性能,需要既能可靠衡量进展、又能识别模型仍存在不足的评估方法。像 GeneBench-Pro 这样的基准测试,有助于将模糊的能力缺陷转化为可诊断和可改进的具体问题。

如果智能体能够可靠地自动化这类分析,它们将能显著加速科学发现。人类遗传学证据在靶点优先排序和转化医学跟进中已处于核心地位,因为具有遗传学支持的机制更有可能最终转化为获批疗法。

与此同时,测序成本已大幅下降,生物库规模的数据集如今以前所未有的广度将分子、表型和健康记录信息关联起来。制约因素正从数据生成转向如何将这些信息转化为可操作的洞见。能够持续执行目前由人类专家团队完成的分析任务的模型,有望通过加速假设筛选、靶点跟进以及数据生成与决策之间的迭代循环,从而变革工业研究。

GeneBench-Pro 是评估经验丰富者所具备的良好科学判断中涉及的那些更抽象技能的一项初步尝试。这些技能使他们能够凭直觉识别出最有前景的初步分析,在数据与初始假设相悖时进行迭代和修正思考,并得出可能影响后续临床、学术或商业决策的结论。

我们预计,随着模型能力的提升,那些在更高抽象层次上探测模型能力的评测基准将变得愈发有用,其价值将超越仅仅测试书本知识或执行常规分析能力的基准。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例)· openai.com