OpenAI:官网动态(RSS · 排除企业/客户案例)
精选
72AI 编辑部评分,满分 100

OpenAI与哈佛等合作研究:o3 Deep Research模型辅助诊断儿童罕见病,额外诊断率4.8%

2026-06-18 16:00· 45天前
跳到正文
精选理由

这是AI辅助罕见病诊断的严肃实证,4.8%的新诊断率在专家反复分析过的病例里相当扎实。虽然离临床落地还很远,但证明推理模型能帮专家从旧数据里挖出新线索。

AI 摘要

波士顿儿童医院、哈佛大学与OpenAI合作,在《NEJM AI》发表研究。团队使用OpenAI o3 Deep Research推理模型重新分析376例此前未确诊的罕见病案例,产出基于证据的候选解释。经专家评审、额外检测和临床确认,医生在18例中建立诊断,额外诊断率达4.8%。研究显示,AI辅助工作流可帮助专家在未解病例中生成可检验假设,使定期再分析更具可扩展性。模型不直接诊断或做临床决策,仅提供证据链供专家审查。

正文 · AI 翻译

在《新英格兰医学杂志 AI》的一项研究中,专家使用 OpenAI 的推理模型重新分析了 376 个此前未解决的病例,并为其中 18 个诊断找到了线索。

即使进行了基因组测序,许多罕见病患者也从未获得明确的基因诊断。在经历了大量检测和专家会诊后,仍有大约一半的患者无法确诊。他们的医疗数据中可能包含线索,但要找到这些线索,往往需要从成千上万个可能的基因变异、碎片化的临床记录以及快速更新的科学文献中进行筛选。

随着新的基因-疾病关联、病例报告和分类证据不断积累,未解决的病例可能会变得可以重新解读。

来自波士顿儿童医院曼顿孤儿病研究中心、哈佛大学和 OpenAI 的研究人员,使用 OpenAI o3 Deep Research 推理模型,分析了 376 个此前已分析过但仍未解决的病例的去标识化临床和基因组信息。该模型为研究人员和临床医生提供了有证据关联的候选解释以供审查。经过专家复核、额外检测和临床确认后,医生在 18 个病例中确立了诊断——在专家此前分析的基础上,额外诊断率为 4.8%。这项研究于 2026 年 6 月 18 日发表在《新英格兰医学杂志 AI》上,展示了 AI 辅助的研究工作流如何帮助专家在重新审视一些最棘手的病例时找到线索。

这些病例中有许多多年来一直未能被专家分析所破解。在这项研究中,OpenAI o3 Deep Research 帮助研究人员识别出了线索,这些线索随后通过既定的临床流程进行了评估,这表明随着知识的演进,由专家主导的定期重新分析可以变得更具可扩展性。该模型并未对任何患者进行诊断,也未做出任何临床决策。它只是生成有证据关联的假设,供专家审查,并在适当情况下通过额外检测进行探究,最终在临床实验室中确认。

为什么一个旧病例可能包含新的答案

一项不确定的基因检测结果并非总是永久性的结论。患者的表型描述、检测结果和家族史可能分散在采用不同标识符、格式和词汇的数据库中。将这些记录关联起来十分困难,因此即使是专家也可能漏诊。此外,专家可能在相关基因或其变异与疾病建立关联之前,就对儿童的基因组进行了测序。随着科学知识的进步,同样的数据能够揭示出以往无法发现的答案。

罕见病的重新分析既是一个科学问题,也是一个维护问题。患者的基因组可能保持不变,但围绕它的证据却在不断变化:研究人员将新的基因和变异与疾病联系起来,实验室对旧变异进行重新分类,病例数据库和论文也在不断积累新的观察结果。每一次更新都可能使一个过去不确定的病例值得重新审视,因此许多机构都积压了越来越多的基因组数据,需要与不断更新的知识库保持同步。

在这项研究中,研究人员设计了工作流程,使模型充当现有基因组分析流程之上的、以解释为先的推理层。模型并非只返回一个排序后的基因,而是被要求将临床特征、遗传模式、变异证据和科学文献联系起来,形成一份人类审查员可以质询的论证。

重新分析是如何进行的

对于每个病例,研究团队整理了一份去标识化的数据包,其中包含:用于描述患者临床表现的标准化人类表型本体术语、偶尔附带的临床医生笔记及任何描述性临床诊断、年龄和性别等元数据,以及一份经过筛选的变异表。该表记录了每个变异的罕见程度、其对编码蛋白质的预测影响、ClinVar 分类,以及可用家庭成员中的信号质量。大多数病例包含来自儿童及其双亲的数据。

研究团队要求模型提出最合理的分子解释,并展示其推理过程。随后,研究人员使用临床实验室用于分类遗传变异的同一套 ACMG/AMP 框架来审查模型输出。每个候选结果至少由两名团队成员审查,分歧通过共识解决,模型输出从未被视为诊断结果。只有在合格专家审查证据、变异被归类为致病性或可能致病性、经 CLIA 认证的实验室确认,并且临床团队将结果反馈给患者家庭后,该发现才被计为一次诊断。

在分析未确诊病例之前,研究团队在已有明确诊断的病例上优化了工作流程。在包含多种罕见疾病的 51 个病例中,该流程在重复运行中为 48 个病例找回了正确的基因和变异。在一组 57 个神经肌肉病例中,该流程在重复运行中为 45 个病例给出了正确诊断。在一组 15 个长读长基因组病例中,该流程在每个病例中都指出了正确的基因,并在 12 个病例中指出了两个致病等位基因。这些评估有助于提示词的开发,并显示出专家审查在哪些环节仍然必不可少。

在这些先前已确诊的病例中,模型自我报告的置信度分数与正确诊断结果相关联:对于持续正确的判断,平均最低分数为 85.6;对于错误或未知的判断,平均最低分数为 42.1。这些分数并非校准后的概率,研究团队也未将其用作证据或临床判定的替代品。但它们有助于指导专家审阅者将注意力集中在最有希望的候选诊断上。

研究人员的发现

随后,研究团队将该工作流程应用于四组先前未确诊病例:患有神经发育疾病的儿童、患有罕见神经肌肉疾病的人群、患有早期精神病的儿童和青少年,以及儿科不明原因猝死病例。这些并非等待首次审查的新病例。其中许多病例此前已经过多个商业或机构分析流程的检查,并由多学科团队讨论过。

各队列结果

队列病例诊断结果****检出率 神经发育障碍 100 10 10.0% 神经肌肉疾病 61 4 6.6% 儿童不明原因猝死 200 2 1.0% 早期精神病 15 2 13.3% 总计 376 18 **** 4.8%

早期精神病队列规模较小,因此其百分比置信区间较宽。检出率也反映了每个队列存在单基因解释的可能性大小。

在模型筛选出候选结果、专家完成审查和临床确认后,医生在 4.8% 的病例中确立了诊断。这一比例虽然不高,但在此类人群中具有重要意义,因为此前的专家审查未能解决这些病例。类似的再分析研究报告显示,在经过严格审查的病例中,检出率仅为个位数增长;较高的检出率通常来自包含新病例或等待基因确认的已知疾病的研究。

在 18 个诊断结果中,有 7 个属于重新发现:即这些诊断已在本地研究流程之外被确立,但未出现在团队审查的记录中。在几个病例中,相关变异已在公共数据库中被列为致病性或可能致病性变异,这凸显了跨数据源整合信息所面临的运营挑战。

在识别变异时展现灵活性

在一个早期精神病病例中,模型推断出基因组中存在一个未在输入数据中列出的结构事件。它将 22 号染色体上一系列低质量检测结果与患儿的心脏、免疫、神经发育和精神特征联系起来,随后假设存在与迪乔治综合征相关的 22q11.2 缺失。这一假设的变异通过后续基因组测序得到了确认。

尽管提示词要求寻找一个单基因病因,但模型有时会提出两个基因,以更好地解释复杂的临床表现。在一个病例中,LAMA2 和 FOXP1 的变异共同解释了肌肉和神经发育特征;另一个病例则存在一个此前未被识别的、涉及 TTN 和 SRPK3 的双基因解释。

提出一个可检验、具有生物学合理性的假设

除了诊断之外,该模型还识别出一种名为白癜风的疾病可能的新机制解释。在一个神经发育病例中,模型指出一名白癜风患者的S1PR1基因存在11个氨基酸的缺失。S1PR1编码一种参与信号传导、免疫细胞迁移和组织生物学的细胞表面受体。模型整合的证据表明,这种缺失可能改变受体结构和信号传导方式,从而减少色素生成,同时帮助免疫细胞在皮肤中持续存在。

提出的S1PR1与白癜风之间的关联需要进一步的实验验证,但这展示了人工智能在将结构生物学、免疫学和临床遗传学中的零散发现转化为具体、可检验的假说方面所发挥的强大作用。

研究团队在神经肌肉队列中也观察到了可能的表型扩展。HSPB8和CDK13基因的有害变异与这些基因最广为人知的疾病并不完全吻合,这表明存在更广泛的临床谱系,需要更多病例和实验室工作来验证。

案例研究:凯拉近二十年后的确诊

一切始于空手道课上,当时凯拉的母亲注意到她9岁的女儿在做站姿时,下蹲幅度不如从前。凯拉在足球训练中也开始变慢,走路和跑步时总是踮着脚尖。她的儿科医生无法确定她肌肉无力的原因,于是将她转诊给专科医生。随后,她经历了近二十年的检查、治疗和会诊,却始终未能确诊。

凯拉的病例是神经肌肉队列中浮现出的四个诊断之一。研究团队将她的病情与HSPB8基因的一个移码变异联系起来,并诊断出一种肌原纤维肌病,即异常蛋白质结构在肌纤维中积聚,导致肌无力。来自曼顿中心的遗传咨询师在凯拉28岁生日前一周左右给她打了电话。

到那时,凯拉已经花了大量时间来适应这种疾病。她13岁时就依赖呼吸机并坐上了轮椅,不过此后她的病情趋于稳定。尽管凯拉所患的肌原纤维肌病极为罕见,以至于对其长期病程知之甚少,但这一诊断还是带来了一些了结。

局限性

这项研究表明,一个通用推理模型能够通过将表型、遗传模式、变异注释、数据质量模式和科学文献整合成可审查的假设,为回顾性基因组再分析做出贡献。研究还揭示了定期再分析的重要性:有些答案只有在知识进步或零散记录被整合之后才会浮现。

这项研究并不证明患者、临床医生或客户应使用 OpenAI 模型来诊断疾病或做出医疗决策。它既不描述也不认可将 OpenAI o3 Deep Research、ChatGPT 或任何其他 OpenAI 产品用于诊断的预期客户用途。该模型未对任何参与者进行诊断;每一次诊断均由医生和其他合格的临床专家通过既定的审查、检测和临床确认流程做出。

该研究是回顾性的,队列具有异质性,且评审人员对模型的置信度并非盲评。研究人员未测量节省的时间、成本、临床医生工作量、假阳性工作负担或护理方面的变化。他们也未系统评估其他类型的遗传变异,如结构变异、重复扩增、深内含子改变或嵌合体。

大语言模型可能会误读上下文,或产生看似合理但经不起仔细推敲的解释。因此,每一个结果都经过了人工裁决和临床确认。该模型拓宽了搜索范围,并聚焦了后续的人工主导分析;它并未决定应向家庭返回哪些信息或诊断。

本研究使用了去标识化信息,未在经批准的环境之外使用或传输任何受保护的健康信息。更广泛的临床部署将需要对隐私、安全、可审计性以及适用于所有医疗服务的当地法规给予同等关注。模型访问不能替代测序基础设施、遗传咨询、确认性检测或专科医生的判断。

“瓶颈在于时间。一位专家一天能投入到任何单个个体身上的时间是有限的。”

“瓶颈在于时间。一位专家一天能投入到任何单个个体身上的时间是有限的。”

凯瑟琳·布朗斯坦博士,波士顿儿童医院曼顿孤儿疾病研究中心

“像凯瑟琳和我这样的研究人员,不可能把8000种不同的疾病都记在脑子里。这就是AI的力量所在。”

“像凯瑟琳和我这样的研究人员,不可能把8000种不同的疾病都记在脑子里。这就是AI的力量所在。”

艾伦·贝格斯,曼顿孤儿疾病研究中心主任

下一步计划

前瞻性、多中心研究应将大语言模型辅助的再分析与传统实践在诊断率、找到候选基因的时间、临床医生工作量、假阳性负担、成本以及对护理的影响等方面进行比较。版本化的提示词、参考文献核查、审计日志以及校准后的不确定性,对于可重复性和安全性至关重要。此类研究仍需合格的临床医生来评估证据、安排适当的检测,并做出任何诊断或治疗决策。

本研究使用了OpenAI o3 Deep Research。更新的通用模型能够搜索和综合更多的科学资料,而像GPT-Rosalind这样的专用系统则专为更深入的生命科学研究而设计,包括变异对蛋白质结构和功能的影响。这些能力未在此次测试中涉及,将需要它们自己的评估和访问控制。

虽然 OpenAI 为这项初步研究提供了支持,但曼顿中心将通过 OpenAI 基金会的一笔资助,领导下一阶段的工作。这笔资助将支持该中心更广泛的努力,即开发一个平台无关、低成本的遗传学 AI 辅助工具,帮助临床团队更快速、更一致地分析罕见病病例。

更长期的研究机遇在于探索:由专家主导、AI 辅助的重新分析,能否帮助科学认知跟上发现的步伐。其前景并非 AI 取代医生的诊断,而是经过审慎评估的研究工具,或许能帮助专家识别出值得深入探究的证据。对于成千上万的家庭而言,今天悬而未决的问题,不必永远没有答案。

OpenAI与哈佛等合作研究:o3 Deep Research模型辅助诊断儿童罕见病,额外诊断率4.8%

OpenAI:官网动态(RSS · 排除企业/客户案例)·2026-06-18 16:00·45天前
阅读原文· openai.com
精选理由

这是AI辅助罕见病诊断的严肃实证,4.8%的新诊断率在专家反复分析过的病例里相当扎实。虽然离临床落地还很远,但证明推理模型能帮专家从旧数据里挖出新线索。

AI 摘要

波士顿儿童医院、哈佛大学与OpenAI合作,在《NEJM AI》发表研究。团队使用OpenAI o3 Deep Research推理模型重新分析376例此前未确诊的罕见病案例,产出基于证据的候选解释。经专家评审、额外检测和临床确认,医生在18例中建立诊断,额外诊断率达4.8%。研究显示,AI辅助工作流可帮助专家在未解病例中生成可检验假设,使定期再分析更具可扩展性。模型不直接诊断或做临床决策,仅提供证据链供专家审查。

正文 · AI 翻译

在《新英格兰医学杂志 AI》的一项研究中,专家使用 OpenAI 的推理模型重新分析了 376 个此前未解决的病例,并为其中 18 个诊断找到了线索。

即使进行了基因组测序,许多罕见病患者也从未获得明确的基因诊断。在经历了大量检测和专家会诊后,仍有大约一半的患者无法确诊。他们的医疗数据中可能包含线索,但要找到这些线索,往往需要从成千上万个可能的基因变异、碎片化的临床记录以及快速更新的科学文献中进行筛选。

随着新的基因-疾病关联、病例报告和分类证据不断积累,未解决的病例可能会变得可以重新解读。

来自波士顿儿童医院曼顿孤儿病研究中心、哈佛大学和 OpenAI 的研究人员,使用 OpenAI o3 Deep Research 推理模型,分析了 376 个此前已分析过但仍未解决的病例的去标识化临床和基因组信息。该模型为研究人员和临床医生提供了有证据关联的候选解释以供审查。经过专家复核、额外检测和临床确认后,医生在 18 个病例中确立了诊断——在专家此前分析的基础上,额外诊断率为 4.8%。这项研究于 2026 年 6 月 18 日发表在《新英格兰医学杂志 AI》上,展示了 AI 辅助的研究工作流如何帮助专家在重新审视一些最棘手的病例时找到线索。

这些病例中有许多多年来一直未能被专家分析所破解。在这项研究中,OpenAI o3 Deep Research 帮助研究人员识别出了线索,这些线索随后通过既定的临床流程进行了评估,这表明随着知识的演进,由专家主导的定期重新分析可以变得更具可扩展性。该模型并未对任何患者进行诊断,也未做出任何临床决策。它只是生成有证据关联的假设,供专家审查,并在适当情况下通过额外检测进行探究,最终在临床实验室中确认。

为什么一个旧病例可能包含新的答案

一项不确定的基因检测结果并非总是永久性的结论。患者的表型描述、检测结果和家族史可能分散在采用不同标识符、格式和词汇的数据库中。将这些记录关联起来十分困难,因此即使是专家也可能漏诊。此外,专家可能在相关基因或其变异与疾病建立关联之前,就对儿童的基因组进行了测序。随着科学知识的进步,同样的数据能够揭示出以往无法发现的答案。

罕见病的重新分析既是一个科学问题,也是一个维护问题。患者的基因组可能保持不变,但围绕它的证据却在不断变化:研究人员将新的基因和变异与疾病联系起来,实验室对旧变异进行重新分类,病例数据库和论文也在不断积累新的观察结果。每一次更新都可能使一个过去不确定的病例值得重新审视,因此许多机构都积压了越来越多的基因组数据,需要与不断更新的知识库保持同步。

在这项研究中,研究人员设计了工作流程,使模型充当现有基因组分析流程之上的、以解释为先的推理层。模型并非只返回一个排序后的基因,而是被要求将临床特征、遗传模式、变异证据和科学文献联系起来,形成一份人类审查员可以质询的论证。

重新分析是如何进行的

对于每个病例,研究团队整理了一份去标识化的数据包,其中包含:用于描述患者临床表现的标准化人类表型本体术语、偶尔附带的临床医生笔记及任何描述性临床诊断、年龄和性别等元数据,以及一份经过筛选的变异表。该表记录了每个变异的罕见程度、其对编码蛋白质的预测影响、ClinVar 分类,以及可用家庭成员中的信号质量。大多数病例包含来自儿童及其双亲的数据。

研究团队要求模型提出最合理的分子解释,并展示其推理过程。随后,研究人员使用临床实验室用于分类遗传变异的同一套 ACMG/AMP 框架来审查模型输出。每个候选结果至少由两名团队成员审查,分歧通过共识解决,模型输出从未被视为诊断结果。只有在合格专家审查证据、变异被归类为致病性或可能致病性、经 CLIA 认证的实验室确认,并且临床团队将结果反馈给患者家庭后,该发现才被计为一次诊断。

在分析未确诊病例之前,研究团队在已有明确诊断的病例上优化了工作流程。在包含多种罕见疾病的 51 个病例中,该流程在重复运行中为 48 个病例找回了正确的基因和变异。在一组 57 个神经肌肉病例中,该流程在重复运行中为 45 个病例给出了正确诊断。在一组 15 个长读长基因组病例中,该流程在每个病例中都指出了正确的基因,并在 12 个病例中指出了两个致病等位基因。这些评估有助于提示词的开发,并显示出专家审查在哪些环节仍然必不可少。

在这些先前已确诊的病例中,模型自我报告的置信度分数与正确诊断结果相关联:对于持续正确的判断,平均最低分数为 85.6;对于错误或未知的判断,平均最低分数为 42.1。这些分数并非校准后的概率,研究团队也未将其用作证据或临床判定的替代品。但它们有助于指导专家审阅者将注意力集中在最有希望的候选诊断上。

研究人员的发现

随后,研究团队将该工作流程应用于四组先前未确诊病例:患有神经发育疾病的儿童、患有罕见神经肌肉疾病的人群、患有早期精神病的儿童和青少年,以及儿科不明原因猝死病例。这些并非等待首次审查的新病例。其中许多病例此前已经过多个商业或机构分析流程的检查,并由多学科团队讨论过。

各队列结果

队列病例诊断结果****检出率 神经发育障碍 100 10 10.0% 神经肌肉疾病 61 4 6.6% 儿童不明原因猝死 200 2 1.0% 早期精神病 15 2 13.3% 总计 376 18 **** 4.8%

早期精神病队列规模较小,因此其百分比置信区间较宽。检出率也反映了每个队列存在单基因解释的可能性大小。

在模型筛选出候选结果、专家完成审查和临床确认后,医生在 4.8% 的病例中确立了诊断。这一比例虽然不高,但在此类人群中具有重要意义,因为此前的专家审查未能解决这些病例。类似的再分析研究报告显示,在经过严格审查的病例中,检出率仅为个位数增长;较高的检出率通常来自包含新病例或等待基因确认的已知疾病的研究。

在 18 个诊断结果中,有 7 个属于重新发现:即这些诊断已在本地研究流程之外被确立,但未出现在团队审查的记录中。在几个病例中,相关变异已在公共数据库中被列为致病性或可能致病性变异,这凸显了跨数据源整合信息所面临的运营挑战。

在识别变异时展现灵活性

在一个早期精神病病例中,模型推断出基因组中存在一个未在输入数据中列出的结构事件。它将 22 号染色体上一系列低质量检测结果与患儿的心脏、免疫、神经发育和精神特征联系起来,随后假设存在与迪乔治综合征相关的 22q11.2 缺失。这一假设的变异通过后续基因组测序得到了确认。

尽管提示词要求寻找一个单基因病因,但模型有时会提出两个基因,以更好地解释复杂的临床表现。在一个病例中,LAMA2 和 FOXP1 的变异共同解释了肌肉和神经发育特征;另一个病例则存在一个此前未被识别的、涉及 TTN 和 SRPK3 的双基因解释。

提出一个可检验、具有生物学合理性的假设

除了诊断之外,该模型还识别出一种名为白癜风的疾病可能的新机制解释。在一个神经发育病例中,模型指出一名白癜风患者的S1PR1基因存在11个氨基酸的缺失。S1PR1编码一种参与信号传导、免疫细胞迁移和组织生物学的细胞表面受体。模型整合的证据表明,这种缺失可能改变受体结构和信号传导方式,从而减少色素生成,同时帮助免疫细胞在皮肤中持续存在。

提出的S1PR1与白癜风之间的关联需要进一步的实验验证,但这展示了人工智能在将结构生物学、免疫学和临床遗传学中的零散发现转化为具体、可检验的假说方面所发挥的强大作用。

研究团队在神经肌肉队列中也观察到了可能的表型扩展。HSPB8和CDK13基因的有害变异与这些基因最广为人知的疾病并不完全吻合,这表明存在更广泛的临床谱系,需要更多病例和实验室工作来验证。

案例研究:凯拉近二十年后的确诊

一切始于空手道课上,当时凯拉的母亲注意到她9岁的女儿在做站姿时,下蹲幅度不如从前。凯拉在足球训练中也开始变慢,走路和跑步时总是踮着脚尖。她的儿科医生无法确定她肌肉无力的原因,于是将她转诊给专科医生。随后,她经历了近二十年的检查、治疗和会诊,却始终未能确诊。

凯拉的病例是神经肌肉队列中浮现出的四个诊断之一。研究团队将她的病情与HSPB8基因的一个移码变异联系起来,并诊断出一种肌原纤维肌病,即异常蛋白质结构在肌纤维中积聚,导致肌无力。来自曼顿中心的遗传咨询师在凯拉28岁生日前一周左右给她打了电话。

到那时,凯拉已经花了大量时间来适应这种疾病。她13岁时就依赖呼吸机并坐上了轮椅,不过此后她的病情趋于稳定。尽管凯拉所患的肌原纤维肌病极为罕见,以至于对其长期病程知之甚少,但这一诊断还是带来了一些了结。

局限性

这项研究表明,一个通用推理模型能够通过将表型、遗传模式、变异注释、数据质量模式和科学文献整合成可审查的假设,为回顾性基因组再分析做出贡献。研究还揭示了定期再分析的重要性:有些答案只有在知识进步或零散记录被整合之后才会浮现。

这项研究并不证明患者、临床医生或客户应使用 OpenAI 模型来诊断疾病或做出医疗决策。它既不描述也不认可将 OpenAI o3 Deep Research、ChatGPT 或任何其他 OpenAI 产品用于诊断的预期客户用途。该模型未对任何参与者进行诊断;每一次诊断均由医生和其他合格的临床专家通过既定的审查、检测和临床确认流程做出。

该研究是回顾性的,队列具有异质性,且评审人员对模型的置信度并非盲评。研究人员未测量节省的时间、成本、临床医生工作量、假阳性工作负担或护理方面的变化。他们也未系统评估其他类型的遗传变异,如结构变异、重复扩增、深内含子改变或嵌合体。

大语言模型可能会误读上下文,或产生看似合理但经不起仔细推敲的解释。因此,每一个结果都经过了人工裁决和临床确认。该模型拓宽了搜索范围,并聚焦了后续的人工主导分析;它并未决定应向家庭返回哪些信息或诊断。

本研究使用了去标识化信息,未在经批准的环境之外使用或传输任何受保护的健康信息。更广泛的临床部署将需要对隐私、安全、可审计性以及适用于所有医疗服务的当地法规给予同等关注。模型访问不能替代测序基础设施、遗传咨询、确认性检测或专科医生的判断。

“瓶颈在于时间。一位专家一天能投入到任何单个个体身上的时间是有限的。”

“瓶颈在于时间。一位专家一天能投入到任何单个个体身上的时间是有限的。”

凯瑟琳·布朗斯坦博士,波士顿儿童医院曼顿孤儿疾病研究中心

“像凯瑟琳和我这样的研究人员,不可能把8000种不同的疾病都记在脑子里。这就是AI的力量所在。”

“像凯瑟琳和我这样的研究人员,不可能把8000种不同的疾病都记在脑子里。这就是AI的力量所在。”

艾伦·贝格斯,曼顿孤儿疾病研究中心主任

下一步计划

前瞻性、多中心研究应将大语言模型辅助的再分析与传统实践在诊断率、找到候选基因的时间、临床医生工作量、假阳性负担、成本以及对护理的影响等方面进行比较。版本化的提示词、参考文献核查、审计日志以及校准后的不确定性,对于可重复性和安全性至关重要。此类研究仍需合格的临床医生来评估证据、安排适当的检测,并做出任何诊断或治疗决策。

本研究使用了OpenAI o3 Deep Research。更新的通用模型能够搜索和综合更多的科学资料,而像GPT-Rosalind这样的专用系统则专为更深入的生命科学研究而设计,包括变异对蛋白质结构和功能的影响。这些能力未在此次测试中涉及,将需要它们自己的评估和访问控制。

虽然 OpenAI 为这项初步研究提供了支持,但曼顿中心将通过 OpenAI 基金会的一笔资助,领导下一阶段的工作。这笔资助将支持该中心更广泛的努力,即开发一个平台无关、低成本的遗传学 AI 辅助工具,帮助临床团队更快速、更一致地分析罕见病病例。

更长期的研究机遇在于探索:由专家主导、AI 辅助的重新分析,能否帮助科学认知跟上发现的步伐。其前景并非 AI 取代医生的诊断,而是经过审慎评估的研究工具,或许能帮助专家识别出值得深入探究的证据。对于成千上万的家庭而言,今天悬而未决的问题,不必永远没有答案。

阅读原文openai.com