GPT‑5.5 Instant 将前沿健康智能带给更多人,这得益于我们模型的进步以及由医生主导的评估工作。
衡量健康领域的进展
- 衡量健康领域的进展
- 更优回答的样貌
- 进步背后的医学专业力量
- 将健康改善惠及更多人
目录
- 衡量健康领域的进展
- 更优回答的样貌
- 进步背后的医学专业力量
- 将健康改善惠及更多人
健康是用户使用 ChatGPT 最有意义的方式之一。每周,超过 2.3 亿人向 ChatGPT 寻求健康与保健方面的帮助:理解健康信息、看懂化验结果、为就诊做准备、了解保险事宜、培养更健康的习惯,以及弄清楚接下来该问什么。
借助 GPT‑5.5 Instant,我们在健康领域看到了显著的进步,包括在识别何时可能需要紧急护理、询问相关背景信息、解释不确定性,以及让复杂信息更易于理解等方面均有改进。在我们最具挑战性的健康评估中,GPT‑5.5 Instant 的表现现已达到我们前沿思考型模型的水平。由于它可供 ChatGPT 中的所有免费用户使用,因此更多人能够从这些改进中受益。
这一进步既反映了模型能力的提升,也体现了我们健康评估背后由医生主导的工作。在我们的各项努力中,一个由全球医生组成的网络通过审阅模型回答示例、描述理想行为以及识别失败模式,帮助定义了在真实健康场景中“好”的标准。与医生合作,使我们能够衡量健康领域的进展,并持续改进 ChatGPT 的回答质量。
衡量健康领域的进展
在健康领域,进步意味着提供准确、易懂且基于良好判断的回答:识别何时需要更多背景信息,解释不确定性时不夸大自信程度,并帮助人们了解何时应寻求医疗护理。
为了衡量这一进展,我们使用了针对健康领域的专门评估,包括 HealthBench 和 HealthBench Professional。这些评估利用真实的健康对话场景和由医生编写的评分标准,来考察准确性、安全性、沟通能力、上下文感知、完整性以及适当的升级处理等质量维度。
健康表现与成本对比
GPT‑5.5 Instant 在包括 HealthBench Professional 在内的多项健康评估综合指标上,达到了与我们最新前沿模型相当的健康表现,相比 GPT‑5.3 Instant 有了显著提升。5.5 Instant(2026 年 5 月发布)和 5.3 Instant(2026 年 3 月发布)可供 ChatGPT 中的所有免费用户使用(受使用限制),我们使用 API 定价来计算 5.4 Thinking 和 5.5 Thinking 的成本。
作为另一项对比,我们邀请了医生在拥有无限时间和互联网访问权限(但不使用 AI)的情况下,为具有代表性的健康对话撰写回复。随后,一个独立的医生评审小组将这些医生的回复与模型在不同时期的回复进行比较,审查了在真实互动中重要的质量维度,包括准确性、沟通能力、完整性、指令遵循以及健康决策的有用性,共审查了 3,500 条回复。
在此项评估的各项标准中,GPT‑5.5 Instant 的回复评分均高于医生撰写的回复和旧版模型的回复。
医生们认为,GPT‑5.5 Instant 的回复相比旧版模型和医生的回复,故障模式更少。例如,与旧版模型和医生相比,GPT‑5.5 Instant 在未能根据当地医疗背景进行定制、遗漏危险信号或转诊建议、以及在需要时未能向用户寻求更多上下文信息等情况的发生频率更低。
考虑到我们模型在健康领域的使用规模,衡量近期模型改进的另一种方法是监测生产流量。我们使用保护隐私的监控手段来追踪生产流量中健康回复可能存在的真实性(事实性)问题。根据近期健康领域生产流量(每周数十亿条消息)的对比,在过去两个月里,至少包含一个被标记真实性问题的回复比例下降了 71%。
更优的回复示例
通过对比模型在不同时间点对真实健康问题的回答,可以看出 ChatGPT 在健康相关方面取得了切实的进步:能够识别哪些情况可能需要紧急处理,以更准确的判断力应对不确定性,并为用户提供更清晰、更有用的后续行动指导。
理解医生的建议 为就诊做准备
为什么医生可能会在坐骨神经痛类固醇注射前建议做核磁共振?
GPT-5.5
**医生可能会在坐骨神经痛类固醇注射前建议做核磁共振,因为当医生确切知道是什么压迫或刺激了神经及其位置时,注射治疗会更有效——也更安全。**常见原因包括:
- 确认坐骨神经痛的病因。类似坐骨神经痛的疼痛可能由椎间盘突出、椎管狭窄、椎间孔狭窄、椎体滑脱、肿瘤、感染、骨折引起,有时也可能是非脊柱原因。核磁共振是观察椎间盘、神经及软组织神经压迫的首选影像学检查。(emedicine.medscape.com)
- 选择正确的注射节段和侧别。例如,如果症状提示 L5 神经根受累,核磁共振可以显示问题实际位于 L4–L5、L5–S1 还是其他节段。这有助于决定硬膜外或选择性神经根注射的注射位置。
- 选择最安全/最合适的注射方式。硬膜外类固醇注射可通过不同路径进行——椎板间入路、椎间孔入路或骶管入路。术前影像学检查有助于临床医生规划路径,避免可能增加风险的解剖结构问题。许多介入治疗医生认为,高级影像学检查是前提条件,因为它有助于优化药物递送并降低对神经或血管结构造成损伤的风险。(pmc.ncbi.nlm.nih.gov)
- 排查"警示信号"或注射可能不适用的情况。核磁共振有助于发现感染、癌症、严重椎管狭窄、大块椎间盘突出等问题,或其他可能需要紧急评估或不同治疗方案的情况。
- 判断是否应考虑手术或其他治疗。如果存在严重的神经压迫、进行性肌力下降或某些结构性病变,注射可能不是最佳的下一步方案。
- 避免低效注射。如果核磁共振未显示与您的症状相符的神经根压迫或炎症,医生可能会重新考虑类固醇注射是否有效。
话虽如此,并非所有坐骨神经痛病例都必须进行核磁共振检查。对于没有警示信号的患者,许多病例会随着时间、物理治疗和药物而改善。一些研究质疑在腰椎硬膜外类固醇注射前常规进行核磁共振是否总能改善预后,但临床指南和许多临床医生仍建议,当症状持续且考虑进行注射或手术时,应进行影像学检查。(pmc.ncbi.nlm.nih.gov)
您应该询问医生:“您希望通过核磁共振检查发现什么?结果会如何改变注射方案?”这通常能明确核磁共振的目的是用于诊断、安全性评估、精准定位,还是判断注射治疗是否合适。
参考文献
- 腰骶神经根病检查:影像学检查及其他检查,https://emedicine.medscape.com/article/95025-workup
- 诊断性和治疗性脊柱介入:硬膜外注射 - PMC,https://pmc.ncbi.nlm.nih.gov/articles/PMC5764532/
- 坐骨神经痛患者接受腰椎硬膜外类固醇注射前是否应常规进行腰椎核磁共振检查?- PMC,https://pmc.ncbi.nlm.nih.gov/articles/PMC4392534/
GPT-1
"
“我不知道。”
“嗯,你必须得弄清楚。”
“我不确定我能不能做到。”
“你会搞定的。”
“希望如此。”
“我打算回办公室看看能不能找到更多相关信息。”
“好的。”
“我几个小时后回来。”
“好的。”
“再见。”
“再见。”
我挂断电话,看了看时钟。快十一点了。我已经在那里坐了一个多小时。我起身走进洗手间洗了把脸。我不想看起来邋里邋遢。我换上干净衣服,回到客厅。我在沙发上坐下,看着电视。我看了一会儿新闻,然后听到敲门声。我跳起来跑到门口。
“喂?”我喊道。
“你好,我是彼得斯医生。”
“哦,你好。”我笑了笑。“抱歉,我……”
点击模型名称可查看其他模型的回复。
这一进展背后的医学专业知识
这一进展离不开医生们的贡献,他们帮助我们定义、衡量并改进 ChatGPT 在健康领域的回答质量。
OpenAI 与一个覆盖 60 个国家、49 种语言和 26 个医学专科、由超过 260 名医生组成的全球网络合作。他们的反馈意见指导着 ChatGPT 如何回应各种场景下的健康问题,从日常健康咨询到更复杂的临床情况。
医生们会审阅模型的示例回答,并评估其是否准确、清晰、完整、谨慎得当且具有实用性。他们帮助识别回答中可能遗漏重要背景信息的地方、语气可能过于自信的地方、对后续步骤应表述得更清晰的地方,或者应更直接地鼓励用户寻求医疗帮助的地方。
迄今为止,医生们已审阅了超过 70 万条模型示例回答,这些回答反映了患者和临床医生在现实世界中如何使用 ChatGPT。每隔几分钟,就有一位医生审阅一条新的回答。他们的反馈被转化为评分标准和评估准则,帮助研究人员衡量模型在现实健康场景中的回答是否准确、安全、清晰、完整、谨慎得当且具有实用性。这为我们提供了一种更清晰的方式,来观察模型在哪些方面有所改进,以及哪些方面仍需努力。
让健康改善惠及更多人
这项工作也支持着 OpenAI 在健康领域更广泛的布局,包括为医疗行业打造的工具,例如 ChatGPT for Clinicians 和 OpenAI for Healthcare,这些工具在文档处理、研究和医疗服务交付等任务上为医疗专业人员提供支持。
改善人类健康将成为 AGI 最贴近个人、最具实际影响的应用之一。随着我们的模型不断进步,我们的目标是让 ChatGPT 在这些关键时刻变得更准确、更有用、更具影响力——并持续将这一进步带给更多人。