The Decoder:AI News(RSS)
精选
78AI 编辑部评分,满分 100

Nature两篇研究:MIRA和AMIE诊断与治疗计划媲美甚至超越医生

2026-06-18 22:37· 48天前· Maximilian Schreiner
AI 导读

德国团队开发的MIRA智能体在模拟电子病历中操作85,000种选项,500余例急诊诊断准确率88.9%,对比测试(311例)得分87.8%,高于资深专科医生(78.1%)和混合团队(71.1%)。MIRA在阑尾炎(98.6%)和胰腺炎(92.3%)最佳,未发现危险药物交互或剂量错误,性能不受语言影响,代码已公开。谷歌AMIE采用双智能体架构,在100个多访视病例中治疗计划适切率95%(初级保健医生72%),并在药物知识基准RxQA上超过医生。两项研究均警告模拟环境与现实存在差距,实际性能可能更低。

推荐理由

两项 Nature 研究把 AI 诊断推到了和医生掰手腕的水平,但更值得关注的是那个被埋起来的实验:更强的模型一上来,精心搭建的 double-agent 架构几乎归零。医疗 AI 的护城河可能不是架构而是接入院内系统的能力。

正文 · AI 翻译
Image description

发表在《自然》杂志上的两项新研究显示,在模拟患者病例中,专业化的AI系统在疾病诊断和治疗决策方面与医生水平相当,有时甚至更胜一筹。这两个系统均运行在已显过时的基础模型之上。

专为医学领域构建的AI程序正日益接近真正的临床价值。这是同时发表在《自然》杂志上的两篇论文的核心结论。德国系统MIRA在诊断胰腺癌和肺炎等疾病方面表现优于医生。谷歌的AMIE系统则能生成更准确的治疗和检测方案。

MIRA如同医生在模拟医院中工作

MIRA代表“医学推理与行动智能”(Medical Intelligence for Reasoning and Action)。它由德累斯顿工业大学、海德堡大学等机构共同开发。与标准聊天工具不同,该系统作为一个自主智能体,在一个封闭的虚拟电子健康记录系统内运行。根据研究,MIRA可以从横跨11种工具的超过85,000个选项中进行选择。它能采集病史、安排实验室检查、微生物检测和影像学检查、解读结果、生成鉴别诊断,并制定包含处方、手术计划和住院安排在内的治疗方案。

研究团队使用来自公共MIMIC-IV数据集的500多个真实急诊病例对MIRA进行了测试。另一个AI智能体扮演患者角色,仅分享来自真实病历的信息。

在八个疾病类别中,以数据集中记录的诊断结果为基准,MIRA的正确诊断率达到88.9%。为了进行直接的头对头比较,双方在相同条件下处理了311个病例的子集。MIRA的得分为87.8%。四位经验丰富的专科医生达到了78.1%。由住院医师和专科医生组成的混合团队达到了71.1%。MIRA在阑尾炎(98.6%)和胰腺炎(92.3%)方面表现最佳。AI和医生在肺炎(72.4%)和尿路感染(77.6%)方面都遇到了更多困难。

研究人员还检查了这些建议的安全性。不知情的专家评审员在不知道建议来自 MIRA 还是人类的情况下进行审核,未发现危险的药物相互作用、未发现针对肾功能受损患者的不正确剂量,也未发现危险的止痛药处方。MIRA 在获取患者当前用药信息方面近乎完美。它还能准确判断患者是否需要住院:没有遗漏任何一例需要住院治疗的情况。即使测试患者只说德语或法语,或者表现得特别焦虑,其性能也保持稳定。源代码已在 GitHub 上提供。

AMIE 将两个智能体与临床指南配对

谷歌的 AMIE 采用了不同的方法:在多次就诊中管理患者。该系统由两部分组成。一个对话智能体负责与患者进行快速、友好的对话。另一个智能体在后台运行,更仔细地思考,并根据医疗指南对病例进行交叉比对。

在一项严格控制的研究中,谷歌将 AMIE 与 21 名初级保健医生进行了比较,涉及 100 个跨越多次就诊的病例。基准是英国国家健康与临床优化研究所(NICE)指南和《英国医学杂志最佳实践》(BMJ Best Practice)指南。患者由演员通过文字聊天扮演。根据研究,AMIE 在治疗决策上与医生持平,并在方案准确性和指南依从性上优于医生。在首次就诊时,AMIE 的整体方案在 95% 的病例中被评为适当。而医生的这一比例为 72%。无论是专家评审员还是扮演患者的演员,都更倾向于选择 AMIE 而非人类医生。

为了测试药物知识,团队基于两个国家药物处方集构建了一个专门的基准测试,名为 RxQA,并由持证药剂师进行了验证。AMIE 在较难的问题上得分超过了初级保健医生。不过,这项测试对双方来说都很难。即使在较简单的问题上,最高得分也低于 75%。

两个团队都警告不要草率下结论

作者们对其研究发现的局限性有清晰的认识。MIRA 针对“虽小但非零”比例的患者,给出了“偏离最佳实践的诊疗建议”。模拟患者的回答也可能“比急诊科患者的真实语言更具结构性”。此外,不能完全排除免费开放的 MIMIC-IV 数据集已包含在所使用模型的训练数据中。如果是这样,那么测得的性能表现更像是一个上限,而非现实评估。作为对照的医生同样在德国急诊系统工作,而该系统与其他国家有所不同。

AMIE 的开发团队称其研究是一个“里程碑”,但强调无论是病例选择还是纯文本对话,都无法反映真实的临床环境。该系统展现出“有前景的能力”,但“尚未准备好投入现实世界的应用”。还需要更多工作来解决可能潜入系统隐藏推理步骤中的“潜在推理错误”。

与 MIRA 共同开发的研究小组负责人 Jakob Kather 向《金融时报》表示:“我们正在预览 AI 如何改变医学。”他将这类 AI 智能体比作飞机的自动驾驶仪:“这些系统可以通过接管常规任务来支持和减轻医疗专业人员的负担,但最终责任始终由医生承担。”

独立专家为这股热潮降温

未参与这两项研究的研究人员称赞了其严谨的方法论,但指出这些只是模拟。牛津大学医学社会学教授 Catherine Pope 向《金融时报》表示,这“与日常医疗保健中混乱、复杂、充满人情味的世界相去甚远。”

爱丁堡大学健康信息学教授 Julie Jacko 表示,报告中提到的许多优势归结于“方案的精确性和完整性”,而非“临床正确性上的明显差异”。该研究“展示的是针对结构化标准的性能表现,而非完全捕捉真实临床决策的复杂性。”

脚手架(Scaffolding)对弱模型帮助最大,而更强的模型则不需要它。

AMIE 的补充实验揭示了最值得关注的发现之一。与同行评审研究的常见情况一样,这两个系统都依赖于较旧的 AI 模型。AMIE 仍运行在谷歌较旧的 Gemini 1.5 Flash 上。MIRA 则使用 OpenAI 的 GPT-4o 和 o1-preview。所有这些模型此后都已被新一代模型超越。

谷歌的研究人员逐一替换了各个组件,以弄清究竟是什么驱动了性能:是双智能体架构、指南匹配和专门训练这些精心设计的框架,还是仅仅依靠底层语言模型本身。

在较旧的 Gemini 1.5 Flash 上,专门的设置带来了研究所描述的巨大性能提升。但当研究人员将同样的设置应用到更新的 Gemini 2.5 Flash 上时,这种优势几乎消失了。

换句话说,专门的系统通过强制进行结构化推理、要求引用指南以及抑制模型幻觉,来弥补旧模型的弱点。更强的模型可以自行完成所有这些工作。该论文承认,随着基础模型的改进,AMIE 的价值会缩小。事实上,像 Gemini 2.5 Pro、o3 和 GPT-5 这样的新一代通用模型在 RxQA 药物测试中已经取得了与完整 AMIE 系统“大致相当”的分数。

在实践中,AMIE 似乎已被 AI 发展的步伐所超越。这是一种不断重复的模式:围绕语言模型的框架随着更强模型的到来而变得多余,有时是因为该框架本身为下一代模型的训练数据提供了素材。这并不意味着其背后的想法毫无价值:在编程领域,并且越来越多地在其他领域,像 Claude Code、OpenAI Codex 和 Claude Cowork 这样的框架工具为模型提供了工具、上下文和记忆。即使是更强的模型,在获得此类支持后,也能在复杂任务上表现更佳。但框架必须跟上模型性能的步伐,否则最终会变成累赘。

MIRA 缺乏此类分析。不过,其架构的一部分与其说是修补模型弱点,不如说是将 AI 连接到医院的临床系统。这部分不会因为更强的模型而变得过时。

来源:The Decoder:AI News(RSS) · the-decoder.com

Nature两篇研究:MIRA和AMIE诊断与治疗计划媲美甚至超越医生

The Decoder:AI News(RSS)·2026-06-18 22:37·48天前·Maximilian Schreiner
AI 导读

德国团队开发的MIRA智能体在模拟电子病历中操作85,000种选项,500余例急诊诊断准确率88.9%,对比测试(311例)得分87.8%,高于资深专科医生(78.1%)和混合团队(71.1%)。MIRA在阑尾炎(98.6%)和胰腺炎(92.3%)最佳,未发现危险药物交互或剂量错误,性能不受语言影响,代码已公开。谷歌AMIE采用双智能体架构,在100个多访视病例中治疗计划适切率95%(初级保健医生72%),并在药物知识基准RxQA上超过医生。两项研究均警告模拟环境与现实存在差距,实际性能可能更低。

正文 · AI 翻译
Image description

发表在《自然》杂志上的两项新研究显示,在模拟患者病例中,专业化的AI系统在疾病诊断和治疗决策方面与医生水平相当,有时甚至更胜一筹。这两个系统均运行在已显过时的基础模型之上。

专为医学领域构建的AI程序正日益接近真正的临床价值。这是同时发表在《自然》杂志上的两篇论文的核心结论。德国系统MIRA在诊断胰腺癌和肺炎等疾病方面表现优于医生。谷歌的AMIE系统则能生成更准确的治疗和检测方案。

MIRA如同医生在模拟医院中工作

MIRA代表“医学推理与行动智能”(Medical Intelligence for Reasoning and Action)。它由德累斯顿工业大学、海德堡大学等机构共同开发。与标准聊天工具不同,该系统作为一个自主智能体,在一个封闭的虚拟电子健康记录系统内运行。根据研究,MIRA可以从横跨11种工具的超过85,000个选项中进行选择。它能采集病史、安排实验室检查、微生物检测和影像学检查、解读结果、生成鉴别诊断,并制定包含处方、手术计划和住院安排在内的治疗方案。

研究团队使用来自公共MIMIC-IV数据集的500多个真实急诊病例对MIRA进行了测试。另一个AI智能体扮演患者角色,仅分享来自真实病历的信息。

在八个疾病类别中,以数据集中记录的诊断结果为基准,MIRA的正确诊断率达到88.9%。为了进行直接的头对头比较,双方在相同条件下处理了311个病例的子集。MIRA的得分为87.8%。四位经验丰富的专科医生达到了78.1%。由住院医师和专科医生组成的混合团队达到了71.1%。MIRA在阑尾炎(98.6%)和胰腺炎(92.3%)方面表现最佳。AI和医生在肺炎(72.4%)和尿路感染(77.6%)方面都遇到了更多困难。

研究人员还检查了这些建议的安全性。不知情的专家评审员在不知道建议来自 MIRA 还是人类的情况下进行审核,未发现危险的药物相互作用、未发现针对肾功能受损患者的不正确剂量,也未发现危险的止痛药处方。MIRA 在获取患者当前用药信息方面近乎完美。它还能准确判断患者是否需要住院:没有遗漏任何一例需要住院治疗的情况。即使测试患者只说德语或法语,或者表现得特别焦虑,其性能也保持稳定。源代码已在 GitHub 上提供。

AMIE 将两个智能体与临床指南配对

谷歌的 AMIE 采用了不同的方法:在多次就诊中管理患者。该系统由两部分组成。一个对话智能体负责与患者进行快速、友好的对话。另一个智能体在后台运行,更仔细地思考,并根据医疗指南对病例进行交叉比对。

在一项严格控制的研究中,谷歌将 AMIE 与 21 名初级保健医生进行了比较,涉及 100 个跨越多次就诊的病例。基准是英国国家健康与临床优化研究所(NICE)指南和《英国医学杂志最佳实践》(BMJ Best Practice)指南。患者由演员通过文字聊天扮演。根据研究,AMIE 在治疗决策上与医生持平,并在方案准确性和指南依从性上优于医生。在首次就诊时,AMIE 的整体方案在 95% 的病例中被评为适当。而医生的这一比例为 72%。无论是专家评审员还是扮演患者的演员,都更倾向于选择 AMIE 而非人类医生。

为了测试药物知识,团队基于两个国家药物处方集构建了一个专门的基准测试,名为 RxQA,并由持证药剂师进行了验证。AMIE 在较难的问题上得分超过了初级保健医生。不过,这项测试对双方来说都很难。即使在较简单的问题上,最高得分也低于 75%。

两个团队都警告不要草率下结论

作者们对其研究发现的局限性有清晰的认识。MIRA 针对“虽小但非零”比例的患者,给出了“偏离最佳实践的诊疗建议”。模拟患者的回答也可能“比急诊科患者的真实语言更具结构性”。此外,不能完全排除免费开放的 MIMIC-IV 数据集已包含在所使用模型的训练数据中。如果是这样,那么测得的性能表现更像是一个上限,而非现实评估。作为对照的医生同样在德国急诊系统工作,而该系统与其他国家有所不同。

AMIE 的开发团队称其研究是一个“里程碑”,但强调无论是病例选择还是纯文本对话,都无法反映真实的临床环境。该系统展现出“有前景的能力”,但“尚未准备好投入现实世界的应用”。还需要更多工作来解决可能潜入系统隐藏推理步骤中的“潜在推理错误”。

与 MIRA 共同开发的研究小组负责人 Jakob Kather 向《金融时报》表示:“我们正在预览 AI 如何改变医学。”他将这类 AI 智能体比作飞机的自动驾驶仪:“这些系统可以通过接管常规任务来支持和减轻医疗专业人员的负担,但最终责任始终由医生承担。”

独立专家为这股热潮降温

未参与这两项研究的研究人员称赞了其严谨的方法论,但指出这些只是模拟。牛津大学医学社会学教授 Catherine Pope 向《金融时报》表示,这“与日常医疗保健中混乱、复杂、充满人情味的世界相去甚远。”

爱丁堡大学健康信息学教授 Julie Jacko 表示,报告中提到的许多优势归结于“方案的精确性和完整性”,而非“临床正确性上的明显差异”。该研究“展示的是针对结构化标准的性能表现,而非完全捕捉真实临床决策的复杂性。”

脚手架(Scaffolding)对弱模型帮助最大,而更强的模型则不需要它。

AMIE 的补充实验揭示了最值得关注的发现之一。与同行评审研究的常见情况一样,这两个系统都依赖于较旧的 AI 模型。AMIE 仍运行在谷歌较旧的 Gemini 1.5 Flash 上。MIRA 则使用 OpenAI 的 GPT-4o 和 o1-preview。所有这些模型此后都已被新一代模型超越。

谷歌的研究人员逐一替换了各个组件,以弄清究竟是什么驱动了性能:是双智能体架构、指南匹配和专门训练这些精心设计的框架,还是仅仅依靠底层语言模型本身。

在较旧的 Gemini 1.5 Flash 上,专门的设置带来了研究所描述的巨大性能提升。但当研究人员将同样的设置应用到更新的 Gemini 2.5 Flash 上时,这种优势几乎消失了。

换句话说,专门的系统通过强制进行结构化推理、要求引用指南以及抑制模型幻觉,来弥补旧模型的弱点。更强的模型可以自行完成所有这些工作。该论文承认,随着基础模型的改进,AMIE 的价值会缩小。事实上,像 Gemini 2.5 Pro、o3 和 GPT-5 这样的新一代通用模型在 RxQA 药物测试中已经取得了与完整 AMIE 系统“大致相当”的分数。

在实践中,AMIE 似乎已被 AI 发展的步伐所超越。这是一种不断重复的模式:围绕语言模型的框架随着更强模型的到来而变得多余,有时是因为该框架本身为下一代模型的训练数据提供了素材。这并不意味着其背后的想法毫无价值:在编程领域,并且越来越多地在其他领域,像 Claude Code、OpenAI Codex 和 Claude Cowork 这样的框架工具为模型提供了工具、上下文和记忆。即使是更强的模型,在获得此类支持后,也能在复杂任务上表现更佳。但框架必须跟上模型性能的步伐,否则最终会变成累赘。

MIRA 缺乏此类分析。不过,其架构的一部分与其说是修补模型弱点,不如说是将 AI 连接到医院的临床系统。这部分不会因为更强的模型而变得过时。

来源:The Decoder:AI News(RSS)· the-decoder.com