# Nature两篇研究：MIRA和AMIE诊断与治疗计划媲美甚至超越医生

- 来源：The Decoder：AI News（RSS）
- 作者：Maximilian Schreiner
- 发布时间：2026-06-18 22:37
- AIHOT 分数：78
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmqjmc80604sqslmhz4738b0k
- 原文链接：https://the-decoder.com/ai-systems-rival-doctors-in-new-nature-studies-but-one-result-suggests-the-tech-wont-age-well

## 精选理由

两项 Nature 研究把 AI 诊断推到了和医生掰手腕的水平，但更值得关注的是那个被埋起来的实验：更强的模型一上来，精心搭建的 double-agent 架构几乎归零。医疗 AI 的护城河可能不是架构而是接入院内系统的能力。

## AI 摘要

德国团队开发的MIRA智能体在模拟电子病历中操作85,000种选项，500余例急诊诊断准确率88.9%，对比测试（311例）得分87.8%，高于资深专科医生（78.1%）和混合团队（71.1%）。MIRA在阑尾炎（98.6%）和胰腺炎（92.3%）最佳，未发现危险药物交互或剂量错误，性能不受语言影响，代码已公开。谷歌AMIE采用双智能体架构，在100个多访视病例中治疗计划适切率95%（初级保健医生72%），并在药物知识基准RxQA上超过医生。两项研究均警告模拟环境与现实存在差距，实际性能可能更低。

## 正文

发表在《自然》杂志上的两项新研究显示，在模拟患者病例中，专业化的AI系统在疾病诊断和治疗决策方面与医生水平相当，有时甚至更胜一筹。这两个系统均运行在已显过时的基础模型之上。

专为医学领域构建的AI程序正日益接近真正的临床价值。这是同时发表在《自然》杂志上的两篇论文的核心结论。德国系统MIRA在诊断胰腺癌和肺炎等疾病方面表现优于医生。谷歌的AMIE系统则能生成更准确的治疗和检测方案。

MIRA如同医生在模拟医院中工作

MIRA代表“医学推理与行动智能”（Medical Intelligence for Reasoning and Action）。它由德累斯顿工业大学、海德堡大学等机构共同开发。与标准聊天工具不同，该系统作为一个自主智能体，在一个封闭的虚拟电子健康记录系统内运行。根据研究，MIRA可以从横跨11种工具的超过85,000个选项中进行选择。它能采集病史、安排实验室检查、微生物检测和影像学检查、解读结果、生成鉴别诊断，并制定包含处方、手术计划和住院安排在内的治疗方案。

研究团队使用来自公共MIMIC-IV数据集的500多个真实急诊病例对MIRA进行了测试。另一个AI智能体扮演患者角色，仅分享来自真实病历的信息。

在八个疾病类别中，以数据集中记录的诊断结果为基准，MIRA的正确诊断率达到88.9%。为了进行直接的头对头比较，双方在相同条件下处理了311个病例的子集。MIRA的得分为87.8%。四位经验丰富的专科医生达到了78.1%。由住院医师和专科医生组成的混合团队达到了71.1%。MIRA在阑尾炎（98.6%）和胰腺炎（92.3%）方面表现最佳。AI和医生在肺炎（72.4%）和尿路感染（77.6%）方面都遇到了更多困难。

研究人员还检查了这些建议的安全性。不知情的专家评审员在不知道建议来自 MIRA 还是人类的情况下进行审核，未发现危险的药物相互作用、未发现针对肾功能受损患者的不正确剂量，也未发现危险的止痛药处方。MIRA 在获取患者当前用药信息方面近乎完美。它还能准确判断患者是否需要住院：没有遗漏任何一例需要住院治疗的情况。即使测试患者只说德语或法语，或者表现得特别焦虑，其性能也保持稳定。源代码已在 GitHub 上提供。

AMIE 将两个智能体与临床指南配对

谷歌的 AMIE 采用了不同的方法：在多次就诊中管理患者。该系统由两部分组成。一个对话智能体负责与患者进行快速、友好的对话。另一个智能体在后台运行，更仔细地思考，并根据医疗指南对病例进行交叉比对。

在一项严格控制的研究中，谷歌将 AMIE 与 21 名初级保健医生进行了比较，涉及 100 个跨越多次就诊的病例。基准是英国国家健康与临床优化研究所（NICE）指南和《英国医学杂志最佳实践》（BMJ Best Practice）指南。患者由演员通过文字聊天扮演。根据研究，AMIE 在治疗决策上与医生持平，并在方案准确性和指南依从性上优于医生。在首次就诊时，AMIE 的整体方案在 95% 的病例中被评为适当。而医生的这一比例为 72%。无论是专家评审员还是扮演患者的演员，都更倾向于选择 AMIE 而非人类医生。

为了测试药物知识，团队基于两个国家药物处方集构建了一个专门的基准测试，名为 RxQA，并由持证药剂师进行了验证。AMIE 在较难的问题上得分超过了初级保健医生。不过，这项测试对双方来说都很难。即使在较简单的问题上，最高得分也低于 75%。

两个团队都警告不要草率下结论

作者们对其研究发现的局限性有清晰的认识。MIRA 针对“虽小但非零”比例的患者，给出了“偏离最佳实践的诊疗建议”。模拟患者的回答也可能“比急诊科患者的真实语言更具结构性”。此外，不能完全排除免费开放的 MIMIC-IV 数据集已包含在所使用模型的训练数据中。如果是这样，那么测得的性能表现更像是一个上限，而非现实评估。作为对照的医生同样在德国急诊系统工作，而该系统与其他国家有所不同。

AMIE 的开发团队称其研究是一个“里程碑”，但强调无论是病例选择还是纯文本对话，都无法反映真实的临床环境。该系统展现出“有前景的能力”，但“尚未准备好投入现实世界的应用”。还需要更多工作来解决可能潜入系统隐藏推理步骤中的“潜在推理错误”。

与 MIRA 共同开发的研究小组负责人 Jakob Kather 向《金融时报》表示：“我们正在预览 AI 如何改变医学。”他将这类 AI 智能体比作飞机的自动驾驶仪：“这些系统可以通过接管常规任务来支持和减轻医疗专业人员的负担，但最终责任始终由医生承担。”

独立专家为这股热潮降温

未参与这两项研究的研究人员称赞了其严谨的方法论，但指出这些只是模拟。牛津大学医学社会学教授 Catherine Pope 向《金融时报》表示，这“与日常医疗保健中混乱、复杂、充满人情味的世界相去甚远。”

爱丁堡大学健康信息学教授 Julie Jacko 表示，报告中提到的许多优势归结于“方案的精确性和完整性”，而非“临床正确性上的明显差异”。该研究“展示的是针对结构化标准的性能表现，而非完全捕捉真实临床决策的复杂性。”

脚手架（Scaffolding）对弱模型帮助最大，而更强的模型则不需要它。

AMIE 的补充实验揭示了最值得关注的发现之一。与同行评审研究的常见情况一样，这两个系统都依赖于较旧的 AI 模型。AMIE 仍运行在谷歌较旧的 Gemini 1.5 Flash 上。MIRA 则使用 OpenAI 的 GPT-4o 和 o1-preview。所有这些模型此后都已被新一代模型超越。

谷歌的研究人员逐一替换了各个组件，以弄清究竟是什么驱动了性能：是双智能体架构、指南匹配和专门训练这些精心设计的框架，还是仅仅依靠底层语言模型本身。

在较旧的 Gemini 1.5 Flash 上，专门的设置带来了研究所描述的巨大性能提升。但当研究人员将同样的设置应用到更新的 Gemini 2.5 Flash 上时，这种优势几乎消失了。

换句话说，专门的系统通过强制进行结构化推理、要求引用指南以及抑制模型幻觉，来弥补旧模型的弱点。更强的模型可以自行完成所有这些工作。该论文承认，随着基础模型的改进，AMIE 的价值会缩小。事实上，像 Gemini 2.5 Pro、o3 和 GPT-5 这样的新一代通用模型在 RxQA 药物测试中已经取得了与完整 AMIE 系统“大致相当”的分数。

在实践中，AMIE 似乎已被 AI 发展的步伐所超越。这是一种不断重复的模式：围绕语言模型的框架随着更强模型的到来而变得多余，有时是因为该框架本身为下一代模型的训练数据提供了素材。这并不意味着其背后的想法毫无价值：在编程领域，并且越来越多地在其他领域，像 Claude Code、OpenAI Codex 和 Claude Cowork 这样的框架工具为模型提供了工具、上下文和记忆。即使是更强的模型，在获得此类支持后，也能在复杂任务上表现更佳。但框架必须跟上模型性能的步伐，否则最终会变成累赘。

MIRA 缺乏此类分析。不过，其架构的一部分与其说是修补模型弱点，不如说是将 AI 连接到医院的临床系统。这部分不会因为更强的模型而变得过时。
