技术解读MIRA 把大语言模型从“输出建议文本”升级为“在 FHIR 沙盒 EHR 里真正执行操作”的自主智能体。下文从工程实现角度拆解它的工具编排、动作空间收敛与安全约束设计。核心要点问题当前医疗 AI 多为文本级「聊天工具」无法在电子健康记录EHR中执行真实临床操作远未触及急诊全流程闭环。方法MIRA 是首个运行在 FHIR 沙盒 EHR 中的自主 AI 智能体基于 GPT-4o可调用 11 种医疗工具、覆盖超过 85,000 个临床决策选项。结果574 例真实急诊病例模拟中诊断准确率 87.8% vs 认证专科医生 78.1%P0.001指南依从性高出 35 个百分点零严重用药安全事件入院决策未遗漏任何需住院病例。意义医疗 AI 首次从「提建议」跨越到「执行操作」——自主完成问诊→开检查→解读结果→制定治疗方案的全流程标志着 AI 医生「副驾驶」copilot方案迈出关键一步。原文Towards autonomous medical artificial intelligence agentsNature2026年6月17日 | DOI: 10.1038/s41586-026-10675-5 | PMID: 42310457急诊科的临床痛点从信息碎片到决策时间窗急诊科Emergency Department, ED是医院系统中最高压、最复杂的场景之一。医生必须在极短时间窗内完成病史采集、体格检查、实验室和影像学检查开具、结果解读、鉴别诊断生成再到处方、手术安排和入院决策——每一步都在电子健康记录Electronic Health Record, EHR中完成整个流程涉及成百上千个可执行操作和数十种医学编码系统的交叉调用。然而当前几乎所有医疗大语言模型Large Language Model, LLM的应用都停留在「聊天级」——输出一段文本建议无法真正嵌入 EHR 工作流中执行操作。正如我们此前分析的 Pythia 认知筛查智能体即便是多智能体协作系统也仍然囿于特定筛查场景。而正如 Automation Bias 研究 所揭示的不恰当的 AI 建议反而可能误导医生因此 AI 能否「做对的事」比「说对的话」更为迫切。Nature于 2026 年 6 月 17 日发表的这项研究正是直面这一根本性瓶颈。由德国海德堡大学医院Heidelberg University Hospital与德累斯顿工业大学 Else Kröner Fresenius 数字健康中心EKFZJakob Nikolas Kather 教授团队领衔联合麻省总医院 A. John Iafrate 等多中心力量推出了MIRAMedical Intelligence for Reasoning and Action——首个在沙盒化 EHR 环境中实现全流程自主诊疗的 AI 智能体。第一从「聊天工具」到「临床操作者」的范式跨越。与以往仅输出自由文本建议的 LLM 不同MIRA 通过符合 HL7 FHIRFast Healthcare Interoperability Resources标准的 API 直接操作 EHR 服务器能够像真实的临床医生一样自主完成病史询问、体格检查、检验检查开立、结果解读、鉴别诊断生成、处方开具、手术安排和入院决策——全部在标准 EHR 框架内完成。第二超大规模可控行动空间与幻觉消除机制。MIRA 的行动空间覆盖 11 种医疗工具、超过 85,000 个临床决策选项包括 246 种 LOINC 实验室编码、176 种微生物学检查、超过 80,000 个 ICD-9/ICD-10 手术代码并通过**标记掩蔽Token Masking**技术强制约束输出为预定义有效选项从程序层面消除了 LLM 生成不存在检查或药物代码的可能性。第三双智能体对话框架与结构化推理。研究构建了一个「患者智能体 医生智能体MIRA」的双向对话系统——患者智能体基于 MIMIC-IV 数据库真实病历回答问诊MIRA基于 GPT-4o温度0.01则调用 o1-preview 进行多步推理规划并利用基于 RAG 的向量检索系统jina-embeddings-v3 Qdrant精准匹配 ICD 手术编码。这与 多模态 AMIE 的思路一脉相承——Nature 同期发表的 AMIE 论文也采用了类似的智能体架构但 MIRA 更进一步实现了 EHR 内的结构化操作闭环。技术原理FHIR 标准化沙盒中的自主推理与行动闭环MIRA 的技术栈可归纳为三层数据层所有患者病例来自 MIMIC-IV 数据库Beth Israel Deaconess Medical Center, 2008-2019经 2 位医生人工筛选后的 574 例真实急诊病例覆盖阑尾炎、胆囊炎、憩室炎、胰腺炎、肺炎、尿路感染Urinary Tract Infection, UTI、肺栓塞Pulmonary Embolism和胰腺癌 8 种目标疾病。交互层患者智能体基于出院小结中的现病史History of Present Illness, HPI回答 MIRA 的问诊研究验证了其回答一致性高达 99.4%且在 933 次常规对话和 880 次对抗性提示中实现零信息泄露。执行层MIRA 通过 Docker 化部署的 HAPI-FHIR 服务器以标准 CRUD 操作与 EHR 交互。所有工具参数的有效性由标记掩蔽强制约束并行工具调用机制允许在单轮对话中同时发起多项检查请求。诊断推理由 o1-preview 模型生成结构化多步计划手术编码匹配通过本地 Qdrant 向量数据库进行语义检索。数据说话诊断超越医生、指南依从性高出35个百分点研究设计了多维度严谨的对照评估核心结果如下评估维度MIRA认证专科医生P 值总体诊断准确率87.8%78.1%0.001胰腺炎诊断准确率95.2%78.6%0.05阑尾炎诊断准确率98.6%——指南依从性较医生35 pp参照0.001血液检查覆盖率51.1%28.3%0.001处方正确率468处方97.0-99.8%——用药严重安全事件0 例——入院决策召回率100%——值得注意的是MIRA 并非简单「全查策略」——其血液检查覆盖率51.1%虽高于医生的 28.3%但仍仅为真实临床基准MIMIC-IV 记录的约一半说明 MIRA 在必要检查和过度检查之间找到了更优平衡点。在 Tversky 距离惩罚过度使用评估中MIRA 在微生物学0.640、血液检查0.607和影像学0.508三个维度均显著优于医生P0.001。用药安全方面6 位盲法评审专家对 56 例 MIRA 处方进行了全覆盖安全审查零重度药物相互作用、零肾功能剂量不兼容、零过敏-药物不匹配、零 QT 风险处方、零不安全阿片类处方。唯一的 3 例治疗重复昂丹司琼重复开具、华法林/依诺肝素重叠待降阶梯、高钾血症管理中胰岛素/葡萄糖推注均被临床判定为合理仅剂量说明可更明确。偏倚鲁棒性测试显示面对 6 种偏倚场景性别不同、患者坚信健康/患癌、过度焦虑、仅说德语/法语MIRA 的性能波动极小Holm 校正后无任何偏倚条件达到统计显著——展现出超出人类医生的抗干扰能力。从实验室到临床应用前景与局限应用前景急诊分诊与住院决策辅助MIRA 入院决策零遗漏召回率100%可作为急诊 Triage 的「安全网」防止高危患者被误放回家。尤其在肺炎和肺栓塞场景中展现出极高的阴性预测值NPV100%。基层医疗能力倍增面对混合经验组含住院医师MIRA 优势扩大至 87.8% vs 71.1%P0.001——越是在经验不足的场景中MIRA 的辅助价值越突出有望缓解医疗资源不均问题。医学编码与文书减负MIRA 的手术编码匹配率阑尾炎 100%、胆囊炎 81.2%和处方填写正确率97%展示了自动化 EHR 操作的效率潜力可大幅减轻医生的文书负担。当前局限模拟患者与真实患者的差距患者智能体的回答基于结构化的出院小结文本可能比真实急诊患者的口语表达更规整缺乏真实场景中的口误、遗漏和不一致。真实世界前瞻性验证必不可少。训练数据重叠风险MIMIC-IV 是公开数据集虽需注册访问但无法完全排除被包含在 GPT-4o 训练语料中的可能。因此诊断性能应保守解读为可能的上界。给药途径错误率处方正确性中给药途径是最大薄弱项正确率 97.0%提示在真实临床部署前需专项优化。结论与产业启示MIRA 的核心价值在于完成了一次从「AI 说」到「AI 做」的范式验证——在受控沙盒环境中一个基于 GPT-4o 的自主智能体能够在标准 FHIR EHR 框架内从零开始完成一次完整的急诊诊疗流程且诊断、治疗和安全指标全面达到或超越人类医生水平。对于思陌智能科研服务而言MIRA 的方向与本公司在 AI 医疗软件开发和医疗 AI 科研服务方面的布局高度契合EHR 集成、FHIR 标准化接口、智能体工具调用链、临床安全验证框架——这些技术要素正是医疗 AI 从概念验证走向产品化的必经路径。思陌可为医院和科研机构提供从医学知识库构建、LLM 微调、EHR 接口开发到临床验证方案设计的全链条服务助力这一方向的快速落地。正如 Kather 教授所言「我们正在预览 AI 将如何变革医学。」而现在预览已经清晰地指向了一个方向AI 不仅是医生的知识库更将成为一个有执行能力的临床协作者。相关问题QMIRA 会替代急诊科医生吗A不会。MIRA 的定位是「临床副驾驶」copilot承担问诊、检查开立、处方填写等重复性高、耗时长的常规任务将医生的时间解放出来投入更有价值的临床判断和医患沟通。Kather 教授用飞机自动驾驶类比——自动驾驶承担巡航任务但机长始终拥有最终控制权。QMIRA 何时能真正用于临床A目前仍在沙盒验证阶段。Nature 论文明确指出现阶段不应在真实临床环境中部署需经过前瞻性真实世界研究验证其安全性、泛化能力和长期可靠性。考虑到医疗器械审批流程预计至少需要 3-5 年才能进入有限场景的临床试点。QMIRA 所依赖的 GPT-4o 模型已被更新版本取代这对研究意义有何影响A这一点恰恰强化了研究的工程意义——MIRA 的价值更多体现在 EHR 集成架构、工具链设计、安全约束框架和评估方法论上而非底层模型本身。将这些架构迁移到更新、更强的模型如 GPT-5、Gemini 3 等有望获得更好的性能这也为后续研究指明了方向。参考文献Ferber D, Hilgers L, Höper C, et al. Towards autonomous medical artificial intelligence agents.Nature. 2026;655:1282-1291. doi:10.1038/s41586-026-10675-5 | PMID: 42310457Johnson AEW, Bulgarelli L, Shen L, et al. MIMIC-IV, a freely accessible electronic health record dataset.Sci Data. 2023;10:1. doi:10.1038/s41597-022-01899-xSinghal K, Tu T, Gottweis J, et al. Toward expert-level medical question answering with large language models.Nat Med. 2025;31:1096-1104. doi:10.1038/s41591-025-03724-5本文基于 Ferber D et al. “Towards autonomous medical artificial intelligence agents”Nature, 2026的独立解读仅供学术交流不构成临床建议。 工程实现要点【环境层】用 FHIR 标准封装 EHR 沙盒患者档案、检验检查、处方、入院单统一映射为 FHIR 资源智能体只走标准接口读写不耦合各家 HIS 的私有 schema。【工具层】11 类医疗工具问诊、体格检查、化验、影像、会诊、处方、手术安排、入院决策等注册为可调用 function背后是 85,000 临床决策选项。【动作空间收敛】八万级选项不能直接塞进 prompt先用检索缩小候选集再分层确认到具体编码是整个系统可落地的关键工程手段。【推理闭环】基于 GPT-4o 的 ReAct 式循环观察 EHR 状态 → 推理 → 调用工具 → 结果写回 EHR直到输出入院/离院决策才终止而不是一次性生成建议。【安全约束】处方环节叠加剂量/途径/禁忌的规则校验实测零严重用药安全事件但给药途径正确率 97.0% 是最薄弱环工程上需额外兵底规则。论文原文信息链接AI能在电子病历系统里独立看病吗MIRA 自主智能体解读诊断准确率87.8%超专科医生