脑脑之家AI-顶刊阅读专栏001-ICLR2026-MedAgent-Pro:通过推理智能体工作流实现循证多模态医学诊断

发布时间:2026/8/12 17:19:12
脑脑之家AI-顶刊阅读专栏001-ICLR2026-MedAgent-Pro:通过推理智能体工作流实现循证多模态医学诊断 论文标题MedAgent-Pro: Towards Evidence-based Multi-modal Medical Diagnosis via Reasoning Agentic Workflow期刊ICLR影响因子预印本暂无影响因子发表日期2025年3月arXiv最新版本2025年7月2日第一作者Ziyue Wang通讯作者Yueming Jin第一单位National University of Singapore新加坡国立大学论文DOI10.48550/arXiv.2503.18968代码https://github.com/jinlab-imvr/MedAgent-Pro摘要在现代医学中临床诊断主要依赖于对文本和视觉数据的综合分析并借助医学专业知识以确保系统化和严谨的推理。近期大型视觉-语言模型VLMs和基于智能体的方法在医学诊断领域展现出巨大潜力这得益于其有效整合多模态患者数据的能力。然而这些方法往往直接给出答案并基于经验得出缺乏定量分析的结论从而降低了其可靠性和临床可用性。本文提出MedAgent-Pro一种新的智能体推理范式遵循现代医学的诊断原则将诊断过程解耦为顺序组件以实现逐步的、基于证据的推理。MedAgent-Pro工作流呈现了一种分层诊断结构来镜像这一原则包含疾病级标准化方案生成和患者级个性化逐步推理。为支持疾病级规划设计了基于检索增强生成RAG的智能体来检索医学指南以确保与临床标准保持一致。对于患者级推理本文提出整合视觉模型等专业工具以实现定量评估。同时本文提出验证每一步的可靠性以实现基于证据的诊断强制执行严格的逻辑推理和充分依据的结论。在广泛的解剖区域、成像模态和疾病上进行的广泛实验表明MedAgent-Pro优于主流VLMs、智能体系统和最先进的专家模型。消融研究和临床专家的人工评估进一步验证了其稳健性和临床相关性。关键词医学诊断多模态推理视觉-语言模型智能体工作流循证医学检索增强生成一、引言临床诊断是医学实践中的核心任务需要综合各种临床信息以得出结论其中临床医生主要基于医学影像的视觉线索和患者记录的文本信息做出决策。例如临床医生检查放射影像以识别肿瘤规模或分析病理图像以检测潜在癌症这些都是常见的做法。早期的AI辅助方法侧重于采用纯图像分析模型来支持诊断如肿瘤学中的肿瘤分割和胸部放射学中的肺炎严重程度评估。近年来视觉-语言模型VLMs已证明整合多模态信息可以显著有益于诊断医学视觉问答VQA是这一背景下的关键任务模型基于医学图像回答文本问题。然而现有方法中制定的普通VQA仍未能反映真实的诊断过程。与执行这种单跳问答不同临床诊断涉及一个标准化的、逐步的过程。每个患者的诊断过程通常包括两个阶段01确定目标疾病并根据医学指南制定包含多个临床指标的标准化工作流以支持决策02逐步分析个性化数据结合定性和定量评估来评价这些指标。在整个过程中每个分析步骤都建立在前序假设的基础上并由相关文献或专业工具提供的分析支持。例如在青光眼诊断中杯盘比是一个关键指标它依赖于前序步骤中对视杯和视盘区域的准确定位。相比之下传统的VQA模型往往仓促生成诊断结论依赖经验性的内部知识而缺乏细粒度的分析。由于医学诊断的严格要求当前方法未能达到临床标准VLMs在一系列任务中表现出强劲性能然而它们缺乏足够的医学知识且难以进行深入的医学分析。虽然GPT-o1和DeepSeek-R1等模型融入了推理能力以支持更结构化的医学分析但其有限的细粒度视觉感知能力损害了定量分析降低了它们在临床应用中的有效性。同时智能体系统通过引入更专业的模型扩展了VLMs的能力。然而当前的医学智能体系统只是简单地将所有工具粘合在一起而非构建一个临床导向的工作流其功能更像是一个集成工具箱而非端到端的自动化解决方案。因此当被要求提供诊断时这些系统只是调用内部VLM而不选择合适的工具来支持其决策。总之现有方法将医学诊断视为经验性的单跳问答任务仅依赖VLMs的内部知识做出定性判断。然而现代医学实践强调循证诊断这需要结构化推理和临床证据。为解决这些问题本文提出MedAgent-Pro一种应对多样化多模态医学诊断任务的推理智能体工作流。本文旨在设计一个符合现代医学标准的工作流利用医学指南和定量分析提供决策支持。MedAgent-Pro采用分层结构来模拟现代临床流程在疾病级和患者级进行逐步推理。疾病级规划生成标准化诊断方案而患者级推理遵循这些方案分析个性化信息。为确保诊断方案与临床指南一致MedAgent-Pro集成了一个RAG智能体来检索相关医学知识。与现代临床工作流常规采用专业工具进行诊断支持相一致MedAgent-Pro集成了专家工具如视觉模型以实现对临床指标的准确定量评估。此外为保持多步临床推理的严谨性本文提出了一种基于证据的分析方法系统在执行下一步之前评估每一步输出的可靠性确保每个诊断推断都建立在坚实可信的基础之上。本文的主要贡献总结如下01本文提出MedAgent-Pro首个呈现系统化、基于证据的推理以实现准确可靠医学诊断的智能体范式。通过与现代医学工作流原则对齐本范式将先前方法的经验性、现成输出转化为更严谨的逻辑推理和充分依据的结论。02MedAgent-Pro呈现了一种包含疾病级和患者级推理的分层结构。基于RAG的方法确保疾病级规划与医学指南一致而定量分析和基于证据的推理则在患者级设计以确保逐步推理的专业性和可靠性。03本文在10余种成像模态、20余个解剖部位和50余种疾病上全面验证了MedAgent-Pro超越了主流VLMs、医学智能体系统甚至任务特定模型。值得注意的是它在青光眼和心脏病诊断上分别比GPT-4o提高了34%和22%。临床医生评估进一步突出了本文方法的诊断质量和可靠性。图1比较了主流VLMs、医学智能体系统以及本文提出的MedAgent-Pro在两种疾病青光眼和心脏病上的诊断结果。红色文本突出了MLLMs的局限性而绿色文本代表了MedAgent-Pro提供的基于证据的诊断。本文方法在提供全面文献支持和视觉证据的同时提高了诊断准确性。二、相关工作01 多模态医学诊断开发用于多模态医学诊断的AI技术已成为主要研究目标。先前研究聚焦于医学影像评估包括分类、检测和分割。VQA已被提出用于端到端多模态诊断而VLMs在医学VQA中展现出有竞争力的性能。尽管取得了这些进展医学VQA与诊断实践相比仍然过于简化亟需进一步研究。02 基于VLM的AI智能体开发自主智能系统是长期的研究目标基于智能体的方法正获得越来越多的关注。基于VLM的智能体在工业工程、科学实验、具身智能、游戏和社会模拟等多样化应用中取得了显著进展。尽管它们能够在无需额外训练的情况下适应各种应用但由于缺乏细粒度的视觉感知基于VLM的智能体在医学领域仍然受限。03 医学智能体系统当前的医学智能体系统可分为两类。第一类通过引入多个VLMs之间的辩论或多数投票等机制来增强VLM能力以优化响应。第二类作为多样化医学任务的工具箱将编排器智能体与各种专业模型集成。然而它们只是简单地将所有工具粘合在一起而非构建一个临床导向的工作流功能更像是一个集成工具箱无法处理复杂的诊断任务。三、方法01 整体工作流对于特定疾病临床医生通常基于医学指南制定标准化的诊断工作流。然后每个患者的诊断遵循该工作流结合定性观察和定量评估以获取临床指标。为镜像这一临床范式MedAgent-Pro设计了一个分层推理工作流包含疾病级规划和患者级推理以在标准化、疾病特定指导下为每个患者实现个性化诊断。在工作流中本文采用VLM V作为基线模型来执行工作流中的基本任务。如图2所示疾病级规划旨在基于医学指南为每种疾病制定标准化诊断方案这由一个RAG智能体辅助完成。同时患者级推理通过逐步执行诊断方案来处理每个患者的个性化数据并辅助VLM通过专业工具执行必要的定量分析从而实现基于证据的推理。以下章节将详细解释这些内容。图2MedAgent-Pro框架概览该框架通过分层结构执行诊断由VLM在RAG智能体和专业工具支持下进行推理。02 疾病级基于知识的规划在临床实践中医生基于其专业知识和经验为特定疾病制定标准化工作流。遵循这一常规本文引入检索增强生成RAG智能体R来在规划阶段纳入医学指南以指导诊断方案的生成。MedAgent-Pro配备了一个领域特定的知识库K该库基于MedlinePlus构建包含超过1,000种疾病和病症的条目以及超过4,000篇关于症状、检测、损伤和治疗的专业评审文章。如图3所示知识库K首先被索引到向量数据库中其中每个文档被分割为片段。为加速检索为每个文档预生成一句话摘要并用作其索引。接收到疾病查询后RAG智能体R通过对这些摘要进行关键词搜索来过滤不相关条目然后在剩余文档中进行向量检索提取最相关的5个片段。基于检索到的片段VLM总结其内容并生成反映所查询疾病真实临床实践的程序化指南G。G的生成过程可表述为G V(R(K))VLM首先从指南G中总结出一组疾病特定的临床指标I {I₁, I₂, …, Iₘ}。为支持对I的分析MedAgent-Pro配备了一个工具集T。为构建可执行方案VLM将G与预定义的操作描述集{A}集成其中每个元素a ∈ A与工具t ∈ T一一对应即t可以是分割模型a是其配对描述例如“该模型在眼底图像中分割视杯。”基于G和AVLM生成一个包含多个推理步骤的疾病特定诊断方案P {P₁, P₂, …, Pₙ}。每个步骤Pᵢ ∈ P表示为Pᵢ: rᵢ ⟨kᵣᵢ, vᵣᵢ⟩ ⟨kᵣᵢ, t(vₒᵢ)⟩, t ∈ T其中处理对象oᵢ ⟨kₒᵢ, vₒᵢ⟩和结果rᵢ ⟨kᵣ, vᵣ⟩表示为键值对键kₒᵢ或kᵣᵢ指定数据属性值vₒᵢ或vᵣ包含实际数据。在实践中P以JSON文件形式存储。每个Pᵢ包含一个操作键t来自工具集T的预定义Python函数具有固定的输入输出行为和两个数据字段kₒ和kᵣ分别指定t的预期输入和输出数据属性。在推理过程中VLM检查当前输入的数据属性。如果它与JSON条目中的任何kₒ匹配则调用相应的函数t以获取输出数据属性kᵣ。例如当提供眼底图像时MedAgent-Pro执行指定操作并生成相应的视杯分割掩码。在整个设计中每种疾病都被分配一个与医学指南对齐的诊断方案为每位患者实现规范化和标准化的工作流。图3RAG过程示意图采用两步检索策略。知识库首先被预处理为片段生成摘要然后通过关键词搜索和向量检索提取最相关的片段最终形成临床指南。03 患者级基于证据的推理对于该疾病的每个患者病例MedAgent-Pro遵循生成的疾病特定诊断方案P来分析临床指标I。对于每个患者的个性化多模态数据DVLM执行一个编排过程根据数据可用性从P中选择可执行步骤过滤掉需要不可用输入的步骤。P′ V(P, D)s.t. ∀Pᵢ {kᵣᵢ, vᵣᵢ} ⟨kᵣᵢ, t(vₒᵢ)⟩, kₒᵢ ∈ D如图4所示在青光眼诊断中当提供眼底图像时编排过程选择相关步骤并跳过需要不可用数据如OCT或视野的步骤。现代医学的一个核心原则是循证实践它强调认真审慎地使用可靠的临床证据结合个体临床专业知识来指导患者护理决策。遵循这一原则本文调用专业工具进行定量评估并采用基于证据的推理范式来确保可靠性。图4青光眼诊断案例研究展示了MedAgent-Pro框架中的详细工作流程。蓝色文本表示智能体绿色文本表示推理步骤。在推理中下划线文本表示通过分析识别的临床指标。01定量分析对于定量分析专业工具智能体被参与执行专业评估以弥合AI与临床实践之间的差距。工具集τ包括视觉模型如分割工具例如Medical SAM Adapter、MedSAM、Cellpose、定位模型例如Maira-2和基于LLM的编码工具例如Copilot。如图4所示专业分割工具用于提取视杯和视盘掩码而编码工具随后基于分割结果计算杯盘比这作为青光眼诊断中的关键指标。02基于证据的推理范式在顺序推理过程中系统在每个步骤Pᵢ′评估输出rᵢ ⟨kᵣᵢ, vᵣᵢ⟩以确定状态sᵢ ∈ {Continue, Terminate, Complete}该状态指导推理过程是否应继续进行。sᵢ由以下方式确定sᵢ Complete,若 kᵣᵢ ∈ Isᵢ Terminate, 若 kᵣᵢ ∉ I ∧ ¬φ(vᵣᵢ)sᵢ Continue,若 kᵣᵢ ∉ I ∧ φ(vᵣᵢ)其中φ是由VLM实现的状态评估函数它基于输入数据vₒᵢ的质量和vᵣᵢ的合理性来评估结果数据vᵣᵢ的可靠性。如果sᵢ Continue输出rᵢ被视为证据e并用作下一步推理的输入oᵢ₊₁。如果sᵢ Terminate过程被终止因为rᵢ被认为不可靠可能阻碍后续推理并导致错误诊断。此过程迭代进行直到sᵢ Complete。最终输出是一组指标推理结果R_final {rᵢ | sᵢ Complete}。然后VLM在指南G的指导下为R_final分配基于风险的权重W以平衡不同指标的结果。最终风险分数ρ计算为加权求和ρ Σᵢ₌₀^|R_final|l wᵢvᵣᵢ,s.t. wᵢ ∈ W, rᵢ ∈ R_final最终诊断通过将ρ与风险阈值θ比较得出。通过基于证据的推理MedAgent-Pro将可靠的外部证据与专家知识相结合以改进诊断决策从而促进现代诊断工作流。四、实验本文在4.2节将本文方法与VLMs、任务特定模型和医学智能体系统进行比较。消融研究和深入分析在4.3节呈现以证明本文方法的有效性。为评估临床相关性本文还在第5节进行了人工评估。01 实验设置01数据集本文在四个具有递增挑战性设置的数据集上进行实验。REFUGE2数据集用于青光眼诊断MITEA数据集用于心脏病诊断如扩张型心肌病、淀粉样变性这两个数据集都适合评估深入诊断推理。为评估对单个患者的多病诊断本文从MIMIC数据集的100名患者中采样了442例胸部X光病例每例涉及识别多达12种潜在的胸部疾病或异常。本文进一步采用新英格兰医学杂志NEJM数据库编译了992例真实诊断病例涵盖超过10个解剖区域、10种成像模态和50种疾病。对于涉及细胞或眼科影像的病例视觉工具可用。然而非临床图像如日常照片通常缺乏兼容的工具支持。02评估指标采用三个指标来评估性能对于REFUGE2、MITEA和MIMIC数据集本文报告平衡准确率bAcc和F1分数。对于NEJM数据集其中任务按照其评估协议被构建为多项选择题本文报告准确率。最佳结果以粗体突出显示次佳结果以下划线标注。03实现细节在MedAgent-Pro工作流中本文使用GPT-4o作为基线VLM并使用LangChain实现RAG智能体。为公平比较所有基线医学智能体系统也采用GPT-4o作为其底层模型。02 对比实验01与通用VLMs的比较本文与先进的VLMs进行了比较包括BioMedClip、GPT-4o、LLaVA-Med、Janus、Qwen和InternVL涵盖所有设置。由于评估的VLMs未设计用于处理3D图像本文从MITEA数据集的3D超声心动图中随机选择三个切片作为视觉输入。此过程重复十次并报告平均性能以减轻采样变异性。如表1和表2所示提出的MedAgent-Pro框架在所有数据集上均显著优于现有VLMs。具体而言与GPT-4o相比它在青光眼和心脏病诊断上的bAcc分别提高了34.0%和21.0%F1分数分别提升了55.3%和44.2%。这些结果突出了MedAgent-Pro工作流在处理复杂诊断任务特别是需要定量指标如杯盘比或左心室射血分数的任务方面的有效性。通过将视觉工具直接集成到推理过程中MedAgent-Pro实现了精确的指标计算并增强了诊断性能有效解决了现有VLMs的局限性。表1在REFUGE2、MITEA和NEJM数据集上与通用VLMs和医学智能体系统的对比%。Opht.为Ophthalmology眼科学的缩写。评估指标包括bAcc平衡准确率和F1分数。表2在MIMIC数据集上与通用VLMs的对比%。Avg.表示12个子任务的平均性能。由于篇幅限制仅呈现bAcc值。涵盖的病症包括肺不张、心脏肥大、实变、水肿、心脏纵隔增大、骨折、肺病变、肺不透明、胸腔积液、肺炎、气胸和支持设备。在NEJM数据库的各种真实诊断场景中MedAgent-Pro在具有视觉工具支持的领域如细胞成像、胸部X光、CT/MRI和眼科展示了显著的性能提升。此外它在没有视觉工具支持的病例中保持了强劲性能总体提升了7.9%证明了其在各种诊断任务中的强鲁棒性和泛化能力。另外如表2所示胸部X光诊断涉及某些依赖精确定量测量如心胸比的任务如心脏肥大。同时其他任务如骨折检测需要详细的逐步分析以识别细微异常。MedAgent-Pro在大多数任务中取得了领先性能平均性能提升显著。02与医学智能体系统的比较本文还将MedAgent-Pro与先进的医学智能体框架进行了比较包括MedAgents、MMedAgent和MDAgent。由于MedAgents和MDAgent最初为基于文本的问题设计本文将其核心机制适配到VQA设置中。如表1所示MedAgent-Pro在所有疾病和领域上均持续优于这些方法。这一性能优势源于先前方法主要为基础问答或模块化工具箱设计缺乏处理复杂多模态临床场景的能力。相比之下MedAgent-Pro整合了基于检索的诊断步骤并将视觉工具无缝集成到其推理过程中在临床环境中实现了有效且全面的决策支持。03与任务特定模型的比较此外本文将MedAgent-Pro与SOTA任务特定方法进行了比较即青光眼诊断和胸部X光分析。对于青光眼诊断本文还与REFUGE2挑战赛排行榜的获胜者进行了比较。由于排行榜仅报告AUC指标本文的比较限于该指标。如表3所示MedAgent-Pro优于这些任务特定方法尽管MedAgent-Pro中的VLMs保持零样本设置。在青光眼诊断中AUC指标提高了6.8%bAcc和F1分数分别增加了4.6%和3.3%。这一发现进一步证明将专业工具与通用VLMs集成可以实现与领域特定模型相当的性能强调了MedAgent-Pro框架的潜力。表3与任务特定模型的对比。左侧为REFUGE2挑战赛获胜者AUC指标中间为眼科VLMsbAcc和F1右侧为胸部X光VLMsbAcc。03 消融实验与详细分析01所提出关键组件的有效性本文在青光眼和心脏病诊断上进行了消融实验以评估三个关键模块的有效性规划、定量分析和基于证据的推理每个模块都建立在前一个模块的基础上。如表4所示纳入规划显著提高了整体性能而集成视觉工具进行定量分析带来了进一步的提升F1分数分别增加了34.5%和20.7%。增加基于证据的推理进一步增强了方案执行的一致性和分析的可靠性从而达到了最佳性能。这些结果验证了所提出组件的有效性并展示了它们在共同实现真正基于证据的医学诊断中的互补作用。表4关键组件包括规划、定量分析和基于证据的推理的消融实验。在青光眼和心脏病任务上评估了不同组件组合对bAcc和F1的影响。02指标精度的影响分析每一步的定性和定量分析都可能引入错误。为评估它们对最终诊断准确性的各自影响本文在青光眼诊断上进行了消融研究。由于定性分析的准确性难以量化本文使用眼科特定模型VisionUnite在工作流中进行定性分析替代原始的GPT-4o。如表5所示结果显示仅有边际改善表明在医学指南的指导下通用VLMs如GPT-4o足以进行定性分析无需额外的领域特定工具。此外在图5中本文按照先前工作模拟了噪声分割掩码并观察到更高的分割精度持续带来更好的诊断性能。这些发现表明在多模态诊断中基于证据的定量分析比经验驱动的定性分析发挥着更关键的作用。图5定量指标分析消融实验揭示了分割精度如何影响诊断性能。横轴为IoU交并比左侧纵轴为bAcc平衡准确率右侧纵轴为F1分数。表5定性指标的消融实验。比较了GPT-4o和VisionUnite在青光眼诊断工作流中进行定性分析的bAcc性能。03决策策略分析本文进一步探索了整合临床指标的替代决策策略。除了本文提出的结构化融合为临床指标分配基于风险的权重之外本文还评估了扁平融合即所有原始指标直接输入VLM进行最终决策。如图6所示结构化融合通过分配明确的权重在不同指标数量下始终优于扁平融合从而做出更平衡和全面的决策而VLMs往往只关注部分指标。图6在不同指标数量下两种决策方式结构化融合与扁平融合在青光眼诊断上的对比。结构化融合通过分配风险权重始终优于扁平融合。五、临床专家的人工评估01 与真实世界临床工作流的对齐为评估MedAgent-Pro在多大程度上反映了真实临床工作流本文量化了其在12项胸部X光诊断任务中执行的步骤数量。本文将结果与胸部临床医生的排名进行了比较其中每项任务根据感知诊断难度和时间需求从1到12进行评级。如图7所示大多数任务在总步骤数与医生评定的复杂度之间显示出明显的正相关。例如骨折是最复杂的涉及最多的步骤而支持设备需要最少的步骤被评为最不复杂。图7诊断计划复杂度与临床医生对各子任务评估的对比。柱状图表示工具使用次数观察、定位、分割折线表示临床复杂度评估。大多数任务在总步骤数与医生评定的复杂度之间显示出正相关。值得注意的是胸腔积液和心脏肥大等疾病受益于视觉工具集成显著减少了工作流步骤。相比之下骨折和水肿等任务仍然步骤密集。这是因为依赖定量指标如心胸比的诊断可以通过视觉工具自动化而需要定性评估的诊断仍然依赖顺序推理。这些发现证明了MedAgent-Pro结构化、基于证据的工作流在真实世界临床诊断中的有效性和实际兼容性。02 生成诊断内容的评估为进一步评估超越准确性的诊断质量本文在青光眼和胸部X光诊断上与临床专家进行了验证。临床医生按照五个维度对VLMs和MedAgent-Pro的诊断输出进行评分——相关性、全面性、临床可靠性、推理连贯性和语言清晰度——使用1到5分的量表。MedAgent-Pro在五个维度上均优于其他VLMs并在多样化病例中展现出强稳定性突出了本文结构化、基于证据的方法与现代医学诊断的一致性。图8临床医生对青光眼诊断a和胸部X光诊断b的评估结果。评估维度包括相关性、全面性、可靠性、连贯性和清晰度。MedAgent-Pro粉色在所有维度上均优于其他方法。六、结论广泛影响本文介绍了MedAgent-Pro一种基于推理的智能体系统旨在提供准确的多模态医学诊断解决了将诊断视为经验性任务的局限性。MedAgent-Pro纳入医学指南进行规划整合定量分析并验证每一步推理的可靠性。本文方法弥合了AI系统与临床程序之间的差距。这代表了向循证医学核心原则和推进AI在临床实践中实际应用迈出的重要一步。局限性虽然在推进自动化临床诊断方面取得了进展但本文工作仍存在若干局限性。所提出的框架依赖于视觉工具的可用性而某些医学领域仍然缺乏这些工具。此外定性分析仍然依赖VLMs这容易受到VLMs固有的不一致性和幻觉的影响。解决这些局限性对于进一步提高计算机辅助诊断的可靠性和临床影响至关重要。致谢本工作得到新加坡国立大学教育部Tier 1启动基金A-8001267-01-00和Tier 1基金A-8003261-00-00支持。Junde Wu得到英国工程与物理科学研究委员会EPSRC资助EP/S024093/1和GE HealthCare的支持。以上内容仅用于知识分享与交流学习如有任何疑问可随时沟通会及时处理谢谢您的理解与支持

相关新闻