北京清华长庚医院8月14日电(神经内科 宋晓微)近日,北京清华长庚医院神经内科武剑教授团队联合清华大学电子工程系吴及教授团队在《人工智能与神经病学》(AI in Neurology, eISSN: 3135-307X)发表原创研究论文“模拟不同模式的临床信息流以实现稳健的卒中分诊:一项多中心的基于文本和影像的大模型评估(Simulating Clinical Information Flows for Robust Stroke Triage: A Multicenter Evaluation of Text-Grounded Versus Pixel-Grounded Large Models)”。神经内科副主任医师宋晓微及清华大学电子工程系杨少帅,史益鸣为共同第一作者。
核心速览:该研究针对急诊卒中分诊中电子健康记录(Electronic Health Records, EHR)异质性和影像报告信息丢失的痛点,设计并比较了三种模拟真实临床工作流的AI范式。研究发现,直接整合原始CT(Computed Tomography)图像的全面的多模态模型,在跨中心的外部验证中表现最稳健,尤其是在识别时间敏感的大血管闭塞(Large Vessel Occlusion, LVO)任务上,优于仅依赖病例文本或依赖影像报告中介的模型。这提示,将原始影像作为“客观锚点”是克服真实世界数据异质性、提升AI辅助诊断安全性和泛化能力的关键。
研究背景:急诊卒中分诊的“信息迷雾”与AI的机遇
急性缺血性卒中(尤其是大血管闭塞型)是致死致残的主要原因,时间就是大脑。急诊医生需要在极短时间内,整合患者的电子健康记录(EHR)和头部CT影像,快速判断是否为卒中、是出血性还是缺血性、是否存在LVO(这决定了患者是否要接受血管内治疗)。
然而,现实充满挑战:
首先,EHR的“方言”:不同医院、甚至同一医院不同医生的记录习惯不同,存在大量非结构化文本、缺失值和记录偏差(即“数据异质性”)。
其次,报告的“压缩损失”:放射科医生书写的报告是对三维影像的文本总结,这个过程不可避免会丢失细微的、但对诊断至关重要的空间信息(如早期缺血的微小征象)。
大型语言模型(Large Language Models, LLM)和视觉-语言模型(Large Vision-Language Models, LVLM)为整合多模态信息提供了新可能。但问题在于:哪种信息整合方式最适合急诊场景?是只看病历,还是看报告,还是让AI直接“看”原始图像?
研究方法:研究团队设计了三种AI系统,模拟从“最简”到“最全”的三种临床信息获取方式:
范式1:纯文本临床智能体(Sole Clinical Agent, SCA) —— “只听描述”的实习生。
输入: 仅使用经统一模板标准化预处理后的EHR文本(主诉、病史、体格检查等)。
模拟场景:医生仅凭病历记录做判断,无影像辅助。
模型:Qwen2.5-3B-Instruct(也测试了GPT API作为参考)。
范式2:报告中介协同智能体(Report-Mediated Collaborative Agents, RMCA)—— “听报告”的实习生。
流程:分为两步。第一步,一个放射科智能体(Radiology Agent, RA, 基于LVLM)“阅读”CT图像,生成一份模拟的放射学报告。第二步,一个诊断智能体(Diagnosis Agent, DA,基于LLM)结合EHR文本和这份生成的报告,做出最终诊断。
模拟场景:模拟了“影像科医生出报告 -> 临床医生看报告+病历”的经典流程。
关键点:信息在报告生成环节被“压缩”了。
范式3:整体多专家整合智能体(Holistic Multi-expert Integrative Agent, HMIA) —— “既听报告又亲眼阅片”的实习生(本研究的最佳范式)。
流程:同样有RA生成报告,但DA升级为LVLM,其输入同时包含了EHR文本、生成的报告、以及原始的CT图像(以伪视频形式输入)。
模拟场景:模拟了资深医生在掌握全部信息(病历+报告+原始影像)后做出的综合判断。
数据与验证:研究纳入四家医疗机构的数据,包括一个内部队列(n=3090)和来自另外三家机构的三个外部验证队列(合计n=151),用于检验模型在跨中心数据异质性下的泛化能力。

图1 面向急诊卒中分流及多中心评估的工作流对齐式AI系统范式
主要结果:原始图像是应对“水土不服”的定海神针
内部验证:在基于Qwen2.5的实现中,各范式总体保持较高表现,HMIA取得最佳综合结果,卒中分类F1为94.0,LVO检测F1为73.6。外部验证:真正的考验来了。当模型部署到从未见过的、数据记录习惯和CT设备都不同的新医院时,性能出现显著分化:
文本模型(SCA)大幅滑坡:卒中分类F1从93.6降至至57.4,说明纯文本模型严重“水土不服”,难以适应EHR的书写差异。
报告中介模型(RMCA)表现中等:优于纯文本,但面对需要捕捉细微影像征象的LVO任务时,其F1为61.4,力不从心。
整体模型(HMIA)表现最稳健:在卒中分类(F1: 63.9)和最关键的LVO检测(F1: 68.8)上均取得最佳成绩。直接整合原始CT图像,为模型提供了额外的视觉证据,降低了其对报告文本质量和EHR记录差异的依赖。
安全性的关键指标:在出血性卒中(溶栓绝对禁忌症)的识别上,包含影像信息的模型(RMCA和HMIA)召回率高于纯文本模型,这表明多模态模型能更有效地避免潜在的危险治疗决策。

图2 代表性案例实践
结论与启示:为AI辅助急诊设计“正确的工作流”。
这项研究的核心结论极具临床指导意义:首先,工作流设计决定AI成败:模拟完整临床工作流(即同时获取文本和影像)的AI系统,比简化版(只看文本或只看报告)更具实用价值和鲁棒性。其次,警惕“信息瓶颈”:在安全至上的医疗决策中,过度依赖经过人为或模型总结的“压缩”信息(如报告)是有风险的。直接获取原始数据(如图像)能保留关键细节,是提升AI安全性和有效性的关键。最后,泛化能力是落地的前提:该研究有力地证明了,在数据异质性极大的真实世界,多模态模型(特别是HMIA)是克服“中心偏移”问题、实现AI工具在不同医院推广应用的更有希望的路径。
本研究也存在一些局限性:如外部验证样本量小、“伪视频”的3D CT表示方法可能丢失物理间距信息,以及两个外部队列仅包含LVO阳性病例,限制了分中心校准、置信区间估计和亚组分析,也可能影响对泛化性能的估计等。这些都为后续研究指明了方向。
未来展望:这项研究为开发真正能辅助急诊医生的AI工具提供了重要的设计原则。未来的工作可能包括:更大规模的前瞻性验证、更精细的3D影像编码、以及将模型嵌入移动卒中单元等实际工作流中。
总而言之,这项研究告诉我们,在急诊卒中分诊这个争分夺秒且人命关天的场景下,给AI配备一双可以直接“阅片”的“眼睛”,远比让它只“阅读”病历和报告要可靠得多。这是多模态AI在临床落地中一个非常扎实的实践探索。
阅读原文

识别二维码或复制下方链接至网页,了解文章详情。
https://doi.org/10.64187/ain.2026.v1.i3.004
引用
Yang, S.S., Song, X.W., Shi, Y.M., et al. Simulating Clinical Information Flows for Robust Stroke Triage: A Multicenter Evaluation of Text-Grounded Versus Pixel-Grounded Large Models. AI Neurol. 2026;1(3):54–68. https://doi.org/10.64187/ain.2026.v1.i3.004

北京清华长庚医院APP
快速挂号