急诊重症患者谵妄为何总被漏诊?北大三院Cell子刊:DeLiriuMAgents七智能体模拟三科会诊,跨MIMIC-IV、北大多中心、eICU三库稳健预警,准确率全面领先单模型与大模型直问
2026/8/22 4:03:21 网站建设 项目流程

一、研究背景

谵妄(delirium)是一种起病急、波动大的急性神经精神综合征,表现为注意力、意识和认知功能的突然受损 DOI: 10.1038/s41572-020-00223-4。它像急诊科里一个「沉默的隐形人」:患病率在急诊科约有 15%,进了重症监护室更是升到约 32%,却因为症状不典型、家属以为老人只是「糊涂了」,常常被漏诊、被延误。而漏诊的代价很实在——住院时间延长、认知功能加速衰退、死亡风险上升 DOI: 10.1136/bmj.h2538。

更麻烦的是,现有的谵妄预测模型大多是为 ICU 患者量身定做的,需要大量结构化数据、留出观察窗口,根本接不住急诊科「时间紧、数据少、环境乱」的现实。于是急诊重症患者的谵妄,长期处在「该预警的人预警不到」的尴尬位置。

2026 年 8 月 13 日,北京大学第三医院急诊科马青变主任医师与北京大学健康医疗大数据国家研究院孔桂兰研究员作为共同通讯作者,在 Cell Reports Medicine 发表研究,提出大模型驱动的多学科智能体系统 DeLiriuMAgents,专门解决急诊危重患者谵妄的早期预测 DOI: 10.1016/j.xcrm.2026.102986。

二、研究创新点

这项工作的价值,在于它把「智能体」真正做成了临床上的「会诊」,有三点鲜明设计:

第一,把一次预测变成一场三科会诊。系统不再输出一个冷冰冰的概率分数,而是像真实的院内多学科会诊(MDT)那样,让急诊科、神经科、精神科三位虚拟专科医生各自陈述判断,再由一个决策智能体汇总成一份带解释的风险报告。

第二,把「数据」和「知识」拧成一股绳。一边用机器学习(CatBoost)从结构化电子病历里算风险,一边用检索增强生成(RAG)实时调取临床指南、教科书和文献证据,既避免大模型「信口开河」,也补上了纯统计模型「只给分数、不给理由」的短板。

第三,多中心外部验证打通可迁移性。模型在美国 MIMIC-IV 数据库上推导,却分别用中国北京大学两家三甲医院的多中心队列和美国 eICU 数据库做了外部验证,直接检验系统跨机构、跨人群、跨国家能不能站得住。

三、技术原理

DeLiriuMAgents 由七个分工明确的智能体串起一条流水线:

  • EHRPromptAgent:把患者的结构化电子病历数据,合成为一份带参考范围比对的标准化自然语言病历摘要;
  • ModelPhysicianAgent:调用底层 CatBoost 模型(25 个特征),给出基于数据的风险预测;
  • EmergencyPhysicianAgent / NeurologyPhysicianAgent / PsychiatryPhysicianAgent:三位虚拟专科医生,分别从急诊、神经、精神三个角度做临床推理;
  • MedEvidenceAgent:通过 RAG 从预建的谵妄医学知识向量库中检索证据,为结论背书、抑制幻觉;
  • DeliriumDecisionAgent:协调各方意见,综合成最终的二元风险判定与叙述式报告。

底层大模型用的是 DeepSeek-R1(另用 Qwen3.5 做敏感性分析)。整个流程跑在普通 MacBook 上,单例约 2.5 分钟、10 次 API 调用、约 3.8 万 token,成本仅约 0.038 美元。这套「ML 算数、LLM 讲理、RAG 找证据、决策智能体拍板」的分工,正是当下临床智能体最主流的落地形态。

四、实验结果

研究在三个独立队列上检验了系统,队列规模相当可观:MIMIC-IV 内部验证 1329 例(谵妄发生率 13.6%)、北京大学多中心外部验证 1054 例(17.6%)、eICU 外部验证 5151 例(12.5%)。

核心结果一栏表:

验证集准确率灵敏度特异度
MIMIC-IV0.7490.7620.747
PKU 多中心0.7310.7080.736
eICU-CRD0.6700.7080.665

把 DeLiriuMAgents 与两种基线摆在一起,差距更说明问题:直接问大模型(LLM Directly)灵敏度高达 0.97 却几乎「见谁报谁」——特异度只有 0.21,等于把大半病人都标记成高危;单一 CatBoost 模型在内部验证上准确率 0.728。而完整的多智能体系统在三个队列上全面领先,且在消融实验里,无论抽掉模型智能体、三专科智能体还是证据智能体,性能都会下降——每个组件都不可替代。

临床可用性也得到了验证:在 100 例北京大学队列的图表审查中,90% 的报告被评为「非常准确或较准确」,96% 的临床医生表示愿意在实际工作中使用,23% 的医生在看完 AI 报告后改变了原来的判断。系统三次重复运行的预测一致性 Cohen’s κ 高达 0.950,结果稳定可复现。

五、应用前景

对急诊科的现实意义,这项研究给出了几条实在的启示:

其一,补上了急诊谵妄预警的空白。急诊重症患者病情瞬息万变,传统 ICU 模型用不上,这套系统直接面向急诊场景,能在入科早期就给出一份带解释的风险报告,为及时的预防和干预争取窗口。

其二,可解释、可交互才是进临床的入场券。医生要的从来不只是「高危」两个字,而是「为什么」和「下一步」。三科会诊式的叙述报告,让判断有了依据,也让 93% 的医生觉得它比单纯的 SHAP 特征图更有用。

其三,低成本意味着真能落地。单例约 4 美分的成本,让它在资源紧张、患者量大的急诊科具备了规模化使用的经济可行性。

需要客观指出,这项研究是回顾性验证,尚未做前瞻性随机对照,且系统输出的是二元标签加报告而非连续概率,底层也未直接报 AUROC。但它作为一份跨三库、多中心、带临床人评的完整证据链,已经把「智能体做谵妄预警」这条路的可行性说清楚了。

六、结论

谵妄难,难在它「静悄悄」。DeLiriuMAgents 用一个七智能体的多学科会诊架构,把机器学习、大模型推理和医学证据检索焊在一起,在三个独立数据库上稳稳给出预警,还让每一份判断都能被看懂、被追问 DOI: 10.1016/j.xcrm.2026.102986。

它未必能取代医生的判断,却能把「该注意到的高危患者」从急诊的嘈杂里挑出来,递到医生眼前。对还在观望「多智能体到底能不能进临床」的人来说,这或许就是最像样的那个答案。

本文基于 2026 年最新论文/开源项目的独立解读,立场与原作者无关,仅作技术交流。

论文原文信息链接:急诊重症患者的谵妄为什么总被漏诊?大模型多学科智能体 DeLiriuMAgents 模拟三科会诊,跨三个数据库稳健预警

参考文献

  1. Shang W, Shi T, Ma Q, Kong G. A large language model-driven multidisciplinary AI agent system predicts delirium in emergency critically ill patients.Cell Reports Medicine, 2026. DOI: 10.1016/j.xcrm.2026.102986
  2. Wilson JE, Mart MF, Cunningham C, et al. Delirium.Nature Reviews Disease Primers, 2020;6:90. DOI: 10.1038/s41572-020-00223-4
  3. Salluh JIF, Wang H, Schneider EB, et al. Outcome of delirium in critically ill patients: systematic review and meta-analysis.BMJ, 2015;350:h2538. DOI: 10.1136/bmj.h2538

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询