A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Err...
2026/8/23 9:45:46
网站建设
项目流程
一、文章主要内容总结
该研究聚焦临床文档中的医疗错误检测与修正问题,系统分析了三种提示策略(零样本提示、随机示例静态提示SPR、检索增强生成动态提示RDP)在9种指令微调大语言模型(含GPT系列、Claude、Gemini等)上的表现,通过MEDEC数据集完成错误标记检测、错误句子检测、错误修正三个子任务的评估。
核心发现包括:
- 零样本提示在非典型错误和缩写密集型错误检测中召回率低;SPR虽提升召回率,但显著增加假阳性率(FPR);
- RDP通过推理时检索语义相关的临床示例,在所有模型中均表现最优:错误标记检测FPR降低约15%,错误句子检测召回率提升5%-10%,错误修正的语境和语义准确性显著改善;
- 模型规模、架构和训练策略影响任务表现,紧凑模型(如o1-mini)在错误修正中表现突出,前沿模型(如GPT-4.1)在错误句子检测中领先,但专家医师在复杂推理类错误修正上仍优于模型;
- RDP对处理临床缩写、术语和减少不必要修正(过度修正)效果显著,为临床文档自动化错误检测与修正提供了可行方案。
二、文章创新点
- 提出RAG驱动的动态提示策略(RDP),基于语义相似性为每个输入样本选择示例,替代随机抽样,解决了静态提示中示例不匹配的问题;
- 首次对零样本、SPR、RDP三种提示策略进行系统性对比,覆盖9种不同规模和架构的大语言模型,全面分析模型特性与提示策略的交互影响;
- 结合定量指标(准确率、召回率、FPR、AggScore等)和定性分析(错误模式、模型-医师差异),揭示了大语言模型在医疗错误