Evaluating Open-Weight Large Language Models for Structured Data Extraction from Narrative Medica...
2026/7/25 2:45:03 网站建设 项目流程

文章核心总结与创新点

主要内容

该研究系统评估了15款开源大语言模型(LLMs)在多场景、多语言临床报告(病理和放射学)结构化信息提取中的表现,覆盖结直肠癌肝转移、肝癌、神经退行性疾病等6类疾病,涉及荷兰语、英语、捷克语三种语言。通过对比零样本、少样本、思维链等6种提示策略,结合人工标注共识作为基准,分析模型规模、领域专业性、提示策略对提取性能的影响,最终验证了中小规模通用型LLMs在优化提示策略下,可达到接近专家标注的提取效果。

创新点

  1. 首次跨多医疗领域(病理+放射学)、多语言、多模型规模开展开源LLMs结构化提取系统评估,突破以往单一任务、单语言研究局限。
  2. 验证了中小规模通用型LLMs(4B-150B参数)性能与大型模型相当,且优于医疗专用LLMs,为资源有限机构提供实用方案。
  3. 提出提示图(Prompt Graph)策略,相比零样本提示实现12.7%的性能提升,明确了优化提示策略比模型规模更能影响提取效果。
  4. 提供开源框架与标准化基准,支持研究者快速适配自有数据集,降低临床数据结构化应用门槛。

英文原文翻译(Markdown格式)

Abstract(摘要)

背景:大型语言模型(LLMs)正越来越多地被探索用于从自由文本临床记录中提取结构化信息。然而,大多数研究聚焦于单一任务、有限模型和英语报告,在疾病类型、语言、提示策略和报告类型等维度的性能理解上存在空白

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询