A Specialized Large Language Model for Clinical Reasoning and Diagnosis in Rare Diseases
2026/8/7 12:34:44 网站建设 项目流程

文章主要内容总结

该研究针对罕见病诊断周期长(平均4-8年)、现有方法存在证据提取与诊断推理脱节、大语言模型(LLM)面临数据稀缺、知识陈旧和幻觉等问题,开发了一款专注于罕见病临床推理与诊断的领域专用大语言模型RareSeek-R1

  1. 核心数据资源构建

    • 构建了三大罕见病专用资源:包含约5亿tokens的大规模临床语料库(RareMed-Corpus,涵盖去标识化电子健康记录、医学文献、病例报告和合成病例)、临床医生验证的推理数据集(RareMed-CoT,含17,477条高质量推理链)、图基检索资源(RareMed-RAG,整合ClinVar、HPO等权威数据库的变异-基因-表型-疾病关联)。
    • 搭建了五大评估基准(含内部/外部EHR、RareBench、基因组数据关联病例等),覆盖11,429个罕见病病例,为模型评估提供全面支撑。
  2. 模型训练框架
    采用渐进式参数高效迁移学习三阶段策略:

    • 阶段1:基于RareMed-Corpus的领域专用指令微调,注入罕见病知识并保留通用语言能力;
    • 阶段2:基于RareMed-CoT的思维链(CoT)微调,强化多步骤临床推理与异质证据整合;
    • 阶段3:图基检索增强生成(GraphRAG),结合罕见病知识图谱减少幻觉,对齐最新生物医学知识。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询