小罗碎碎念
文献来源:Sellergren, A., Kazemzadeh, S., Mahvar, F. et al.An open vision-language model for diverse medical applications.Nature Medicine (2026). 研究团队来自 Google(Mountain View, CA, USA)及 Google via Advanced Clinical 等合作机构,通讯作者为 Andrew Sellergren、David F. Steiner、Daniel Golden 与 Lin Yang。模型集合包括 MedGemma 4B/27B(多模态)、MedGemma 27B Text(纯文本)及配套医学图像编码器 MedSigLIP,已开源发布。
尽管大规模多模态模型(large multimodal models)在通用视觉理解上展现出惊人能力,但通用模型往往缺乏解读与推理医学数据所需的细致医学理解能力——它们能认出"这是一张 X 光片",却读不出"左侧大量液气胸伴引流管在位"。
与此同时,医学 AI 的落地又面临三重现实约束:数据来源极其多元(放射、皮肤、病理、眼科各有各的图像规范)、任务谱系庞杂(从分类到报告生成到智能体问诊)、以及严格的隐私与本地部署要求。
此前的解法要么是训练一个个彼此孤立的专科小模型,要么是依赖闭源的前沿模型,数据出不了医院、成本下不来、黑盒无法解释。
与其为每一种医学影像单独铸造一把钥匙,不如先锻造一枚"通用医学底座"——它既懂医学影像的视觉语言,又保留通用大模型的语言与推理能力,还能开源、能本地跑、能被研究者二次微调。
这正是 Google 团队推出 MedGemma 的出发点:一个建立在 Gemma 3 架构之上、经过医学领域预训练与后训练优化的视觉-语言基础模型集合。
一句话概括一下这篇文章——让一个模型同时读懂放射影像、皮肤镜、数字病理与眼底照片,并在此基础上衍生出从报告生成到智能体问诊的广泛下游应用。
左侧是训练所用的数据来源:上半部分是四大医学影像模态——放射科胸片、皮肤科皮肤镜、数字病理切片、眼科眼底照片;下半部分是两类文本数据——合成生成的电子健康病历(EHR)文本,以及生物医学文献文本。
右侧最上方的 MedSigLIP 是一枚仅 4 亿参数的纯图像编码器,它只接收医学影像数据,不接触文本,专长是把一张医学图片压缩成可供下游使用的视觉向量,典型用途是医学图像分类与图像检索——比如从医院影像库里自动找出与当前病例最相似的历史胸片。
中间的 MedGemma 主体则是多模态大模型家族,包含 40 亿(4B)和 270 亿(27B)两个参数量版本,它同时吃影像、EHR 文本和生物医学文本三类数据,能完成放射报告撰写、多模态临床推理(看图+读病史综合判断)以及 EHR 总结与检索——其中 EHR 总结与检索这项高级能力只有 27B 版本支持。
最下方的 MedGemma 27B Text 是纯文本版本,不接收任何图像输入,只处理生物医学文本和 EHR 文本,专攻文本临床推理与医学内容总结,适合不需要看图、只需要读懂病历和文献的场景。
MedX知识岛
看完一篇好论文,下一步该做什么?找代码、查数据,还是尝试复现?
在MedX知识岛,既有医学AI领域最新的顶刊复现,也有最全面的公开代码和数据库查询系统!
注册登录即可免费探索,让医工交叉领域的前沿探索不再为代码和数据所困!
一、MedGemma不是简单的微调
MedGemma 真正的创新逻辑,不在于"把一个通用模型塞进医学数据里重新训练",而在于一次视觉端与语言端的分头强化、再在顶层对齐的系统工程。
MedSigLIP
你可以把MedSigLIP理解成一个 4 亿参数的视觉编码器(image encoder),它的唯一任务是把一张医学图像压缩成模型能读懂的视觉向量。
传统做法是直接沿用通用图像编码器(比如 SigLIP),但通用编码器在自然图像上学到的纹理、色彩概念,到了灰度胸片、染色病理切片上几乎全部失效。
Google 的做法是把原版 SigLIP-400M 用数百万对医学图像-文本配对数据做了医学微调(fine-tuned),让这双"眼睛"从头学会识别肺纹理、细胞异型性、皮肤皮损形态等医学视觉概念。
文献特别强调,MedSigLIP 不仅是 MedGemma 的视觉底座,单独拿出来作为图像编码器使用时,其零样本(zero-shot)图像分类与检索性能已经可以与许多专门训练的医学图像编码器比肩甚至超越。
基于 Gemma 3 的语言模型主干
MedGemma 并非只有一个模型,而是一个家族:
- MedGemma 4B(40 亿参数,多模态,可同时接收文本、图像或两者输入)
- MedGemma 27B(270 亿参数,多模态)
- MedGemma 27B Text(270 亿参数,纯文本优化)
与那些为了医学任务而牺牲通用能力的"专科模型"不同,MedGemma 在医学后训练中刻意保留了 Gemma 3 的通用语言能力——这意味着它既能写放射报告,也能做普通指令跟随、能与患者进行多样化对话,而不会像许多医学专用模型那样在非医学任务上失效。
MedGemma工作流程
第一步是视觉端的医学化
用数百万医学图像-文本对微调 SigLIP,得到 MedSigLIP,让模型第一次"看懂"医学影像的视觉语言。
第二步是语言端的医学化对齐
在 Gemma 3 主干上,用生物医学文本(PubMed、医学考试题、临床指南、合成电子健康记录文本)与多模态医学数据做后训练,把医学知识与视觉理解拧成一股绳。
第三步是家族化交付
4B 与 27B 两个多模态版本覆盖从轻量部署到高性能需求的不同场景,27B Text 版本则专攻纯文本临床推理与医学总结。
每一步设计的巧妙之处在于"不推倒重来"——没有从零训练一个新的大模型,而是在成熟的 Gemma 3 架构上做领域适配,这使得 MedGemma 既能快速迭代,又天然继承了 Gemma 3 的通用能力与开源生态。
二、MedGemma 性能验证
医学文本问答
研究团队在 MedQA、MedMCQA、PubMedQA、MMLU Med、AfriMed-QA、EHRQA 等一系列公开医学考试题上评测 MedGemma。
MedGemma 4B 在 MedQA 上达到 86.2% 的准确率,这在当时是开源模型中的最佳成绩——仅次于6710 亿参数的闭源模型 DeepSeek-R1(91.0%),却比体量相近的开源模型 OpenBioLLM-70B(78.2%)高出一截。
更值得细品的是 MedHallu 基准上的表现——这个基准专门测试模型能否区分"正确答案"与"听起来合理但实际错误的答案"(即医学幻觉)。
在难度最高的 hard set 上,MedGemma 4B 得分 0.50,而基础 Gemma 3 4B 只有 0.09。
这个 5 倍以上的差距说明:医学微调不是让模型"多答对几道题",而是真正教会了它在医学语境下辨别真伪、减少胡编。
医学影像分类与视觉问答
研究团队在胸片(MIMIC-CXR、CheXpert、CXR14)、病理(PathMCQA)、皮肤镜(US-Derm MCQA)、眼底(EyePACS)四大影像领域做了零样本分类测试。
以胸片为例,在分布外(OOD)的 CXR14 数据集上,MedGemma 4B 的 Macro F1 达到 50.1,而基础 Gemma 3 4B 只有 32.0;在 MIMIC-CXR 的 MAIRA 测试集上,MedGemma 4B 为 40.5,Gem… 3 4B 仅 26.7。
文献给出的整体结论是:在分布外任务上,MedGemma 相比基础模型在医学图像问答上提升 2.6%–10%,在胸片发现分类上提升 15.5%–18.1%。
在视觉问答(VQA-RAD、SLAKE)与胸片报告生成任务上,MedGemma 不仅碾压同规模的基础 Gemma 3,甚至表现得与体量远大于它的 Gemini 2.5 Flash、Gemini 2.5 Pro 等 API 模型相当。
真实医生与真实报告的对照
胸片报告生成是放射科医生最耗时的工作之一,研究团队用 RadGraph F1 这一衡量报告结构与事实准确性的指标评测 MedGemma:经过强化学习(RL)微调后的 MedGemma 4B 在 MIMIC-CXR 数据集上达到 RadGraph F1 = 30.3,超过了包括 Med-PaLM M、MAIRA-2、CheXagent、Flamingo-CXR、PaliGemma 2、MedVersa 在内的一大批专门为报告生成设计的模型,创下该数据集当时的最佳成绩。
由三名美国持证临床医生对 MedGemma 生成的报告逐题评分,结果显示 68% 的正常研究报告、49% 的异常研究报告被评为等同于或优于原始放射科报告;换算成临床决策层面,约 81% 的生成报告被认为会导致与原始报告相同或更优的临床决策。
作为参照,此前更大的 Med-Gemini 模型这一比例为 73%。
此外,在模拟临床智能体环境 AgentClinic-MedQA 中,MedGemma 27B 在患者问诊、检查解读、诊断推理等多轮任务上超过了人类医生的表现——这是一个 270 亿参数的开源模型首次在这类模拟诊疗环境中达到此高度。
文献反复强调这一点——对医院、药企、学术实验室而言,能在本地、用有限算力跑起一个接近前沿模型医学能力的开源底座,其实际价值往往不亚于性能本身。
三、从"一个模型"到"一整片生态"
MedGemma 的意义不止于又一个医学 AI 模型,而在于它改变了医学 AI 的生产关系。
在它之前,一个放射科想做胸片报告 AI,要么买闭源 API(数据出域、按月付费、黑箱不可改),要么从零训一个专科模型(需要标注数据、算力团队、数月周期)。
MedGemma 提供了第三条路:一个开源、可本地部署、已具备强医学基础能力的起点,研究者只需用自己的数据做轻量微调,就能长出适配本院流程的专科应用。
文献中一个关键发现直接支撑了这条路——在仅使用 10% 的可用训练数据时,微调 MedGemma 4B 仍然优于微调基础 Gemma 3 4B。
这意味着对数据稀缺的基层医院、罕见病研究、专科诊所而言,MedGemma 是一个"数据高效"的起点。
从应用版图看,MedGemma 已经指向了若干具体场景。
在肿瘤病理领域,它能对数字病理切片做开放提问式分析——文献给出的案例中,MedGemma 4B 对一张乳腺病理切片的回答是"高级别浸润性癌,伴显著细胞异型性与核仁突出,提示恶性肿瘤伴侵袭性生长",与病理科医生印象"浸润性导管癌(乳腺癌)"高度吻合。
在皮肤科,它从一张皮肤照片中识别出基底细胞癌(BCC)的珍珠样丘疹与可见血管,并建议转诊皮肤科医生确诊。
在电子健康记录(EHR)领域,27B Text 版本能做纵向患者数据的跨记录推理——用强化学习微调后,需要跨多条病史记录推理的问题类别获得了最大幅度的性能提升。
文献还提到一个有趣的下游生态信号:开源发布后,第三方社区已经基于 MedGemma 搭建了多模态检索增强生成(RAG)系统用于临床实践指南检索,并在 ReXrank.ai 的胸片报告生成公开排行榜上取得了靠前位置。
展望未来,文献明确指出了几条延伸方向:把放射能力从二维胸片扩展到 CT、MRI 的三维序列;接入基因组学等更多模态;以及让模型在智能体(agentic)框架中与其他工具组合,形成跨模态的综合诊疗助手。
而最根本的长期价值,在于解锁存量医学数据——全球医院里沉睡着的百万级胸片、病理切片、皮肤镜图像、眼底照片,过去因为缺乏统一的视觉-语言底座而无法被高效利用;MedGemma 这样的开源底座,让这些数据第一次有了一个可以被普遍接入、本地微调、隐私合规的"翻译器"。
MedX知识岛
看完一篇好论文,下一步该做什么?找代码、查数据,还是尝试复现?
在MedX知识岛,既有医学AI领域最新的顶刊复现,也有最全面的公开代码和数据库查询系统!
注册登录即可免费探索,让医工交叉领域的前沿探索不再为代码和数据所困!