☰
飞桨模型库社区临床模型 emilyalsentzer/Bio_Discharge_Summary_BERT 的获取与加载指南
2026/10/9 1:49:05 网站建设 项目流程
  • 人工智能
  • 深度学习
  • 计算机视觉
  • NLP
  • 语音

【免费下载链接】models

Officially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.

项目地址:https://gitcode.com/gh_mirrors/mo/models
点击查看免费下载

本文围绕飞桨模型库(PaddlePaddle models)社区模型emilyalsentzer/Bio_Discharge_Summary_BERT的中文下载指南展开,完整给出该 ClinicalBERT 衍生模型的权重文件清单、两种获取方式(直连文件下载与paddlenlp命令行下载),并结合仓库中的模型元数据与介绍 Notebook 说明如何在 PaddleNLP 中加载该模型完成前向推理,读完后可直接完成该模型的落地使用。

一、模型背景:Bio + Discharge Summary BERT

emilyalsentzer/Bio_Discharge_Summary_BERT是 ClinicalBERT 系列模型中的Bio + Discharge Summary BERT Model,其来源与任务定位可从仓库中的元数据文件确认:

  • 模型描述(description):ClinicalBERT - Bio + Discharge Summary BERT Model,发布者(Publisher)为 emilyalsentzer,语言为英文(Language: English),授权协议为 MIT(License: mit);
  • 任务标签为「自然语言处理 / Fill-Mask(槽位填充)」,与 BERT 掩码语言模型(MLM)预训练目标一致;
  • 关联论文为Publicly Available Clinical BERT Embeddings(arXiv:1904.03323)与 *BioBERT: a pre-trained biomedical language representation model for biomedical text mining*(arXiv:1901.08746)。

以上信息记录在 模型元数据文件 中。

从 中文介绍 Notebook 的正文可以进一步了解该模型在 ClinicalBERT 系列中的位置:原论文共发布了四个 clinicalBERT 模型,其差异由两个维度交叉组合而成——

  • 初始化底座:BERT-Base(cased_L-12_H-768_A-12)或 BioBERT(BioBERT-Base v1.0 + PubMed 200K + PMC 270K);
  • 训练语料:MIMIC 全部病历文本(all MIMIC notes)或仅出院小结(discharge summaries)。

本模型即「以 BioBERT 初始化、仅在 MIMIC 出院小结上训练」的这一支。Notebook 末尾同时注明:该模型介绍及权重来源于 Hugging Face 同名模型卡,并已转换为飞桨模型格式后收录进本仓库,这也是下文下载文件以 PaddlePaddle 权重文件(.pdparams)为准的原因。

二、模型文件清单与大小

原文档给出的模型列表如下,四个文件共同构成可被 PaddleNLP 加载的完整模型目录:

模型名称模型介绍模型大小模型下载
emilyalsentzer/Bio_Discharge_Summary_BERTClinicalBERT - Bio + Discharge Summary BERT Model500.52MBmodel_config.json
model_state.pdparams
tokenizer_config.json
vocab.txt

四个文件的分工可以这样理解:

  • model_state.pdparams:PaddlePaddle 格式的全部模型权重(主体部分,模型约 500.52MB 的体积主要由它贡献);
  • model_config.json:模型结构配置,AutoModel.from_pretrained依据它还原网络结构;
  • tokenizer_config.json与vocab.txt:分词器配置与词表,加载AutoTokenizer时依赖,二者沿用 BERT 系英文词表格式。

如果只需手动下载文件,可依次访问上表中对应 URL 获取,并建议将四个文件放置在同一目录下,便于后续用本地路径直接加载。

三、方式一:直连 URL 下载各文件

即上表「模型下载」列所列的四个直连地址。这种方式适合需要精确控制文件落盘位置、或希望单独校验某一文件(例如只检查词表)的场景。下载完成后,请确认目录结构与模型名称一致,例如:

./pretrained_models/emilyalsentzer/Bio_Discharge_Summary_BERT/ ├── model_config.json ├── model_state.pdparams ├── tokenizer_config.json └── vocab.txt

四、方式二:使用 paddlenlp CLI 下载模型权重

原文档推荐的方式是通过paddlenlp提供的命令行工具一键拉取整个模型目录,共两步:

第 1 步:安装(或升级)PaddleNLP

pip install --upgrade paddlenlp

第 2 步:执行下载命令

paddlenlp download --cache-dir ./pretrained_models emilyalsentzer/Bio_Discharge_Summary_BERT

命令中的各部分含义如下:

  • paddlenlp download:PaddleNLP 内置的模型下载子命令,支持按「命名空间/模型名」形式定位模型;
  • --cache-dir ./pretrained_models:指定模型缓存目录,本例为当前目录下的./pretrained_models,下载完成后模型会按emilyalsentzer/Bio_Discharge_Summary_BERT的层级存放在该缓存目录下;
  • 末尾的emilyalsentzer/Bio_Discharge_Summary_BERT:待下载的模型名称,与 模型元数据文件 中的name字段严格一致。

使用 CLI 下载的好处是无需关心具体由哪些文件组成,命令会自动补齐完整的模型目录;这也与仓库中其他社区模型(例如同发布者的 Bio_ClinicalBERT 下载文档)采用的统一下载范式保持一致。若下载过程中遇到问题,原文档建议到 PaddleNLP 官方仓库提交 Issue 咨询。

五、下载后如何加载模型

下载完成后,可直接使用paddlenlp.transformers.AutoModel按模型名加载(首次加载时会自动触发缓存/下载逻辑)。仓库 中文介绍 Notebook 中给出的官方用法如下:

import paddle from paddlenlp.transformers import AutoModel model = AutoModel.from_pretrained("emilyalsentzer/Bio_Discharge_Summary_BERT") input_ids = paddle.randint(100, 200, shape=[1, 20]) print(model(input_ids))

说明:

  • AutoModel.from_pretrained以模型名emilyalsentzer/Bio_Discharge_Summary_BERT定位权重与配置;若已通过前文 CLI 下载到本地,也可改为传入本地目录路径;
  • 示例中input_ids使用paddle.randint(100, 200, shape=[1, 20])生成一批随机 token id(取值 100~200 均在英文 BERT 词表范围内),仅用于打通前向链路、验证模型可正常加载与推理;实际业务中应先用配套的AutoTokenizer将出院小结等临床文本分词为真实input_ids再送入模型;
  • 由于该模型的预训练目标是掩码语言模型(Fill-Mask 任务标签见 info.yaml),其输出适合用作下游 NLP 任务(如临床文本分类、命名实体识别)的文本表示底座。

六、同系列模型对照与延伸阅读

在modelcenter/community目录下,同发布者(emilyalsentzer)还提供另一个 Community 模型emilyalsentzer/Bio_ClinicalBERT,其文件清单、大小(同为 500.52MB)与下载流程完全一致,对应的是「BioBERT 初始化 + 全量 MIMIC 病历文本训练」这一支,两个模型的下载与加载方式可互为对照:

  • Bio_Discharge_Summary_BERT 下载文档(本文对应)
  • Bio_Discharge_Summary_BERT 介绍 Notebook
  • Bio_ClinicalBERT 下载文档
  • 飞桨模型库使用指南

综上,按照本文的清单核对、CLI 下载与AutoModel.from_pretrained加载三步,即可完成该 ClinicalBERT 出院小结模型在 PaddleNLP 中的获取与验证,并可在此基础上开展下游临床文本挖掘任务。

  • 人工智能
  • 深度学习
  • 计算机视觉
  • NLP
  • 语音

【免费下载链接】models

Officially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.

项目地址:https://gitcode.com/gh_mirrors/mo/models
点击查看免费下载

相关推荐

上一篇:洛雪音乐音源配置终极教程:免费打造全网音乐聚合方案
下一篇:OpCore-Simplify:5分钟搞定黑苹果EFI配置的终极开源工具

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询