- 人工智能
- 深度学习
- 计算机视觉
- NLP
- 语音
【免费下载链接】models
Officially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.
本文围绕飞桨模型库(PaddlePaddle models)社区模型emilyalsentzer/Bio_Discharge_Summary_BERT的中文下载指南展开,完整给出该 ClinicalBERT 衍生模型的权重文件清单、两种获取方式(直连文件下载与paddlenlp命令行下载),并结合仓库中的模型元数据与介绍 Notebook 说明如何在 PaddleNLP 中加载该模型完成前向推理,读完后可直接完成该模型的落地使用。
一、模型背景:Bio + Discharge Summary BERT
emilyalsentzer/Bio_Discharge_Summary_BERT是 ClinicalBERT 系列模型中的Bio + Discharge Summary BERT Model,其来源与任务定位可从仓库中的元数据文件确认:
- 模型描述(
description):ClinicalBERT - Bio + Discharge Summary BERT Model,发布者(Publisher)为 emilyalsentzer,语言为英文(Language: English),授权协议为 MIT(License: mit); - 任务标签为「自然语言处理 / Fill-Mask(槽位填充)」,与 BERT 掩码语言模型(MLM)预训练目标一致;
- 关联论文为Publicly Available Clinical BERT Embeddings(arXiv:1904.03323)与 *BioBERT: a pre-trained biomedical language representation model for biomedical text mining*(arXiv:1901.08746)。
以上信息记录在 模型元数据文件 中。
从 中文介绍 Notebook 的正文可以进一步了解该模型在 ClinicalBERT 系列中的位置:原论文共发布了四个 clinicalBERT 模型,其差异由两个维度交叉组合而成——
- 初始化底座:BERT-Base(
cased_L-12_H-768_A-12)或 BioBERT(BioBERT-Base v1.0 + PubMed 200K + PMC 270K); - 训练语料:MIMIC 全部病历文本(all MIMIC notes)或仅出院小结(discharge summaries)。
本模型即「以 BioBERT 初始化、仅在 MIMIC 出院小结上训练」的这一支。Notebook 末尾同时注明:该模型介绍及权重来源于 Hugging Face 同名模型卡,并已转换为飞桨模型格式后收录进本仓库,这也是下文下载文件以 PaddlePaddle 权重文件(.pdparams)为准的原因。
二、模型文件清单与大小
原文档给出的模型列表如下,四个文件共同构成可被 PaddleNLP 加载的完整模型目录:
| 模型名称 | 模型介绍 | 模型大小 | 模型下载 |
|---|---|---|---|
| emilyalsentzer/Bio_Discharge_Summary_BERT | ClinicalBERT - Bio + Discharge Summary BERT Model | 500.52MB | model_config.json model_state.pdparams tokenizer_config.json vocab.txt |
四个文件的分工可以这样理解:
model_state.pdparams:PaddlePaddle 格式的全部模型权重(主体部分,模型约 500.52MB 的体积主要由它贡献);model_config.json:模型结构配置,AutoModel.from_pretrained依据它还原网络结构;tokenizer_config.json与vocab.txt:分词器配置与词表,加载AutoTokenizer时依赖,二者沿用 BERT 系英文词表格式。
如果只需手动下载文件,可依次访问上表中对应 URL 获取,并建议将四个文件放置在同一目录下,便于后续用本地路径直接加载。
三、方式一:直连 URL 下载各文件
即上表「模型下载」列所列的四个直连地址。这种方式适合需要精确控制文件落盘位置、或希望单独校验某一文件(例如只检查词表)的场景。下载完成后,请确认目录结构与模型名称一致,例如:
./pretrained_models/emilyalsentzer/Bio_Discharge_Summary_BERT/ ├── model_config.json ├── model_state.pdparams ├── tokenizer_config.json └── vocab.txt四、方式二:使用 paddlenlp CLI 下载模型权重
原文档推荐的方式是通过paddlenlp提供的命令行工具一键拉取整个模型目录,共两步:
第 1 步:安装(或升级)PaddleNLP
pip install --upgrade paddlenlp第 2 步:执行下载命令
paddlenlp download --cache-dir ./pretrained_models emilyalsentzer/Bio_Discharge_Summary_BERT命令中的各部分含义如下:
paddlenlp download:PaddleNLP 内置的模型下载子命令,支持按「命名空间/模型名」形式定位模型;--cache-dir ./pretrained_models:指定模型缓存目录,本例为当前目录下的./pretrained_models,下载完成后模型会按emilyalsentzer/Bio_Discharge_Summary_BERT的层级存放在该缓存目录下;- 末尾的
emilyalsentzer/Bio_Discharge_Summary_BERT:待下载的模型名称,与 模型元数据文件 中的name字段严格一致。
使用 CLI 下载的好处是无需关心具体由哪些文件组成,命令会自动补齐完整的模型目录;这也与仓库中其他社区模型(例如同发布者的 Bio_ClinicalBERT 下载文档)采用的统一下载范式保持一致。若下载过程中遇到问题,原文档建议到 PaddleNLP 官方仓库提交 Issue 咨询。
五、下载后如何加载模型
下载完成后,可直接使用paddlenlp.transformers.AutoModel按模型名加载(首次加载时会自动触发缓存/下载逻辑)。仓库 中文介绍 Notebook 中给出的官方用法如下:
import paddle from paddlenlp.transformers import AutoModel model = AutoModel.from_pretrained("emilyalsentzer/Bio_Discharge_Summary_BERT") input_ids = paddle.randint(100, 200, shape=[1, 20]) print(model(input_ids))说明:
AutoModel.from_pretrained以模型名emilyalsentzer/Bio_Discharge_Summary_BERT定位权重与配置;若已通过前文 CLI 下载到本地,也可改为传入本地目录路径;- 示例中
input_ids使用paddle.randint(100, 200, shape=[1, 20])生成一批随机 token id(取值 100~200 均在英文 BERT 词表范围内),仅用于打通前向链路、验证模型可正常加载与推理;实际业务中应先用配套的AutoTokenizer将出院小结等临床文本分词为真实input_ids再送入模型; - 由于该模型的预训练目标是掩码语言模型(Fill-Mask 任务标签见 info.yaml),其输出适合用作下游 NLP 任务(如临床文本分类、命名实体识别)的文本表示底座。
六、同系列模型对照与延伸阅读
在modelcenter/community目录下,同发布者(emilyalsentzer)还提供另一个 Community 模型emilyalsentzer/Bio_ClinicalBERT,其文件清单、大小(同为 500.52MB)与下载流程完全一致,对应的是「BioBERT 初始化 + 全量 MIMIC 病历文本训练」这一支,两个模型的下载与加载方式可互为对照:
- Bio_Discharge_Summary_BERT 下载文档(本文对应)
- Bio_Discharge_Summary_BERT 介绍 Notebook
- Bio_ClinicalBERT 下载文档
- 飞桨模型库使用指南
综上,按照本文的清单核对、CLI 下载与AutoModel.from_pretrained加载三步,即可完成该 ClinicalBERT 出院小结模型在 PaddleNLP 中的获取与验证,并可在此基础上开展下游临床文本挖掘任务。
- 人工智能
- 深度学习
- 计算机视觉
- NLP
- 语音
【免费下载链接】models
Officially maintained, supported by PaddlePaddle, including CV, NLP, Speech, Rec, TS, big models and so on.
相关推荐
EMQX 会话过期时间上限收敛:DISCONNECT 报文中的 Session Expiry Interval 钳制机制解析
EMQX 会话过期时间上限收敛:DISCONNECT 报文中的 Session Expiry Interval 钳制机制解析 导读 本篇文章聚焦 EMQX 对
人工智能深度学习计算机视觉NLP语音Kata Containers Go 包体系解析:从 `src/runtime/pkg` 看运行时与 shim 的共享工具库
Kata Containers Go 包体系解析:从 src/runtime/pkg 看运行时与 shim 的共享工具库 Kata Containers 的 G
人工智能深度学习计算机视觉NLP语音飞桨社区模型库全景指南:470+ 社区贡献模型的目录结构、复现标准与使用路径
飞桨社区模型库全景指南:470+ 社区贡献模型的目录结构、复现标准与使用路径 飞桨(PaddlePaddle)生态中的社区模型库收录了 470+ 由开发者与高校
人工智能深度学习计算机视觉NLP语音
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考