兼顾理解与生成:awesome-pretrained-chinese-nlp-models 仓库 NLU-NLG 系列中文预训练模型全景指南
2026/9/18 0:17:00 网站建设 项目流程

兼顾理解与生成:awesome-pretrained-chinese-nlp-models 仓库 NLU-NLG 系列中文预训练模型全景指南

【免费下载链接】awesome-pretrained-chinese-nlp-modelsAwesome Pretrained Chinese NLP Models,高质量中文预训练模型&大模型&多模态模型&大语言模型集合项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-pretrained-chinese-nlp-models

本文聚焦开源仓库 awesome-pretrained-chinese-nlp-models 中「NLU-NLG 系列」9 个核心模型(UniLM、SimBERT、RoFormer-sim、周文王、CPM-2、CPT、GLM、PLUG、OPD),完整整理每个模型的论文出处、版本规格与各框架下载渠道,并结合 README.md 的分类体系与 docs/changelog.md 的演进记录给出选型与获取建议。读完本文,你将掌握这类"既能理解、又能生成"的中文预训练模型谱系,能够按任务场景快速锁定合适的模型与资源入口。

本文内容主体继承自仓库文档 docs/nlu-nlg-models.md,仓库的 README 与更新日志仅作为补充佐证。

一、什么是 NLU-NLG 预训练模型

在中文预训练模型体系中,主流模型通常偏向单一能力:以 BERT、RoBERTa、ALBERT、ERNIE 为代表的 NLU 系列 擅长理解(分类、抽取、匹配);以 GPT、T5、BART、CPM 为代表的 NLG 系列 擅长生成(续写、摘要、对话)。而 NLU-NLG 系列的目标是把两种能力放进同一个模型——既能做语义理解/检索,也能做文本生成。

在 README.md 的模型分类索引中,该系列被定位为:

系列代表模型详情
NLU-NLG系列UniLM · GLM · CPT · SimBERT查看全部 9 个

其技术路线大体有三类:

  • 统一掩码/预训练目标:如 UniLM 通过不同的自注意力掩码机制,把双向编码(理解)与自回归/序列到序列(生成)统一到一个 Transformer 中;GLM 则用"自回归空白填充"目标同时适配理解与生成。
  • 检索 + 生成融合:如 SimBERT、RoFormer-sim,把句向量(检索)与 Seq2Seq(生成)能力训练进同一个模型,实现"鱼与熊掌兼得"。
  • 大规模多任务统一:如 CPM-2、PLUG、OPD,以十亿到千亿级参数规模,在理解与生成两类下游任务上同时发力。

下文按 docs/nlu-nlg-models.md 的原始顺序逐一展开。

二、UniLM:统一语言模型预训练的开山之作

论文/资料

  • 2019 | Unified Language Model Pre-training for Natural Language Understanding and Generation | Li Dong, et al. | arXiv | PDF

UniLM 的核心思想是:在同一个 Transformer 上,通过不同的自注意力掩码(双向掩码、从左到右掩码、序列到序列掩码)分别模拟"理解型"预训练目标与"生成型"预训练目标,从而让单一模型同时胜任 NLU 与 NLG 任务。它也是后续大量"理解+生成"中文模型(如 SimBERT)的底层结构基础。

模型版本TensorFlowPyTorch作者源地址应用领域
Unilmbase百度网盘-tblr百度网盘-etwfYunwenTechnologygithub通用

提示:该行中 TensorFlow 与 PyTorch 列均为百度网盘分享(提取码见链接后缀),作者为 YunwenTechnology,源仓库为 Unilm,适用于通用场景。

三、SimBERT:融合检索和生成的"鱼与熊掌"

论文/资料

  • 2020 | 鱼与熊掌兼得:融合检索和生成的SimBERT模型 | 苏剑林 | spaces | Blog post

SimBERT 由苏剑林(科学空间)提出,目标是把语义向量检索生成统一到一个模型中:模型的句向量端用于相似文本检索/匹配,Seq2Seq 端用于文本生成(如改写、扩写),二者共享同一套参数。它继承了 UniLM 的掩码思想,并在中文语料上做融合训练,因此"兼顾理解和生成"。

模型版本TensorFlowPyTorch作者源地址应用领域
SimBERT Tinytiny百度网盘-1tp7ZhuiyiTechnologygithub通用
SimBERT Smallsmall百度网盘-nu67ZhuiyiTechnologygithub通用
SimBERT Basebase百度网盘-6xhqZhuiyiTechnologygithub通用

该系列共提供 tiny / small / base 三个规格,参数规模从轻量到标准逐级递进,便于在不同资源约束下选用:tiny 适合快速实验与轻量部署场景,base 适合作为生产基线。

四、RoFormer-sim:SimBERTv2,检索生成的进一步升级

论文/资料

  • 2021 | SimBERTv2来了!融合检索和生成的RoFormer-Sim模型 | 苏剑林 | spaces | Blog post

RoFormer-sim 是 SimBERT 的升级版(SimBERTv2),将底座从 BERT 更换为引入**旋转位置编码(Rotary Position Embedding)**的 RoFormer 结构,并重新设计了句向量与 Seq2Seq 的联合训练,在检索相似度和生成质量上都有进一步提升。根据 docs/changelog.md 的更新记录,2021.07.19 还发布了roformer-sim-v2:利用标注数据增强版本,即在无监督训练基础上叠加了人工标注数据增强,效果更强。

模型版本TensorFlowPyTorch作者源地址应用领域
roformer-simbase(L12)百度网盘-2cgzZhuiyiTechnologygithub通用
roformer-simsmall(L6)百度网盘-h68qZhuiyiTechnologygithub通用
roformer-sim-v2base(L12)百度网盘-w15nZhuiyiTechnologygithub通用

版本说明:base(L12) 为 12 层标准规模,small(L6) 为 6 层轻量规模;v2 是在 v1 基础上的标注增强版本。

五、周文王(Zhouwenwang):封神榜系列的 RoFormer 中文模型

模型来源:IDEA-CCNL 封神榜(Fengshenbang-LM)开源体系。根据 docs/changelog.md 的更新记录,2021.11.27 新增了 IDEA 研究院开源的封神榜系列语言模型,包含二郎神、周文王、闻仲、余元等。其中周文王属于 RoFormer 类型,定位为中文通用模型,主打理解与生成的兼顾能力。

模型版本类型TensorFlowPyTorch作者源地址应用领域
Zhouwenwangbase(L12)roformer[🤗HF]IDEA-CCNLgithub中文通用
Zhouwenwanglarge(L24)roformer[🤗HF]IDEA-CCNLgithub中文通用

规模说明:base(L12) 对应 12 层(约 110M 参数),large(L24) 对应 24 层(约 1.3B 参数)。两档均提供 HuggingFace 权重,可直接通过 transformers 生态加载使用,面向中文通用理解与生成任务。

六、CPM-2:大规模高性价比预训练模型(悟道系列)

论文/资料

  • 2021 | CPM-2: Large-scale Cost-effective Pre-trained Language Models | Zhengyan Zhang, et al. | arXiv | PDF

CPM-2 由智源研究院(BAAI-WuDao)提出,来自"悟道"(WuDao)大模型体系,主打低成本大规模预训练:通过模型结构、训练策略上的成本优化,在可控资源下训练出十亿到千亿级的生成式语言模型,兼顾理解与生成。根据 docs/changelog.md,该模型于 2021.08.16 收录进仓库。

模型版本介绍模型下载作者源地址应用领域备注
CPM-2110亿参数项目首页模型下载BAAI-WuDaogithub通用需要申请才能下载
CPM-2100亿参数项目首页模型下载BAAI-WuDaogithub中英需要申请才能下载
CPM-21980亿参数项目首页模型下载BAAI-WuDaogithub中英需要申请才能下载

下载注意:CPM-2 各规格均需申请后才能下载,下载入口与项目首页均指向悟道平台(wudaoai.cn),应用领域涵盖通用与中英双语场景,其中 1980 亿参数版本属于超大规模模型,对部署资源要求极高。

七、CPT:非均衡 Transformer,同时服务理解与生成

论文/资料

  • 2021 | CPT: A Pre-Trained Unbalanced Transformer for Both Chinese Language Understanding and Generation | Yunfan Shao, et al. | arXiv | PDF

CPT 由复旦 fastNLP 团队提出。其核心是"非均衡 Transformer"结构:编码器部分负责理解,解码器部分负责生成,二者共享大部分底层参数,从而在保证理解与生成能力的同时节省整体参数量。根据 docs/changelog.md 的介绍,CPT 是"兼顾理解和生成的中文预训练模型";同仓库的中文版 BART(docs/nlg-models.md)也是该团队为中文生成任务(如摘要)提供的可靠 Baseline,可作为对比参考。

模型版本TensorFlowPyTorch作者源地址应用领域
CPT-basebase(L12)[🤗HF]fastNLPgithub通用
CPT-largelarge(L24)[🤗HF]fastNLPgithub通用

版本说明:CPT-base 为 12 层(L12),CPT-large 为 24 层(L24),均提供 HuggingFace 权重,可直接通过 transformers 加载。

八、GLM:自回归空白填充的通用语言模型

论文/资料

  • 2022 | GLM: General Language Model Pretraining with Autoregressive Blank Infilling | Zhengxiao Du, et al. | arXiv | PDF
  • 2022 | GLM-130B: An Open Bilingual Pre-trained Model | Aohan Zeng, et al. | arXiv | PDF

GLM(General Language Model)由清华 THUDM 提出,采用自回归空白填充(Autoregressive Blank Infilling)目标进行预训练:把文本中的片段挖空,再以自回归方式按任意顺序生成被挖空的内容,从而同时适配理解任务与生成任务。根据 docs/changelog.md,2022.06.15 收录 GLM 时即指出"使用自回归填空目标进行预训练,可以针对各种自然语言理解和生成任务进行微调";随后 2022.09.11 收录的 GLM-130B 则是开源的双语(中英)预训练生成模型,是当时少有的千亿级开放双语模型。

模型版本TensorFlowPyTorch作者源地址应用领域
GLMlarge[🤗HF]THUDMgithub通用
GLMxxlarge[🤗HF]THUDMgithub通用
GLM-130B130B申请地址1 / 申请地址2THUDMgithub通用

下载注意:GLM large(约 3.35 亿参数)、xxlarge(约 100 亿参数)提供 HuggingFace 权重;GLM-130B 为 1300 亿参数级模型,需通过申请地址获取,且对推理显存要求极高。

九、PLUG:27B 参数的理解与生成一体化模型(AliceMind)

论文/资料

  • 2019 | StructBERT: Incorporating Language Structures into Pre-training for Deep Language Understanding | Wei Wang, et al. | arXiv | PDF
  • 2020 | PALM: Pre-training an Autoencoding & Autoregressive Language Model for Context-conditioned Generation | Bin Bi, et al. | ACL | PDF

PLUG 出自阿里巴巴达摩院 AliceMind 体系,相关研究脉络是 StructBERT(语言结构增强的理解预训练)与 PALM(自编码+自回归联合的上下文条件生成预训练)。根据 docs/changelog.md 的收录说明:"PLUG 集语言理解与生成能力于一身,支持文本生成、问答、语义理解等多类下游任务,PLUG 开源将助力开发者在语言理解和语言生成上做出更多延拓。"

模型版本模型下载作者源地址应用领域
PLUG27BAliceMind-需要申请Alibabagithub通用

下载注意:PLUG 为 270 亿参数级模型,需通过 AliceMind 平台申请获取;其源码位于 AliceMind 仓库的 StructBERT 目录下。

十、OPD:6.3B 中文开放域对话模型

论文/资料

  • 2022 | 待定 | , et al. | arXiv | PDF

OPD(清华 thu-coai)定位为中文开放域对话预训练模型。根据 docs/changelog.md 的收录说明:"OPD 是一个中文开放域对话预训练模型,拥有 63 亿参数,在 70GB 高质量对话数据上进行训练而成,大规模&高性能。"这也解释了为何仓库 README.md 中还存在独立的 Awesome-OPD 资源列表(涉及 On-Policy Distillation 等训练方法)。

模型版本介绍模型下载作者源地址应用领域备注
OPD6.3B项目首页模型下载thu-coaigithub中文开放域对话需要申请才能下载

下载注意:OPD 需申请后才能下载,项目首页与模型下载指向清华 coai 实验室页面,适用于中文开放域闲聊、对话生成等场景。

十一、模型对比与选型参考

综合 docs/nlu-nlg-models.md 全表,可以按参数量级、获取方式、应用领域三个维度做横向对比:

模型发布时间规模档位下载方式应用领域技术路线要点
UniLM2019base百度网盘通用统一掩码,理解+生成一体
SimBERT2020tiny / small / base百度网盘通用检索(句向量)+ 生成(Seq2Seq)融合
RoFormer-sim2021small(L6) / base(L12)百度网盘通用SimBERTv2,旋转位置编码底座,v2 为标注增强版
周文王 Zhouwenwang2021base(L12) / large(L24)HuggingFace中文通用RoFormer 类型,封神榜系列
CPM-22021110亿 / 100亿 / 1980亿申请制(悟道平台)通用 / 中英大规模高性价比预训练
CPT2021base(L12) / large(L24)HuggingFace通用非均衡 Transformer,共享参数
GLM2022large / xxlarge / 130BHuggingFace + 申请制通用自回归空白填充;GLM-130B 为开源双语千亿模型
PLUG2019-2020 研究脉络27B申请制(AliceMind)通用理解+生成一体化,阿里达摩院
OPD20226.3B申请制中文开放域对话70GB 对话数据训练

选型建议

  • 句子相似度/检索 + 改写生成都要:优先 SimBERT 或 RoFormer-sim(v2 效果更佳),二者是开箱即用的"检索+生成"融合模型,且体量小、易部署。
  • 需要标准理解+生成双任务微调:CPT、UniLM 是经典选择,均有 base 规模权重,HuggingFace 生态支持好。
  • 追求更强生成质量、资源充足:GLM(xxlarge/130B)、CPM-2(百亿/千亿)、PLUG(27B)等大参数模型更合适,但需注意申请流程与硬件成本。
  • 中文开放域对话机器人:OPD 是专门面向对话场景的选择。
  • 偏好 HuggingFace 直接加载:周文王、CPT、GLM(large/xxlarge)均提供 [🤗HF] 权重,体验最顺畅。

十二、获取资源的注意事项

结合 README.md 与上文各表,获取 NLU-NLG 系列模型时有几点实操提示:

  1. 下载渠道分三类:百度网盘(UniLM、SimBERT、RoFormer-sim,TensorFlow 与 PyTorch 权重往往分属不同链接);HuggingFace(周文王、CPT、GLM 部分版本,标有 [🤗HF]);申请制平台(CPM-2、GLM-130B、PLUG、OPD,需在项目首页/模型下载页提交申请)。
  2. 国内访问 HuggingFace 可使用镜像:README 中明确推荐使用 HuggingFace 镜像地址(hf-mirror.com)加速下载仓库模型。
  3. 网盘链接时效性:百度网盘分享链接可能因分享政策调整而失效,若遇失效可顺藤摸瓜访问作者源地址(如 ZhuiyiTechnology、YunwenTechnology 的 GitHub 仓库)寻找更新入口。
  4. 大模型部署成本:百亿级以上的模型(CPM-2、GLM-130B、PLUG)对显存、推理框架要求很高,建议先评估硬件再申请。
  5. 关注更新脉络:仓库 docs/changelog.md 记录了每个模型的收录时间与说明(如 roformer-sim-v2 的标注增强、OPD 的 70GB 对话数据等),是判断模型迭代关系的第一手资料。

十三、总结

NLU-NLG 系列是中文预训练模型中"理解与生成兼备"的一类特殊存在。通过本文对 docs/nlu-nlg-models.md 中 9 个模型的完整梳理——从 UniLM 的统一掩码、SimBERT/RoFormer-sim 的检索生成融合,到 CPT 的非均衡结构、GLM 的自回归空白填充,再到 CPM-2/PLUG/OPD 的大规模实践——可以看到一条从"轻量融合"到"千亿级统一"的清晰技术演进线。

按需选取合适的模型与下载渠道后,建议结合仓库中对应的 NLU 系列、NLG 系列 文档横向对比,并在 README.md 的分类索引中持续跟踪新收录模型,构建属于自己的中文预训练模型选型地图。

【免费下载链接】awesome-pretrained-chinese-nlp-modelsAwesome Pretrained Chinese NLP Models,高质量中文预训练模型&大模型&多模态模型&大语言模型集合项目地址: https://gitcode.com/GitHub_Trending/aw/awesome-pretrained-chinese-nlp-models

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询