Calibre 中文图书元数据获取完整指南:国家图书馆ISBN插件的3个最快工作流
2026/8/24 22:46:26 网站建设 项目流程

Calibre 中文图书元数据获取完整指南:国家图书馆ISBN插件的3个最快工作流

【免费下载链接】NLCISBNPlugin基于中国国家图书馆ISBN检索的calibre的source/metadata插件。https://doiiars.com/article/NLCISBNPlugin项目地址: https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin

中文电子书入库后,元数据经常缺东少西:出版社、出版年缺失,中图分类号更是几乎没人能帮你补上。国家图书馆ISBN插件正好解决这件事——它接入 Calibre,按 ISBN 或书名检索国家图书馆目录,自动回填书名、作者、出版信息和中图分类号等完整元数据。

它凭什么值得装:三个同类插件没有的能力

1. 能拿到中图分类号(CLC)

这是目前唯一能获取中图分类号的 Calibre 元数据插件。它不仅把代码原样带回来,还支持按层级把它解析成可读的分类名称(1–3 级,默认 2 级)并写进标签,你的书库分类管理从此有据可依。

2. 双路检索:有 ISBN 走精确,没 ISBN 走模糊

  • 有 ISBN:直接精确匹配目录记录,一次取回整条书目信息;
  • 没有 ISBN:输入书名走模糊搜索,插件会顺带把对应的 ISBN 号一起带回来,等于帮残缺的书补上了识别码。模糊搜索还支持自动拼接作者信息,缩小匹配范围。

3. 字段全,还能区分版本

返回项覆盖书名、作者、简介、出版社、出版年份和标签。另外插件会写入一个nlchash标识符(书名+出版年的哈希),ISBN 相同但版本不同的书可以靠它区分,批量整理时不会互相覆盖。

从克隆到出结果:最短安装与首次使用路径

  1. 克隆仓库到本地:

    git clone https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin
  2. 打开 Calibre 的「首选项 > 插件」,点「加载插件从文件」,指向项目里的__init__.py(入口文件在 src/ 目录下),安装后在插件列表中勾选启用。

  3. 在书库中选中一本中文书,右键「编辑元数据」,在弹出的元数据编辑器里点「下载元数据」。插件从国家图书馆检索完毕后,核对信息、点确定即可——书名、作者、出版信息已经填好。

全程就这 3 步,不需要改任何代码。

三个真实工作流:单本补全、批量整理、学术文献库

工作流一:单本快速补全

适用场景:刚导入一本中文电子书,元数据几乎全空。

  1. 右键该书 →「编辑元数据」;
  2. 在 ISBN 栏填入号码(没有就只填书名);
  3. 点「下载元数据」,等插件回填;
  4. 确认无误后保存。

得到:书名、作者、出版社、出版年、简介、含分类的标签,一次到位。

工作流二:批量整理书库

适用场景:库里几十上百本中文书,信息混乱。

  1. 框选需要整理的一批书,批量触发元数据下载;
  2. 默认 2 线程 + 随机延时会控制请求节奏,批量跑不用额外干预;
  3. 跑完后用nlchash字段核对 ISBN 相同、版本不同的书,确认没有错配。

工作流三:建专业文献库

适用场景:研究人员按学科归档专著。

  1. 导入专著后走 ISBN 精确检索,拿全出版信息;
  2. 依赖中图分类号标签做学科归类(解析层级默认 2 级,够细但不啰嗦);
  3. 作者字段默认已清理「著/编」后缀,引文信息可直接使用;
  4. 出版年份精确到目录登记值,方便排引用格式。

让它跑得又快又稳:参数与限流保护

配置入口在「首选项 > 插件 > 自定义插件」,建议保持默认,只有遇到问题再动:

参数默认值说明
最大线程数2并发请求数。调大更快,但请求过密可能触发国家图书馆对 IP 的封锁
最大返回量6标题模糊搜索时最多取回几条结果,越大请求量越大
爬虫基础间隔时间200 ms实际间隔 = 基础间隔 + 30~600 ms 随机延时,模拟自然访问节奏
中图分类号解析层级2取值 1–3:1 只给一级分类,3 给完整路径,2 是平衡点

其余开关(标题/作者字段清洗、nlchash、纯净标签、带作者模糊搜索)都是为适配国家图书馆目录的字段格式设计的。比如作者清洗会把「XXX 著」里的后缀去掉——如果你的作者名本身以「著/编」结尾,关掉它即可,其他项没有明确理由不必碰。

踩坑清单:常见报错与排查

现象:安装时报错 It does not contain a top-level init.py file→ 原因:「加载插件从文件」时指向的位置不含插件入口__init__.py(选错了层级)。 → 解决:把路径对准项目里的__init__.py再加载;同时确认 Calibre 版本支持插件机制。

现象:ISBN 检索查不到任何记录→ 原因:稀有书、新出版的书可能尚未进入国家图书馆目录。 → 解决:改用书名模糊搜索,或核对 ISBN 本身是否抄错。

现象:请求超时、反复失败→ 原因:本地网络访问不到国家图书馆站点,或此前请求过猛导致 IP 被临时限流。 → 解决:先确认浏览器能正常打开国家图书馆 OPAC 检索页;然后把线程数和间隔恢复默认,过一段时间再重试。

现象:一个 ISBN 对应多本书时,元数据下不下来→ 原因:同一 ISBN 下存在多条目录记录(不同版本)。 → 解决:保持nlchash开启(默认即开启),靠书名+出版年区分版本;或改走标题搜索,从返回的多条结果里手动选定。

现象:书名、作者字段带多余字符→ 原因:目录原始字段含「[著]」等标注。 → 解决:标题/作者清洗默认已开启;若个别作者名被误切,关闭作者字段清洗。

它在生态里的位置

插件以元数据源(source/identify)的形式寄生在 Calibre 内部,不改动主程序行为,装完即用。配合 Calibre Web 这类 Web 书库管理工具时,元数据同样完整入库,线上线下共用一套书目信息。

项目基于 Apache 2.0 协议开源(见 LICENSE),由 Doiiars 持续维护,检索入口与字段解析在 src/init.py,中图分类号的层级解析逻辑在 src/clc_parser.py。欢迎提交代码贡献,也设有专门的交流群接收反馈。

装上不复杂:克隆仓库、指向__init__.py、点一下「下载元数据」——今晚装好,明天你导入的每本中文书都能自动带上完整元数据和中图分类号。

【免费下载链接】NLCISBNPlugin基于中国国家图书馆ISBN检索的calibre的source/metadata插件。https://doiiars.com/article/NLCISBNPlugin项目地址: https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询