Calibre 中文图书元数据获取完整指南:国家图书馆ISBN插件的3个最快工作流
【免费下载链接】NLCISBNPlugin基于中国国家图书馆ISBN检索的calibre的source/metadata插件。https://doiiars.com/article/NLCISBNPlugin项目地址: https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin
中文电子书入库后,元数据经常缺东少西:出版社、出版年缺失,中图分类号更是几乎没人能帮你补上。国家图书馆ISBN插件正好解决这件事——它接入 Calibre,按 ISBN 或书名检索国家图书馆目录,自动回填书名、作者、出版信息和中图分类号等完整元数据。
它凭什么值得装:三个同类插件没有的能力
1. 能拿到中图分类号(CLC)
这是目前唯一能获取中图分类号的 Calibre 元数据插件。它不仅把代码原样带回来,还支持按层级把它解析成可读的分类名称(1–3 级,默认 2 级)并写进标签,你的书库分类管理从此有据可依。
2. 双路检索:有 ISBN 走精确,没 ISBN 走模糊
- 有 ISBN:直接精确匹配目录记录,一次取回整条书目信息;
- 没有 ISBN:输入书名走模糊搜索,插件会顺带把对应的 ISBN 号一起带回来,等于帮残缺的书补上了识别码。模糊搜索还支持自动拼接作者信息,缩小匹配范围。
3. 字段全,还能区分版本
返回项覆盖书名、作者、简介、出版社、出版年份和标签。另外插件会写入一个nlchash标识符(书名+出版年的哈希),ISBN 相同但版本不同的书可以靠它区分,批量整理时不会互相覆盖。
从克隆到出结果:最短安装与首次使用路径
克隆仓库到本地:
git clone https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin打开 Calibre 的「首选项 > 插件」,点「加载插件从文件」,指向项目里的
__init__.py(入口文件在 src/ 目录下),安装后在插件列表中勾选启用。在书库中选中一本中文书,右键「编辑元数据」,在弹出的元数据编辑器里点「下载元数据」。插件从国家图书馆检索完毕后,核对信息、点确定即可——书名、作者、出版信息已经填好。
全程就这 3 步,不需要改任何代码。
三个真实工作流:单本补全、批量整理、学术文献库
工作流一:单本快速补全
适用场景:刚导入一本中文电子书,元数据几乎全空。
- 右键该书 →「编辑元数据」;
- 在 ISBN 栏填入号码(没有就只填书名);
- 点「下载元数据」,等插件回填;
- 确认无误后保存。
得到:书名、作者、出版社、出版年、简介、含分类的标签,一次到位。
工作流二:批量整理书库
适用场景:库里几十上百本中文书,信息混乱。
- 框选需要整理的一批书,批量触发元数据下载;
- 默认 2 线程 + 随机延时会控制请求节奏,批量跑不用额外干预;
- 跑完后用
nlchash字段核对 ISBN 相同、版本不同的书,确认没有错配。
工作流三:建专业文献库
适用场景:研究人员按学科归档专著。
- 导入专著后走 ISBN 精确检索,拿全出版信息;
- 依赖中图分类号标签做学科归类(解析层级默认 2 级,够细但不啰嗦);
- 作者字段默认已清理「著/编」后缀,引文信息可直接使用;
- 出版年份精确到目录登记值,方便排引用格式。
让它跑得又快又稳:参数与限流保护
配置入口在「首选项 > 插件 > 自定义插件」,建议保持默认,只有遇到问题再动:
| 参数 | 默认值 | 说明 |
|---|---|---|
| 最大线程数 | 2 | 并发请求数。调大更快,但请求过密可能触发国家图书馆对 IP 的封锁 |
| 最大返回量 | 6 | 标题模糊搜索时最多取回几条结果,越大请求量越大 |
| 爬虫基础间隔时间 | 200 ms | 实际间隔 = 基础间隔 + 30~600 ms 随机延时,模拟自然访问节奏 |
| 中图分类号解析层级 | 2 | 取值 1–3:1 只给一级分类,3 给完整路径,2 是平衡点 |
其余开关(标题/作者字段清洗、nlchash、纯净标签、带作者模糊搜索)都是为适配国家图书馆目录的字段格式设计的。比如作者清洗会把「XXX 著」里的后缀去掉——如果你的作者名本身以「著/编」结尾,关掉它即可,其他项没有明确理由不必碰。
踩坑清单:常见报错与排查
现象:安装时报错 It does not contain a top-level init.py file→ 原因:「加载插件从文件」时指向的位置不含插件入口__init__.py(选错了层级)。 → 解决:把路径对准项目里的__init__.py再加载;同时确认 Calibre 版本支持插件机制。
现象:ISBN 检索查不到任何记录→ 原因:稀有书、新出版的书可能尚未进入国家图书馆目录。 → 解决:改用书名模糊搜索,或核对 ISBN 本身是否抄错。
现象:请求超时、反复失败→ 原因:本地网络访问不到国家图书馆站点,或此前请求过猛导致 IP 被临时限流。 → 解决:先确认浏览器能正常打开国家图书馆 OPAC 检索页;然后把线程数和间隔恢复默认,过一段时间再重试。
现象:一个 ISBN 对应多本书时,元数据下不下来→ 原因:同一 ISBN 下存在多条目录记录(不同版本)。 → 解决:保持nlchash开启(默认即开启),靠书名+出版年区分版本;或改走标题搜索,从返回的多条结果里手动选定。
现象:书名、作者字段带多余字符→ 原因:目录原始字段含「[著]」等标注。 → 解决:标题/作者清洗默认已开启;若个别作者名被误切,关闭作者字段清洗。
它在生态里的位置
插件以元数据源(source/identify)的形式寄生在 Calibre 内部,不改动主程序行为,装完即用。配合 Calibre Web 这类 Web 书库管理工具时,元数据同样完整入库,线上线下共用一套书目信息。
项目基于 Apache 2.0 协议开源(见 LICENSE),由 Doiiars 持续维护,检索入口与字段解析在 src/init.py,中图分类号的层级解析逻辑在 src/clc_parser.py。欢迎提交代码贡献,也设有专门的交流群接收反馈。
装上不复杂:克隆仓库、指向__init__.py、点一下「下载元数据」——今晚装好,明天你导入的每本中文书都能自动带上完整元数据和中图分类号。
【免费下载链接】NLCISBNPlugin基于中国国家图书馆ISBN检索的calibre的source/metadata插件。https://doiiars.com/article/NLCISBNPlugin项目地址: https://gitcode.com/gh_mirrors/nl/NLCISBNPlugin
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考