如何用pdf2zh保留排版做PDF翻译:论文翻译完整指南
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
翻好的英文论文一打开,双栏排版散架、公式错乱、图表编号对不上,这种重灾区你大概率踩过。PDFMathTranslate(命令叫pdf2zh)做 PDF 全文双语翻译的同时保留原始排版,公式和图表原样不动。它是学生、研究人员以及任何要啃外文文献的人的翻译工具。
30 秒速览:看它能干什么
PDFMathTranslate 是一个基于大模型和版面检测技术的 PDF 翻译工具。翻译前它先用 DocLayout-YOLO 模型把文档版面"读"一遍,只动能动的文字部分。
- 公式图表保留:识别公式、图表、目录、注释等元素,只翻译文字,数学符号和图号原样保留。
- 翻译服务随便换:默认 Google 不用密钥,还支持 DeepL、OpenAI、Ollama 等二十余种服务,本地模型也能接。
- 产出双份 PDF:生成
-mono后缀的纯译文和-dual后缀的中英对照版各一份。 - 自带翻译缓存:相同文本只调一次 API,重复处理同一文档省时省额度。
装完就跑:一条命令翻出两个 PDF
需要 Python 3.11~3.12 环境,装完直接把文件喂给它:
pip install pdf2zh pdf2zh document.pdf跑完当前目录会多出document-mono.pdf和document-dual.pdf,一份纯译文、一份中英对照。不想碰命令行的话,pdf2zh -i能起图形界面,浏览器打开http://localhost:7860/上传即可;Docker 则拉取byaidu/pdf2zh镜像映射 7860 端口,Windows 用户还能直接下载 release 里的 exe 免安装运行。
真实流程:指定服务和页码翻一篇论文
最高频的玩法:手头一篇论文,想用 OpenAI 模型翻,但又只关心开头十页。下面这条命令一次性完成"选服务 + 限页码 + 出结果":
pdf2zh paper.pdf -s openai:gpt-4o-mini -p 1-10 # 指定 OpenAI 模型,只翻译第 1-10 页运行结束后,你会在目录里看到新的译文 PDF,双栏结构、图表位置和公式与原文完全对得上。
按需拧旋钮:换服务、换语言、批量翻
- 想换 DeepL,就先把环境变量
DEEPL_AUTH_KEY设好,再用-s deepl指定服务。 - 想翻日中、德中这类非中文方向,就加
-li ja -lo zh,前者源语言、后者目标语言。 - 想跳过缓存强制重新翻译,就加
--ignore-cache。 - 想批量翻一整个文件夹的文献,就把
--dir指向目录,结果统一落到-o指定的输出目录:
pdf2zh --dir /path/to/papers/ -o results/自定义 LLM 提示词--prompt、加载 JSON 配置--config、调并发线程-t等完整参数,都在 docs/ADVANCED.md 里。
眼见为实:一篇 Nature 论文的翻译前后
拿官方演示里的这篇 Nature 论文看:原文是英文双栏排版,带图注、脚注和公式;翻译后变成中文版,双栏结构、图表位置、\( \frac{b}{c} > k \)这类数学符号、脚注和页眉全部留在原处。
翻译前(英文原文):
翻译后(中文译文):
这个项目已被 EMNLP 2025 收录,PyPI 下载量超过 22 万,属于被验证过的选择。
翻车预警:三个高频坑
- 扫描版 PDF 翻不动。它解析的是 PDF 里的文本层,纯图片扫描件没有文字可识别。先把文档过一遍 OCR 生成带文本层的 PDF 再喂给它。
- 首次运行卡在模型下载。第一次跑要拉取 DocLayout-YOLO 版面模型,部分地区网络受限。按 docs/ADVANCED.md 的思路设置镜像变量:cmd 下用
set HF_ENDPOINT=https://hf-mirror.com,PowerShell 用$env:HF_ENDPOINT = "https://hf-mirror.com"。 - 换付费服务报错。各服务对应自己的环境变量名,密钥必须提前设好再用
-s切换。
每个服务对应的变量名,在 docs/ADVANCED.md 的表格里逐一查得到。
就一句话
曾经要一段段粘给翻译工具、再手动拼回排版的活,现在一条命令就保住版式翻完。PDFMathTranslate 把"PDF 翻译还保排版"压缩到了安装加一条命令的距离。
pip install pdf2zh
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考