pdf2zh 把整份英文 PDF 译成中文,双栏排版和公式一个不丢
2026/9/8 22:23:41 网站建设 项目流程

pdf2zh 把整份英文 PDF 译成中文,双栏排版和公式一个不丢

【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate

组会前夜,六篇英文 PDF 还压在待办最上面,明早综述就得交。pdf2zh(PDFMathTranslate)一条命令就能把整份文档译成中文,公式、图表和双栏结构原样保留。

它交付了什么

  • 生成两版 PDF:每次翻译产出xxx-mono.pdf纯译文和xxx-dual.pdf中英对照两份文件,直接落在当前目录,不用二次导出。
  • 保留公式与图表:版面检测先把公式、图表、目录圈出来,只翻正文文字,\frac{b}{c} > k这类符号和图注编号原样保留。
  • 内置二十多种翻译后端:从免密钥的 Google 到 DeepL、OpenAI,再到 Ollama 本地推理都能接,-s参数一换就切换。
  • 自带翻译缓存:翻译结果写进本地缓存,同一句子第二次出现直接复用,不重复烧 API 额度。

跑起来之前

环境要求:Python 3.11 ~ 3.12,依赖随pip一次装齐。

pip install pdf2zh
  • 首次运行自动从 HF 拉取wybxc/DocLayout-YOLO-DocStructBench-onnx版面模型,下载卡住就设HF_ENDPOINT=https://hf-mirror.com再试
  • GUI 模式占用 7860 端口,冲突时加--serverport换端口

主流程:四步翻完一个 PDF

默认 Google 服务零配置,四步走完:

安装依赖。一条命令装齐所有组件:

pip install pdf2zh

执行翻译。跑完后当前目录多出document-mono.pdfdocument-dual.pdf

pdf2zh document.pdf

图形界面模式。不想敲参数就开 WebUI,浏览器访问http://localhost:7860/,拖文件、选服务、点 Translate:

pdf2zh -i

容器部署。服务器场景直接拉镜像,映射 7860 端口拿到同样的 WebUI:

docker pull byaidu/pdf2zh # 官方镜像 docker run -d -p 7860:7860 byaidu/pdf2zh

换翻译服务与自定义提示词

参数作用典型值
-s切换翻译服务,LLM 可直接带模型名-s openai:gpt-4o-mini
-p只翻指定页码,先试水前几页-p 1-3,5
-li/-lo源语言与目标语言-li en -lo ja
--dir-o批量翻译整个目录,输出落到指定路径pdf2zh --dir papers/ -o out/
--prompt自定义 LLM 提示词文件,支持${text}等变量--prompt prompt.txt

完整参数列表与各翻译服务对应的环境变量名,见 docs/ADVANCED.md。

翻译后的 PDF 长什么样

先看译前:上传文件后,右侧直接是英文原文的双栏预览。

译完再看同一篇:双栏结构、图表编号、脚注和页眉位置全部对得上,公式区域整块跳过不翻译,正文变成中文,页面下方还能直接下载译好的文件。

两个输出文件的差别一句话带过:mono版只有译文,dual版逐页中英对照,适合边读边核原文。

做不了什么,以及怎么绕

纯图片扫描件没有文本层,pdf2zh 解析不出任何文字。先用任意 OCR 工具补出文本层,再交给它处理。

首次拉取版面模型时,网络受限的环境容易卡在下载进度。设 HF 镜像再跑一次:

export HF_ENDPOINT=https://hf-mirror.com

7860 端口被别的进程占用时,GUI 起不来。--serverport 7861换个端口启动即可。

组会前夜那六篇,装完逐篇跑一遍,明早的综述就齐了。项目被 EMNLP 2025 收录,更新也活跃,够你安心押上组会汇报。

【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询