PDFMathTranslate完整使用指南:如何快速翻译科学PDF论文并保留排版
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
处理外文文献时最折腾的,往往不是"翻译"本身,而是翻译之后的善后:公式被拆成乱码、图表漂到别的位置、目录直接丢失,最后还得手动把版式拼回去。PDFMathTranslate 解决的就是这个问题——它对 PDF 做全文翻译,同时保留公式、图表、目录和注释的原始排版,一次翻译能同时得到纯译文版和双语对照版两个 PDF。
📋 项目速览:它能做什么
- 全文翻译科学 PDF,公式、图表、目录、注释的位置和版式保持原样
- 翻译一次产出两份文件:
xxx-mono.pdf(纯译文)和xxx-dual.pdf(中英双语对照) - 接入 Google、DeepL、OpenAI、Ollama 等十多种翻译服务,其中 Ollama / Xinference 可跑本地模型
- 提供命令行、浏览器 GUI、Docker 容器、MCP 服务和 Zotero 插件多种用法
- 支持批量翻译整个目录,也能只翻译指定页码区间
翻译效果可以先看这张动图,左侧原文、右侧译文,版式逐行对齐:
🚀 三种方式跑起来:GUI / Docker / 命令行
新手安装指南:浏览器图形界面
适合不想碰终端的用户。先装好 Python(3.11–3.12 版本),然后:
pip install pdf2zh安装命令行工具及全部依赖。接着启动图形界面:
pdf2zh -i在浏览器中打开 http://localhost:7860(没自动打开就手动访问),把 PDF 拖进窗口、点 Translate 即可。成功标准:页面能拖入文件、点击翻译后出现进度和结果预览。
容器化部署步骤:Docker 一键起服务
适合部署到服务器、给团队共用。两条命令:
docker pull byaidu/pdf2zh拉取官方镜像。然后:
docker run -d -p 7860:7860 byaidu/pdf2zh后台启动并把 7860 端口映射到本机。之后浏览器访问 http://服务器IP:7860 看到翻译页面,即部署成功。
命令行方式:翻译单篇 PDF
适合习惯终端、要写脚本的用户。同样先pip install pdf2zh,然后:
pdf2zh document.pdf开始翻译,完成后在当前目录生成document-mono.pdf和document-dual.pdf,看到这两个文件就说明成功了。
🧪 实战:走一遍翻译完整流程
拿一篇英文论文example.pdf做端到端演示。
第一步,执行基础翻译命令:
pdf2zh example.pdf默认使用 Google 翻译服务,处理过程中先解析版面再逐段翻译,页数越多耗时越长,耐心等它跑完。
第二步,检查产出。当前目录下应出现两个文件:
example-mono.pdf:纯译文版,排版结构与原文一致example-dual.pdf:双语对照版,方便边读边核对
下面是同一篇文档翻译前后的页面截图,注意公式和图表都留在原位:
如果手头没有现成文件,也可以直接给在线地址:pdf2zh http://arxiv.org/paper.pdf,程序会先下载再翻译。
🛠️ 进阶调优与避坑
常用参数速查
按需挑几个用就行,不用记全:
| 参数 | 作用 | 示例 |
|---|---|---|
-s | 指定翻译服务 | pdf2zh example.pdf -s deepl |
-p | 只翻译指定页码 | pdf2zh example.pdf -p 1-5 |
-t | 并发线程数,默认 1 | pdf2zh example.pdf -t 4 |
-o | 指定输出目录 | pdf2zh example.pdf -o output |
--prompt | 自定义 LLM 提示词 | pdf2zh example.pdf --prompt prompt.txt |
--dir | 批量翻译整个目录 | pdf2zh --dir /path/to/papers/ |
指定模型时可以连写:-s openai:gpt-4o-mini,各服务需要哪些环境变量见高级用法文档。
常见报错速查
模型下载失败:首次运行要从 HuggingFace 拉取版面分析模型,网络受限时会卡住。解决方法:设置镜像站环境变量后重试——
export HF_ENDPOINT=https://hf-mirror.com译文不更新:程序会缓存已翻译文本以省 API 调用,怀疑结果不对时加--ignore-cache强制重新翻译。
复杂排版翻译后跑版:加兼容模式参数再试一次:
pdf2zh example.pdf --compatibleOpenAI 兼容接口 404:自定义代理的BASE_URL必须以/v1结尾,少写会直接 404,细节可查代理配置指南。
🔗 相关资源
- 高级用法文档:全部参数、翻译服务与环境变量说明
- API 参考:Python / HTTP 二次开发接口
- GUI 使用文档:图形界面细节与支持的语言列表
一句话总结:装好pdf2zh后,一行命令就能把外文论文变成版式无损的中文 PDF,团队共用再套个 Docker 即可。
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考