如何用 PDF 翻译工具把英文论文快速翻成中文且保住公式
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
批量读外文文献时,最烦的就是翻译工具把公式翻烂、或者版式碎到没法重读。PDFMathTranslate(pdf2zh)是一个完整保留公式与排版的 PDF 翻译工具,翻译完直接产出纯中文和中英对照两个版本。
三步装好 pdf2zh 并完成第一次 PDF 翻译
环境要求 Python 3.11 或 3.12。装完把 PDF 路径丢进去就行:
pip install pdf2zh pdf2zh document.pdf跑完会在当前目录生成document-mono.pdf(纯译文)和document-dual.pdf(中英对照),默认翻译服务是 Google,不用配任何密钥。
这个 PDF 翻译工具替你省了哪三件事
公式和图表原样保留
它不是逐句翻译。内置的 DocLayout-YOLO 版面模型会先识别公式、图表、目录的位置,只替换正文里的文字,公式和图注留在原处。
翻译服务随意切换
默认用 Google 不用配。想用 DeepL、OpenAI 或本地 Ollama 模型,把对应环境变量设好,用-s指定服务名即可,所有服务走统一的翻译接口,切换只是一个参数的事。
不想敲命令的话,用pdf2zh -i启动后浏览器打开http://localhost:7860/,服务、语言、页码都能在界面上选。
翻译缓存只花一次额度
相同文本第一次会调 API,之后直接读本地缓存。反复处理同一批文档时,省时间也省额度。
实战:如何指定页码范围、如何批量翻译整个文件夹
只翻摘要和引言
先读个大概时,用-p指定页码,-li/-lo指定源语言和目标语言,-t调并发线程数:
pdf2zh paper.pdf -p 1-3,5 -li en -lo zh得到的是只含指定页译文的 PDF。缓存结果不满意时加--ignore-cache强制重翻。
批量处理整个文献文件夹
文献多不用一篇篇喂,--dir指向目录、-o指定输出目录:
pdf2zh --dir /path/to/papers/ -o results/跑完results/里每个原文件都有对应的 mono 和 dual 两个 PDF。--prompt自定义提示词、--config加载 JSON 配置等全部参数见 完整参数。
PDF 翻译工具如何保住排版:翻译前后效果对比
下面是一篇 Nature 论文翻译前后的样子:
对照看:双栏结构、图注编号、脚注位置都和原文对齐,公式里的数学符号一个没坏。
注意事项:三个容易踩的坑
扫描件翻不了。它解析的是 PDF 里的文本层,纯图片扫描件要先过一遍 OCR 再喂给它。
首次下载模型可能卡住。第一次运行会拉取 DocLayout-YOLO 的 ONNX 模型,网络受限的地区先设置HF_ENDPOINT=https://hf-mirror.com再运行。
Python 版本只认 3.11~3.12。系统版本不符就用 conda 或 uv 装一个对应版本,Windows 用户也可以直接下 release 页的 exe 免安装。
适合需要大量读外文文献的研究生和研究者。装完先拿一篇论文跑一遍上面的命令试试,界面细节看 GUI 说明。
【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译,支持 Google/DeepL/Ollama/OpenAI 等服务,提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考