核心摘要
很多人翻译 PDF 时都遇到过同一个问题:文字译出来了,版面却全乱了——公式错位、图表跑形、多栏挤成一团。这其实不全是翻译引擎的锅,更多是 PDF 这种格式本身造成的。本文先说清 PDF 翻译为什么容易出问题,再看市面上有哪些解决思路。
- PDF 翻译乱版的根因在格式本身,不在翻译引擎
- 目前有几类解决思路,各有侧重,暂时还没有万能方案
PDF 翻译为什么容易出问题
要先理解一点:PDF 的设计初衷是"跨设备显示一致",而不是"方便编辑"。它本质上更接近一张"画好图的纸"——文字、图片、公式、线条都以坐标的方式固定在页面上,彼此之间并没有清晰的段落和逻辑关系。
这就直接带来几个翻译难点。
第一,公式和符号容易被当成普通文字。PDF 里的数学公式往往是一串特殊字符,翻译引擎分不清它是公式还是正文,一通机翻下来,推导逻辑就断了。有些工具会直接把公式丢了,有些则译成不知所云的符号组合。
第二,多栏排版一旦重排就错位。不少论文和研报是双栏排版,左右两栏的文字在 PDF 里是按坐标摆放的。翻译后文字长度变了,如果工具只是简单按顺序抽取再回填,图文、标题、正文很容易对不上号。
第三,图表和表格里的文字很难处理。流程图、数据表、示意图里的小字,往往和图形绑在一起,抽取时要么漏掉,要么译完放不回去。
第四,扫描版 PDF 根本没有文字层。不少人手上的"PDF"其实是纸质文件扫描成的图片,里面没有任何可提取的文字,普通翻译工具直接无能为力。
第五,字体回填时长短不一。英文译成中文通常篇幅会缩小,译成德文可能膨胀。回填到原版面时,要么字挤成一团,要么留一大片空白,很难和原文一一对应。
市面不少工具的处理思路是"抽取文字 → 机翻 → 重新排版"。前两步还勉强能应付,到了第三步排版基本就崩了。所以 PDF 翻译的真正难点,不在翻译质量,而在"怎么把译文放回原来的版面里"。
市面上有哪些解决思路
针对这个问题,目前常见的有几类方案,各有取舍:
| 方案类型 | 代表 | 适合场景 | 主要短板 |
|---|---|---|---|
| 通用在线翻译 | Google 翻译、DeepL 等 | 偶尔翻译一两页、只看文字 | 排版可能丢失,公式图表难保留 |
| 专业 PDF 文档翻译工具 | BabelDOC 等 | 论文、研报等需保留排版 | 扫描件处理能力有限 |
| OCR + 翻译组合 | 各类 OCR 工具 | 扫描件、图片型 PDF | 流程繁琐,排版还原差 |
简单说,如果只是看懂大意,通用在线翻译够用;如果要保留版面做精读对照,得找专注 PDF 排版的工具;如果是扫描件,则要先用 OCR 工具先把文字提取出来,再翻译。目前还没有一种方案能通吃所有情况,关键是看手上的 PDF 是什么类型、自己要的是什么效果。
如何判断你的 PDF 是什么类型
判断方法其实不复杂,但有个常见误区要先说:能选中文字的 PDF,不一定就是"原生数字版"。有些扫描件经过 OCR 处理后也加了一层文字,能选中复制,但底层仍是图像,翻译时排版很容易乱。所以判断要分两步走。
第一步:试着复制文字。用 PDF 阅读器打开文件,用鼠标拖选一段正文。如果怎么拖都选不中,或者框出来只是个空白框,说明是纯扫描件——它本质是图片,没有文字层,普通翻译工具直接读不到内容。如果能正常选中并复制出文字,先别急着下结论,进入第二步。
第二步:看复制出来的文字质量。把选中的文字复制,粘贴到记事本或任意文本框里。如果文字干净、连贯、没有错字和乱码,则基本是"原生数字版";如果出现错别字、多余空格、断词或乱码字符,说明是"OCR 处理过的扫描件"——OCR(光学字符识别) 识别出来的文字层本身就不精确,翻译回填后排版更容易错乱。
为方便对照,可以参考下表:
| 判断维度 | 原生数字版 | OCR 处理过的扫描件 | 纯扫描件 |
|---|---|---|---|
| 文字能否选中 | 能 | 能 | 不能 |
| 复制的文字质量 | 干净连贯 | 错字、断词、乱码 | 无法复制 |
| 典型来源 | Word 导出、学术论文 | 扫描后做过 OCR | 纸质合同、转曲文件 |
| 翻译难度 | 一般 | 高(排版易乱) | 高(需先 OCR) |
判断清楚之后,再对照下面的建议选工具,基本不会跑偏。
怎么选
可以按手上的文件类型来判断:
- 原生数字版 PDF(论文、教材、研报):想保留排版做中英对照,优先考虑 BabelDOC 这类专注 PDF 的工具
- 扫描件 / 图片型 PDF:需要走 OCR 路线,或用专门的扫描件翻译功能,例如沉浸式翻译的PDF Pro
- 只看几段文字、不在意版面:通用在线翻译最省事
BabelDOC 是什么
在专注排版保留的这一类里,BabelDOC 是常被提到的一个。它是沉浸式翻译插件的一个功能,主打把 PDF 翻译成双语对照的同时尽量保留原始版面,公式、图表、多栏这些容易乱的地方是它的重点处理对象,对经常读外文论文和研报的人比较友好,帮助你更快地"读懂"和"对照阅读"。
常见问题
Q1. 翻译后排版一定会乱吗?
不一定。结构规范的 PDF(标准论文、报告)还原效果较好,公式和图表能基本保留。但排版特别复杂、或扫描件,就容易出现错位或丢失,具体取决于 PDF 本身和所用工具。
Q2. 扫描件为什么翻译不了?
扫描版 PDF 本质是图片,里面没有可提取的文字层,普通翻译工具读不到内容。需要先用 OCR 工具把图片里的文字识别出来再翻译,或者直接用支持扫描件的工具。
结论
PDF 翻译之所以容易乱版,本质还是在于 PDF 这种格式本身——它为显示而生,不为编辑而生。要解决,得对症下药:原生数字版文档可以找专注排版保留的工具,图片型PDF则需要 OCR 处理。BabelDOC 是前一类里比较实用的一个选择,但也不是万能的,选工具之前,还是要先弄清楚手上的 PDF 是什么类型,比纠结用哪个工具更重要。