把一份 PDF 丢进翻译工具,结果译文出来时段落错位、表格散架、图表上的文本叠在一起——这几乎是每个人翻译 PDF 都遇过的痛。问题不在于翻译品质,而在于 PDF 这种格式本身。这篇教学会说明为什么 PDF 容易乱版,并给出三种能真正保留排版的做法。
为什么普通工具翻译 PDF 会乱版?
很多人以为 PDF 像 Word 一样,是一段一段可以自由重排的文本。实际上恰好相反。PDF 的设计目标是「不管在哪台设备打开都长一样」,所以它记录的是每一个字、每一条线、每一张图在页面上的绝对座标,而不是文本之间的逻辑关系。
这带来三个典型问题:
- **文本流断裂:**同一个句子在 PDF 内部可能被拆成好几个独立的文本块,分散在不同座标。普通工具按块翻译,译文顺序就会错乱。
- **字宽与字体:**中文、日文翻成英文后字数通常变长,英文翻成中文又变短。原本刚好填满一行的文本,译后不是溢出边界就是留下大片空白,内嵌字体还可能无法显示。
- **表格与图表:**PDF 里的表格往往只是一堆线条加上分散的文本,没有「保存格」这个概念。一旦文本长度改变,字段就会错位,图表上的标签也会跑位。
理解这一点之后,挑选方法的逻辑就清楚了:你需要的工具,必须先「看懂」版面结构,再把译文放回对应位置,而不是单纯替换文本。
方法一:用支持排版还原的 AI 工具
目前较可靠的做法,是使用会先做**版面分析(layout analysis)**的 AI 翻译工具。这类工具的处理流程通常是:先辨识页面上的段落、标题、表格、图片等区块,创建结构模型,翻译后再依照原始区块的位置与大小重新排版输出。
以 DocTransAI 为例,它在处理 PDF 时会保留段落层级、表格布局与图表位置,并支持双语对照输出(原文与译文上下并排),方便核对。客观来说,没有任何工具能保证 100% 完美还原复杂版面——版面越花俏、文本长度变化越大,误差就越可能出现。但相比直接替换文本的传统做法,排版还原能省去大量手动调整的时间。
什么情况最适合这个方法?
- 原生(非扫描)的 PDF,例如从 Word、InDesign 导出的文件。
- 含有表格、多栏排版、页眉页脚的正式文档,如报告、合约、产品手册。
- 需要把译文交给他人直接使用、没时间逐页重排的场景。
方法二:扫描版 PDF 需要先做 OCR
如果你的 PDF 是扫描件或拍照转成的文件,那它本质上是一张张图片,里面没有任何可选取的文本。这种情况下,任何翻译工具都无法直接读到文本,必须先经过 **OCR(光学字符辨识)**把图片中的文本提取出来。
处理扫描 PDF 的建议步骤:
- 确认文件是否为扫描件——试着用鼠标选取文本,选不到就是扫描件。
- 使用具备 OCR 功能的工具辨识文本。辨识品质受原图清晰度影响很大,扫描分辨率建议在 300 DPI 以上。
- 辨识后务必校对一遍,OCR 容易把相似字(如「O」与「0」、「未」与「末」)认错,这些错误会直接带进译文。
- 再进行翻译与排版还原。
DocTransAI 对扫描 PDF 提供内置 OCR 识别,可在同一流程中完成辨识与翻译,减少在多个工具之间搬运文件的麻烦。即便如此,扫描件的还原难度本来就高于原生 PDF,对结果保持合理预期会更省心。
方法三:用术语库保证专业词一致
排版对了,还有一个常被忽略的品质问题:专有名词前后不一致。一份几十页的技术文档里,同一个产品名、零件名或法律术语,若每次翻译结果都不同,读者会困惑,专业度也会打折。
解法是创建术语库(glossary):事先把关键词的标准译法固定下来,翻译时强制套用。例如把「Liquidity Coverage Ratio」固定译为「流动性覆盖比率」,整份文档就不会一下叫这个、一下叫那个。详见企业翻译为什么必须创建术语库?
DocTransAI 支持自建术语库并以 CSV 批量导入,翻译时自动比对替换。对于需要长期维护品牌词汇或行业术语的团队,这一步能显著拉高交稿的一致性。
常见错误与建议
- **把扫描件当原生 PDF 处理:**结果往往是「翻译完全没反应」或输出空白。先判断文件类型,扫描件一律走 OCR 流程。
- **忽略字数膨胀:**中译英、日译英常出现文本变长导致溢出。固定版面的文档,翻译后一定要快速检查边界与分页。
- **对复杂版面期待 100% 完美:**多栏杂志、含大量浮动图框的设计稿,任何自动工具都难以完全还原,预留少量手动微调时间更实际。
- **跳过校对:**无论工具多强,正式对外的文档都应由人最后审一遍,尤其是数字、日期、专有名词。
- **整份大档一次处理:**几百页的文件建议先用几页试翻,确认效果与术语设置无误,再跑全文,避免白做工。
小结
翻译 PDF 保留排版的关键,不是找「翻译最准」的工具,而是找「看得懂版面」的工具。原生 PDF 用支持排版还原的 AI 翻译;扫描件先 OCR 再翻;专业文档搭配术语库保证用词一致——三者结合,就能把后续手动调整的工作量降到最低。