把一份 PDF 丢进翻译工具,结果译文出来时段落错位、表格散架、图表上的文本叠在一起——这几乎是每个人翻译 PDF 都遇过的痛。问题不在于翻译品质,而在于 PDF 这种格式本身。这篇教学会说明为什么 PDF 容易乱版,并给出三种能真正保留排版的做法。

为什么普通工具翻译 PDF 会乱版?

很多人以为 PDF 像 Word 一样,是一段一段可以自由重排的文本。实际上恰好相反。PDF 的设计目标是「不管在哪台设备打开都长一样」,所以它记录的是每一个字、每一条线、每一张图在页面上的绝对座标,而不是文本之间的逻辑关系。

这带来三个典型问题:

理解这一点之后,挑选方法的逻辑就清楚了:你需要的工具,必须先「看懂」版面结构,再把译文放回对应位置,而不是单纯替换文本。

方法一:用支持排版还原的 AI 工具

目前较可靠的做法,是使用会先做**版面分析(layout analysis)**的 AI 翻译工具。这类工具的处理流程通常是:先辨识页面上的段落、标题、表格、图片等区块,创建结构模型,翻译后再依照原始区块的位置与大小重新排版输出。

以 DocTransAI 为例,它在处理 PDF 时会保留段落层级、表格布局与图表位置,并支持双语对照输出(原文与译文上下并排),方便核对。客观来说,没有任何工具能保证 100% 完美还原复杂版面——版面越花俏、文本长度变化越大,误差就越可能出现。但相比直接替换文本的传统做法,排版还原能省去大量手动调整的时间。

什么情况最适合这个方法?

方法二:扫描版 PDF 需要先做 OCR

如果你的 PDF 是扫描件或拍照转成的文件,那它本质上是一张张图片,里面没有任何可选取的文本。这种情况下,任何翻译工具都无法直接读到文本,必须先经过 **OCR(光学字符辨识)**把图片中的文本提取出来。

处理扫描 PDF 的建议步骤:

  1. 确认文件是否为扫描件——试着用鼠标选取文本,选不到就是扫描件。
  2. 使用具备 OCR 功能的工具辨识文本。辨识品质受原图清晰度影响很大,扫描分辨率建议在 300 DPI 以上。
  3. 辨识后务必校对一遍,OCR 容易把相似字(如「O」与「0」、「未」与「末」)认错,这些错误会直接带进译文。
  4. 再进行翻译与排版还原。

DocTransAI 对扫描 PDF 提供内置 OCR 识别,可在同一流程中完成辨识与翻译,减少在多个工具之间搬运文件的麻烦。即便如此,扫描件的还原难度本来就高于原生 PDF,对结果保持合理预期会更省心。

方法三:用术语库保证专业词一致

排版对了,还有一个常被忽略的品质问题:专有名词前后不一致。一份几十页的技术文档里,同一个产品名、零件名或法律术语,若每次翻译结果都不同,读者会困惑,专业度也会打折。

解法是创建术语库(glossary):事先把关键词的标准译法固定下来,翻译时强制套用。例如把「Liquidity Coverage Ratio」固定译为「流动性覆盖比率」,整份文档就不会一下叫这个、一下叫那个。详见企业翻译为什么必须创建术语库?

DocTransAI 支持自建术语库并以 CSV 批量导入,翻译时自动比对替换。对于需要长期维护品牌词汇或行业术语的团队,这一步能显著拉高交稿的一致性。

常见错误与建议

小结

翻译 PDF 保留排版的关键,不是找「翻译最准」的工具,而是找「看得懂版面」的工具。原生 PDF 用支持排版还原的 AI 翻译;扫描件先 OCR 再翻;专业文档搭配术语库保证用词一致——三者结合,就能把后续手动调整的工作量降到最低。