PDFを翻訳ツールに入力した結果、翻訳後の段落がずれ、表が崩れ、図表のテキストが重なってしまう——これは誰もがPDF翻訳で経験したことがある頭痛の種です。問題は翻訳品質ではなく、PDFというフォーマット自体にあります。本チュートリアルでは、PDFでレイアウトが崩れやすい理由を説明し、レイアウトを確実に維持するための3つのアプローチを紹介します。

一般的なツールでPDF翻訳するとレイアウトが崩れる理由

多くの人は、PDFがWordのように段落ごとに自由に再配置できるテキストの集合体だと考えています。実際は全くその逆です。PDFの設計目標は「どのデバイスで開いても同じように見えること」であり、テキスト間の論理的な関係ではなく、ページ上のすべての文字、線、画像の絶対座標を記録しています。

これにより、以下の3つの典型的な問題が発生します。

この点を理解すれば、ツール選びのロジックは明確です。必要なツールは、単にテキストを置き換えるのではなく、まずレイアウト構造を「理解」し、翻訳文を対応する位置に配置し直せるものでなければなりません。

方法1:レイアウト復元をサポートするAIツールを使用する

現在、より信頼性の高いアプローチは、事前に**レイアウト分析(layout analysis)**を行うAI翻訳ツールを使用することです。これらのツールの処理フローは通常、ページ上の段落、見出し、表、画像などのブロックを最初に認識して構造モデルを構築し、翻訳後に元のブロックの位置とサイズに従って再レイアウトして出力するというものです。

例えばDocTransAIは、PDFを処理する際に段落レベル、表のレイアウト、図表の位置を維持し、対訳出力(原文と翻訳文を上下に並べて表示)をサポートしているため、照合が容易です。客観的に言えば、複雑なレイアウトを100%完璧に復元できるツールは存在しません。レイアウトが複雑でテキストの長さの変化が大きいほど、誤差が生じやすくなります。しかし、テキストを直接置き換える従来の方法と比較すれば、レイアウト復元により手動で調整する時間を大幅に節約できます。

この方法が最も適しているケース

方法2:スキャン版PDFには事前にOCR処理を行う

PDFがスキャンデータや写真から変換されたファイルの場合、その実体は画像の集合であり、選択可能なテキストは含まれていません。このような場合、どの翻訳ツールも直接テキストを読み取ることはできず、まず**OCR(光学式文字認識)**を使用して画像からテキストを抽出する必要があります。

スキャンPDFを処理する際の推奨ステップ:

  1. ファイルがスキャンデータかどうかを確認します。マウスでテキストを選択してみて、選択できなければスキャンデータです。
  2. OCR機能を備えたツールを使用してテキストを認識させます。認識品質は元画像の鮮明さに大きく左右されるため、スキャン解像度は300 DPI以上を推奨します。
  3. 認識後は必ず校正を行ってください。OCRは類似した文字(「O」と「0」、「未」と「末」など)を誤認識しやすく、これらのエラーがそのまま翻訳文に引き継がれてしまいます。
  4. その後、翻訳とレイアウト復元を行います。

DocTransAIはスキャンPDFに対して組み込みのOCR認識を提供しており、同じワークフロー内で認識と翻訳を完了できるため、複数のツール間でファイルを移動する手間を省けます。それでもなお、スキャンデータの復元難易度はネイティブPDFよりも元々高いものなので、結果に対して現実的な期待を持つことがストレス軽減につながります。

方法3:用語集を使用して専門用語の統一を保証する

レイアウトが正しくても、もう一つ見落とされがちな品質の問題があります。固有名詞の訳語が前後で不一致になることです。数十ページに及ぶ技術文書の中で、同じ製品名、部品名、または法律用語が翻訳されるたびに異なる訳語が使われていると、読者は混乱し、専門性も損なわれます。

解決策は**用語集(glossary)**を作成することです。事前にキーワードの標準的な訳語を固定し、翻訳時に強制的に適用します。例えば「Liquidity Coverage Ratio」を「流動性カバレッジ比率」と固定しておけば、文書全体で訳語がバラバラになることはありません。詳細は企業翻訳になぜ用語集が必要なのか?をご覧ください。

DocTransAIは独自の用語集の作成とCSVによる一括インポートをサポートしており、翻訳時に自動的に照合して置換します。ブランド用語や業界用語を長期的に管理する必要があるチームにとって、このステップは納品物の一貫性を大幅に向上させます。

よくある間違いとアドバイス

まとめ

PDF翻訳でレイアウトを維持する鍵は、「翻訳が最も正確な」ツールを探すことではなく、「レイアウトを理解できる」ツールを探すことです。ネイティブPDFにはレイアウト復元をサポートするAI翻訳を、スキャンデータには先にOCR処理を行ってから翻訳を、専門文書には用語組み合わせて用語の統一を保証します。これら3つを組み合わせることで、その後の手動調整にかかる作業量を最小限に抑えることができます。