PDFを翻訳ツールに入力した結果、翻訳後の段落がずれ、表が崩れ、図表のテキストが重なってしまう——これは誰もがPDF翻訳で経験したことがある頭痛の種です。問題は翻訳品質ではなく、PDFというフォーマット自体にあります。本チュートリアルでは、PDFでレイアウトが崩れやすい理由を説明し、レイアウトを確実に維持するための3つのアプローチを紹介します。
一般的なツールでPDF翻訳するとレイアウトが崩れる理由
多くの人は、PDFがWordのように段落ごとに自由に再配置できるテキストの集合体だと考えています。実際は全くその逆です。PDFの設計目標は「どのデバイスで開いても同じように見えること」であり、テキスト間の論理的な関係ではなく、ページ上のすべての文字、線、画像の絶対座標を記録しています。
これにより、以下の3つの典型的な問題が発生します。
- テキストフローの分断: PDF内部では、1つの文が複数の独立したテキストブロックに分割され、異なる座標に分散していることがあります。一般的なツールはブロックごとに翻訳するため、翻訳後のテキストの順序が乱れてしまいます。
- 文字幅とフォント: 中国語や日本語を英語に翻訳すると文字数が増え、逆に英語を中国語にすると減るのが一般的です。元々1行にちょうど収まっていたテキストが、翻訳後は境界線をオーバーフローしたり、大きな空白が残ったりし、埋め込みフォントが正しく表示されない場合もあります。
- 表と図表: PDF内の表は、多くの場合「セル」という概念を持たない、単なる線と分散したテキストの集合体です。テキストの長さが変わると列がずれ、図表上のラベルも位置がずれてしまいます。
この点を理解すれば、ツール選びのロジックは明確です。必要なツールは、単にテキストを置き換えるのではなく、まずレイアウト構造を「理解」し、翻訳文を対応する位置に配置し直せるものでなければなりません。
方法1:レイアウト復元をサポートするAIツールを使用する
現在、より信頼性の高いアプローチは、事前に**レイアウト分析(layout analysis)**を行うAI翻訳ツールを使用することです。これらのツールの処理フローは通常、ページ上の段落、見出し、表、画像などのブロックを最初に認識して構造モデルを構築し、翻訳後に元のブロックの位置とサイズに従って再レイアウトして出力するというものです。
例えばDocTransAIは、PDFを処理する際に段落レベル、表のレイアウト、図表の位置を維持し、対訳出力(原文と翻訳文を上下に並べて表示)をサポートしているため、照合が容易です。客観的に言えば、複雑なレイアウトを100%完璧に復元できるツールは存在しません。レイアウトが複雑でテキストの長さの変化が大きいほど、誤差が生じやすくなります。しかし、テキストを直接置き換える従来の方法と比較すれば、レイアウト復元により手動で調整する時間を大幅に節約できます。
この方法が最も適しているケース
- WordやInDesignからエクスポートされた、ネイティブ(非スキャン)のPDFファイル。
- 報告書、契約書、製品マニュアルなど、表、多段組みレイアウト、ヘッダーやフッターを含む公式文書。
- 翻訳文を他の人にそのまま渡す必要があり、ページごとに再レイアウトする時間がない場合。
方法2:スキャン版PDFには事前にOCR処理を行う
PDFがスキャンデータや写真から変換されたファイルの場合、その実体は画像の集合であり、選択可能なテキストは含まれていません。このような場合、どの翻訳ツールも直接テキストを読み取ることはできず、まず**OCR(光学式文字認識)**を使用して画像からテキストを抽出する必要があります。
スキャンPDFを処理する際の推奨ステップ:
- ファイルがスキャンデータかどうかを確認します。マウスでテキストを選択してみて、選択できなければスキャンデータです。
- OCR機能を備えたツールを使用してテキストを認識させます。認識品質は元画像の鮮明さに大きく左右されるため、スキャン解像度は300 DPI以上を推奨します。
- 認識後は必ず校正を行ってください。OCRは類似した文字(「O」と「0」、「未」と「末」など)を誤認識しやすく、これらのエラーがそのまま翻訳文に引き継がれてしまいます。
- その後、翻訳とレイアウト復元を行います。
DocTransAIはスキャンPDFに対して組み込みのOCR認識を提供しており、同じワークフロー内で認識と翻訳を完了できるため、複数のツール間でファイルを移動する手間を省けます。それでもなお、スキャンデータの復元難易度はネイティブPDFよりも元々高いものなので、結果に対して現実的な期待を持つことがストレス軽減につながります。
方法3:用語集を使用して専門用語の統一を保証する
レイアウトが正しくても、もう一つ見落とされがちな品質の問題があります。固有名詞の訳語が前後で不一致になることです。数十ページに及ぶ技術文書の中で、同じ製品名、部品名、または法律用語が翻訳されるたびに異なる訳語が使われていると、読者は混乱し、専門性も損なわれます。
解決策は**用語集(glossary)**を作成することです。事前にキーワードの標準的な訳語を固定し、翻訳時に強制的に適用します。例えば「Liquidity Coverage Ratio」を「流動性カバレッジ比率」と固定しておけば、文書全体で訳語がバラバラになることはありません。詳細は企業翻訳になぜ用語集が必要なのか?をご覧ください。
DocTransAIは独自の用語集の作成とCSVによる一括インポートをサポートしており、翻訳時に自動的に照合して置換します。ブランド用語や業界用語を長期的に管理する必要があるチームにとって、このステップは納品物の一貫性を大幅に向上させます。
よくある間違いとアドバイス
- スキャンデータをネイティブPDFとして処理する: 結果は「翻訳が全く反応しない」か、空白が出力されることが多いです。まずファイルの種類を判断し、スキャンデータは必ずOCR処理を行います。
- 文字数の膨張を無視する: 中国語や日本語から英語への翻訳では、テキストが長くなってオーバーフローすることがよくあります。レイアウトが固定された文書は、翻訳後に必ず境界線と改ページを素早く確認してください。
- 複雑なレイアウトに100%の完璧を期待する: 多段組みの雑誌や多数のフローティング画像フレームを含むデザインデータなど、どのような自動ツールでも完全に復元するのは困難です。手動での微調整に少し時間を割く方が現実的です。
- 校正をスキップする: どれだけ優れたツールでも、公式に外部へ公開する文書は必ず人間が最終確認を行うべきです。特に数字、日付、固有名詞は注意が必要です。
- 巨大なファイルを一度に処理する: 数百ページに及ぶファイルは、まず数ページだけテスト翻訳し、効果や用語設定に問題がないことを確認してから全文を処理することをお勧めします。無駄な手戻りを防げます。
まとめ
PDF翻訳でレイアウトを維持する鍵は、「翻訳が最も正確な」ツールを探すことではなく、「レイアウトを理解できる」ツールを探すことです。ネイティブPDFにはレイアウト復元をサポートするAI翻訳を、スキャンデータには先にOCR処理を行ってから翻訳を、専門文書には用語組み合わせて用語の統一を保証します。これら3つを組み合わせることで、その後の手動調整にかかる作業量を最小限に抑えることができます。