Wirft man eine PDF in ein Übersetzungstool, kommt die Übersetzung oft mit verschobenen Absätzen, zerfallenen Tabellen und überlappendem Text in Diagrammen heraus – ein Problem, das fast jeder bei der PDF-Übersetzung schon einmal hatte. Das Problem liegt nicht an der Übersetzungsqualität, sondern am PDF-Format selbst. Dieses Tutorial erklärt, warum PDFs so anfällig für Layoutfehler sind, und stellt drei Methoden vor, mit denen sich das Layout wirklich erhalten lässt.

Warum ruinieren herkömmliche Tools das PDF-Layout?

Viele glauben, eine PDF sei wie ein Word-Dokument, bei dem Textabsätze frei neu angeordnet werden können. Tatsächlich ist es genau umgekehrt. Das Designziel einer PDF ist es, "auf jedem Gerät gleich auszusehen". Daher speichert sie die absoluten Koordinaten jedes Buchstabens, jeder Linie und jedes Bildes auf der Seite, nicht aber die logischen Beziehungen zwischen den Texten.

Dies führt zu drei typischen Problemen:

Wenn man das verstanden hat, wird die Logik bei der Auswahl der Methode klar: Das benötigte Tool muss die Layoutstruktur zuerst "verstehen" und die Übersetzung dann an den entsprechenden Stellen platzieren, anstatt einfach nur den Text auszutauschen.

Methode 1: KI-Tools mit Layout-Wiederherstellung verwenden

Der derzeit zuverlässigste Ansatz ist die Verwendung von KI-Übersetzungstools, die zunächst eine Layoutanalyse (Layout Analysis) durchführen. Der Verarbeitungsablauf solcher Tools sieht in der Regel so aus: Zuerst werden Absätze, Überschriften, Tabellen, Bilder und andere Bereiche auf der Seite erkannt und ein Strukturmodell erstellt. Nach der Übersetzung wird das Layout basierend auf der Position und Größe der ursprünglichen Bereiche neu formatiert und ausgegeben.

DocTransAI beispielsweise behält bei der Verarbeitung von PDFs die Absatzebenen, das Tabellenlayout und die Diagrammpositionen bei und unterstützt die zweisprachige Gegenüberstellung (Originaltext und Übersetzung untereinander), was die Überprüfung erleichtert. Objektiv betrachtet kann kein Tool eine 100% perfekte Wiederherstellung komplexer Layouts garantieren – je ausgefallener das Layout und je größer die Änderungen der Textlänge, desto wahrscheinlicher sind Abweichungen. Im Vergleich zur traditionellen Methode des einfachen Textaustauschs spart die Layout-Wiederherstellung jedoch enorm viel Zeit für manuelle Anpassungen.

Wann ist diese Methode am besten geeignet?

Methode 2: Gescannte PDFs erfordern zunächst OCR

Wenn Ihre PDF ein Scan oder eine abfotografierte Datei ist, besteht sie im Grunde aus einzelnen Bildern ohne jeglichen auswählbaren Text. In diesem Fall kann kein Übersetzungstool den Text direkt auslesen; es muss zunächst eine OCR (Optical Character Recognition) durchgeführt werden, um den Text aus den Bildern zu extrahieren.

Empfohlene Schritte für die Verarbeitung gescannter PDFs:

  1. Prüfen Sie, ob die Datei gescannt ist – versuchen Sie, Text mit der Maus auszuwählen. Wenn das nicht geht, ist es ein Scan.
  2. Verwenden Sie ein Tool mit OCR-Funktion zur Texterkennung. Die Erkennungsqualität hängt stark von der Klarheit des Originalbildes ab; eine Scanauflösung von mindestens 300 DPI wird empfohlen.
  3. Korrigieren Sie die Erkennung unbedingt im Nachhinein. Die OCR verwechselt leicht ähnliche Zeichen (z. B. "O" und "0"), und diese Fehler landen direkt in der Übersetzung.
  4. Führen Sie erst dann die Übersetzung und Layout-Wiederherstellung durch.

DocTransAI bietet eine integrierte OCR-Erkennung für gescannte PDFs, sodass Erkennung und Übersetzung in einem einzigen Arbeitsgang erledigt werden können, was den mühsamen Datei-Transfer zwischen verschiedenen Tools erspart. Dennoch ist die Wiederherstellung von Scans naturgemäß schwieriger als bei nativen PDFs; realistische Erwartungen an das Ergebnis machen es stressfreier.

Methode 3: Glossare für konsistente Fachbegriffe verwenden

Wenn das Layout stimmt, gibt es noch ein oft übersehenes Qualitätsproblem: Inkonsistente Fachbegriffe. In einem mehrseitigen technischen Dokument kann es verwirrend wirken und die Professionalität mindern, wenn derselbe Produktname, dieselbe Komponente oder derselbe juristische Begriff jedes Mal anders übersetzt wird.

Die Lösung ist die Erstellung eines Glossars: Dabei werden die Standardübersetzungen für Schlüsselbegriffe im Voraus festgelegt und bei der Übersetzung strikt angewendet. Wenn beispielsweise "Liquidity Coverage Ratio" immer einheitlich übersetzt wird, gibt es im gesamten Dokument keine wechselnden Bezeichnungen. Siehe auch Warum Unternehmen für ihre Übersetzungen ein Glossar benötigen

DocTransAI unterstützt die Erstellung eigener Glossare und deren Massenimport als CSV-Datei, wobei die Begriffe während der Übersetzung automatisch abgeglichen und ersetzt werden. Für Teams, die Markenwörter oder Branchenbegriffe langfristig pflegen müssen, kann dieser Schritt die Konsistenz der gelieferten Dokumente erheblich steigern.

Häufige Fehler und Empfehlungen

Fazit

Der Schlüssel zur PDF-Übersetzung unter Beibehaltung des Layouts liegt nicht darin, das Tool mit der "präzisesten Übersetzung" zu finden, sondern das Tool, das das Layout "verstehen" kann. Native PDFs werden mit KI-Übersetzungstools bearbeitet, die Layout-Wiederherstellung unterstützen; Scans werden zuerst per OCR erkannt und dann übersetzt; professionelle Dokumente werden mit Glossaren kombiniert, um eine konsistente Terminologie zu gewährleisten. Die Kombination dieser drei Ansätze minimiert den Aufwand für nachträgliche manuelle Anpassungen.