Glisser un PDF dans un outil de traduction pour obtenir un résultat avec des paragraphes décalés, des tableaux disloqués et du texte qui se chevauche sur les graphiques : c'est un problème que presque tout le monde a déjà rencontré en traduisant un PDF. Le problème ne réside pas dans la qualité de la traduction, mais dans le format PDF lui-même. Ce tutoriel explique pourquoi les PDF sont sujets aux erreurs de mise en page et présente trois méthodes pour préserver réellement la mise en page.
Pourquoi les outils classiques détruisent-ils la mise en page des PDF ?
Beaucoup pensent qu'un PDF est comme Word, composé de blocs de texte que l'on peut réorganiser librement. En réalité, c'est tout le contraire. L'objectif du format PDF est de « s'afficher de la même manière sur n'importe quel appareil ». Il enregistre donc les coordonnées absolues de chaque caractère, de chaque ligne et de chaque image sur la page, plutôt que les relations logiques entre les textes.
Cela entraîne trois problèmes typiques :
- Flux de texte rompu : Une même phrase peut être divisée en plusieurs blocs de texte indépendants dans le PDF, dispersés à différentes coordonnées. Les outils classiques traduisent bloc par bloc, ce qui perturbe l'ordre de la traduction.
- Largeur des caractères et polices : Le chinois ou le japonais traduit en anglais prend généralement plus de place, tandis que l'anglais traduit en chinois en prend moins. Un texte qui remplissait parfaitement une ligne débordera ou laissera de grands espaces vides après la traduction, et les polices intégrées pourraient ne pas s'afficher correctement.
- Tableaux et graphiques : Les tableaux dans un PDF ne sont souvent qu'un ensemble de lignes et de textes dispersés, sans notion de « cellule ». Dès que la longueur du texte change, les colonnes se désalignent et les étiquettes des graphiques se déplacent.
Une fois ce point compris, la logique de sélection des outils devient claire : l'outil dont vous avez besoin doit d'abord « comprendre » la structure de la mise en page, puis replacer le texte traduit à l'emplacement correspondant, au lieu de simplement remplacer le texte.
Méthode 1 : Utiliser des outils d'IA prenant en charge la restauration de la mise en page
L'approche la plus fiable actuellement consiste à utiliser des outils de traduction par IA qui effectuent d'abord une analyse de la mise en page (layout analysis). Le processus de traitement de ces outils est généralement le suivant : ils identifient d'abord les blocs de la page (paragraphes, titres, tableaux, images, etc.), créent un modèle structurel, puis, après la traduction, remettent en page la sortie en fonction de la position et de la taille des blocs d'origine.
Prenons l'exemple de DocTransAI : lors du traitement d'un PDF, il conserve les niveaux de paragraphes, la disposition des tableaux et la position des graphiques, et prend en charge la sortie bilingue côte à côte (texte original et traduction l'un sous l'autre ou côte à côte, pour faciliter la vérification). Objectivement, aucun outil ne peut garantir une restauration parfaite à 100 % d'une mise en page complexe : plus la mise en page est complexe et plus les variations de longueur de texte sont importantes, plus des erreurs sont susceptibles d'apparaître. Cependant, par rapport à l'approche traditionnelle qui consiste à remplacer simplement le texte, la restauration de la mise en page permet d'économiser un temps considérable en ajustements manuels.
Dans quels cas cette méthode est-elle la plus adaptée ?
- Les PDF natifs (non numérisés), tels que les fichiers exportés depuis Word ou InDesign.
- Les documents officiels contenant des tableaux, une mise en page sur plusieurs colonnes, des en-têtes et des pieds de page, comme les rapports, les contrats et les manuels de produits.
- Les situations où la traduction doit être remise directement à d'autres personnes pour une utilisation immédiate, sans temps à consacrer à la remise en page page par page.
Méthode 2 : Les PDF numérisés nécessitent d'abord une étape d'OCR
Si votre PDF est un document numérisé ou converti à partir de photos, il s'agit essentiellement d'une série d'images sans aucun texte sélectionnable. Dans ce cas, aucun outil de traduction ne peut lire directement le texte ; il faut d'abord passer par l'OCR (Reconnaissance Optique de Caractères) pour extraire le texte des images.
Étapes recommandées pour traiter un PDF numérisé :
- Vérifiez si le fichier est numérisé : essayez de sélectionner le texte avec la souris. Si vous n'y arrivez pas, c'est un document numérisé.
- Utilisez un outil doté de fonctions OCR pour reconnaître le texte. La qualité de la reconnaissance dépend fortement de la clarté de l'image d'origine ; une résolution de numérisation d'au moins 300 DPI est recommandée.
- Après la reconnaissance, il est impératif de relire et corriger. L'OCR a tendance à confondre les caractères similaires (comme « O » et « 0 »). Ces erreurs se répercuteront directement dans la traduction.
- Procédez ensuite à la traduction et à la restauration de la mise en page.
DocTransAI propose une reconnaissance OCR intégrée pour les PDF numérisés, permettant de réaliser la reconnaissance et la traduction dans un même processus, ce qui évite d'avoir à transférer des fichiers entre plusieurs outils. Néanmoins, la restauration de documents numérisés est intrinsèquement plus difficile que celle de PDF natifs ; garder des attentes réalistes quant aux résultats vous évitera bien des déconvenues.
Méthode 3 : Utiliser un glossaire pour garantir la cohérence des termes professionnels
Une fois la mise en page corrigée, il reste un problème de qualité souvent négligé : l'incohérence des termes spécialisés. Dans un document technique de plusieurs dizaines de pages, si le même nom de produit, de pièce ou terme juridique est traduit différemment à chaque fois, le lecteur sera confus et le professionnalisme du document en pâtira.
La solution consiste à créer un glossaire : fixer à l'avance la traduction standard des mots-clés et l'appliquer de force lors de la traduction. Par exemple, en fixant la traduction de « Liquidity Coverage Ratio » à « ratio de couverture des liquidités », ce terme sera uniforme dans tout le document. Voir aussi Pourquoi les entreprises doivent-elles absolument créer un glossaire pour leurs traductions ?
DocTransAI permet de créer vos propres glossaires et de les importer en masse au format CSV, avec une comparaison et un remplacement automatiques lors de la traduction. Pour les équipes qui doivent maintenir à long terme le vocabulaire de leur marque ou les termes de leur secteur, cette étape améliore considérablement la cohérence des livrables.
Erreurs courantes et conseils
- Traiter un document numérisé comme un PDF natif : Le résultat est souvent « aucune traduction » ou une sortie vide. Identifiez d'abord le type de fichier ; les documents numérisés doivent toujours passer par le processus OCR.
- Ignorer l'expansion du texte : La traduction du chinois ou du japonais vers l'anglais entraîne souvent un allongement du texte, provoquant des débordements. Pour les documents à mise en page fixe, vérifiez toujours rapidement les marges et les sauts de page après la traduction.
- Attendre une perfection à 100 % pour les mises en page complexes : Les magazines à colonnes multiples, les maquettes avec de nombreux cadres d'images flottants... aucun outil automatique ne peut les restaurer parfaitement. Prévoyez un peu de temps pour des ajustements manuels, c'est plus réaliste.
- Sauter la relecture : Quelle que soit la puissance de l'outil, les documents destinés à un usage externe doivent toujours être relus en dernier lieu par un humain, en particulier pour les chiffres, les dates et les noms propres.
- Traiter un gros fichier d'un seul coup : Pour les fichiers de plusieurs centaines de pages, il est conseillé de tester d'abord la traduction sur quelques pages pour vérifier l'effet et les paramètres du glossaire avant de lancer le texte intégral, afin d'éviter de travailler pour rien.
Conclusion
La clé pour traduire un PDF tout en préservant sa mise en page n'est pas de chercher l'outil « qui traduit le plus précisément », mais celui « qui comprend la mise en page ». Utilisez une traduction par IA avec restauration de la mise en page pour les PDF natifs ; passez d'abord par l'OCR pour les documents numérisés ; associez les documents professionnels à un glossaire pour garantir la cohérence du vocabulaire. En combinant ces trois éléments, vous réduirez au minimum la charge de travail liée aux ajustements manuels ultérieurs.