Загрузка PDF в инструмент перевода часто заканчивается тем, что абзацы смещаются, таблицы разваливаются, а текст на графиках накладывается друг на друга — с этой болью сталкивался почти каждый, кто переводил PDF. Проблема не в качестве перевода, а в самой природе формата PDF. В этом руководстве мы объясним, почему PDF так легко «ломается», и предложим три рабочих метода сохранения исходной верстки.

Почему обычные инструменты ломают верстку PDF?

Многие думают, что PDF устроен как Word: это просто текст, разбитый на абзацы, которые можно свободно переставлять. На самом деле всё наоборот. Главная задача PDF — «выглядеть одинаково на любом устройстве», поэтому он хранит абсолютные координаты каждой буквы, линии и изображения на странице, а не логические связи между словами.

Это порождает три типичные проблемы:

Поняв это, становится ясно, как выбирать инструмент: вам нужен такой, который сначала «поймет» структуру макета, а затем поместит перевод в соответствующие места, а не просто заменит текст.

Метод 1: Использование ИИ-инструментов с поддержкой восстановления верстки

Самый надежный на сегодняшний день подход — использование ИИ-инструментов перевода, которые сначала выполняют анализ макета (layout analysis). Обычно процесс выглядит так: инструмент распознает абзацы, заголовки, таблицы, изображения и другие блоки на странице, строит структурную модель, переводит текст, а затем перекомпоновывает его в соответствии с исходным положением и размером блоков.

Возьмем, к примеру, DocTransAI. При работе с PDF он сохраняет структуру абзацев, макет таблиц и расположение графиков, а также поддерживает двуязычный вывод (оригинал и перевод друг под другом), что удобно для сверки. Объективно говоря, ни один инструмент не гарантирует 100% идеального восстановления сложной верстки — чем сложнее макет и чем сильнее меняется длина текста, тем выше вероятность погрешностей. Но по сравнению с традиционным методом простой замены текста, восстановление верстки экономит массу времени на ручную правку.

В каких случаях этот метод подходит лучше всего?

Метод 2: Предварительное использование OCR для сканированных PDF

Если ваш PDF — это скан или фотография документа, то по сути это набор изображений, в которых нет выделяемого текста. В таком случае ни один инструмент перевода не сможет напрямую прочитать текст: сначала необходимо извлечь его из изображений с помощью OCR (оптического распознавания символов).

Рекомендуемые шаги для работы со сканированными PDF:

  1. Убедитесь, что файл является сканом — попробуйте выделить текст мышкой. Если не выделяется, это скан.
  2. Используйте инструмент с функцией OCR для распознавания текста. Качество распознавания сильно зависит от четкости исходного изображения; рекомендуемое разрешение сканирования — не менее 300 DPI.
  3. После распознавания обязательно проведите вычитку. OCR часто путает похожие символы (например, «О» и «0», «С» и «С»), и эти ошибки напрямую попадут в перевод.
  4. Только после этого приступайте к переводу и восстановлению верстки.

DocTransAI предлагает встроенное OCR-распознавание для сканированных PDF, позволяя выполнить распознавание и перевод в рамках одного процесса, что избавляет от необходимости переносить файлы между разными инструментами. Тем не менее, восстановление сканов изначально сложнее, чем нативных PDF, поэтому разумные ожидания помогут сохранить нервы.

Метод 3: Использование глоссариев для обеспечения единообразия профессиональных терминов

Даже если с версткой всё в порядке, остается часто игнорируемая проблема качества: несогласованность специальных терминов и имен собственных. В техническом документе на несколько десятков страниц, если одно и то же название продукта, детали или юридический термин каждый раз переводится по-разному, читатель запутается, а профессиональный уровень документа упадет.

Решение — создание глоссария: заранее зафиксируйте стандартные переводы ключевых терминов и принудительно применяйте их при переводе. Например, если закрепить перевод «Liquidity Coverage Ratio» как «коэффициент покрытия ликвидности», во всем документе он будет звучать одинаково. Подробнее см. Почему корпоративному переводу необходим глоссарий?

DocTransAI поддерживает создание собственных глоссариев с массовым импортом из CSV и автоматически сверяет и заменяет термины во время перевода. Для команд, которым необходимо постоянно поддерживать единообразие брендовой или отраслевой лексики, этот шаг значительно повысит согласованность готовых материалов.

Частые ошибки и рекомендации

Итоги

Ключ к переводу PDF с сохранением верстки — не поиск «самого точного» переводчика, а поиск инструмента, который «понимает макет». Нативные PDF переводите с помощью ИИ-инструментов с восстановлением верстки; сканы сначала прогоняйте через OCR; профессиональные документы дополняйте глоссариями для единообразия терминов. Сочетание этих трех подходов сведет к минимуму объем ручной правки на последующих этапах.