Загрузка PDF в инструмент перевода часто заканчивается тем, что абзацы смещаются, таблицы разваливаются, а текст на графиках накладывается друг на друга — с этой болью сталкивался почти каждый, кто переводил PDF. Проблема не в качестве перевода, а в самой природе формата PDF. В этом руководстве мы объясним, почему PDF так легко «ломается», и предложим три рабочих метода сохранения исходной верстки.
Почему обычные инструменты ломают верстку PDF?
Многие думают, что PDF устроен как Word: это просто текст, разбитый на абзацы, которые можно свободно переставлять. На самом деле всё наоборот. Главная задача PDF — «выглядеть одинаково на любом устройстве», поэтому он хранит абсолютные координаты каждой буквы, линии и изображения на странице, а не логические связи между словами.
Это порождает три типичные проблемы:
- Разрыв текстового потока: одно и то же предложение внутри PDF может быть разбито на несколько независимых текстовых блоков, разбросанных по разным координатам. Обычные инструменты переводят блок за блоком, из-за чего порядок текста в переводе нарушается.
- Ширина символов и шрифты: при переводе с китайского или японского на английский объем текста обычно увеличивается, а при переводе с английского на китайский — уменьшается. Текст, который идеально вписывался в одну строку, после перевода либо вылезает за границы, либо оставляет огромные пробелы, а встроенные шрифты могут вообще не отобразиться.
- Таблицы и графики: таблицы в PDF часто представляют собой просто набор линий и разрозненного текста без понятия «ячейки». Как только длина текста меняется, столбцы смещаются, а метки на графиках уезжают со своих мест.
Поняв это, становится ясно, как выбирать инструмент: вам нужен такой, который сначала «поймет» структуру макета, а затем поместит перевод в соответствующие места, а не просто заменит текст.
Метод 1: Использование ИИ-инструментов с поддержкой восстановления верстки
Самый надежный на сегодняшний день подход — использование ИИ-инструментов перевода, которые сначала выполняют анализ макета (layout analysis). Обычно процесс выглядит так: инструмент распознает абзацы, заголовки, таблицы, изображения и другие блоки на странице, строит структурную модель, переводит текст, а затем перекомпоновывает его в соответствии с исходным положением и размером блоков.
Возьмем, к примеру, DocTransAI. При работе с PDF он сохраняет структуру абзацев, макет таблиц и расположение графиков, а также поддерживает двуязычный вывод (оригинал и перевод друг под другом), что удобно для сверки. Объективно говоря, ни один инструмент не гарантирует 100% идеального восстановления сложной верстки — чем сложнее макет и чем сильнее меняется длина текста, тем выше вероятность погрешностей. Но по сравнению с традиционным методом простой замены текста, восстановление верстки экономит массу времени на ручную правку.
В каких случаях этот метод подходит лучше всего?
- Нативные (несканированные) PDF, например, файлы, экспортированные из Word или InDesign.
- Официальные документы с таблицами, многоколоночной версткой, колонтитулами: отчеты, контракты, руководства по продуктам.
- Ситуации, когда перевод нужно передать другим людям для непосредственного использования, и нет времени переверстывать каждую страницу.
Метод 2: Предварительное использование OCR для сканированных PDF
Если ваш PDF — это скан или фотография документа, то по сути это набор изображений, в которых нет выделяемого текста. В таком случае ни один инструмент перевода не сможет напрямую прочитать текст: сначала необходимо извлечь его из изображений с помощью OCR (оптического распознавания символов).
Рекомендуемые шаги для работы со сканированными PDF:
- Убедитесь, что файл является сканом — попробуйте выделить текст мышкой. Если не выделяется, это скан.
- Используйте инструмент с функцией OCR для распознавания текста. Качество распознавания сильно зависит от четкости исходного изображения; рекомендуемое разрешение сканирования — не менее 300 DPI.
- После распознавания обязательно проведите вычитку. OCR часто путает похожие символы (например, «О» и «0», «С» и «С»), и эти ошибки напрямую попадут в перевод.
- Только после этого приступайте к переводу и восстановлению верстки.
DocTransAI предлагает встроенное OCR-распознавание для сканированных PDF, позволяя выполнить распознавание и перевод в рамках одного процесса, что избавляет от необходимости переносить файлы между разными инструментами. Тем не менее, восстановление сканов изначально сложнее, чем нативных PDF, поэтому разумные ожидания помогут сохранить нервы.
Метод 3: Использование глоссариев для обеспечения единообразия профессиональных терминов
Даже если с версткой всё в порядке, остается часто игнорируемая проблема качества: несогласованность специальных терминов и имен собственных. В техническом документе на несколько десятков страниц, если одно и то же название продукта, детали или юридический термин каждый раз переводится по-разному, читатель запутается, а профессиональный уровень документа упадет.
Решение — создание глоссария: заранее зафиксируйте стандартные переводы ключевых терминов и принудительно применяйте их при переводе. Например, если закрепить перевод «Liquidity Coverage Ratio» как «коэффициент покрытия ликвидности», во всем документе он будет звучать одинаково. Подробнее см. Почему корпоративному переводу необходим глоссарий?
DocTransAI поддерживает создание собственных глоссариев с массовым импортом из CSV и автоматически сверяет и заменяет термины во время перевода. Для команд, которым необходимо постоянно поддерживать единообразие брендовой или отраслевой лексики, этот шаг значительно повысит согласованность готовых материалов.
Частые ошибки и рекомендации
- Обработка сканов как нативных PDF: результат часто — «перевод вообще не реагирует» или пустой вывод. Сначала определите тип файла: сканы всегда обрабатывайте через OCR.
- Игнорирование раздувания текста: при переводе с китайского или японского на английский текст часто удлиняется и вылезает за границы. В документах с фиксированной версткой после перевода обязательно быстро проверяйте границы и разрывы страниц.
- Ожидание 100% идеала для сложных макетов: многоколоночные журналы, макеты с большим количеством плавающих фреймов — ни один автоматический инструмент не сможет восстановить их полностью, поэтому лучше сразу заложить немного времени на ручную доводку, это более практично.
- Пропуск вычитки: какой бы мощной ни была машина, официальные документы перед публикацией должен окончательно вычитать человек, особенно в части цифр, дат и терминов.
- Обработка огромных файлов за один раз: файлы на сотни страниц рекомендуется сначала переводить по несколько страниц, чтобы убедиться в правильности результата и настроек терминов, и только потом запускать весь объем, чтобы не делать двойную работу.
Итоги
Ключ к переводу PDF с сохранением верстки — не поиск «самого точного» переводчика, а поиск инструмента, который «понимает макет». Нативные PDF переводите с помощью ИИ-инструментов с восстановлением верстки; сканы сначала прогоняйте через OCR; профессиональные документы дополняйте глоссариями для единообразия терминов. Сочетание этих трех подходов сведет к минимуму объем ручной правки на последующих этапах.