Memasukkan PDF ke dalam alat terjemahan, hanya untuk mendapati perenggan tersasar, jadual berantakan, dan teks pada carta bertindih—ini hampir menjadi masalah yang dihadapi oleh semua orang apabila menterjemah PDF. Masalahnya bukan pada kualiti terjemahan, tetapi pada format PDF itu sendiri. Tutorial ini akan menerangkan mengapa PDF mudah rosak formatnya dan memberikan tiga kaedah yang benar-benar dapat mengekalkan format asal.
Mengapa Alat Biasa Merosakkan Format PDF?
Ramai yang menyangka PDF seperti Word, iaitu teks yang boleh disusun semula secara bebas perenggan demi perenggan. Sebenarnya, ia bertentangan. Objektif reka bentuk PDF ialah "kelihatan sama tidak kira dibuka pada peranti mana", jadi ia merekod koordinat mutlak setiap aksara, garisan, dan imej pada halaman, bukannya hubungan logik antara teks.
Ini membawa kepada tiga masalah tipikal:
- Aliran teks terputus: Satu ayat yang sama dalam PDF mungkin dipecahkan kepada beberapa blok teks bebas, tersebar pada koordinat yang berbeza. Alat biasa menterjemah mengikut blok, menyebabkan urutan terjemahan menjadi keliru.
- Lebar dan fon aksara: Apabila bahasa Cina atau Jepun diterjemahkan ke bahasa Inggeris, bilangan aksara biasanya menjadi lebih panjang, manakala Inggeris ke Cina menjadi lebih pendek. Teks yang asalnya muat dalam satu baris, selepas diterjemah sama ada melampaui sempadan atau meninggalkan ruang kosong yang besar, dan fon terbenam mungkin tidak dapat dipaparkan.
- Jadual dan carta: Jadual dalam PDF selalunya hanya sekumpulan garisan ditambah teks yang tersebar, tanpa konsep "sel". Sebaik sahaja panjang teks berubah, lajur akan tersasar, dan label pada carta juga akan teranjak.
Setelah memahami perkara ini, logik untuk memilih kaedah menjadi jelas: alat yang anda perlukan mesti "memahami" struktur reka letak terlebih dahulu, kemudian meletakkan semula terjemahan pada kedudukan yang sepadan, dan bukannya sekadar menggantikan teks.
Kaedah 1: Gunakan Alat AI yang Menyokong Pemulihan Format
Pendekatan yang lebih boleh dipercayai pada masa ini ialah menggunakan alat terjemahan AI yang melakukan analisis reka letak (layout analysis) terlebih dahulu. Aliran pemprosesan alat jenis ini biasanya: mengenal pasti perenggan, tajuk, jadual, blok imej dan lain-lain pada halaman, membina model struktur, dan selepas diterjemah, menyusun semula output mengikut kedudukan dan saiz blok asal.
Sebagai contoh, DocTransAI mengekalkan tahap perenggan, reka letak jadual dan kedudukan carta semasa memproses PDF, serta menyokong output perbandingan dwibahasa (teks asal dan terjemahan disusun atas dan bawah) untuk memudahkan semakan. Secara objektif, tiada alat yang dapat menjamin pemulihan 100% sempurna untuk reka letak yang kompleks—semakin rumit reka letak dan semakin besar perubahan panjang teks, semakin besar kemungkinan ralat berlaku. Namun, berbanding dengan kaedah tradisional yang hanya menggantikan teks, pemulihan format dapat menjimatkan banyak masa untuk pelarasan manual.
Bilakah kaedah ini paling sesuai?
- PDF asli (bukan imbasan), seperti fail yang dieksport dari Word, InDesign.
- Dokumen rasmi yang mengandungi jadual, reka letak berbilang lajur, pengepala dan pengaki, seperti laporan, kontrak, manual produk.
- Senario di mana terjemahan perlu diserahkan kepada orang lain untuk kegunaan terus, tanpa masa untuk menyusun semula halaman demi halaman.
Kaedah 2: PDF Imbasan Perlu Melalui OCR Terlebih Dahulu
Jika PDF anda ialah imbasan atau fail yang ditukar daripada gambar, ia pada dasarnya adalah imej, tanpa sebarang teks yang boleh dipilih. Dalam keadaan ini, mana-mana alat terjemahan tidak dapat membaca teks secara terus, ia mesti melalui OCR (Pengecaman Aksara Optik) terlebih dahulu untuk mengekstrak teks daripada imej.
Langkah yang disyorkan untuk memproses PDF imbasan:
- Sahkan sama ada fail tersebut ialah imbasan—cuba pilih teks dengan tetikus, jika tidak boleh dipilih, ia adalah imbasan.
- Gunakan alat dengan fungsi OCR untuk mengecam teks. Kualiti pengecaman sangat bergantung pada kejelasan imej asal, resolusi imbasan disyorkan 300 DPI ke atas.
- Pastikan untuk menyemak selepas pengecaman, OCR sering tersalah cam aksara yang serupa (seperti "O" dan "0"), ralat ini akan dibawa terus ke dalam terjemahan.
- Teruskan dengan terjemahan dan pemulihan format.
DocTransAI menyediakan pengecaman OCR terbina dalam untuk PDF imbasan, membolehkan pengecaman dan terjemahan diselesaikan dalam aliran yang sama, mengurangkan masalah memindahkan fail antara pelbagai alat. Walaupun begitu, kesukaran pemulihan untuk imbasan sememangnya lebih tinggi berbanding PDF asli, mempunyai jangkaan yang munasabah terhadap hasil akan membuatkan anda lebih tenang.
Kaedah 3: Gunakan Glosari untuk Memastikan Istilah Profesional Konsisten
Format sudah betul, tetapi masih ada isu kualiti yang sering diabaikan: ketidak konsistenan istilah khusus. Dalam dokumen teknikal berpuluh muka surat, jika nama produk, nama komponen atau istilah undang-undang yang sama diterjemahkan secara berbeza setiap kali, pembaca akan keliru dan tahap profesionalisme akan berkurang.
Penyelesaiannya ialah membina glosari (glossary): menetapkan terjemahan standard untuk kata kunci terlebih dahulu, dan memaksanya digunakan semasa menterjemah. Contohnya, menetapkan "Liquidity Coverage Ratio" secara konsisten sebagai "Nisbah Liputan Kecairan", maka keseluruhan dokumen tidak akan menggunakan istilah yang berbeza-beza. Lihat Mengapa terjemahan perusahaan mesti membina glosari?
DocTransAI menyokong pembinaan glosari sendiri dan import pukal melalui CSV, dengan padanan dan penggantian automatik semasa menterjemah. Bagi pasukan yang perlu mengekalkan perbendaharaan kata jenama atau istilah industri untuk jangka masa panjang, langkah ini dapat meningkatkan konsistensi penghantaran dengan ketara.
Kesilapan dan Cadangan Umum
- Memproses imbasan sebagai PDF asli: Hasilnya selalunya "terjemahan tidak bertindak balas langsung" atau output kosong. Nilailah jenis fail terlebih dahulu, imbasan sentiasa melalui aliran OCR.
- Mengabaikan pengembangan bilangan aksara: Terjemahan Cina ke Inggeris, Jepun ke Inggeris sering mengalami teks yang menjadi lebih panjang sehingga melampaui sempadan. Untuk dokumen dengan format tetap, pastikan untuk menyemak sempadan dan halaman dengan pantas selepas diterjemah.
- Menjangkakan kesempurnaan 100% untuk reka letak kompleks: Majalah berbilang lajur, draf reka bentuk dengan banyak bingkai imej terapung, mana-mana alat automatik sukar untuk memulihkannya sepenuhnya, meluangkan sedikit masa untuk pelarasan manual adalah lebih praktikal.
- Melangkau penyemakan: Tidak kira betapa hebatnya alat, dokumen rasmi untuk kegunaan luaran harus disemak terakhir oleh manusia, terutamanya nombor, tarikh, dan istilah khusus.
- Memproses keseluruhan fail besar sekaligus: Untuk fail beratus muka surat, disyorkan untuk mencuba menterjemah beberapa muka surat terlebih dahulu, pastikan kesan dan tetapan istilah adalah betul, sebelum memproses keseluruhan teks, bagi mengelakkan kerja sia-sia.
Kesimpulan
Kunci untuk mengekalkan format semasa menterjemah PDF bukanlah mencari alat yang "paling tepat dalam terjemahan", tetapi alat yang "memahami reka letak". Gunakan terjemahan AI yang menyokong pemulihan format untuk PDF asli; lakukan OCR dahulu sebelum menterjemah untuk imbasan; gabungkan dokumen profesional dengan glosari untuk memastikan penggunaan istilah yang konsisten—dengan menggabungkan ketiga-tiganya, anda dapat mengurangkan beban kerja pelarasan manual pada tahap minimum.