जब आप किसी PDF को ट्रांसलेशन टूल में डालते हैं, और परिणामस्वरूप अनुवाद में पैराग्राफ गलत जगह पर होते हैं, टेबल बिखर जाते हैं, और चार्ट पर टेक्स्ट एक-दूसरे के ऊपर चढ़ जाते हैं—यह लगभग हर कोई है जिसने PDF का अनुवाद करते समय यह दर्दनाक अनुभव किया है। समस्या अनुवाद की गुणवत्ता में नहीं, बल्कि PDF फॉर्मेट की प्रकृति में है। यह ट्यूटोरियल बताएगा कि PDF का लेआउट क्यों बिगड़ता है, और लेआउट को वास्तव में संरक्षित रखने के तीन तरीके प्रदान करेगा।

सामान्य टूल से PDF का अनुवाद करने पर लेआउट क्यों बिगड़ता है?

कई लोग मानते हैं कि PDF वर्ड (Word) की तरह है, जहां टेक्स्ट के पैराग्राफ को स्वतंत्र रूप से व्यवस्थित किया जा सकता है। वास्तविकता इसके बिल्कुल विपरीत है। PDF का डिज़ाइन उद्देश्य यह है कि "किसी भी डिवाइस पर खोले जाने पर यह बिल्कुल वैसा ही दिखे", इसलिए यह पेज पर प्रत्येक अक्षर, प्रत्येक रेखा, और प्रत्येक छवि के निरपेक्ष निर्देशांक (absolute coordinates) को रिकॉर्ड करता है, न कि टेक्स्ट के बीच के तार्किक संबंधों को।

इसके परिणामस्वरूप तीन विशिष्ट समस्याएं उत्पन्न होती हैं:

इसे समझने के बाद, सही तरीका चुनने का तर्क स्पष्ट हो जाता है: आपको ऐसे टूल की आवश्यकता है जो पहले लेआउट संरचना को "समझ" सके, और फिर अनुवाद को संबंधित स्थानों पर वापस रख सके, न कि केवल टेक्स्ट को बदल दे।

विधि 1: लेआउट रीस्टोरेशन का समर्थन करने वाले AI टूल का उपयोग करें

वर्तमान में अधिक विश्वसनीय तरीका यह है कि लेआउट विश्लेषण (layout analysis) करने वाले AI अनुवाद टूल का उपयोग किया जाए। ऐसे टूल की प्रक्रिया आमतौर पर यह होती है: पहले पेज पर पैराग्राफ, शीर्षक, टेबल, चित्र आदि ब्लॉकों की पहचान करना, एक संरचनात्मक मॉडल बनाना, और अनुवाद करने के बाद मूल ब्लॉकों की स्थिति और आकार के अनुसार पुनः लेआउट करके आउटपुट देना।

DocTransAI के उदाहरण के रूप में, यह PDF को संसाधित करते समय पैराग्राफ स्तर, टेबल लेआउट और चार्ट की स्थिति को संरक्षित रखता है, और द्विभाषी तुलनात्मक आउटपुट (मूल और अनुवादित टेक्स्ट को ऊपर-नीचे रखकर) का समर्थन करता है, जिससे क्रॉस-चेक करना आसान हो जाता है। वस्तुनिष्ठ रूप से कहें तो, कोई भी टूल जटिल लेआउट को 100% पूर्ण रूप से पुनर्स्थापित करने की गारंटी नहीं दे सकता—लेआउट जितना अधिक जटिल होगा और टेक्स्ट की लंबाई में बदलाव जितना अधिक होगा, त्रुटियां उतनी ही अधिक संभावित होंगी। लेकिन पारंपरिक तरीके की तुलना में जो केवल टेक्स्ट को बदलता है, लेआउट रीस्टोरेशन से मैन्युअल समायोजन में काफी समय बचता है।

यह तरीका किस स्थिति में सबसे उपयुक्त है?

विधि 2: स्कैन किए गए PDF के लिए पहले OCR करना आवश्यक है

यदि आपकी PDF एक स्कैन की गई कॉपी है या फोटो से परिवर्तित फ़ाइल है, तो यह मूल रूप से चित्रों का एक सेट है, जिसमें कोई चुनने योग्य टेक्स्ट नहीं है। इस स्थिति में, कोई भी अनुवाद टूल सीधे टेक्स्ट नहीं पढ़ सकता, पहले OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) के माध्यम से चित्रों से टेक्स्ट निकालना आवश्यक है।

स्कैन किए गए PDF को संसाधित करने के लिए अनुशंसित चरण:

  1. पुष्टि करें कि फ़ाइल स्कैन की गई है या नहीं—माउस से टेक्स्ट को चुनने का प्रयास करें; यदि नहीं चुना जा सकता, तो यह स्कैन की गई फ़ाइल है।
  2. OCR कार्यक्षमता वाले टूल का उपयोग करके टेक्स्ट को पहचानें। पहचान की गुणवत्ता मूल छवि की स्पष्टता पर बहुत अधिक निर्भर करती है; स्कैन रिज़ॉल्यूशन 300 DPI या उससे अधिक होने की सिफारिश की जाती है।
  3. पहचान के बाद इसे अवश्य प्रूफरीड करें, OCR अक्सर "O" और "0" जैसे समान दिखने वाले अक्षरों को गलत पहचान लेता है, और ये त्रुटियां सीधे अनुवाद में आ जाएंगी।
  4. इसके बाद अनुवाद और लेआउट रीस्टोरेशन करें।

DocTransAI स्कैन किए गए PDF के लिए बिल्ट-इन OCR पहचान प्रदान करता है, जिससे पहचान और अनुवाद एक ही प्रक्रिया में पूरे हो जाते हैं, जिससे कई टूल्स के बीच फ़ाइलों को स्थानांतरित करने की झंझट कम हो जाती है। इसके बावजूद, स्कैन की गई फ़ाइलों की रीस्टोरेशन कठिनाई स्वाभाविक रूप से नेटिव PDF से अधिक होती है, इसलिए परिणामों को लेकर यथार्थवादी अपेक्षाएं रखना बेहतर होगा।

विधि 3: पेशेवर शब्दों की निरंतरता सुनिश्चित करने के लिए ग्लॉसरी (शब्दकोश) का उपयोग करें

लेआउट तो सही हो गया, लेकिन एक और गुणवत्ता संबंधी समस्या है जिसे अक्सर नजरअंदाज कर दिया जाता है: विशेष शब्दों में असंगति। कई दर्जन पृष्ठों वाले तकनीकी दस्तावेज़ में, यदि एक ही उत्पाद का नाम, पुर्जे का नाम, या कानूनी शब्द हर बार अलग-अलग अनुवाद किया जाता है, तो पाठक भ्रमित हो जाएंगे और पेशेवरता भी प्रभावित होगी।

इसका समाधान ग्लॉसरी (शब्दकोश) बनाना है: पहले से ही महत्वपूर्ण शब्दों के मानक अनुवाद को तय कर दें, और अनुवाद के दौरान इसे अनिवार्य रूप से लागू करें। उदाहरण के लिए, "Liquidity Coverage Ratio" का अनुवाद हमेशा "तरलता कवरेज अनुपात" के रूप में तय कर दें, ताकि पूरे दस्तावेज़ में एक ही शब्द के लिए अलग-अलग नाम न हों। विस्तार से जानें उद्यम अनुवाद के लिए ग्लॉसरी बनाना क्यों आवश्यक है?

DocTransAI कस्टम ग्लॉसरी बनाने और CSV के माध्यम से थोक में आयात करने का समर्थन करता है, और अनुवाद के दौरान स्वचालित रूप से मिलान और प्रतिस्थापन करता है। उन टीमों के लिए जिन्हें ब्रांड शब्दावली या उद्योग शब्दों को लंबे समय तक बनाए रखने की आवश्यकता होती है, यह कदम डिलीवरी की निरंतरता को काफी बढ़ा सकता है।

सामान्य गलतियां और सुझाव

निष्कर्ष

PDF का अनुवाद करते समय लेआउट को संरक्षित रखने की कुंजी, "सबसे सटीक अनुवाद" करने वाला टूल खोजना नहीं है, बल्कि "लेआउट को समझने वाला" टूल खोजना है। नेटिव PDF के लिए लेआउट रीस्टोरेशन का समर्थन करने वाले AI अनुवाद का उपयोग करें; स्कैन की गई फ़ाइलों के लिए पहले OCR करें फिर अनुवाद करें; पेशेवर दस्तावेज़ों के लिए शब्दों की निरंतरता सुनिश्चित करने के लिए ग्लॉसरी का उपयोग करें—इन तीनों को मिलाने से, बाद में मैन्युअल समायोजन के कार्यभार को न्यूनतम किया जा सकता है।