একটি PDF ফাইল অনুবাদ টুলে দিলে যখন অনুবাদিত টেক্সট বের হয়, তখন প্যারাগ্রাফ এলোমেলো হয়ে যায়, টেবিল ভেঙে যায় এবং চার্টের টেক্সটগুলো একে অপরের ওপর উঠে যায়—PDF অনুবাদ করতে গিয়ে প্রায় সবারই এই সমস্যার সম্মুখীন হতে হয়। সমস্যাটি অনুবাদের মানের নয়, বরং PDF ফরম্যাটের নিজস্ব বৈশিষ্ট্যের। এই টিউটোরিয়ালে ব্যাখ্যা করা হবে কেন PDF-এর লেআউট নষ্ট হয়ে যায় এবং কীভাবে লেআউট বজায় রেখে অনুবাদ করা যায়, তার তিনটি কার্যকর পদ্ধতি দেওয়া হবে।
কেন সাধারণ টুল দিয়ে PDF অনুবাদ করলে লেআউট নষ্ট হয়ে যায়?
অনেকের ধারণা PDF অনেকটা Word-এর মতো, যেখানে টেক্সটগুলো প্যারাগ্রাফ আকারে থাকে এবং সেগুলোকে স্বাধীনভাবে পুনর্বিন্যাস করা যায়। কিন্তু বাস্তবে ঠিক এর উল্টো। PDF-এর মূল ডিজাইনের লক্ষ্য হলো "যেকোনো ডিভাইসে খুললেও যেন একই রকম দেখায়"। তাই এটি টেক্সটগুলোর মধ্যকার যৌক্তিক সম্পর্কের পরিবর্তে প্রতিটি অক্ষর, প্রতিটি রেখা এবং প্রতিটি ছবির পৃষ্ঠায় পরম স্থানাঙ্ক (absolute coordinates) রেকর্ড করে।
এর ফলে তিনটি সাধারণ সমস্যা দেখা দেয়:
- টেক্সট ফ্লো ভেঙে যাওয়া: PDF-এর ভেতরে একটি বাক্যকে কয়েকটি আলাদা টেক্সট ব্লকে ভাগ করে বিভিন্ন স্থানাঙ্কে রাখা হতে পারে। সাধারণ টুলগুলো ব্লক অনুযায়ী অনুবাদ করে, ফলে অনুবাদের ক্রম এলোমেলো হয়ে যায়।
- অক্ষরের প্রস্থ এবং ফন্ট: চাইনিজ বা জাপানিজ থেকে ইংরেজিতে অনুবাদ করলে সাধারণত শব্দের দৈর্ঘ্য বেড়ে যায়, আবার ইংরেজি থেকে চাইনিজ করলে কমে যায়। মূল ফাইলে যে টেক্সটটি ঠিক এক লাইনে ফিট করে, অনুবাদের পর তা হয় সীমানা ছাড়িয়ে চলে যায় অথবা বিশাল ফাঁকা জায়গা থেকে যায়। এমনকি এমবেডেড ফন্টগুলোও সঠিকভাবে প্রদর্শিত নাও হতে পারে।
- টেবিল এবং চার্ট: PDF-এর টেবিলগুলো মূলত কিছু রেখা এবং ছড়িয়ে ছিটিয়ে থাকা টেক্সটের সমষ্টি, এতে "সেল" বা কক্ষের কোনো ধারণা থাকে না। টেক্সটের দৈর্ঘ্য পরিবর্তন হলেই কলামগুলো এলোমেলো হয়ে যায় এবং চার্টের লেবেলগুলোও স্থান পরিবর্তন করে।
বিষয়টি বোঝার পর, সঠিক পদ্ধতি বেছে নেওয়ার যুক্তি পরিষ্কার হয়ে যায়: আপনার এমন একটি টুল দরকার যা প্রথমে লেআউটের গঠন "বুঝতে" পারবে এবং এরপর অনুবাদিত টেক্সটকে সঠিক স্থানে বসাবে, কেবল টেক্সট প্রতিস্থাপন করবে না।
পদ্ধতি ১: লেআউট রিস্টোরেশন সাপোর্ট করে এমন AI টুল ব্যবহার করা
বর্তমানে সবচেয়ে নির্ভরযোগ্য পদ্ধতি হলো এমন AI অনুবাদ টুল ব্যবহার করা যা প্রথমে লেআউট অ্যানালাইসিস (layout analysis) করে। এই ধরনের টুলগুলোর কাজের প্রক্রিয়া সাধারণত এমন হয়: প্রথমে পৃষ্ঠায় থাকা প্যারাগ্রাফ, শিরোনাম, টেবিল, ছবি ইত্যাদি ব্লকগুলো শনাক্ত করে একটি স্ট্রাকচারাল মডেল তৈরি করে, এবং অনুবাদ করার পর মূল ব্লকগুলোর অবস্থান এবং আকার অনুযায়ী পুনরায় লেআউট সাজিয়ে আউটপুট দেয়।
উদাহরণস্বরূপ DocTransAI-এর কথা বলা যায়, এটি PDF প্রসেস করার সময় প্যারাগ্রাফের স্তর, টেবিলের লেআউট এবং চার্টের অবস্থান বজায় রাখে এবং দ্বিভাষিক তুলনামূলক আউটপুট (মূল এবং অনুবাদিত টেক্সট পাশাপাশি বা উপর-নিচ) সাপোর্ট করে, যা যাচাই করা সহজ করে। বস্তুনিষ্ঠভাবে বলতে গেলে, জটিল লেআউট ১০০% নিখুঁতভাবে পুনরুদ্ধার করার গ্যারান্টি কোনো টুলই দিতে পারে না—লেআউট যত জটিল হবে এবং টেক্সটের দৈর্ঘ্যের পরিবর্তন যত বেশি হবে, ত্রুটি হওয়ার সম্ভাবনা তত বাড়বে। তবে সরাসরি টেক্সট প্রতিস্থাপনের ঐতিহ্যবাহী পদ্ধতির তুলনায়, লেআউট রিস্টোরেশন ম্যানুয়াল অ্যাডজাস্টমেন্টের অনেক সময় বাঁচিয়ে দেয়।
কোন কোন ক্ষেত্রে এই পদ্ধতিটি সবচেয়ে উপযুক্ত?
- নেটিভ (স্ক্যান করা নয়) PDF, যেমন Word বা InDesign থেকে এক্সপোর্ট করা ফাইল।
- টেবিল, মাল্টি-কলাম লেআউট, হেডার এবং ফুটারযুক্ত আনুষ্ঠানিক ডকুমেন্ট, যেমন রিপোর্ট, চুক্তি, প্রোডাক্ট ম্যানুয়াল।
- অনুবাদিত টেক্সট অন্য কাউকে সরাসরি ব্যবহারের জন্য দিতে হবে এবং প্রতিটি পৃষ্ঠা পুনরায় সাজানোর সময় নেই এমন পরিস্থিতি।
পদ্ধতি ২: স্ক্যান করা PDF-এর ক্ষেত্রে প্রথমে OCR করা প্রয়োজন
আপনার PDF যদি স্ক্যান করা বা ছবি তুলে তৈরি করা ফাইল হয়, তবে তা মূলত একগুচ্ছ ছবি, যার ভেতরে সিলেক্ট করার মতো কোনো টেক্সট থাকে না। এই পরিস্থিতিতে, কোনো অনুবাদ টুল সরাসরি টেক্সট পড়তে পারে না, প্রথমে OCR (অপটিক্যাল ক্যারেকটার রিকগনিশন) এর মাধ্যমে ছবি থেকে টেক্সট এক্সট্র্যাক্ট করতে হয়।
স্ক্যান করা PDF প্রসেস করার জন্য প্রস্তাবিত ধাপগুলো:
- নিশ্চিত করুন ফাইলটি স্ক্যান করা কিনা—মাউস দিয়ে টেক্সট সিলেক্ট করার চেষ্টা করুন, যদি সিলেক্ট না হয় তবে বুঝবেন এটি স্ক্যান করা ফাইল।
- OCR ফাংশনালিটিযুক্ত টুল ব্যবহার করে টেক্সট শনাক্ত করুন। শনাক্তকরণের মান মূল ছবির স্পষ্টতার ওপর ব্যাপকভাবে নির্ভর করে, স্ক্যান রেজোলিউশন ৩০০ DPI বা তার বেশি হওয়া উচিত।
- শনাক্ত করার পর অবশ্যই একবার প্রুফরিড করুন, OCR-এর ক্ষেত্রে একই রকম দেখতে অক্ষরগুলো (যেমন "O" এবং "0") ভুল হওয়ার সম্ভাবনা থাকে, আর এই ভুলগুলো সরাসরি অনুবাদে চলে আসে।
- এরপর অনুবাদ এবং লেআউট রিস্টোরেশন প্রক্রিয়া সম্পন্ন করুন।
DocTransAI স্ক্যান করা PDF-এর জন্য বিল্ট-ইন OCR শনাক্তকরণ সুবিধা দেয়, যা একই প্রক্রিয়ায় শনাক্তকরণ এবং অনুবাদ সম্পন্ন করতে সাহায্য করে এবং একাধিক টুলের মধ্যে ফাইল আদান-প্রদানের ঝামেলা কমায়। তারপরও, স্ক্যান করা ফাইলের লেআউট পুনরুদ্ধার করা নেটিভ PDF-এর তুলনায় বেশি কঠিন, তাই ফলাফল সম্পর্কে বাস্তবসম্মত প্রত্যাশা রাখলে মানসিক চাপ কম হবে।
পদ্ধতি ৩: পেশাদার শব্দগুলোর ধারাবাহিকতা নিশ্চিত করতে গ্লসারি ব্যবহার করা
লেআউট ঠিক থাকলেও আরেকটি প্রায়ই উপেক্ষা করা হয় এমন মানের সমস্যা থেকে যায়: নির্দিষ্ট নাম বা পরিভাষার অসামঞ্জস্যতা। কয়েক ডজন পৃষ্ঠার একটি টেকনিক্যাল ডকুমেন্টে, একই প্রোডাক্টের নাম, পার্টসের নাম বা লিগ্যাল টার্ম যদি প্রতিবার ভিন্নভাবে অনুবাদ করা হয়, তবে পাঠকরা বিভ্রান্ত হবেন এবং ডকুমেন্টের পেশাদারিত্বও কমে যাবে।
এর সমাধান হলো একটি গ্লসারি (glossary) তৈরি করা: আগে থেকেই মূলশব্দগুলোর স্ট্যান্ডার্ড অনুবাদ নির্ধারণ করে রাখা এবং অনুবাদের সময় তা জোরপূর্বক প্রয়োগ করা। উদাহরণস্বরূপ, "Liquidity Coverage Ratio" কে সবসময় একইভাবে অনুবাদ করা, তাহলে পুরো ডকুমেন্টে একই শব্দের জন্য ভিন্ন ভিন্ন অনুবাদ থাকবে না। বিস্তারিত জানতে পড়ুন কেন এন্টারপ্রাইজ অনুবাদের জন্য গ্লসারি তৈরি করা অপরিহার্য?
DocTransAI কাস্টম গ্লসারি তৈরি এবং CSV ফরম্যাটে বাল্ক ইম্পোর্ট করার সুবিধা দেয়, যা অনুবাদের সময় স্বয়ংক্রিয়ভাবে মিলিয়ে প্রতিস্থাপন করে। ব্র্যান্ডের শব্দভাণ্ডার বা ইন্ডাস্ট্রির পরিভাষা দীর্ঘমেয়াদে রক্ষণাবেক্ষণকারী টিমগুলোর জন্য, এই ধাপটি ডেলিভারির ধারাবাহিকতা উল্লেখযোগ্যভাবে বৃদ্ধি করতে পারে।
সাধারণ ভুল এবং পরামর্শ
- স্ক্যান করা ফাইলকে নেটিভ PDF ভেবে প্রসেস করা: এর ফলাফল সাধারণত হয় "অনুবাদে কোনো সাড়া পাওয়া যায় না" অথবা আউটপুট সম্পূর্ণ ফাঁকা আসে। প্রথমে ফাইলের ধরন যাচাই করুন, স্ক্যান করা ফাইলের ক্ষেত্রে সবসময় OCR প্রক্রিয়া অনুসরণ করুন।
- শব্দের দৈর্ঘ্য বৃদ্ধি উপেক্ষা করা: চাইনিজ বা জাপানিজ থেকে ইংরেজিতে অনুবাদ করায় প্রায়ই টেক্সটের দৈর্ঘ্য বেড়ে গিয়ে সীমানা ছাড়িয়ে যায়। ফিক্সড লেআউটের ডকুমেন্টের ক্ষেত্রে, অনুবাদের পর অবশ্যই দ্রুত সীমানা এবং পেজ ব্রেক চেক করে নিন।
- জটিল লেআউটের জন্য ১০০% নিখুঁত ফলাফলের প্রত্যাশা করা: মাল্টি-কলাম ম্যাগাজিন বা প্রচুর ফ্লোটিং ইমেজ ফ্রেমযুক্ত ডিজাইন ফাইল, কোনো অটোমেটেড টুলই এগুলো পুরোপুরি পুনরুদ্ধার করতে পারে না, তাই ম্যানুয়াল অ্যাডজাস্টমেন্টের জন্য সামান্য সময় রাখাটাই বাস্তবসম্মত।
- প্রুফরিডিং এড়িয়ে যাওয়া: টুল যত শক্তিশালীই হোক না কেন, আনুষ্ঠানিকভাবে প্রকাশের জন্য তৈরি ডকুমেন্টগুলো সবসময় একজন মানুষের দ্বারা চূড়ান্তভাবে পর্যালোচনা করা উচিত, বিশেষ করে সংখ্যা, তারিখ এবং নির্দিষ্ট নামগুলোর ক্ষেত্রে।
- পুরো বড় ফাইল একসাথে প্রসেস করা: কয়েকশ পৃষ্ঠার ফাইলের ক্ষেত্রে, প্রথমে কয়েক পৃষ্ঠা টেস্ট অনুবাদ করার পরামর্শ দেওয়া হয়, ফলাফল এবং টার্ম সেটিংস ঠিক আছে কিনা নিশ্চিত হয়ে তারপর পুরো ফাইলটি প্রসেস করুন, যাতে বৃথা পরিশ্রম না হয়।
উপসংহার
PDF অনুবাদ করে লেআউট বজায় রাখার মূল চাবিকাঠি হলো "সবচেয়ে নির্ভুল অনুবাদ করা" টুল খোঁজা নয়, বরং "লেআউট বুঝতে পারে" এমন টুল খোঁজা। নেটিভ PDF-এর জন্য লেআউট রিস্টোরেশন সাপোর্ট করে এমন AI অনুবাদ ব্যবহার করুন; স্ক্যান করা ফাইলের ক্ষেত্রে প্রথমে OCR করে তারপর অনুবাদ করুন; পেশাদার ডকুমেন্টের ক্ষেত্রে শব্দের ধারাবাহিকতা নিশ্চিত করতে গ্লসারি ব্যবহার করুন—এই তিনটি পদ্ধতির সমন্বয়ে আপনি পরবর্তী ম্যানুয়াল অ্যাডজাস্টমেন্টের কাজকে সর্বনিম্ন পর্যায়ে নামিয়ে আনতে পারবেন।