অনুবাদ-মানের মার্কেটিং কেন ভুল পথে — আর আমরা তার বদলে কী প্রকাশ করি
যেকোনো লাইভ-অনুবাদ ভেন্ডরের সাইট খুলুন। একই ধরনের সংখ্যা চোখে পড়বে:
- "200+ ভাষা"
- "6,000+ ভাষা-জোড়া"
- "বিশ্বের প্রথম" / "সর্বোচ্চ নির্ভুলতা"
- "99% নির্ভুল"
এবার ওই ভেন্ডর পেজগুলোর কোনোটিতে খুঁজে দেখুন, আপনি যে মিটিং চালাতে যাচ্ছেন তার জন্য এই সংখ্যাগুলোর অর্থ কী। প্রতিটি ভাষার মান। পুনরুৎপাদনযোগ্য পদ্ধতি। নমুনার আকার। সময়ের সঙ্গে স্কোরের পরিবর্তন। মডেল কোথায় দুর্বল, তার সৎ প্রকাশ।
এগুলো আপনি পাবেন না। মার্কেটিং কপিতে নয়, আর ডকুমেন্টেশনেও কচিৎ।
এটিই এই ক্যাটাগরির ভারসাম্যাবস্থা। এর পেছনে তিনটি কারণ আছে:
- বেশিরভাগ ভেন্ডরের নিজস্ব অনুবাদ ইঞ্জিন নেই। তারা OpenAI, Google, DeepL, Microsoft, অথবা এগুলোর কোনো সমন্বয়ের মধ্য দিয়ে রুট করে। জোড়াভিত্তিক মানের তথ্য প্রকাশ করা মানে অন্য কারও মডেলের বেঞ্চমার্কিং করা — এতে মার্কেটিং-মূল্য নেই।
- সৎ মানের তথ্য বিলবোর্ডে তোলা কঠিন। একটিমাত্র স্কোরে অনেক নয়েজ থাকে। বিন্যাস (distribution) বেশি কাজের, কিন্তু সংক্ষেপে দেখানো কঠিন।
last-six-months trendআরও কাজের, আর আরও কঠিন। - ক্রয় বিভাগ এখনো প্রশ্ন তোলেনি। ক্রেতারা মার্কেটিংয়ের সংখ্যা আপাতমূল্যেই মেনে নেয়, ফলে ভারসাম্য টিকে থাকে।
এই ভারসাম্য টিকবে না। পরবর্তী প্রজন্মের ক্রেতারা — ফার্মা, আইন, অর্থ, অডিট, সরকারি খাত — "কয়টি ভাষা" এর চেয়ে কঠিন প্রশ্ন করবেন। আমরা /benchmark তৈরি করেছি, কারণ আমরা মনে করি ভেন্ডরের কথা চোখ বুজে মেনে নেওয়ার প্রয়োজন তাঁদের থাকা উচিত নয়।
মার্কেটিংয়ের সংখ্যা আপনাকে যা বলে না
"200+ ভাষা" মানে ভেন্ডরের এমন একটি মডেল আছে যা 200টি ভাষায় টেক্সট তৈরি করে। এসব ভাষায় মান প্রধান জোড়ায় (EN↔DE, EN↔ES, EN↔FR) প্রোডাকশন-মানের থেকে শুরু করে স্বল্প-সম্পদের জোড়ায় কোনোমতে ব্যবহারযোগ্য পর্যন্ত হয়ে থাকে। জোড়াভিত্তিক বিশ্লেষণ ছাড়া আপনার মিটিং ওই রেখার কোন পাশে পড়বে, তা বলা যায় না।
"6,000+ ভাষা-জোড়া" হলো 80টি সোর্স ভাষার উপর N × N কম্বিনেটরিক্স। 6,000 জোড়া সমর্থনের কথা বলা সহজ অংশ। কোনো নির্দিষ্ট জোড়া CAPA রিভিউ, চুক্তি-আলোচনা বা আর্নিংস কলের জন্য যথেষ্ট ভালো — এটা বলা যে অংশ, সেটি ব্রোশিয়ারে থাকে না।
"99% নির্ভুল" — কী পরিমাপ করা হয়েছে, কোন রেফারেন্সের বিপরীতে, কোন নমুনায়, কোন বিচারকের দ্বারা, তা না বললে — এটি বিষয়বস্তুহীন। অনুবাদের মানের কোনো সর্বজনীন একক সংখ্যা নেই। এটি একটি বিন্যাস, যা নির্ভর করে ভাষা-জোড়া, কনটেন্টের ক্ষেত্র, অডিওর মান (ভয়েসের ক্ষেত্রে), লেটেন্সি বাজেট এবং নির্দিষ্ট ব্যবহারের ক্ষেত্রে "যথেষ্ট ভালো" বলতে কী বোঝায় তার উপর।