InterMIND যে চারটি অনুবাদ পাইপলাইনে চলে, তার ভেতরের কথা
mind.com-এর পুরোনো /product/overview/how-it-works পৃষ্ঠাটি এখন কয়েকটি বড় রিলিজ পিছিয়ে আছে। বেশিরভাগ ভেন্ডর পৃষ্ঠার মতো এটিও একটিমাত্র "অনুবাদ ইঞ্জিন"-এর কথা বলে: "আপনি বলছেন" থেকে "তারা শুনছেন" পর্যন্ত একটাই বড় তীর। দুই বছর আগেই ছবিটা অতিসরলীকৃত ছিল। আজ এটি ভুল।
আসল কথা হলো, InterMIND চালায় চারটি আলাদা অনুবাদ পাইপলাইন। প্রতিটি আলাদা সমস্যা সমাধান করে, আলাদা ইঞ্জিন, আলাদা লেটেন্সি বাজেট আর আলাদা মানের পরিসীমা নিয়ে। ভাষা বাছাইয়ের ইন্টারফেসটি এদের এক, কিন্তু ইঞ্জিন এক নয়।
"এটি কীভাবে কাজ করে" প্রশ্নের এটাই হালনাগাদ উত্তর।
সঙ্গী লেখা: "আপনারা কতগুলো ভাষা সমর্থন করেন?" লেখাটি বলে প্রতিটি পাইপলাইন কী কভার করে (23 / 23 / 30 / 17)। এই লেখাটি বলে প্রতিটি পাইপলাইন কী করে, এবং কেন সেটি আলাদা একটি জিনিস।
"সবকিছুর জন্য একটাই ইঞ্জিন" কেন একটি ভুল ধারণা
একটি লাইভ মিটিং প্ল্যাটফর্মকে একই সঙ্গে অন্তত চারটি কাজ করতে হয়, এবং কাজগুলো পরস্পরের উল্টো দিকে টানে:
- রিয়েল-টাইম ভয়েস: অডিও ঢোকে, অনুবাদিত অডিও বেরোয়, এক সেকেন্ডের মধ্যে, প্রতিটি দর্শক নিজের ভাষায়। এখানে প্রধান বাধা লেটেন্সি।
- রিয়েল-টাইম চ্যাট টেক্সট: ছোট বার্তা, দ্রুত, এডিট, কোট এবং HTML কাঠামো অক্ষুণ্ণ রেখে।
- রিয়েল-টাইম শেয়ার্ড নোটস: অক্ষর ধরে ধরে সহযোগিতামূলক টাইপিং, যেখানে কাঠামোগত শ্রেণিবিন্যাস (তালিকা, শিরোনাম, চেকবক্স) অনুবাদের পরেও টিকে থাকতে হয়।
- অ্যাসিনক্রোনাস ডকুমেন্ট ফাইল: চ্যাটে ফেলে দেওয়া 40 পৃষ্ঠার একটি PDF। এখানে লেটেন্সির কোনো বাজেট নেই। প্রধান বাধা বিশ্বস্ততা: ফরম্যাটিং, টেবিল, পৃষ্ঠা নম্বর, ফন্ট।
চারটি কাজই করতে চায় এমন একটি বিশাল LLM কল বানানো যায়। আমরা চেষ্টা করেছি। চারটিতেই সেটি খারাপ। ভয়েসের লেটেন্সি বাজেটের মানে মডেল ভাবার সময় পায় না, আর ডকুমেন্টের বিশ্বস্ততার বাজেটের মানে মডেলকে ভাবতেই হয়। চ্যাট এডিটের জন্য দরকার দর্শকের ভাষায় একটি ডিফ; 40 পৃষ্ঠার PDF-এর জন্য দরকার এমন ফরম্যাট সংরক্ষণ, যা কোনো টোকেন-স্ট্রিমিং মডেল দেয় না।
তাই আমরা চারটি চালাই। প্রতিটির বিবরণ নিচে।