InterMIND को चलाने वाली चार ट्रांसलेशन पाइपलाइनों के अंदर
mind.com पर पुराना /product/overview/how-it-works पेज कई बड़ी रिलीज़ पीछे रह गया है। यह ज़्यादातर वेंडर पेजों की तरह एक ही "ट्रांसलेशन इंजन" बताता है: "आप बोलते हैं" से "वे सुनते हैं" तक एक बड़ा तीर। दो साल पहले भी यह तस्वीर सरलीकरण थी। आज यह गलत है।
सच यह है कि InterMIND चार अलग-अलग ट्रांसलेशन पाइपलाइनें चलाता है। हर पाइपलाइन अलग समस्या हल करती है, और उसका इंजन, लेटेंसी बजट और गुणवत्ता का दायरा भी अलग है। इन चारों में भाषा चुनने का पिकर साझा है, इंजन साझा नहीं है।
"यह कैसे काम करता है?" का यह अद्यतन उत्तर है।
एक सहयोगी लेख: "आप कितनी भाषाओं को सपोर्ट करते हैं?" बताता है कि हर पाइपलाइन क्या कवर करती है (23 / 23 / 30 / 17)। यह लेख बताता है कि हर पाइपलाइन क्या करती है, और वह अपने आप में अलग क्यों है।
"सबके लिए एक ही इंजन" एक झूठ क्यों है
लाइव मीटिंग प्लेटफ़ॉर्म को कम से कम चार काम एक साथ करने होते हैं, और ये काम अलग-अलग दिशाओं में खींचते हैं:
- रीयल-टाइम वॉइस — ऑडियो अंदर, अनुवादित ऑडियो बाहर, एक सेकंड से कम में, और हर दर्शक अपनी भाषा में। यहाँ सबसे कठिन बाधा लेटेंसी है।
- रीयल-टाइम चैट टेक्स्ट — छोटे संदेश, तेज़ी से, एडिट और कोट के साथ और HTML संरचना सुरक्षित रखते हुए।
- रीयल-टाइम शेयर्ड नोट्स — अक्षर-दर-अक्षर सहयोगी टाइपिंग, जिसमें संरचनात्मक पदानुक्रम (सूचियाँ, हेडिंग, चेकबॉक्स) अनुवाद के बाद भी बना रहना चाहिए।
- एसिंक्रोनस दस्तावेज़ फ़ाइलें — चैट में डाला गया 40 पन्नों का PDF। यहाँ लेटेंसी का कोई बजट नहीं है। सबसे कठिन बाधा विश्वसनीयता है: फ़ॉर्मैटिंग, टेबल, पेज नंबर और फ़ॉन्ट।
आप एक विशाल LLM कॉल बना सकते हैं जो चारों काम करने की कोशिश करे। हमने कोशिश की थी। वह चारों में खराब निकला। वॉइस के लेटेंसी बजट का मतलब है कि मॉडल सोच नहीं सकता। दस्तावेज़ों के फ़िडेलिटी बजट का मतलब है कि मॉडल को सोचना पड़ेगा। चैट एडिट के लिए दर्शक की भाषा में डिफ़ चाहिए। 40 पन्नों के PDF के लिए फ़ॉर्मैट सुरक्षित रखना चाहिए, जो कोई टोकन-स्ट्रीमिंग मॉडल नहीं देता।
इसलिए हम चार चलाते हैं। हर एक का विवरण यह है।