InterMIND کو چلانے والی چار ترجمہ پائپ لائنز کا اندرونی جائزہ
mind.com پر پرانا /product/overview/how-it-works صفحہ کئی بڑی ریلیزز پیچھے رہ چکا ہے۔ یہ زیادہ تر وینڈر صفحات کی طرح ایک ہی "ترجمہ انجن" بیان کرتا ہے، یعنی "آپ بولتے ہیں" سے "وہ سنتے ہیں" تک ایک بڑا تیر۔ دو سال پہلے بھی یہ تصویر حقیقت کی سادہ شکل تھی۔ آج یہ غلط ہے۔
حقیقت یہ ہے کہ InterMIND چار الگ ترجمہ پائپ لائنز چلاتا ہے۔ ہر ایک مختلف مسئلہ حل کرتی ہے، اور ہر ایک کا انجن، تاخیر کا بجٹ اور معیار کا دائرہ مختلف ہے۔ ان میں زبان منتخب کرنے والا ایک ہی پِکر مشترک ہے۔ انجن مشترک نہیں ہے۔
یہ "یہ کیسے کام کرتا ہے" کا تازہ جواب ہے۔
ایک ساتھی تحریر: "آپ کتنی زبانوں کو سپورٹ کرتے ہیں؟" میں بتایا گیا ہے کہ ہر پائپ لائن کیا کور کرتی ہے (23 / 23 / 30 / 17)۔ یہ تحریر بتاتی ہے کہ ہر پائپ لائن کیا کرتی ہے، اور وہ الگ کیوں ہے۔
"ہر کام کے لیے ایک انجن" کیوں غلط ہے
لائیو میٹنگ پلیٹ فارم کو بیک وقت کم از کم چار کام کرنے ہوتے ہیں، اور یہ ایک دوسرے سے متضاد سمتوں میں کھینچتے ہیں:
- ریئل ٹائم آواز: آڈیو اندر، ترجمہ شدہ آڈیو باہر، ایک سیکنڈ سے کم میں، اور ہر ناظر اپنی زبان میں سنے۔ یہاں سب سے سخت پابندی تاخیر کی ہے۔
- ریئل ٹائم چیٹ ٹیکسٹ: مختصر پیغامات، تیزی سے، اور ایڈٹس، کوٹس اور HTML ساخت محفوظ رہیں۔
- ریئل ٹائم مشترکہ نوٹس: حرف بہ حرف اشتراکی ٹائپنگ، اور ساختی درجہ بندی (فہرستیں، سرخیاں، چیک باکس) جو ترجمے کے بعد بھی برقرار رہنی چاہیے۔
- غیر ہم وقتی دستاویزی فائلیں: چیٹ میں ڈالی گئی 40 صفحات کی PDF۔ تاخیر کا کوئی بجٹ نہیں۔ یہاں سخت پابندی وفاداری کی ہے، یعنی فارمیٹنگ، ٹیبلز، صفحہ نمبر اور فونٹ۔
آپ ایک بڑی LLM کال بنا سکتے ہیں جو چاروں کام کرنے کی کوشش کرے۔ ہم نے کوشش کی۔ وہ چاروں میں خراب نکلی۔ آواز کے تاخیری بجٹ کا مطلب ہے کہ ماڈل سوچ نہیں سکتا، جبکہ دستاویزات کے وفاداری بجٹ کا مطلب ہے کہ ماڈل کو سوچنا پڑتا ہے۔ چیٹ ایڈٹ کو ناظر کی زبان میں diff چاہیے، اور 40 صفحات کی PDF کو ایسی فارمیٹ حفاظت چاہیے جو ٹوکن اسٹریم کرنے والا کوئی ماڈل نہیں دیتا۔
اس لیے ہم چار چلاتے ہیں۔ ہر ایک کا حال یہ ہے۔