طریقۂ کار
InterMIND کا ترجمے کے معیار کا بینچ مارک ہمارے اپنے ٹیسٹ سوٹ سے خودکار طور پر تیار ہوتا ہے: ہفتہ وار مصنوعی رن اسی ترجمہ پائپ لائن کو، جو عوامی /demo کو چلاتی ہے، ایک مقررہ حوالہ سیٹ پر چلاتا ہے، اور ہر زبان کے جوڑے کے لیے ایک ہی طریقے سے۔ یہ مصنوعی اور دوبارہ حاصل کیا جا سکنے والا ہے — یہاں کوئی چیز چنی ہوئی یا منتخب کردہ نہیں، اور اسکورنگ کے عمل میں کوئی انسان شامل نہیں۔
ایک ٹیسٹ کیسے کام کرتا ہے
ٹیسٹ رن ماخذ زبان سے ایک حوالہ آڈیو فائل چلاتا ہے (وائس ٹیسٹ) یا ایک حوالہ متن بھیجتا ہے (چیٹ ٹیسٹ)، اور اسے ہماری لائیو ترجمہ پائپ لائن کے ذریعے ہدفی زبان تک پہنچاتا ہے۔ حاصل ہونے والے ترجمے کو ایک LLM جج ایک مستند حوالہ ترجمے کے مقابلے میں 0–100 کے پیمانے پر اسکور کرتا ہے۔
LLM جج: بنیادی طور پر google/gemini-3.8-flash، اور متبادل کے طور پر anthropic/claude-sonnet-5 (Vercel AI Gateway کے ذریعے)۔ تمام جوڑوں کے لیے ایک ہی پرامپٹ، ایک ہی معیار (rubric) اور ایک ہی حوالہ متون استعمال ہوتے ہیں۔
ایک مہینے کی تجمیع کیسے ہوتی ہے
- ہر مکمل بینچ مارک رن
demo_test_runsمیں ہر ہدفی زبان کے اسکور کے ساتھ درج ہوتا ہے۔ ایک جوڑے کی پیش نظارہ رنز شامل نہیں کی جاتیں — صرف مکمل کثیر لسانی رنز ہی میڈین میں شمار ہوتے ہیں۔ - ہر (ماخذ زبان، ہدفی زبان، ٹیسٹ کی قسم، ہفتہ) کے لیے ہم تازہ ترین رن رکھتے ہیں، پھر مہینے کے لحاظ سے تجمیع کرتے ہیں — تاکہ ایک ہی ہفتے میں کسی جوڑے کو دہرا کر کوئی ایک ماخذ میڈین کو متاثر نہ کر سکے۔
- غیر مکرر مجموعے سے ہم میڈین، کم از کم، زیادہ سے زیادہ، p10، p90، اوسط اور نمونے کا سائز نکالتے ہیں۔
- ہم انفرادی اسکورز کا اسنیپ شاٹ محفوظ کرتے ہیں تاکہ مہینہ بند ہونے کے بعد، خام رنز TTL کے ذریعے حذف ہو جانے پر بھی، اعداد و شمار مستحکم رہیں۔
کوئی جوڑا عوامی انڈیکس میں کب ظاہر ہوتا ہے
(جوڑا × ٹیسٹ کی قسم × مہینہ) کی ایک قطار عوامی انڈیکس اور سائٹ میپ کے لیے اس وقت اہل ہوتی ہے جب وہ کم از کم نمونے کے سائز اور میڈین اسکور کی کم از کم حد پر پوری اترے (وائس کے لیے یہ حد کم ہے، کیونکہ اس میں ASR کا ناگزیر شور ہوتا ہے)۔ چونکہ ڈیٹا سیٹ بہت سے آزاد وزیٹرز کے بجائے ایک ہی خودکار ماخذ سے آتا ہے، اس لیے اس مصنوعی ڈیٹا کے لیے منفرد ماخذ کی شرط نرم کر دی گئی ہے — نمونے کے سائز اور معیار کی حدیں پھر بھی لاگو رہتی ہیں۔
جو جوڑے ان حدوں پر پورے نہیں اترتے وہ براہِ راست لنک کے ذریعے بدستور دستیاب رہتے ہیں — حدیں صرف اس چیز کو محدود کرتی ہیں جو سرچ انجن دیکھتے ہیں۔ ہم کم اسکورز کو کسی ایسے شخص سے نہیں چھپاتے جو انہیں براہِ راست مانگے۔
ہم جان بوجھ کر کن باتوں کا دعویٰ نہیں کرتے
- کوئی ایک اسکور قابلِ اعتماد نہیں ہوتا۔ ایک اچھا کام کرنے والا جوڑا بھی رنز کے درمیان 30 پوائنٹ تک اتار چڑھاؤ دکھا سکتا ہے کیونکہ ASR اور LLM کا فیصلہ دونوں شور والے ہیں۔ اسی لیے ہر صفحہ ایک واحد عدد کے بجائے پورا تقسیمی خاکہ (distribution) دکھاتا ہے۔
- خود LLM جج بھی کامل نہیں ہے۔ ہم مستقبل میں جج بدل سکتے ہیں یا دو ججوں کا طریقہ اپنا سکتے ہیں؛ ایسا ہونے پر تاریخی قطاروں میں جج کی شناخت درج ہوگی۔
- بینچ مارک تاخیر (latency)، لاگت، دستیابی یا صارف کی اطمینان کی پیمائش نہیں کرتا۔ وہ باتیں کہیں اور موجود ہیں۔
- ڈیٹا سیٹ مصنوعی ہے — ہمارے اپنے خودکار سوٹ سے تیار کردہ، آزاد تیسرے فریق کی ٹریفک سے نہیں۔ ہم اسے صاف الفاظ میں بیان کرتے ہیں، کسی بیرونی پینل کا تاثر نہیں دیتے۔
دیانت دارانہ طرزِ عمل
جب کسی مخصوص جوڑے کا معیار کسی مہینے میں گر جاتا ہے — تو وہ نظر آتا رہتا ہے۔ جب کوئی خرابی دور ہو جاتی ہے اور اگلے مہینے اسکور بڑھتا ہے — تو بہتری اسی صفحے پر دکھائی دیتی ہے۔ ہم تاریخی تجمیعات کو کبھی دوبارہ نہیں لکھتے۔ ایڈمن صرف انفرادی مہینوں کو عوامی انڈیکس سے چھپا سکتے ہیں؛ وہ پہلے سے شائع شدہ اعداد و شمار کو تبدیل نہیں کر سکتے۔
تاریخی ڈیٹا کو متاثر کرنے والے معلوم مسائل
- چیٹ ٹیسٹ ہارنس، 2026-04-23 سے پہلے: خودکار چیٹ ٹیسٹ پائپ لائن میں زبان کے لحاظ سے ناکامیاں تھیں۔ پچھلے مہینوں کے چیٹ مجموعی اسکورز ان ادوار کے ترجمے کے اصل معیار سے کم دکھائی دے سکتے ہیں۔ متاثرہ مہینے ڈیٹا بیس میں محفوظ ہیں لیکن عوامی انڈیکس سے روکے گئے ہیں؛ رجحان کا چارٹ اصلاح کے مقام پر ایک اچانک تبدیلی دکھائے گا۔
سوالات
یہاں کسی بات سے اختلاف ہے؟ ایک issue کھولیں یا ہمیں لکھیں۔ ہم اس صفحے کو اپ ڈیٹ کریں گے اور تبدیلی کا ذکر کریں گے۔