कार्यप्रणाली
InterMIND अनुवाद गुणवत्ता बेंचमार्क हमारे अपने टेस्ट सूट द्वारा स्वचालित रूप से तैयार किया जाता है: एक साप्ताहिक सिंथेटिक रन उसी अनुवाद पाइपलाइन को चलाता है जो सार्वजनिक /demo को संचालित करती है, एक निश्चित संदर्भ सेट पर, हर भाषा जोड़ी के लिए एक ही तरीके से। यह सिंथेटिक और पुनरुत्पादन-योग्य है — यहाँ कुछ भी चुना-छाँटा नहीं गया है, और स्कोरिंग प्रक्रिया में कोई मानव शामिल नहीं है।
एक अकेला टेस्ट कैसे काम करता है
एक टेस्ट रन किसी स्रोत भाषा की संदर्भ ऑडियो फ़ाइल चलाता है (वॉइस टेस्ट) या संदर्भ टेक्स्ट भेजता है (चैट टेस्ट), और उसे हमारी लाइव अनुवाद पाइपलाइन से होते हुए लक्ष्य भाषा तक पहुँचाता है। परिणामी अनुवाद को एक LLM जज एक मानक संदर्भ अनुवाद के विरुद्ध 0–100 के पैमाने पर स्कोर करता है।
LLM जज: प्राथमिक google/gemini-3.8-flash, फ़ॉलबैक anthropic/claude-sonnet-5 (Vercel AI Gateway के माध्यम से)। सभी जोड़ियों में एक ही प्रॉम्प्ट, रूब्रिक और संदर्भ टेक्स्ट इस्तेमाल किए जाते हैं।
एक महीने का एग्रीगेशन कैसे होता है
- हर पूर्ण बेंचमार्क रन, लक्ष्य भाषा-वार स्कोर के साथ,
demo_test_runsमें दर्ज किया जाता है। एकल-जोड़ी प्रीव्यू शामिल नहीं किए जाते — केवल पूर्ण बहु-भाषा रन ही मीडियन में योगदान देते हैं। - प्रत्येक (स्रोत भाषा, लक्ष्य भाषा, टेस्ट प्रकार, सप्ताह) के लिए हम सबसे हाल का रन रखते हैं, फिर महीने के आधार पर एग्रीगेट करते हैं — ताकि कोई एक स्रोत किसी सप्ताह में एक ही जोड़ी दोहराकर मीडियन को प्रभावित न कर सके।
- डुप्लिकेट हटाए गए सेट से हम मीडियन, न्यूनतम, अधिकतम, p10, p90, औसत और नमूना आकार की गणना करते हैं।
- हम व्यक्तिगत स्कोर का स्नैपशॉट रखते हैं, ताकि महीना बंद होने के बाद, कच्चे रन TTL द्वारा हटा दिए जाने पर भी, आँकड़े स्थिर रहें।
कोई जोड़ी सार्वजनिक इंडेक्स में कब दिखती है
कोई (जोड़ी × टेस्ट प्रकार × महीना) पंक्ति तब सार्वजनिक इंडेक्स और साइटमैप के लिए पात्र होती है जब वह न्यूनतम नमूना आकार और मीडियन-स्कोर की न्यूनतम सीमा पार कर लेती है (वॉइस के लिए यह सीमा कम रखी गई है, क्योंकि उसमें ASR का अपरिहार्य शोर होता है)। चूँकि डेटासेट कई स्वतंत्र विज़िटरों के बजाय एक ही स्वचालित स्रोत से आता है, इसलिए इस सिंथेटिक डेटा के लिए अद्वितीय-स्रोत की आवश्यकता में ढील दी गई है — नमूना आकार और गुणवत्ता की न्यूनतम सीमाएँ फिर भी लागू रहती हैं।
जो जोड़ियाँ इन सीमाओं तक नहीं पहुँचतीं, वे सीधे लिंक से उपलब्ध रहती हैं — सीमाएँ केवल यह तय करती हैं कि सर्च इंजन को क्या दिखे। जो कोई सीधे माँगे, उससे हम कम स्कोर छिपाते नहीं हैं।
हम जानबूझकर क्या दावा नहीं करते
- कोई एकल स्कोर भरोसेमंद नहीं होता। एक अच्छी तरह काम करने वाली जोड़ी भी दो रन के बीच 30 अंक तक ऊपर-नीचे हो सकती है, क्योंकि ASR और LLM का आकलन दोनों ही शोरयुक्त हैं। इसीलिए हर पेज एकल संख्या के बजाय वितरण दिखाता है।
- LLM जज स्वयं भी अपूर्ण है। भविष्य में हम जज बदल सकते हैं या दो जजों का उपयोग कर सकते हैं; ऐसा होने पर ऐतिहासिक पंक्तियों में जज का पहचानकर्ता दर्ज रहेगा।
- यह बेंचमार्क लेटेंसी, लागत, उपलब्धता या उपयोगकर्ता संतुष्टि को नहीं मापता। वे अन्यत्र उपलब्ध हैं।
- डेटासेट सिंथेटिक है — हमारे अपने स्वचालित सूट द्वारा तैयार किया गया, स्वतंत्र तृतीय-पक्ष ट्रैफ़िक से नहीं। हम इसे स्पष्ट रूप से बताते हैं, किसी बाहरी पैनल का आभास नहीं देते।
ईमानदार रिपोर्टिंग
जब किसी जोड़ी की गुणवत्ता किसी महीने गिरती है — तो वह दिखाई देती रहती है। जब कोई बग ठीक होता है और अगले महीने सुधार दिखता है — तो वह सुधार उसी पेज पर दिखाई देता है। हम ऐतिहासिक एग्रीगेट को कभी दोबारा नहीं लिखते। एडमिन केवल अलग-अलग महीनों को सार्वजनिक इंडेक्स से छिपा सकते हैं; वे पहले से प्रकाशित आँकड़ों को बदल नहीं सकते।
ऐतिहासिक डेटा को प्रभावित करने वाली ज्ञात समस्याएँ
- चैट टेस्ट हार्नेस, 2026-04-23 से पहले: स्वचालित चैट-टेस्ट पाइपलाइन में भाषा-वार विफलताएँ थीं। पहले के महीनों के चैट एग्रीगेट उन अवधियों की वास्तविक अनुवाद गुणवत्ता से कम स्कोर दिखा सकते हैं। प्रभावित महीने डेटाबेस में रखे गए हैं, लेकिन सार्वजनिक इंडेक्स से हटाए गए हैं; ट्रेंड चार्ट में सुधार वाले बिंदु पर एक अचानक बदलाव दिखेगा।
प्रश्न
यहाँ किसी बात से असहमत हैं? एक इश्यू खोलें या हमें लिखें। हम इस पेज को अपडेट करेंगे और बदलाव का उल्लेख करेंगे।