المنهجية

يُنتَج معيار جودة الترجمة في InterMIND تلقائيًا بواسطة مجموعة الاختبارات الخاصة بنا: يشغّل تشغيل اصطناعي أسبوعي خط الترجمة نفسه الذي يشغّل /demo العام على مجموعة مرجعية ثابتة، وبالطريقة نفسها لكل زوج لغوي. وهو اصطناعي وقابل لإعادة الإنتاج — لا شيء هنا منتقى أو مختار بعناية، ولا يوجد أي تدخل بشري في حلقة التقييم.

كيف يعمل اختبار واحد

يشغّل الاختبار ملفًا صوتيًا مرجعيًا (اختبار صوتي) أو يرسل نصًا مرجعيًا (اختبار دردشة) من لغة مصدر عبر خط الترجمة المباشرة لدينا إلى لغة هدف. ثم يقيّم نموذج لغوي كبير (LLM) بصفة محكّم الترجمة الناتجة بدرجة من 0 إلى 100 قياسًا إلى ترجمة مرجعية معتمدة.

المحكّم LLM: google/gemini-3.8-flash أساسي، وanthropic/claude-sonnet-5 احتياطي (عبر Vercel AI Gateway). يُستخدم الموجّه نفسه ومعيار التقييم نفسه والنصوص المرجعية نفسها لجميع الأزواج.

كيف يُجمَّع الشهر

  1. يُسجَّل كل تشغيل كامل مكتمل للمعيار في demo_test_runs مع درجات لكل لغة هدف. تُستبعد المعاينات لزوج واحد — فقط عمليات التشغيل الكاملة متعددة اللغات تغذّي الوسيطات.
  2. لكل (لغة المصدر، لغة الهدف، نوع الاختبار، أسبوع) نحتفظ بآخر تشغيل فقط، ثم نجمّع حسب الشهر — بحيث لا يستطيع مصدر واحد أن يحرّف الوسيطات بتكرار زوج ضمن الأسبوع نفسه.
  3. من المجموعة بعد إزالة التكرار نحسب الوسيط والحد الأدنى والحد الأقصى وp10 وp90 والمتوسط وحجم العينة.
  4. نحفظ لقطة للدرجات الفردية بحيث تبقى الأرقام ثابتة بعد إغلاق الشهر، حتى بعد حذف عمليات التشغيل الخام بحسب TTL.

متى يظهر الزوج في الفهرس العام

يكون صف (زوج × نوع اختبار × شهر) مؤهلًا للظهور في الفهرس العام وخريطة الموقع عندما يتجاوز حدًا أدنى لحجم العينة وحدًا أدنى لوسيط الدرجات (وهو أقل في الاختبار الصوتي، الذي يتضمن ضجيجًا لا مفر منه في ASR). ولأن مجموعة البيانات تأتي من مصدر آلي واحد لا من زوار مستقلين كثيرين، فقد خُفّف شرط المصادر الفريدة لهذه البيانات الاصطناعية — مع بقاء حدّي حجم العينة والجودة ساريين.

تبقى الأزواج التي لا تبلغ الحدود متاحة عبر الرابط المباشر — فالعتبات تحدد فقط ما تراه محركات البحث. نحن لا نخفي الدرجات المنخفضة عن أي شخص يطلبها مباشرة.

ما لا ندّعيه عمدًا

  • الدرجة الواحدة ليست موثوقة. فقد يتأرجح زوج جيد الأداء بمقدار 30 نقطة بين تشغيلين، لأن ASR وحكم LLM كليهما يتسمان بالضجيج. ولهذا تعرض كل صفحة توزيعًا لا رقمًا واحدًا.
  • المحكّم LLM نفسه غير كامل. قد نبدّله أو نعتمد محكّمين اثنين في المستقبل؛ وستحمل الصفوف التاريخية معرّف المحكّم عند حدوث ذلك.
  • لا يقيس المعيار زمن الاستجابة ولا التكلفة ولا التوافر ولا رضا المستخدمين. هذه تُقاس في مكان آخر.
  • مجموعة البيانات اصطناعية — أنتجتها مجموعتنا الآلية الخاصة، لا حركة مرور مستقلة من أطراف خارجية. ونفصح عن ذلك صراحةً بدلًا من الإيحاء بوجود لجنة خارجية.

تقييم صريح

عندما تنخفض الجودة في شهر ما لزوج معين — يبقى ذلك ظاهرًا. وعندما يُصلَح خلل ويقفز الشهر التالي — يظهر التحسن في الصفحة نفسها. لا نعيد كتابة المجاميع التاريخية أبدًا. يستطيع المشرفون فقط إخفاء أشهر فردية من الفهرس العام؛ ولا يستطيعون تغيير الأرقام التي نُشرت بالفعل.

مشكلات معروفة تؤثر في البيانات التاريخية

  • أداة اختبار الدردشة، قبل 2026-04-23: كان خط اختبار الدردشة الآلي يعاني إخفاقات في بعض اللغات. وقد تُظهر مجاميع الدردشة للأشهر السابقة درجات أقل من جودة الترجمة الفعلية في تلك الفترات. تُحفظ الأشهر المتأثرة في قاعدة البيانات لكنها تُحجب عن الفهرس العام؛ وسيُظهر مخطط الاتجاه تغيرًا حادًا عند الإصلاح.

الأسئلة

هل تختلف مع شيء هنا؟ افتح بلاغًا (issue) أو راسلنا. سنحدّث هذه الصفحة ونوضّح التغيير.