מתודולוגיה
מדד איכות התרגום של InterMIND נוצר באופן אוטומטי על ידי חבילת הבדיקות שלנו: ריצה סינתטית שבועית מפעילה את אותו צינור תרגום שמניע את ה-/demo הציבורי, על גבי קבוצת ייחוס קבועה, באותה דרך לכל זוג שפות. המדד סינתטי וניתן לשחזור. דבר כאן אינו נבחר או מסונן בקפידה כדי להציג תוצאות טובות, ואין אדם בלולאת הציון.
איך פועלת בדיקה בודדת
ריצת בדיקה מנגנת קובץ שמע של ייחוס (בדיקת קול) או שולחת טקסט ייחוס (בדיקת צ'אט) משפת מקור, דרך צינור התרגום החי שלנו, אל שפת יעד. התרגום המתקבל מקבל ציון בין 0 ל-100 מ-LLM שופט, בהשוואה לתרגום ייחוס קנוני.
LLM שופט: google/gemini-3.8-flash ראשי, anthropic/claude-sonnet-5 כגיבוי (דרך Vercel AI Gateway). אותה הנחיה, אותו מחוון ואותם טקסטי ייחוס משמשים בכל הזוגות.
איך מחושב אגרגט חודשי
- כל ריצת מדד מלאה שהושלמה נרשמת ב-
demo_test_runsעם ציונים לכל שפת יעד. תצוגות מקדימות של זוג בודד אינן נכללות, ורק ריצות מלאות מרובות שפות משפיעות על החציונים. - לכל צירוף של (שפת מקור, שפת יעד, סוג בדיקה, שבוע) אנו שומרים את הריצה האחרונה, ואז מבצעים אגרגציה לפי חודש. כך מקור בודד אינו יכול להטות את החציונים באמצעות חזרה על זוג אחד בתוך שבוע.
- מתוך הקבוצה לאחר הסרת כפילויות אנו מחשבים חציון, מינימום, מקסימום, p10, p90, ממוצע וגודל מדגם.
- אנו שומרים תצלום מצב של הציונים הבודדים, כך שלאחר סגירת חודש המספרים נשארים יציבים גם אם ריצות הגלם נמחקות לפי TTL.
מתי זוג מופיע באינדקס הציבורי
שורה של (זוג × סוג בדיקה × חודש) כשירה להיכלל באינדקס הציבורי ובמפת האתר (sitemap) כאשר היא עוברת גודל מדגם מינימלי וסף ציון חציוני (סף נמוך יותר לקול, שנושא רעש ASR בלתי נמנע). מכיוון שהנתונים מגיעים ממקור אוטומטי יחיד ולא ממבקרים עצמאיים רבים, הדרישה למקורות ייחודיים מוקלת עבור הנתונים הסינתטיים האלה. ספי גודל המדגם והאיכות ממשיכים לחול.
זוגות שאינם עומדים בספים נשארים נגישים בקישור ישיר. הספים מסננים רק את מה שמנועי חיפוש רואים. איננו מסתירים ציונים נמוכים מאף אחד שמבקש לראות אותם ישירות.
מה אנחנו במכוון לא טוענים
- ציון בודד אינו אמין. זוג שמתנהג היטב יכול להשתנות ב-30 נקודות בין ריצות, משום ש-ASR ושיפוט ה-LLM רועשים שניהם. לכן בכל עמוד מוצגת התפלגות ולא מספר בודד.
- ה-LLM השופט עצמו אינו מושלם. ייתכן שנחליף שופט או נשתמש בשני שופטים בעתיד, ושורות היסטוריות יישאו את מזהה השופט כשזה יקרה.
- המדד אינו מודד השהיה, עלות, זמינות או שביעות רצון משתמשים. אלה מתועדים במקום אחר.
- הנתונים סינתטיים: הם נוצרים על ידי חבילת הבדיקות האוטומטית שלנו ולא על ידי תעבורה עצמאית של צד שלישי. אנו מציינים זאת במפורש ולא רומזים על פאנל חיצוני.
קריאות כנות
כשחודש יורד באיכות עבור זוג מסוים, הוא נשאר גלוי. כשבאג מתוקן והחודש הבא קופץ, השיפור גלוי באותו עמוד. אנו לעולם לא משכתבים אגרגטים היסטוריים. מנהלי מערכת יכולים רק להסתיר חודשים בודדים מהאינדקס הציבורי, ואינם יכולים לשנות מספרים שכבר פורסמו.
בעיות ידועות המשפיעות על נתונים היסטוריים
- תשתית בדיקות הצ'אט, לפני 2026-04-23: בצינור בדיקות הצ'אט האוטומטי היו כשלים בשפות מסוימות. אגרגטים של צ'אט מחודשים קודמים עשויים להציג ציונים נמוכים מאיכות התרגום בפועל באותן תקופות. החודשים המושפעים נשמרים במסד הנתונים אך מודחקים מהאינדקס הציבורי, ותרשים המגמה יציג קפיצה בנקודת התיקון.
שאלות
לא מסכימים עם משהו כאן? פתחו issue או כתבו לנו. נעדכן את העמוד ונציין את השינוי.