Методологія
Бенчмарк якості перекладу InterMIND створюється автоматично нашим власним набором тестів: щотижневий синтетичний прогін запускає той самий конвеєр перекладу, що працює в публічному /demo, на фіксованому еталонному наборі, однаково для кожної мовної пари. Він синтетичний і відтворюваний — нічого тут не добирається вибірково й не підганяється, а в оцінюванні немає людини.
Як працює один тест
Тестовий прогін відтворює еталонний аудіофайл (голосовий тест) або надсилає еталонний текст (чат-тест) з вихідної мови через наш конвеєр живого перекладу на цільову мову. Отриманий переклад оцінюється за шкалою 0–100 LLM-суддею порівняно з канонічним еталонним перекладом.
LLM-суддя: google/gemini-3.8-flash — основний, anthropic/claude-sonnet-5 — резервний (через Vercel AI Gateway). Для всіх пар використовуються однаковий промпт, критерії оцінювання та еталонні тексти.
Як агрегується місяць
- Кожен завершений повний прогін бенчмарку записується в
demo_test_runsз оцінками за кожну цільову мову. Попередні перегляди окремих пар виключаються — на медіани впливають лише повні багатомовні прогони. - Для кожної комбінації (вихідна мова, цільова мова, тип тесту, тиждень) ми зберігаємо останній прогін, а потім агрегуємо за місяць — тож одне джерело не може зсунути медіани, повторюючи пару протягом тижня.
- З дедуплікованого набору ми обчислюємо медіану, мінімум, максимум, p10, p90, середнє та розмір вибірки.
- Ми зберігаємо знімки окремих оцінок, щоб після закриття місяця числа залишалися стабільними, навіть якщо необроблені прогони буде видалено за TTL.
Коли пара з’являється в публічному індексі
Рядок (пара × тип тесту × місяць) потрапляє до публічного індексу та sitemap, якщо досягає мінімального розміру вибірки й нижньої межі медіанної оцінки (для голосу ця межа нижча через неминучий шум ASR). Оскільки набір даних походить з одного автоматизованого джерела, а не від багатьох незалежних відвідувачів, вимогу унікальності джерел для цих синтетичних даних послаблено — пороги розміру вибірки та якості залишаються чинними.
Пари, що не досягають порогів, залишаються доступними за прямим посиланням — пороги обмежують лише те, що бачать пошукові системи. Ми не приховуємо низькі оцінки від тих, хто запитує їх напряму.
Чого ми свідомо НЕ стверджуємо
- Окрема оцінка не заслуговує на довіру. Навіть стабільна пара може коливатися на 30 пунктів між прогонами, оскільки і ASR, і судження LLM є шумними. Саме тому кожна сторінка показує розподіл, а не одне число.
- Сам LLM-суддя недосконалий. У майбутньому ми можемо змінити суддю або використовувати двох; тоді історичні рядки міститимуть ідентифікатор судді.
- Бенчмарк не вимірює затримку, вартість, доступність чи задоволеність користувачів. Це висвітлюється деінде.
- Набір даних синтетичний — його створює наш власний автоматизований набір тестів, а не незалежний сторонній трафік. Ми прямо повідомляємо про це, а не створюємо враження зовнішньої панелі.
Чесні підходи
Коли якість за місяць для певної пари падає — це залишається видимим. Коли помилку виправлено і наступного місяця оцінка зростає — покращення видно на тій самій сторінці. Ми ніколи не переписуємо історичні агрегати. Адміністратори можуть лише приховати окремі місяці з публічного індексу; змінити вже опубліковані числа вони не можуть.
Відомі проблеми, що впливають на історичні дані
- Тестовий каркас чату, до 2026-04-23: автоматизований конвеєр чат-тестів мав збої для окремих мов. Агрегати чату за попередні місяці можуть показувати нижчі оцінки, ніж фактична якість перекладу в ті періоди. Уражені місяці збережено в базі даних, але приховано з публічного індексу; на графіку тренду буде видно стрибок у момент виправлення.
Запитання
Не погоджуєтеся з чимось тут? Створіть issue або напишіть нам. Ми оновимо цю сторінку та зазначимо зміну.