Методологія

Бенчмарк якості перекладу InterMIND створюється автоматично нашим власним набором тестів: щотижневий синтетичний прогін запускає той самий конвеєр перекладу, що працює в публічному /demo, на фіксованому еталонному наборі, однаково для кожної мовної пари. Він синтетичний і відтворюваний — нічого тут не добирається вибірково й не підганяється, а в оцінюванні немає людини.

Як працює один тест

Тестовий прогін відтворює еталонний аудіофайл (голосовий тест) або надсилає еталонний текст (чат-тест) з вихідної мови через наш конвеєр живого перекладу на цільову мову. Отриманий переклад оцінюється за шкалою 0–100 LLM-суддею порівняно з канонічним еталонним перекладом.

LLM-суддя: google/gemini-3.8-flash — основний, anthropic/claude-sonnet-5 — резервний (через Vercel AI Gateway). Для всіх пар використовуються однаковий промпт, критерії оцінювання та еталонні тексти.

Як агрегується місяць

  1. Кожен завершений повний прогін бенчмарку записується в demo_test_runs з оцінками за кожну цільову мову. Попередні перегляди окремих пар виключаються — на медіани впливають лише повні багатомовні прогони.
  2. Для кожної комбінації (вихідна мова, цільова мова, тип тесту, тиждень) ми зберігаємо останній прогін, а потім агрегуємо за місяць — тож одне джерело не може зсунути медіани, повторюючи пару протягом тижня.
  3. З дедуплікованого набору ми обчислюємо медіану, мінімум, максимум, p10, p90, середнє та розмір вибірки.
  4. Ми зберігаємо знімки окремих оцінок, щоб після закриття місяця числа залишалися стабільними, навіть якщо необроблені прогони буде видалено за TTL.

Коли пара з’являється в публічному індексі

Рядок (пара × тип тесту × місяць) потрапляє до публічного індексу та sitemap, якщо досягає мінімального розміру вибірки й нижньої межі медіанної оцінки (для голосу ця межа нижча через неминучий шум ASR). Оскільки набір даних походить з одного автоматизованого джерела, а не від багатьох незалежних відвідувачів, вимогу унікальності джерел для цих синтетичних даних послаблено — пороги розміру вибірки та якості залишаються чинними.

Пари, що не досягають порогів, залишаються доступними за прямим посиланням — пороги обмежують лише те, що бачать пошукові системи. Ми не приховуємо низькі оцінки від тих, хто запитує їх напряму.

Чого ми свідомо НЕ стверджуємо

  • Окрема оцінка не заслуговує на довіру. Навіть стабільна пара може коливатися на 30 пунктів між прогонами, оскільки і ASR, і судження LLM є шумними. Саме тому кожна сторінка показує розподіл, а не одне число.
  • Сам LLM-суддя недосконалий. У майбутньому ми можемо змінити суддю або використовувати двох; тоді історичні рядки міститимуть ідентифікатор судді.
  • Бенчмарк не вимірює затримку, вартість, доступність чи задоволеність користувачів. Це висвітлюється деінде.
  • Набір даних синтетичний — його створює наш власний автоматизований набір тестів, а не незалежний сторонній трафік. Ми прямо повідомляємо про це, а не створюємо враження зовнішньої панелі.

Чесні підходи

Коли якість за місяць для певної пари падає — це залишається видимим. Коли помилку виправлено і наступного місяця оцінка зростає — покращення видно на тій самій сторінці. Ми ніколи не переписуємо історичні агрегати. Адміністратори можуть лише приховати окремі місяці з публічного індексу; змінити вже опубліковані числа вони не можуть.

Відомі проблеми, що впливають на історичні дані

  • Тестовий каркас чату, до 2026-04-23: автоматизований конвеєр чат-тестів мав збої для окремих мов. Агрегати чату за попередні місяці можуть показувати нижчі оцінки, ніж фактична якість перекладу в ті періоди. Уражені місяці збережено в базі даних, але приховано з публічного індексу; на графіку тренду буде видно стрибок у момент виправлення.

Запитання

Не погоджуєтеся з чимось тут? Створіть issue або напишіть нам. Ми оновимо цю сторінку та зазначимо зміну.