Чому маркетинг якості перекладу зламаний — і що ми публікуємо натомість
Відкрийте сайт будь-якого постачальника послуг живого перекладу. Ви побачите однакові показники:
- «200+ мов»
- «6000+ мовних пар»
- «Перший у світі» / «Найвища точність»
- «99% точності»
Тепер спробуйте знайти — на будь-якій з цих сторінок постачальників — що ці цифри означають для зустрічі, яку ви збираєтесь провести. Якість для кожної мови. Відтворювана методологія. Розмір вибірки. Динаміка оцінки в часі. Чесне визнання того, де модель слабка.
Ви цього не знайдете. Ні в маркетингових матеріалах, і рідко в документації.
Це рівновага категорії. Вона існує з трьох причин:
- Більшість постачальників не володіють власним рушієм перекладу. Вони маршрутизують запити через OpenAI, Google, DeepL, Microsoft або їхню комбінацію. Публікація даних про якість для кожної пари означала б бенчмаркінг чужої моделі — в цьому немає маркетингової цінності.
- Чесні дані про якість важко розмістити на білборді. Єдина оцінка містить багато шуму. Розподіл є кориснішим, але його важче стиснути.
last-six-months trendє ще кориснішим і ще складнішим для стиснення. - Відділ закупівель ще не дав відсічі. Покупці приймають маркетингові цифри за чисту монету, і тому рівновага зберігається.
Ця рівновага не втримається. Наступний клас покупців — фармацевтика, юридичний сектор, фінанси, аудит, державний сектор — ставитиме складніші запитання, ніж «скільки мов». Ми створили /benchmark, тому що вважаємо, що їм не доведеться брати слово постачальника на віру.
Чого не кажуть маркетингові цифри
«200+ мов» означає, що у постачальника є модель, яка видає текст 200 мовами. Якість для цих мов коливається від придатної для виробничого використання для основних пар (EN↔DE, EN↔ES, EN↔FR) до ледь придатної для малоресурсних пар. Без розбивки по кожній парі ви не можете сказати, на який бік від цієї межі потрапить ваша зустріч.
«6000+ мовних пар» — це N × N комбінаторика для 80 вихідних мов. Сказати, що ви підтримуєте 6000 пар, — це легка частина. Сказати, що будь-яка конкретна пара достатньо хороша для перевірки CAPA, переговорів щодо контракту або звітного дзвінка про прибутки — це та частина, якої немає в рекламному проспекті.
«99% точності», без уточнення, що було виміряно, з яким еталоном, на якій вибірці, яким суддею — не несе жодного змісту. Якість перекладу не має універсального скаляра. Вона має розподіл, який залежить від мовної пари, предметної області, якості аудіо (для голосу), бюджету затримки та того, що означає «достатньо добре» для конкретного випадку використання.
Що насправді потрібно знати покупцю
Питання, які виникають під час реальних перевірок DPA та оцінок закупівель:
- Якість для кожної пари — як це працює на DE↔EN, EN↔AR, JA↔KO, зокрема?
- Розмір вибірки — на якій кількості запусків базується ваше заявлене число? Десять? Десять тисяч?
- Методологія — хто оцінює переклади, з яким еталоном, за якими критеріями?
- Розподіл, а не середнє — як виглядає найгірших 10%? Найкращі 10%? Медіана?
- Дрейф у часі — чи стала конкретна пара кращою чи гіршою з моменту вашої останньої публікації цифр?
- Що ви не вимірюєте — що саме ваш бенчмарк явно не враховує?
Жодне з них не є таким, на яке неможливо відповісти. Їх просто немає на жодній маркетинговій сторінці.
Що ми публікуємо
/benchmark — це наша відповідь. Методологія знаходиться за адресою /benchmark/methodology — написана до того, як ми дізналися, що ви будете це читати.
Три речі відрізняють її від стандартів категорії.
1. Реальний трафік, а не кураторський набір
Кожна оцінка у відкритому бенчмарку походить від реального тестового запуску /demo. Ми не відбираємо заздалегідь пари, які працюють добре. Той самий конвеєр, який обслуговує демо покупця, є тим, що вимірюється.
2. Ім'я судді зазначене
Основний: google/gemini-3.5-flash. Запасний: anthropic/claude-sonnet-5. Обидва через Vercel AI Gateway. Суддя є частиною методології — розкритий на ім'я. Коли ми змінюємо суддю (а ми це робили, коли моделі знімали з експлуатації), історичні рядки містять суддю, який насправді їх оцінив; старі оцінки ніколи тихо не переоцінюються.
3. Розподіл — це дані, а не середнє
Кожен опублікований рядок показує медіану, p10, p90, min, max та розмір вибірки — а не одне число. Одне число для мовної пари — це шум. Форма розподілу — це сигнал.
Практики, яких категорія ще не перейняла
- Пари з низькими оцінками не приховуються. Відкритий індекс обмежено умовами
≥ 10 distinct IPs, ≥ 10 runs, median ≥ 60— але будь-хто може перейти за прямим посиланням на будь-яку пару і побачити реальні цифри, включаючи пари, які цього місяця працюють погано. - Відомі проблеми задокументовані. Коли тестова обв'язка чату була зламана на кілька тижнів на початку 2026 року, цей період був вилучений з індексу та зазначений у письмовому вигляді на сторінці методології. Історія тихо не переписується.
- Що ми свідомо НЕ стверджуємо — це окремий розділ на сторінці методології. Ми кажемо, де саме LLM-суддя є недосконалим. Ми кажемо, що ми не вимірюємо (затримку, вартість, задоволеність користувачів, помилки на боці ASR до того, як переклад взагалі почнеться). Ми розкриваємо, що наші власні автоматизовані димні тести є частиною трафіку.
Фільтр для наступної оцінки постачальника
Якщо ви оцінюєте будь-яку багатомовну платформу для зустрічей — нашу чи чужу — методологія — це сторінка, яку варто прочитати. Самі цифри — це легка частина.
Практичний фільтр для будь-якого постачальника в цій категорії:
- Попросіть дані про якість для кожної мовної пари, щомісяця, на основі реального трафіку. Не кураторський бенчмарк. Не агреговані дані.
- Запитайте, хто їхній суддя, що вони свідомо не вимірюють і що змінилося за останні шість місяців.
- Запитайте, що відбувається, коли оцінка пари падає — чи кажуть вони комусь, чи виправляють це тихо?
Якщо постачальник має письмові відповіді на всі три питання, оцінюйте його серйозно. Якщо ні, ви купуєте маркетинг — а не якість перекладу.
Спробуйте самі
- Спробуйте живе демо — запускає виробничий конвеєр перекладу на вашому аудіо, оцінює його тим самим суддею, що оцінює відкритий бенчмарк, і показує вам результат.
- Перегляньте бенчмарк — кожна опублікована мовна пара, кожен місяць, з повним розподілом.
- Прочитайте методологію — як обчислюються цифри, що вони включають, а що ні.
Вам не доведеться брати наше слово на віру за будь-що з цього. В цьому і суть.
Джерела: ідентифікатори суддів, порогові значення та правила придушення вище перевірені на відповідність відправленому коду та опубліковані на /benchmark/methodology; судді обслуговуються через Vercel AI Gateway; маркетингові твердження, процитовані на початку, є типовими формулюваннями для категорії, а не цитатами конкретного постачальника; перевірено в серпні 2026 року.