Почему маркетинг качества перевода сломан — и что мы публикуем вместо этого
Откройте сайт любого поставщика услуг живого перевода. Вы увидите одни и те же цифры:
- «200+ языков»
- «6 000+ языковых пар»
- «Первые в мире» / «Максимальная точность»
- «99% точности»
Теперь попробуйте найти — на любой из страниц этих вендоров — что эти цифры значат для встречи, которую вы собираетесь провести. Качество по каждому языку. Воспроизводимая методология. Размер выборки. Динамика оценки во времени. Честное описание слабых сторон модели.
Вы этого не найдете. Ни в маркетинговых текстах, и редко в документации.
Таково равновесие этой категории. Оно существует по трем причинам:
- Большинство вендоров не владеют собственным движком перевода. Они маршрутизируют запросы через OpenAI, Google, DeepL, Microsoft или их комбинацию. Публикация данных о качестве по каждой паре означала бы бенчмаркинг чужой модели — в этом нет маркетинговой ценности.
- Честные данные о качестве сложно вынести на билборд. Единичная оценка зашумлена. Распределение полезнее, но его сложнее сжать. А
тренд за последние шесть месяцев— еще полезнее, и сжать его еще сложнее. - Закупщики пока не сопротивляются. Покупатели принимают маркетинговые цифры за чистую монету, и равновесие сохраняется.
Это равновесие не продержится. Следующий класс покупателей — фармацевтика, юриспруденция, финансы, аудит, госсектор — будет задавать более жесткие вопросы, чем «сколько у вас языков». Мы создали /benchmark, потому что считаем, что им не нужно верить вендорам на слово.
Чего не говорят маркетинговые цифры
«200+ языков» означает, что у вендора есть модель, генерирующая текст на 200 языках. Качество перевода для этих языков варьируется от готового к продакшену для основных пар (EN↔DE, EN↔ES, EN↔FR) до едва пригодного для пар с малыми ресурсами. Без разбивки по парам вы не сможете понять, на какой стороне этой границы окажется ваша встреча.
«6 000+ языковых пар» — это комбинаторика N × N на 80 исходных языках. Сказать, что вы поддерживаете 6 000 пар, — это простая часть. Сказать, что какая-то конкретная пара достаточно хороша для ревью CAPA, переговоров по контракту или звонка по финансовым результатам — это та часть, которой нет в брошюре.
«99% точности» без указания, что именно измерялось, с каким эталоном сравнивалось, на какой выборке и кем оценивалось — не несет никакой информации. Качество перевода не сводится к универсальному скаляру. Оно имеет распределение, которое зависит от языковой пары, предметной области, качества звука (для голоса), бюджета по задержке и того, что означает «достаточно хорошо» для конкретного сценария использования.