Методология

Почему маркетинг качества перевода сломан — и что мы публикуем вместо этого

Каждый поставщик услуг перевода публикует количество языков. Никто не публикует проверяемое качество перевода по парам языков на реальном трафике. Почему этот пробел важен для вашей следующей оценки при закупке — и что мы публикуем вместо этого.

The Mind.com Team

Почему маркетинг качества перевода сломан — и что мы публикуем вместо этого

Почему маркетинг качества перевода сломан — и что мы публикуем вместо этого

Откройте сайт любого поставщика услуг живого перевода. Вы увидите одни и те же цифры:

  • «200+ языков»
  • «6 000+ языковых пар»
  • «Первые в мире» / «Максимальная точность»
  • «99% точности»

Теперь попробуйте найти — на любой из страниц этих вендоров — что эти цифры значат для встречи, которую вы собираетесь провести. Качество по каждому языку. Воспроизводимая методология. Размер выборки. Динамика оценки во времени. Честное описание слабых сторон модели.

Вы этого не найдете. Ни в маркетинговых текстах, и редко в документации.

Таково равновесие этой категории. Оно существует по трем причинам:

  1. Большинство вендоров не владеют собственным движком перевода. Они маршрутизируют запросы через OpenAI, Google, DeepL, Microsoft или их комбинацию. Публикация данных о качестве по каждой паре означала бы бенчмаркинг чужой модели — в этом нет маркетинговой ценности.
  2. Честные данные о качестве сложно вынести на билборд. Единичная оценка зашумлена. Распределение полезнее, но его сложнее сжать. А тренд за последние шесть месяцев — еще полезнее, и сжать его еще сложнее.
  3. Закупщики пока не сопротивляются. Покупатели принимают маркетинговые цифры за чистую монету, и равновесие сохраняется.

Это равновесие не продержится. Следующий класс покупателей — фармацевтика, юриспруденция, финансы, аудит, госсектор — будет задавать более жесткие вопросы, чем «сколько у вас языков». Мы создали /benchmark, потому что считаем, что им не нужно верить вендорам на слово.


Чего не говорят маркетинговые цифры

«200+ языков» означает, что у вендора есть модель, генерирующая текст на 200 языках. Качество перевода для этих языков варьируется от готового к продакшену для основных пар (EN↔DE, EN↔ES, EN↔FR) до едва пригодного для пар с малыми ресурсами. Без разбивки по парам вы не сможете понять, на какой стороне этой границы окажется ваша встреча.

«6 000+ языковых пар» — это комбинаторика N × N на 80 исходных языках. Сказать, что вы поддерживаете 6 000 пар, — это простая часть. Сказать, что какая-то конкретная пара достаточно хороша для ревью CAPA, переговоров по контракту или звонка по финансовым результатам — это та часть, которой нет в брошюре.

«99% точности» без указания, что именно измерялось, с каким эталоном сравнивалось, на какой выборке и кем оценивалось — не несет никакой информации. Качество перевода не сводится к универсальному скаляру. Оно имеет распределение, которое зависит от языковой пары, предметной области, качества звука (для голоса), бюджета по задержке и того, что означает «достаточно хорошо» для конкретного сценария использования.


Что покупателю на самом деле нужно знать

Вопросы, которые возникают при реальных проверках DPA и в ходе закупочных оценок:

  1. Качество по каждой паре — как система работает на DE↔EN, EN↔AR, JA↔KO конкретно?
  2. Размер выборки — на скольких запусках основана ваша заявленная цифра? Десять? Десять тысяч?
  3. Методология — кто оценивает переводы, с каким эталоном и по каким критериям?
  4. Распределение, а не среднее — как выглядят 10% худших случаев? 10% лучших? Медиана?
  5. Дрейф во времени — улучшилась или ухудшилась конкретная пара с момента вашей последней публикации цифр?
  6. Чего вы не измеряете — что ваш бенчмарк явно не охватывает?

Ни на один из них нет неразрешимого ответа. Их просто нет ни на одной маркетинговой странице.


Что мы публикуем

/benchmark — наш ответ. Методология находится на странице /benchmark/methodology — она была написана до того, как мы узнали, что вы будете ее читать.

Три вещи отличают его от норм категории.

1. Реальный трафик, а не отобранный набор

Каждая оценка в публичном бенчмарке берется из реального тестового запуска /demo. Мы не отбираем заранее пары, которые показывают хорошие результаты. Измеряется тот же пайплайн, который обслуживает демо покупателя.

2. Судья указан

Основной: google/gemini-3.5-flash. Резервный: anthropic/claude-sonnet-5. Оба — через Vercel AI Gateway. Судья — часть методологии, он раскрывается по имени. Когда мы меняем судью (а мы меняли, когда модели выводились из эксплуатации), исторические строки содержат того судью, который их реально оценивал; старые оценки никогда не пересчитываются втихую.

3. Распределение — это данные, а не среднее

Каждая опубликованная строка показывает медиану, p10, p90, минимум, максимум и размер выборки — а не одно число. Одно число для пары перевода — это шум. Форма распределения — это сигнал.


Практики, не принятые в категории

  • Пары с низкими оценками не скрыты. Попадание в публичный индекс ограничено условием ≥ 10 distinct IPs, ≥ 10 runs, median ≥ 60 — но любой может сделать прямую ссылку на любую пару и увидеть реальные цифры, включая те пары, которые в этом месяце показывают плохие результаты.
  • Известные проблемы документируются. Когда система тестирования чата сломалась на несколько недель в начале 2026 года, этот период был исключен из индекса и отмечен в письменной форме на странице методологии. История не переписывается втихую.
  • То, что мы сознательно НЕ заявляем, вынесено в отдельный раздел на странице методологии. Мы указываем, в чем сам LLM-судья несовершенен. Мы говорим, что мы не измеряем (задержку, стоимость, удовлетворенность пользователей, ошибки на стороне ASR до того, как перевод вообще начнется). Мы раскрываем, что наши собственные автоматические smoke-тесты являются частью трафика.

Фильтр для следующей оценки вендора

Если вы оцениваете любую платформу для многоязычных встреч — нашу или любую другую — методология — это страница, которую стоит прочитать. Сами цифры — это простая часть.

Практический фильтр для любого вендора в этой категории:

  • Просите данные о качестве по каждой языковой паре за каждый месяц на реальном трафике. Не отобранный бенчмарк. Не агрегированные данные.
  • Спрашивайте, кто их судья, что они явно не измеряют и что изменилось за последние шесть месяцев.
  • Спрашивайте, что происходит, когда оценка пары падает — они кому-то об этом сообщают или молча исправляют?

Если вендор предоставляет ответы на все три вопроса в письменном виде, оценивайте его всерьез. Если нет, вы покупаете маркетинг, а не качество перевода.


Попробуйте сами

Вам не придется верить нам на слово. В этом суть.


Источники: идентификаторы судьи, пороговые значения фильтрации и правила исключения, упомянутые выше, сверены с поставляемым кодом и опубликованы на странице /benchmark/methodology; судьи обслуживаются через Vercel AI Gateway; маркетинговые заявления, процитированные в начале, являются типичными формулировками для этой категории, а не цитатами конкретного вендора; проверено в августе 2026 года.

Получать новые публикации по email

Мы пришлём письмо, когда выйдет новая публикация. Отписаться можно в любой момент.