Методология
Бенчмарк качества перевода InterMIND формируется автоматически нашим собственным набором тестов: еженедельный синтетический прогон запускает тот же конвейер перевода, который обеспечивает работу публичной страницы /demo, на фиксированном эталонном наборе, одинаково для каждой языковой пары. Он синтетический и воспроизводимый — здесь нет ничего отобранного вручную или подобранного выборочно, а в процессе оценки не участвует человек.
Как работает отдельный тест
Тестовый прогон воспроизводит эталонный аудиофайл (голосовой тест) или отправляет эталонный текст (тест чата) с исходного языка через наш конвейер перевода в реальном времени на целевой язык. Полученный перевод оценивается по шкале от 0 до 100 LLM-судьёй относительно канонического эталонного перевода.
LLM-судья: google/gemini-3.8-flash — основной, anthropic/claude-sonnet-5 — резервный (через Vercel AI Gateway). Для всех пар используются один и тот же промпт, одни и те же критерии оценки и эталонные тексты.
Как агрегируется месяц
- Каждый завершённый полный прогон бенчмарка записывается в
demo_test_runsс оценками по каждому целевому языку. Предварительные прогоны одной пары исключаются — в медианы попадают только полные многоязычные прогоны. - Для каждой комбинации (исходный язык, целевой язык, тип теста, неделя) мы оставляем последний прогон, а затем агрегируем данные по месяцам — так что один источник не может исказить медианы, повторяя пару в течение недели.
- По дедуплицированному набору мы вычисляем медиану, минимум, максимум, p10, p90, среднее и размер выборки.
- Мы сохраняем снимки отдельных оценок, чтобы после закрытия месяца числа оставались неизменными, даже когда исходные прогоны будут удалены по TTL.
Когда пара появляется в публичном индексе
Строка (пара × тип теста × месяц) попадает в публичный индекс и sitemap, если набирает минимальный размер выборки и проходит порог медианной оценки (для голоса порог ниже, поскольку распознавание речи (ASR) неизбежно вносит шум). Поскольку набор данных поступает из одного автоматизированного источника, а не от множества независимых посетителей, требование уникальности источников для этих синтетических данных смягчено — пороги по размеру выборки и качеству по-прежнему действуют.
Пары, не прошедшие пороги, остаются доступными по прямой ссылке — пороги ограничивают только то, что видят поисковые системы. Мы не скрываем низкие оценки от тех, кто запрашивает их напрямую.
Чего мы намеренно НЕ утверждаем
- Единичной оценке доверять нельзя. Даже у благополучной пары результат может колебаться на 30 пунктов от прогона к прогону, потому что и ASR, и оценка LLM подвержены шуму. Поэтому на каждой странице показано распределение, а не одно число.
- Сам LLM-судья несовершенен. В будущем мы можем заменить его или использовать двух судей; в этом случае исторические строки будут содержать идентификатор судьи.
- Бенчмарк не измеряет задержку, стоимость, доступность или удовлетворённость пользователей. Эти показатели описаны в других местах.
- Набор данных синтетический — он создан нашим собственным автоматизированным набором тестов, а не независимым сторонним трафиком. Мы прямо об этом сообщаем, а не создаём впечатление внешней панели.
Честные оценки
Когда качество в какой-то месяц для конкретной пары падает, это остаётся на виду. Когда ошибка исправлена и в следующем месяце результат растёт, улучшение видно на той же странице. Мы никогда не переписываем исторические агрегаты. Администраторы могут только скрывать отдельные месяцы из публичного индекса; изменить уже опубликованные числа они не могут.
Известные проблемы, влияющие на исторические данные
- Тестовая оснастка чата, до 2026-04-23: в автоматизированном конвейере тестирования чата были сбои по отдельным языкам. Агрегаты по чату за более ранние месяцы могут показывать более низкие оценки, чем фактическое качество перевода в те периоды. Затронутые месяцы сохранены в базе данных, но скрыты из публичного индекса; на графике тренда в момент исправления будет виден скачок.
Вопросы
Не согласны с чем-то здесь? Создайте issue или напишите нам. Мы обновим эту страницу и отметим изменение.