Внутри четырёх конвейеров перевода, на которых работает InterMIND
Старая страница /product/overview/how-it-works на mind.com устарела на несколько крупных релизов. Она описывает единый «движок перевода» так, как это делают страницы большинства вендоров — одна большая стрелка от «вы говорите» к «они слышат». Эта картина была упрощением уже два года назад. Сегодня она неверна.
На самом деле InterMIND использует четыре отдельных конвейера перевода, каждый из которых решает свою задачу с помощью собственного движка, собственного бюджета задержки и собственного диапазона качества. Они используют общий селектор языка. У них нет общего движка.
Это обновлённый ответ на вопрос «как это работает».
Сопутствующая статья: «Сколько языков вы поддерживаете?» описывает, что каждый конвейер охватывает (23 / 23 / 30 / 17). Этот пост описывает, что каждый конвейер делает — и почему он существует отдельно.
Почему «один движок для всего» — это ложь
Платформа для встреч в реальном времени должна выполнять как минимум четыре задачи одновременно, и они тянут в несовместимых направлениях:
- Голос в реальном времени — аудио на входе, переведённое аудио на выходе, меньше секунды, каждый участник на своём языке. Жёсткое ограничение — задержка.
- Текст чата в реальном времени — короткие сообщения, быстро, с сохранением правок, цитирований и HTML-структуры.
- Общие заметки в реальном времени — посимвольная совместная печать с сохранением структурной иерархии (списки, заголовки, чекбоксы), которая должна пережить перевод.
- Асинхронные файлы документов — 40-страничный PDF, брошенный в чат. Нет бюджета на задержку. Жёсткое ограничение — точность — форматирование, таблицы, номера страниц, шрифт.
Можно сделать один гигантский вызов LLM, который пытается делать всё четыре. Мы пробовали. Он плохо справляется со всеми четырьмя. Бюджет задержки для голоса означает, что модель не может размышлять; бюджет точности для документов означает, что модель должна это делать. Правка в чате требует diff на языке участника; 40-страничному PDF нужно сохранение формата, которое ни одна модель с потоковой передачей токенов вам не даст.
Поэтому мы используем четыре. Вот каждый из них.