Говорите собственным голосом — на языке, которого вы не знаете
Вот часть перевода в реальном времени, которую почти все понимают неправильно и о которой почти никто не говорит: голос, который вы слышите.
Можно иметь отличное распознавание речи и отличный перевод — и всё равно получить встречу, которая ощущается как машина, зачитывающая список. Потому что последний шаг — превращение переведённого текста обратно в звук — это момент, когда большинство инструментов незаметно подменяют вас единым синтетическим диктором. Восемь человек в комнате — один роботизированный голос для всех. Вы теряете ощущение того, кто говорит, интонацию, индивидуальность. Разборчиво, но не разговор.
InterMIND выполняет последний шаг иначе. Когда вы говорите, другие участники слышат перевод голосом, который узнаваемо ваш — с вашим тембром и вашей манерой речи — но произносящим слова на их языке. Это ещё не безупречное сходство; суть в том, что это вы, а не стандартный диктор — и это становится лучше. Это работает для каждого участника, в обоих направлениях, одновременно.
Этот пост — недостающая глава Внутри четырёх конвейеров перевода, на которых работает InterMIND: та статья объясняла, как аудио превращается в переведённое аудио. Эта — о том, чей голос звучит на другом конце.
Стандарт, который поставляют все, и почему он плоский
Если вы использовали живой перевод в любой из крупных платформ для встреч, вы знаете этот звук. Нейтральный, равномерный голос зачитывает перевод. Это один и тот же голос, независимо от того, говорит ли ваш генеральный директор, открывая общую встречу, или коллега, отпускающий шутку. Технология под капотом — синтез речи с одной фиксированной голосовой моделью, а проектное допущение состоит в том, что разборчивости достаточно.
На реальной встрече — нет. Половина того, что передаёт встреча, — это кто говорит и как. Уберите голос — и вы превратили обсуждение в расшифровку, которую просто зачитывают вслух. Люди перестают реагировать друг на друга и начинают ждать своей очереди.
Что делает InterMIND вместо этого
Перевод работает как каскадный конвейер — три специализированных этапа подряд, а не одна модель, пытающаяся сделать всё. Первые два этапа описаны в посте о конвейерах; этап голоса — тот, о котором этот пост:
- ASR — распознавание речи. Ваши слова транскрибируются на вашем языке, в вашем браузере, по мере того как вы говорите. (Локальное выполнение экономит один цикл туда-обратно и даёт минимально возможную задержку до того, как перевод сможет начаться.)
- MT — перевод. Расшифровка группируется в стабильные фрагменты предложений — клаузы — так что перевод может начаться до того, как вы закончите предложение, и каждый фрагмент переводится прогрессивно на язык слушателя.
- Zero-shot TTS — синтез голоса. Каждый переведённый фрагмент озвучивается с использованием образца вашего собственного голоса и передаётся в поток слушателю.
Именно третий этап — ASR → MT → zero-shot TTS — создаёт этот эффект. «Zero-shot» означает, что системе не нужны предварительно записанная регистрация или обучающая сессия для вашего голоса. Она моделирует ваш голос из аудио встречи, в которой вы уже находитесь.
Прогрев: как система начинает звучать как вы так быстро
В идее «использовать образец вашего собственного голоса» скрыта проблема курицы и яйца. В самом начале звонка система ещё недостаточно услышала вас, чтобы хорошо смоделировать ваш голос.
InterMIND решает это с помощью прогрессивного прогрева:
- Примерно первые 5–10 секунд, пока система собирает достаточно вашей речи, каждый переведённый фрагмент синтезируется с использованием аудиофрагмента, соответствующего тому, что вы только что сказали на исходном языке. Озвучка привязана к вашей реальной, текущей речи.
- Как только накапливается достаточно длинный образец — на отметке 5–10 секунд — система фиксирует его и использует для озвучки всего последующего.
На практике вы не слышите переключения. По мере развития разговора перевод звучит всё больше как вы — не идеальная копия вашего голоса, но явно ваш, а не машинный, и улучшается по мере того, как модель слышит больше. Сочетание прогрессивного перевода (клауза за клаузой, а не предложение за предложением) и прогрессивного озвучивания — это то, что удерживает всё в рамках бюджета задержки, продолжая звучать по-человечески.
Образец голоса нигде не хранится
Именно об этом команда безопасности или юристы спрашивают сразу же, поэтому скажем прямо.
Образец голоса, используемый для синтеза, — эфемерный. Он существует только для текущей сессии конференции, в целях озвучивания перевода, и нигде не хранится. Mind API и SDK, обеспечивающие сессию в реальном времени, не сохраняют никаких данных — всё временное уничтожается, когда сессия конференции завершается.
Стоит уточнить, чем этот образец не является: он не относится к функциям записи InterMIND. Запись видео и аудио встречи — это отдельное, намеренное действие, которое вы выполняете сознательно, со своими элементами управления. Образец собственного голоса — это не запись; это временный вход для синтезатора речи, который не переживает звонок.
Это важно не только с точки зрения гигиены приватности. «Говорите собственным голосом» — это именно та функция, которая звучит так, будто она должна включать хранение голосового отпечатка где-то. Это не так. Честная версия — лучшая история: ваш голос моделируется в моменте и исчезает, когда вы кладёте трубку.
Почему никто другой это не предлагает
Дело не в том, что клонирование голоса — секрет. Дело в том, что делать это вживую, для каждого участника, в обоих направлениях, в рамках односекундного бюджета, на 24 языках, без хранения чего-либо — это совсем другая задача, чем клонирование голоса офлайн для подкаста.
Крупные платформы оптимизируют свой перевод под покрытие субтитрами и единый безопасный голос диктора — это дешёвый, надёжный стандарт при масштабировании. Сохранение собственного голоса каждого говорящего означает, что этап синтеза должен отслеживать каждого участника независимо и оставаться в рамках того же бюджета задержки, под которым работает остальной конвейер. Мы создали голосовой движок сами, на собственной инфраструктуре — и именно это делает этот компромисс нашим решением. (Подробнее о том, почему движок — наш собственный код: Из чего состоит одна встреча InterMIND.)
Куда это движется: lip-sync
Сохранение вашего голоса — половина более крупной цели. Другая половина — ваше лицо.
Сейчас вы слышите другого человека его собственным голосом, но если вы на камере, его губы всё ещё движутся в соответствии со словами, которые он фактически сказал — на языке, которого вы не знаете. Следующий шаг — lip-sync: перераспределение времени движений рта говорящего под переведённое аудио, так что на вашем экране кажется, будто они говорят на вашем языке.
Соедините оба — и весь смысл этой работы проявляется отчётливо. Два человека, не имеющих общего языка, сидят друг напротив друга на видеозвонке и видят и слышат друг друга так, будто каждый — носитель языка собеседника: тот же голос, то же лицо, без переводчика посередине, без робота, зачитывающего текст по сценарию.
Чтобы прояснить статус: голос доступен сегодня; lip-sync в дорожной карте, ещё не реализован. Мы указываем на конечную цель, потому что именно поэтому работа над голосом важна — перевод собственным голосом — это не конечная функция, а первая половина «говорите с кем угодно, на любом языке, оставаясь собой».
Где это послушать
Перевод собственным голосом доступен сегодня для всех 21 голосового языка — тех же языков, что указаны в документации. Не нужно ничего включать отдельно: когда перевод включён во встрече, участники автоматически слышат друг друга собственными голосами. Будем честны о том, где это сейчас: сегодня голос уже узнаваемо ваш, и сходство — то, что мы активно улучшаем. Послушайте и оцените сами.
- Попробуйте демо — запускает живой голосовой конвейер с вашим аудио на любом из 24 языков.
- Посмотрите показатели качества — тот же продакшен-конвейер, оцениваемый ежемесячно по FLORES-200, с полным распределением, публикуемым по каждой языковой паре.
- Как это работает, в документации — краткая версия этого поста.
Переведённая встреча должна ощущаться так, будто люди, которые реально в ней участвуют, говорят друг с другом. Сохранение вашего голоса — это то, как к этому приходят.