Ваш собственный голос
Ваш собственный голос
Когда InterMIND переводит вашу речь для другого участника, этот участник слышит не роботизированный синтетический диктор. Он слышит голос, который узнаваемо ваш — он сохраняет ваш тембр и вашу манеру речи — который теперь произносит слова на его языке.
Это работает в обоих направлениях и для каждого участника независимо. На встрече, где пять человек говорят на пяти языках, каждый слышит остальных четверых на своем языке, и каждый из этих четверых по-прежнему звучит как он сам.
Как это звучит
Большинство инструментов живого перевода заменяют говорящего одним общим синтетическим голосом. Результат разборчив, но плоский — вы теряете личность говорящего, интонации, индивидуальность. InterMIND сохраняет голос говорящего, поэтому переведенная встреча ощущается как разговор между людьми, которые в ней реально участвуют, а не как очередь объявлений, зачитываемых машиной.
Как это работает
InterMIND использует каскадный пайплайн, и этап голоса — последняя стадия:
- Распознавание речи — ваши слова транскрибируются на вашем языке по мере того, как вы говорите.
- Сегментация — транскрипт группируется в стабильные фрагменты предложений (клаузы), чтобы перевод мог начаться до того, как вы закончите предложение.
- Перевод — каждый фрагмент последовательно переводится на язык слушателя.
- Синтез речи — каждый переведенный фрагмент озвучивается с использованием образца вашего собственного голоса и отправляется слушателю.
Пока система собирает достаточно фрагментов вашей речи на встрече для моделирования голоса (примерно первые 5–10 секунд), для синтеза используется аудиофрагмент, соответствующий тому, что вы только что сказали на исходном языке. Как только образца становится достаточно, система переключается на его использование для всего последующего. На практике вы не замечаете переключения — перевод все больше звучит как вы по мере продолжения звонка. Это не будет безупречным воспроизведением вашего голоса, но это будете узнаваемо вы, а не безликий диктор — и качество продолжает улучшаться по мере того, как модель слышит вас больше.
Языки
Перевод вашим собственным голосом доступен для всех 24 голосовых языков — того же набора, что указан в разделе Выбор языков. Ничего не нужно включать отдельно: когда перевод включен, участники автоматически слышат вас вашим собственным голосом.
Приватность
Образец голоса, используемый для синтеза, является эфемерным. Он существует только на протяжении встречи в реальном времени и не хранится нигде — Mind API и SDK, обеспечивающие сеанс, не сохраняют никаких данных после его завершения. Этот образец голоса никак не связан с функциями записи видео и голоса InterMIND, которые представляют собой отдельные явные записи, которые вы запускаете намеренно.
В планах: Синхронизация губ
Слышать перевод вашим собственным голосом — это первая половина более крупной цели. Следующий шаг, над которым мы работаем, — это lip-sync (синхронизация губ): корректировка движения губ говорящего на камере под переведенную аудиодорожку, чтобы казалось, что каждый участник говорит на языке другого. В сочетании с переводом собственным голосом мы стремимся к тому, чтобы участники звонка, не имеющие общего языка, видели и слышали друг друга так, словно каждый говорит на языке собеседника как на родном.
Это пункт дорожной карты, а не выпущенная функция — перевод собственным голосом, описанный выше, уже доступен сегодня.