Ваш собственный голос

Как InterMIND озвучивает перевод собственным голосом каждого участника, а не синтетическим диктором.

Ваш собственный голос

Когда InterMIND переводит вашу речь для другого участника, тот не слышит роботизированного диктора на основе синтеза речи из текста. Он слышит голос, узнаваемо ваш — с вашим тембром и вашей манерой речи — теперь произносящий слова на его языке.

Это работает в обоих направлениях и для каждого участника независимо. На встрече, где пять человек говорят на пяти языках, каждый слышит остальных четырёх на своём языке, и каждый из этих четырёх по-прежнему звучит как он сам.

Как это звучит

Большинство инструментов живого перевода заменяют говорящего единым обезличенным синтетическим голосом. Результат разборчив, но плоский — теряется, кто говорит, интонации, индивидуальность. InterMIND сохраняет голос говорящего, поэтому переведённая встреча ощущается как разговор между людьми, которые в ней участвуют на самом деле, а не как очередь объявлений, зачитываемых машиной.

Как это работает

InterMIND использует каскадный пайплайн, и этап голоса — финальная стадия:

  1. Распознавание речи — ваши слова транскрибируются на вашем родном языке по мере того, как вы говорите.
  2. Сегментация — транскрипт группируется в устойчивые фрагменты предложений (клаузы), чтобы перевод мог начаться до того, как вы закончите предложение.
  3. Перевод — каждый фрагмент прогрессивно переводится на язык слушателя.
  4. Синтез голоса — каждый переведённый фрагмент озвучивается с использованием образца вашего собственного голоса и отправляется слушателю.

Пока встреча ещё собирает достаточный объём вашей речи для моделирования вашего голоса (примерно первые 5–10 секунд), синтез использует аудиофрагмент, соответствующий тому, что вы только что произнесли на исходном языке. Как только образец становится достаточно длинным, переключается на использование этого образца для всего последующего. На практике переключение незаметно — перевод звучит всё больше как вы по мере продолжения встречи. Это не будет безупречным воспроизведением вашего голоса, но это узнаваемо вы, а не обезличенный диктор — и качество продолжает улучшаться по мере того, как модель слышит вас больше.

Языки

Перевод вашим голосом доступен для всех 23 голосовых языков — того же набора, что указан в разделе Выбор языков. Ничего отдельно включать не нужно: когда перевод включён, участники автоматически слышат вас в вашем собственном голосе.

Ваш сохранённый образец голоса (необязательно)

Авторизованные пользователи могут пропустить разогрев, один раз записав образец голоса в Настройки → Ваш голос в переводе: нажмите Записать мой голос, произнесите числа от одного до десяти в любом порядке, и образец сохранится сам, когда все десять подсветятся. С вашей следующей встречи ваша переведённая речь озвучивается с его помощью с первого предложения.

Карточка «Ваш голос в переводе» в настройках: числа от одного до десяти и кнопка «Записать мой голос»

Приватность

Два образца, два жизненных цикла. Живой образец, используемый для разогрева во время встречи, эфемерен: он существует только в течение живой встречи и нигде не сохраняется; Mind API и SDK, обеспечивающие сеанс в реальном времени, не сохраняют никаких данных после завершения сеанса конференции. Сохранённый образец из настроек хранится вместе с вашим аккаунтом с единственной целью — для озвучивания вашей переведённой речи — и отправляется в движок перевода каждый раз, когда вы присоединяетесь к встрече, а удаляется в момент, когда вы удаляете его или удаляете свой аккаунт. Ни один из них не является одной из функций записи видео и голоса в InterMIND — это отдельные, явные записи, которые вы запускаете намеренно.

В дорожной карте: lip-sync

Слышать перевод в собственном голосе — это первая половина более крупной цели. Следующий шаг, над которым мы работаем, — lip-sync: синхронизация движения губ говорящего на камере с переведённым аудио, так что каждый участник выглядит говорящим на языке другого. В сочетании с переводом вашим голосом цель — звонок, в котором люди без общего языка видят и слышат друг друга так, словно каждый говорит на языке другого на уровне носителя.

Это пункт дорожной карты, а пока не выпущенная функция — описанный выше перевод вашим голосом доступен уже сегодня.

Хотите полную техническую картину? Читайте Говорите собственным голосом — на языке, которого не знаете в блоге.