Говорите собственным голосом — на языке, которого вы не знаете
Вот аспект перевода в реальном времени, который почти все понимают неправильно и о котором почти никто не говорит: голос, который вы слышите.
У вас может быть отличное распознавание речи и отличный перевод, но в итоге вы всё равно получите встречу, которая звучит так, будто машина зачитывает список. Потому что на последнем этапе — превращении переведённого текста обратно в звук — большинство инструментов незаметно подменяют вас одним обобщённым синтетическим диктором. Восемь человек в комнате, и один голос робота для всех. Вы теряете того, кто говорит, акценты, индивидуальность. Разборчиво, но это не разговор.
InterMIND выполняет последний этап иначе. Когда вы говорите, другие участники слышат перевод голосом, который узнаваемо ваш — с вашим тембром и вашей манерой речи — теперь произносящим слова на их языке. Пока это не безупречное воспроизведение; суть в том, что это вы, а не стандартный диктор, и со временем это становится лучше. Это работает для каждого участника, в обоих направлениях и одновременно.
Этот пост — недостающая глава из Внутри четырёх конвейеров перевода, на которых работает InterMIND: та статья объясняла, как аудио становится переведённым аудио. Эта — о том, чей голос раздаётся на другом конце.
Дефолт, который поставляют все, и почему он плоский
Если вы использовали живой перевод на любой из крупных платформ для встреч, вы знаете этот звук. Нейтральный, равномерный голос зачитывает перевод. Это один и тот же голос, независимо от того, говорит ли ваш CEO, открывая общую встречу, или коллега шутит. В основе лежит технология text-to-speech с одной фиксированной моделью голоса, а проектное допущение состоит в том, что разборчивости достаточно.
В реальной встрче это не так. Половина того, что передаёт встреча, — это кто это говорит и как. Уберите голос, и вы превратили обсуждение в стенограмму, которую просто озвучивают вслух. Люди перестают реагировать друг на друга и начинают ждать своей очереди.