Архитектура

Говорите своим голосом — на языке, которого вы не знаете

Большинство инструментов живого перевода заменяют вас одним роботизированным диктором. InterMIND сохраняет ваш голос: каждый участник слышит перевод голосом исходного диктора. Вот как это работает в каскаде, что даёт опциональный сохранённый образец голоса в Настройках и какие данные хранятся.

The Mind.com Team

Говорите своим голосом — на языке, которого вы не знаете

Говорите собственным голосом — на языке, которого вы не знаете

Вот аспект перевода в реальном времени, который почти все понимают неправильно и о котором почти никто не говорит: голос, который вы слышите.

У вас может быть отличное распознавание речи и отличный перевод, но в итоге вы всё равно получите встречу, которая звучит так, будто машина зачитывает список. Потому что на последнем этапе — превращении переведённого текста обратно в звук — большинство инструментов незаметно подменяют вас одним обобщённым синтетическим диктором. Восемь человек в комнате, и один голос робота для всех. Вы теряете того, кто говорит, акценты, индивидуальность. Разборчиво, но это не разговор.

InterMIND выполняет последний этап иначе. Когда вы говорите, другие участники слышат перевод голосом, который узнаваемо ваш — с вашим тембром и вашей манерой речи — теперь произносящим слова на их языке. Пока это не безупречное воспроизведение; суть в том, что это вы, а не стандартный диктор, и со временем это становится лучше. Это работает для каждого участника, в обоих направлениях и одновременно.

Этот пост — недостающая глава из Внутри четырёх конвейеров перевода, на которых работает InterMIND: та статья объясняла, как аудио становится переведённым аудио. Эта — о том, чей голос раздаётся на другом конце.


Дефолт, который поставляют все, и почему он плоский

Если вы использовали живой перевод на любой из крупных платформ для встреч, вы знаете этот звук. Нейтральный, равномерный голос зачитывает перевод. Это один и тот же голос, независимо от того, говорит ли ваш CEO, открывая общую встречу, или коллега шутит. В основе лежит технология text-to-speech с одной фиксированной моделью голоса, а проектное допущение состоит в том, что разборчивости достаточно.

В реальной встрче это не так. Половина того, что передаёт встреча, — это кто это говорит и как. Уберите голос, и вы превратили обсуждение в стенограмму, которую просто озвучивают вслух. Люди перестают реагировать друг на друга и начинают ждать своей очереди.

Что InterMIND делает вместо этого

Перевод работает как каскадный конвейер — три специализированных этапа последовательно, а не одна модель, пытающаяся сделать всё сразу. Первые два этапа описаны в посте о конвейерах; этап голоса — это тема этого поста:

  1. ASR — распознавание речи. Ваши слова транскрибируются на вашем собственном языке, по мере того как вы говорите, на нашем собственном движке — медиасервере, который ведёт звонок (Mind API, OVH France) — так что перевод может начаться до того, как предложение будет закончено.
  2. MT — перевод. Стенограмма группируется в стабильные фрагменты предложений — clause — чтобы перевод мог начаться до того, как вы закончите предложение, и каждый фрагмент переводится прогрессивно на язык слушателя.
  3. Zero-shot TTS — синтез речи. Каждый переведённый фрагмент озвучивается обратно с использованием образца вашего собственного голоса и стримится слушателю.

Именно этот третий этап — ASR → MT → zero-shot TTS — даёт эффект. "Zero-shot" означает, что системе не нужны заранее записанная регистрация или тренировочная сессия для вашего голоса. Она моделирует ваш голос из аудио встречи, в которой вы уже находитесь.

Прогрев: как голос так быстро начинает звучать как ваш

В идее "использовать образец вашего собственного голоса" кроется проблема курицы и яйца. В самом начале звонка система ещё услышала недостаточно вас, чтобы хорошо смоделировать ваш голос.

InterMIND решает это с помощью прогрессивного прогрева:

  • Примерно первые 5–10 секунд, пока система собирает достаточно вашей речи, каждый переведённый фрагмент синтезируется с использованием аудиофрагмента, который совпадает с тем, что вы только что сказали на исходном языке. Озвучка привязана к вашей реальной, непосредственной речи.
  • Как только образца становится достаточно — на отметке в 5–10 секунд — система фиксирует его и использует для озвучки всего последующего.

На практике вы не слышите щелчка переключателя. Перевод звучит всё больше как ваш голос по мере развития разговора — не идеальная копия вашего голоса, но явно ваш, а не машинный, и улучшающийся по мере того, как модель слышит больше. Сочетание прогрессивного перевода (clause за clause, а не предложение за предложением) и прогрессивной озвучки — это то, что удерживает всё в рамках бюджета задержки, продолжая звучать по-человечески.

Запишите свой голос один раз и пропустите прогрев

Описанный выше прогрев происходит по умолчанию, без каких-либо настроек. С сентября 2026 года для авторизованных пользователей доступен опциональный второй путь: сохранённый образец голоса в Settings → Your voice in translation.

Запись — это одно действие. Нажмите Record my voice, дождитесь Speak now и произнесите числа от одного до десяти в любом порядке. Каждое число подсвечивается на карточке, как только движок распознавания речи его слышит; когда все десять подсвечены, образец проверяется и сохраняется автоматически. Ничего не нужно воспроизводить или подтверждать, и никакого обратного отсчёта: карточка сохраняет тот фрагмент вашей записи, который содержит числа. Тихая комната и гарнитура дают лучший результат.

Что меняет сохранённый образец: начиная со следующей встречи синтезатор озвучивает ваш перевод с его помощью с первого фрагмента, так что собеседники слышат вас как вас с первого предложения, а не после прогрева. Под капотом это тот же синтез zero-shot с лучшей стартовой точкой; живой прогрев продолжает уточнять голос по мере развития звонка.

Запись проходит проверку перед сохранением. Это должны быть от 3 до 10 секунд чистой речи (входное окно синтезатора): слишком тихо, обрезано, в основном тишина или утопает в фоновом шуме — и карточка подскажет, что исправить, и попросит записать ещё раз. Числа были выбраны в качестве фразы по прагматичной причине: они короткие, узнаваемы в каждом из 23 языков, и движок может подтвердить, что услышал все десять, что превращает "сработала ли запись?" в наглядное "да".

Два образца голоса, два жизненных цикла

Это то, о чём команда безопасности или юристы спрашивают сразу, поэтому скажем прямо. Есть два разных образца, и они живут по-разному.

Живой образец, используемый для прогрева во время встречи, — эфемерный. Он существует только во время живой сессии конференции, в интересах озвучки перевода, и нигде не сохраняется. Mind API и SDK, обеспечивающие сессию в реальном времени, не сохраняют никаких данных; всё временное уничтожается, когда сессия конференции завершается.

Сохранённый образец из Settings хранится с вашей учётной записью для одной цели: он отправляется в движок перевода каждый раз, когда вы присоединяетесь к встрече, чтобы ваша переведённая речь могла быть озвучена с его помощью, и больше ни для чего. Он остаётся, пока вы не нажмёте Remove на карточке, что немедленно вернёт вас к стандартному прогреву, и удаляется вместе с вашей учётной записью. Гости не могут его записать; это функция для авторизованных пользователей по замыслу.

Стоит уточнить, чем не является ни один из образцов: это не одна из функций записи InterMIND. Запись видео и аудио встречи — это отдельное, намеренное действие, которое вы совершаете целенаправленно, со своими элементами управления. Образец голоса — это входной сигнал для синтезатора речи: временный в живом случае и ваш — чтобы сохранить или удалить — в сохранённом.

Почему никто другой этого не поставляет

Дело не в том, что клонирование голоса — секрет. Дело в том, что делать это вживую, для каждого участника, в обоих направлениях, в рамках бюджета в одну секунду, на 23 языках, не сохраняя ничего, о чём вы не просили — это иная задача, чем клонирование голоса офлайн для подкаста.

Крупные платформы оптимизируют свой перевод под охват субтитрами и единый безопасный голос диктора — это дешёвый, надёжный дефолт в масштабе. Сохранение собственного голоса для каждого говорящего означает, что этап синтеза должен отслеживать каждого участника независимо и укладываться в тот же бюджет задержки, под которым живёт остальная часть конвейера. Мы создали голосовой движок сами, на собственной инфраструктуре, и именно это делает этот компромисс нашим. (Подробнее о том, почему движок — наш собственный код: Из чего состоит одна встреча InterMIND.)

К чему это ведёт: lip-sync

Сохранение вашего голоса — это половина более крупной цели. Другая половина — ваше лицо.

Сейчас вы слышите другого человека его собственным голосом, но если вы на камере, его губы всё ещё движутся в соответствии со словами, которые он на самом деле произнёс — на языке, которого вы не понимаете. Следующий шаг — lip-sync: подстройка движения губ говорящего под переведённое аудио, так что на вашем экране он будет выглядеть говорящим на вашем языке.

Сложите два компонента, и вся суть этой работы становится ясной. Два человека, не имеющих общего языка, сидят на видеозвонке и видят и слышат друг друга так, будто каждый является носителем языка другого — тот же голос, то же лицо, без переводчика посередине, без робота, зачитывающего сценарий.

Чтобы прояснить статус: голос работает вживую уже сегодня; lip-sync в роадмапе, но ещё не поставляется. Мы указываем на пункт назначения, потому что именно поэтому работа над голосом имеет значение — перевод вашим собственным голосом — это не отдельная фича, это первая половина "общайтесь с кем угодно, на любом языке, оставаясь собой".

Где послушать

Перевод вашим собственным голосом доступен сегодня, на всех 23 голосовых языках — тех же языках, что указаны в документации. Ничего не нужно включать отдельно: когда перевод включён во встрече, участники автоматически слышат друг друга в собственных голосах. Будем честны о текущем состоянии: сегодня голос уже узнаваемо ваш, и мы активно работаем над тем, чтобы сходство становилось ближе. Слушайте и судите сами.

Встреча с переводом должна ощущаться так, будто люди, которые в ней участвуют, разговаривают друг с другом. Сохранение вашего голоса — путь к этому.

Получайте новые публикации и обновления продукта по email

Одно письмо в месяц с новыми публикациями и обновлениями продукта. Отписаться можно в любой момент.


Мы завершили аудит GDPR. Вот что мы на самом деле закрыли.

Значок «соответствует GDPR» от поставщика ничего не стоит без проделанной работы. Мы провели полный аудит собственной кодовой базы на соответствие обязательствам GDPR, которые ложатся на обработчика данных — удаление данных, хранение, субобработчики, среда выполнения в ЕС — и вот каждый пункт, который мы закрыли, проверенный по коду.

Живой перевод в Microsoft Teams (2026): как это работает, сколько стоит и где заканчиваются его возможности

Может ли Teams переводить в реальном времени? Да, тремя способами — субтитры с живым переводом, агент AI Interpreter и каналы с синхронным переводом человеком. Какая лицензия требуется для каждого из них (Teams Premium, Microsoft 365 Copilot), сколько это стоит на пользователя, сколько языков поддерживается, как включить функцию и какие ограничения определяют, подойдёт ли она для вашей встречи.