Ваш власний голос

Як InterMIND озвучує переклад власним голосом кожного учасника замість синтетичного диктора.

Ваш власний głos

Коли InterMIND перекладає ваше мовлення для іншого учасника, він не чує роботизованого синтезованого диктора. Він чує голос, який впізнавально ваш — зі збереженням вашого тембру та манери мовлення — який тепер промовляє слова його мовою.

Це працює в обох напрямках і для кожного учасника незалежно. На зустрічі, де п'ятеро людей розмовляють п'ятьма мовами, кожен чує інших чотирьох своєю мовою, і кожен із цих чотирьох звучить як він сам.

Як це звучить

Більшість інструментів живого перекладу замінюють мовця єдиним універсальним синтетичним голосом. Результат зрозумілий, але плоский — ви втрачаєте, хто говорить, акценти, індивідуальність. InterMIND зберігає голос мовця, тож перекладена зустріч відчувається як розмова між реальними людьми, а не як черга повідомлень, зачитаних машиною.

Як це працює

InterMIND використовує каскадний конвеєр, і крок голосу — завершальний етап:

  1. Розпізнавання мовлення — ваші слова транскрибуються вашою мовою, коли ви говорите.
  2. Сегментація — транскрипт групується у стабільні фрагменти речень (клаузи), щоб переклад міг розпочатися до того, як ви завершите речення.
  3. Переклад — кожен фрагмент перекладається прогресивно мовою слухача.
  4. Синтез мовлення — кожен перекладений фрагмент озвучується з використанням зразка вашого власного голосу та надсилається слухачеві.

Поки система під час зустрічі ще збирає достатньо вашого мовлення для моделювання голосу (приблизно перші 5–10 секунд), синтез використовує той звуковий фрагмент, що відповідає тому, що ви щойно сказали мовою оригіналу. Як тільки зразок стає достатньо довгим, система переходить до використання цього зразка для всього подальшого. На практиці ви не помічаєте перемикання — переклад звучить усе більше схоже на вас, чим довше триває дзвінок. Це не буде бездоганною імітацією вашого голосу, але це впізнавано ви, а не універсальний диктор — і якість продовжує покращуватися, чим більше модель вас чує.

Мови

Переклад вашим власним голосом доступний для усіх 23 голосових мов — того самого набору, що вказано на сторінці Вибір мов. Не потрібно нічого вмикати окремо: коли переклад увімкнено, учасники автоматично чують вас вашим власним голосом.

Ваш збережений зразок голосу (необов'язково)

Авторизовані користувачі можуть пропустити розминку, записавши зразок голосу один раз у Налаштування → Your voice in translation: натисніть Записати мій голос, назвіть числа від одного до десяти в будь-якому порядку, і зразок збережеться сам, коли всі десять засвітяться. Починаючи з вашої наступної зустрічі, ваше перекладене мовлення озвучується з його використанням із першого речення.

Карта Your voice in translation у Налаштуваннях: числа від одного до десяти та кнопка «Записати мій голос»

Приватність

Два зразки, два життєвих цикли. Живий зразок, що використовується для розминки під час зустрічі, є короткочасним: він існує лише впродовж поточної зустрічі й ніде не зберігається; Mind API та SDK, які забезпечують сесію у реальному часі, не зберігають жодних даних після завершення сесії конференції. Збережений зразок із Налаштувань зберігається з вашим обліковим записом з єдиною метою — озвучуванням вашого перекладеного мовлення; він надсилається до рушія перекладу щоразу, коли ви приєднуєтеся до зустрічі, та видаляється в момент, коли ви прибираєте його або видаляєте свій обліковий запис. Жоден із них не належить до функцій запису відео та голосу InterMIND — це окремі записи, які ви навмисно запускаєте.

У планах: Lip-Sync

Слухати переклад вашим власним голосом — це перша половина ширшої мети. Наступний крок, над яким ми працюємо, — це lip-sync: переналаштування рухів губ мовця на камері за часом, щоб відповідали перекладеному аудіо, тож кожен учасник виглядатиме так, ніби говорить мовою свого співрозмовника. У поєднанні з перекладом власним голосом мета — це дзвінок, де люди, які не мають спільної мови, бачать і чують одне одного так, ніби кожен говорить мовою іншого як рідною.

Це пункт у дорожній карті, а не випущена функція — переклад власним голосом, описаний вище, уже доступний сьогодні.

Хочете побачити повну технічну картину? Дивіться Говоріть власним голосом — мовою, якої ви не знаєте у блозі.