Ваш власний голос
Ваш власний голос
Коли InterMIND перекладає ваше мовлення для іншого учасника, той не чує роботизованого синтетичного диктора. Він чує голос, який є безпомилково вашим — із вашим тембром та вашою манерою розмови — який тепер промовляє слова його мовою.
Це працює в обох напрямках і для кожного учасника незалежно. На зустрічі, де п'ятеро людей розмовляють п'ятьма мовами, кожна людина чує інших чотирьох своєю мовою, і кожен із цих чотирьох все одно звучить як він сам.
Як це звучить
Більшість інструментів живого перекладу замінюють мовця одним типовим синтетичним голосом. Результат зрозумілий, але плаский — ви втрачаєте те, хто саме говорить, наголоси, індивідуальність. InterMIND зберігає голос мовця, тому перекладена зустріч відчувається як розмова між людьми, які насправді в ній беруть участь, а не як черга оголошень, зачитаних машиною.
Як це працює
InterMIND використовує каскадний пайплайн, і етап роботи з голосом є останнім кроком:
- Розпізнавання мовлення — ваші слова транскрибуються вашою ж мовою, коли ви говорите.
- Сегментація — транскрипт групується в стабільні фрагменти речень (клаузи), щоб переклад міг початися ще до того, як ви завершите речення.
- Переклад — кожен фрагмент прогресивно перекладається мовою слухача.
- Синтез голосу — кожен перекладений фрагмент озвучується із використанням зразка вашого власного голосу та надсилається слухачу.
Поки зустріч ще збирає достатньо вашого мовлення для моделювання вашого голосу (приблизно перші 5–10 секунд), синтез використовує аудіофрагмент, який відповідає тому, що ви щойно сказали вашою мовою оригіналу. Коли зразок стає достатньо довгим, система перемикається на використання цього зразка для всього подальшого. На практиці ви не помічаєте перемикання — у міру того, як триває дзвінок, переклад звучить дедалі більше схоже на вас. Це не буде бездоганною імітацією вашого голосу, але це безпомилково ви, а не типовий диктор — і якість продовжуватиме покращуватися, чим більше модель слухатиме вас.
Мови
Переклад власним голосом доступний для усіх 24 голосових мов — того ж набору, що вказано у розділі Вибір мов. Нічого не потрібно вмикати окремо: коли переклад увімкнено, учасники автоматично чують вас вашим власним голосом.
Приватність
Зразок голосу, що використовується для синтезу, є ефемерним. Він існує лише протягом тривалості живої зустрічі та не зберігається ніде — Mind API та SDK, які забезпечують сеанс у реальному часі, не зберігають жодних даних після завершення сеансу конференції. Цей зразок голосу не пов’язаний із функціями запису відео та голосу InterMIND, які є окремими, явними записами, які ви навмисно ініціюєте.
У дорожній карті: Синхронізація губ
Прослуховування перекладу вашим власним голосом — це перша половина більшої мети. Наступний крок, над яким ми працюємо, — це синхронізація губ (lip-sync) — зміна таймінгу рухів рота мовця на камері, щоб вони відповідали перекладеному аудіо, тож кожен учасник виглядає так, ніби говорить мовою іншого. У поєднанні з перекладом власним голосом, метою є дзвінок, під час якого люди, які не мають спільної мови, бачать і чують одне одного так, ніби кожен розмовляє мовою іншого на рідному рівні.
Це пункт дорожньої карти, а ще не випущена функція — переклад власним голосом, описаний вище, вже доступний сьогодні.