Говоріть власним голосом — мовою, якої ви не знаєте
Ось та частина перекладу в реальному часі, яку майже всі розуміють неправильно, і про яку майже ніхто не говорить: голос, який ви чуєте.
Ви можете мати чудове розпізнавання мовлення та чудовий переклад, але в результаті отримати зустріч, яка відчувається як читання списку машиною. Бо саме на останньому кроці — перетворенні перекладеного тексту назад на звук — більшість інструментів непомітно замінюють вас на єдиний синтетичний диктор. Вісім людей у кімнаті, один голос робота для всіх. Ви втрачаєте те, хто говорить, акценти, індивідуальність. Зрозуміло, але це не розмова.
InterMIND робить останній крок інакше. Коли ви говорите, інші учасники чують переклад голосом, який легко впізнати як ваш — що зберігає ваш тембр і вашу манеру мовлення — тепер промовляючи слова їхньою мовою. Це ще не бездоганна імітація; суть у тому, що це ви, а не типовий диктор, і це стає кращим. Це працює для кожного учасника, в обох напрямках, одночасно.
Цей пост — відсутній розділ Зсередини чотирьох конвеєрів перекладу, на яких працює InterMIND: та стаття пояснювала, як аудіо стає перекладеним аудіо. Ця — про те, чий голос лунає на виході.
Стандарт, який постачають усі, і чому він плаский
Якщо ви користувалися перекладом в реальному часі на будь-якій великій платформі для зустрічей, ви знаєте цей звук. Нейтральний, рівномірний голос читає переклад. Це той самий голос, незалежно від того, чи спікер — ваш CEO, що відкриває загальні збори, чи колега, що жартує. Технологія, що стоїть за цим — це текст у мовлення з однією фіксованою моделлю голосу, а дизайнерське припущення полягає в тому, що розбірливості достатньо.
У реальній зустрічі це не так. Половина того, що передає зустріч — це хто говорить і як. Заберіть голос, і ви перетворите обговорення на стенограму, яку просто зачитують вголос. Люди перестають реагувати одне на одного і починають чекати своєї черги.
Що натомість робить InterMIND
Переклад працює як каскадний конвеєр — три спеціалізовані етапи послідовно, замість однієї моделі, яка намагається зробити все. Перші два етапи розглянуті в пості про конвеєри; крок з голосом — це те, чому присвячений цей пост:
- ASR — розпізнавання мовлення. Ваші слова транскрибуються вашою власною мовою, у вашому браузері, під час того, як ви говорите. (Запуск локально економить подвійну передачу даних і дає найменшу можливу затримку перед тим, як переклад взагалі зможе початися.)
- MT — переклад. Стенограма групується в стабільні фрагменти речень — клаузули — щоб переклад міг розпочатися до того, як ви закінчите речення, і кожен фрагмент прогресивно перекладається мовою слухача.
- Zero-shot TTS — синтез голосу. Кожен перекладений фрагмент озвучується з використанням зразка вашого власного голосу і транслюється слухачу.
Саме цей третій етап — ASR → MT → zero-shot TTS — створює цей ефект. "Zero-shot" означає, що системі не потрібна попередньо записана реєстрація або тренувальна сесія для вашого голосу. Вона моделює ваш голос з аудіо зустрічі, в якій ви вже перебуваєте.
Розігрів: як він так швидко починає звучати як ви
У фразі "використати зразок вашого власного голосу" ховається проблема курки та яйця. На самому початку дзвінка система ще не чула вас достатньо, щоб добре змоделювати ваш голос.
InterMIND вирішує це за допомогою прогресивного розігріву:
- Приблизно протягом перших 5–10 секунд, поки вона ще збирає достатньо вашого мовлення, кожен перекладений фрагмент синтезується з використанням аудіофрагмента, що відповідає тому, що ви щойно сказали вашою мовою джерела. Озвучення прив'язане до вашого реального, безпосереднього мовлення.
- Як тільки є достатньо довгий зразок — ця позначка 5–10 секунд — система фіксується на ньому і використовує його для озвучення всього наступного.
На практиці ви не чуєте, як перемикається тумблер. Переклад звучить більше як ви, щойно розмова розгортається — не ідеальна копія вашого голосу, але явно ваша, а не машини, і покращується в міру того, як модель чує більше. Комбінація прогресивного перекладу (клаузула за клаузулою, а не речення за реченням) і прогресивного озвучення — це те, що утримує все в межах бюджету затримки, при цьому звучачи по-людськи.
Зразок голосу ніколи не зберігається
Саме про цю частину команда безпеки чи юристів запитує негайно, тому викладемо це прямо.
Зразок голосу, що використовується для синтезу, є ефемерним. Він існує лише для сесії конференції в реальному часі, для обслуговування озвучення перекладу, і він ніде не зберігається. Mind API та SDK, що живлять сесію в реальному часі, не зберігають жодних даних — усе тимчасове зникає, коли сесія конференції завершується.
Варто бути точним щодо того, чим цей зразок не є: він не є однією з функцій запису InterMIND. Запис відео та аудіо зустрічі — це окрема, навмисна дія, яку ви робите цілеспрямовано, з власними елементами керування. Зразок власного голосу не є записом — це перехідні вхідні дані для синтезатора мовлення, які ніколи не переживають дзвінок.
Це має значення вище за звичайну гігієну конфіденційності. "Говоріть власним голосом" — це саме той тип функції, яка звучить так, ніби вона має передбачати збереження голосового відбитка десь. Але ні. Чесна версія — це краща історія: ваш голос моделюється в моменті і зникає, коли ви кладете слухавку.
Чому більше ніхто цього не постачає
Справа не в тому, що клонування голосу є таємницею. Справа в тому, що робити це в реальному часі, для кожного учасника, в обох напрямках, в межах бюджету в одну секунду, для 24 мов, без зберігання чогось — це інша проблема, ніж клонування голосу офлайн для подкасту.
Великі платформи оптимізують свій переклад для охоплення субтитрами та єдиного безпечного голосу диктора — це дешевий, надійний стандарт у масштабі. Збереження власного голосу кожного спікера означає, що етап синтезу має відстежувати кожного учасника незалежно і залишатися в межах того самого бюджету затримки, під яким живе решта конвеєра. Ми створили голосовий рушій самостійно, на власній інфраструктурі, що робить цей компроміс нашим. (Більше про те, чому рушій — наш власний код: З чого складається одна зустріч InterMIND.)
Куди це рухається: lip-sync
Збереження вашого голосу — це половина більшої мети. Інша половина — це ваше обличчя.
Зараз ви чуєте іншу людину її власним голосом, але якщо ви на камері, її губи все ще рухаються під слова, які вона насправді сказала — мовою, яку ви не читаєте. Наступний крок — lip-sync: зміна таймінгу роту спікера під перекладене аудіо, щоб на вашому екрані здавалося, ніби він говорить вашою мовою.
Об'єднайте це, і вся суть цієї роботи стає чіткою. Двоє людей, які не мають спільної мови, сидять через відеодзвінок і бачать, і чують одне одного так, ніби кожен є носієм мови іншого — той самий голос, те саме обличчя, без перекладача посередині, без робота, що читає сценарій.
Щоб прояснити статус: голос працює вже сьогодні; lip-sync є у дорожній карті, але не постачається. Ми вказуємо на цю ціль, оскільки саме тому робота над голосом має значення — переклад власним голосом не є функцією, це перша половина "спілкуйтеся з ким завгодно, будь-якою мовою, будучи собою".
Де це послухати
Переклад власним голосом працює вже сьогодні для всіх 21 голосових мов — тих самих мов, що перераховані в документації. Не потрібно нічого вмикати окремо: коли переклад увімкнено на зустрічі, учасники автоматично чують одне одного власними голосами. Ми будемо чесними щодо того, де це зараз: сьогодні голос вже впізнавано ваш, і цю схожість ми активно продовжуємо наближати. Ідіть послухайте та оцініть самі.
- Спробуйте демо — запускає конвеєр голосу в реальному часі для вашого аудіо будь-якою з 24 мов.
- Перегляньте цифри якості — той самий продуктовий конвеєр, що щомісяця оцінюється за FLORES-200, з повним розподілом, що публікується для кожної мовної пари.
- Як це працює, у документації — коротка версія цього посту.
Перекладена зустріч має відчуватися так, ніби люди, які насправді в ній перебувають, говорять одне з одним. Збереження вашого голосу — це те, як до цього прийти.