Архітектура

Розмовляйте власним голосом — мовою, якої ви не знаєте

Більшість інструментів для живого перекладу замінюють вас одним роботизованим диктором. InterMIND зберігає ваш голос: кожен учасник чує переклад голосом оригінального мовця. Ось як це робить каскад, що дає необовʼязковий збережений зразок голосу у Налаштуваннях, і що зберігається.

The Mind.com Team

Розмовляйте власним голосом — мовою, якої ви не знаєте

Говоріть власним голосом — мовою, якою ви не володієте

Ось та частина перекладу у реальному часі, яку майже всі трактують помилково і про яку майже ніхто не говорить: голос, який ви чуєте.

Ви можете мати чудове розпізнавання мовлення та чудовий переклад, але в результаті отримати мітинг, що нагадує читання списку машиною. Бо на останньому кроці — перетворенні перекладеного тексту назад на звук — більшість інструментів непомітно замінюють вас на один узагальнений синтетичний голос. Вісім людей у кімнаті, один голос робота для всіх. Ви втрачаєте те, хто говорить, інтонації, індивідуальність. Зрозуміло, але це не розмова.

InterMIND виконує останній крок інакше. Коли ви говорите, інші учасники чують переклад голосом, який впізнається як ваш — із вашим тембром та вашою манерою мовлення — тепер промовляючи слова їхньою мовою. Це ще не бездоганна імітація, але суть у тому, що це ви, а не шаблонний диктор, і це стає кращим. Це працює для кожного учасника, в обох напрямках, одночасно.

Ця стаття — відсутній розділ Всередині чотирьох пайплайнів перекладу, на яких працює InterMIND: той матеріал пояснював, як аудіо стає перекладеним аудіо. Ця стаття — про те, чий голос звучить на іншому кінці.


Стандарт, який постачають усі, і чому він звучить плоско

Якщо ви користувалися живим перекладом на будь-якій із великих платформ для мітингів, ви знаєте цей звук. Нейтральний, рівномірний голос читає переклад. Це той самий голос, незалежно від того, чи промовляє ваш CEO, відкриваючи загальні збори, чи колега, який жартує. Технологія під капотом — це перетворення тексту на мовлення з однією фіксованою моделлю голосу, а проєктне припущення полягає в тому, що зрозумілості достатньо.

На справжньому мітингу — ні. Половина того, що комунікує мітинг, — це хто говорить і як. Якщо прибрати голос, ви перетворюєте дискусію на стенограму, яку просто озвучують вголос. Люди перестають реагувати одне на одного і починають чекати своєї черги.

Що натомість робить InterMIND

Переклад працює як каскадний пайплайн — три спеціалізовані етапи поспіль, а не одна модель, яка намагається зробити все. Перші два етапи розглядаються у постатті про пайплайни; голосовий крок — це те, про що ця стаття:

  1. ASR — розпізнавання мовлення. Ваші слова транскрибуються вашою ж мовою, коли ви говорите, на нашому власному рушії — медіасервері, що здійснює виклик (Mind API, OVH France), — тож переклад може розпочатися до завершення речення.
  2. MT — переклад. Стенограма групується у стабільні фрагменти речень — клаузи — тож переклад може розпочатися до того, як ви закінчите речення, і кожен фрагмент поступово перекладається мовою слухача.
  3. Zero-shot TTS — синтез голосу. Кожен перекладений фрагмент озвучується з використанням зразка вашого власного голосу та транслюється слухачу.

Саме цей третій етап — ASR → MT → zero-shot TTS — створює ефект. "Zero-shot" означає, що системі не потрібен попередньо записаний файл реєстрації або тренувальна сесія для вашого голосу. Вона моделює ваш голос з аудіо мітингу, на якому ви вже знаходитеся.

Розминка: як він так швидко починає звучати як ви

У "використанні зразка вашого власного голосу" ховається проблема курки та яйця. На самому початку виклику система ще не почула достатньо вашого мовлення, щоб добре змоделювати ваш голос.

InterMIND вирішує це за допомогою прогресивної розминки:

  • Приблизно перші 5–10 секунд, поки вона ще збирає достатньо вашого мовлення, кожен перекладений фрагмент синтезується з використанням аудіофрагмента, що відповідає тому, що ви щойно сказали вихідною мовою. Озвучення прив'язане до вашого реального, безпосереднього мовлення.
  • Щойно збирається достатньо довгий зразок — позначка у 5–10 секунд — система фіксує його та використовує для озвучення всього подальшого.

На практиці ви не чуєте різкого перемикання. Переклад звучить більше як ви, коли розмова розгортається — не ідеальна копія вашого голосу, але явно ваша, а не машинна, і покращується в міру того, як модель слухає більше. Поєднання прогресивного перекладу (клауза за клаузою, а не речення за реченням) та прогресивного озвучення — це те, що утримує весь процес у межах бюджету затримки, все ще звучачи по-людськи.

Запишіть свій голос один раз і пропустіть розминку

Розминка, описана вище, — це те, що відбувається за замовчуванням, без жодних налаштувань. З вересня 2026 року існує додатковий другий шлях для авторизованих користувачів: збережений зразок голосу у Налаштуваннях → Ваш голос у перекладі.

Запис — це одна дія. Натисніть Записати мій голос, дочекайтеся Говоріть зараз, і назвіть числа від одного до десяти в будь-якому порядку. Кожне число підсвічується на картці, щойно механізм розпізнавання мовлення його чує; коли підсвічені всі десять, зразок перевіряється та зберігається сам по собі. Нічого не потрібно відтворювати назад або підтверджувати, і таймера зворотного відліку немає: картка зберігає той фрагмент вашого запису, де ви називаєте числа. Тиха кімната та гарнітура дають найкращий результат.

Що змінює збережений зразок: починаючи з вашого наступного мітингу, синтезатор озвучує ваш переклад з його допомогою з першого фрагмента, тож інша сторона чує вас як ви з першого ж речення, а не після розминки. Під капотом це той самий zero-shot синтез із кращою вихідною точкою; інтерактивна розминка все одно уточнює голос у міру розвитку виклику.

Запис перевіряється перед зберіганням. Він має тривати від 3 до 10 секунд чіткого мовлення (вхідне вікно синтезатора): якщо занадто тихо, обрізано, переважно тиша або заглушено фоновим шумом, картка підкаже, що виправити, і попросить новий запис. Числа були обрані як фраза з практичної причини: вони короткі, розпізнаються в кожній із 23 мов, і рушій може підтвердити, що почув усі десять, що перетворює "чи вийшов той запис?" на явне "так".

Два зразки голосу, два життєві цикли

Це та частина, про яку команда з безпеки чи юридичний відділ запитує одразу, тож викладемо все відкрито. Існує два різні зразки, і вони живуть по-різному.

Інтерактивний зразок, що використовується для розминки під час мітингу, є ефемерним. Він існує лише для поточної сесії конференції, для озвучення перекладу, і ніде не зберігається. Mind API та SDK, які забезпечують роботу сесії у реальному часі, не зберігають жодних даних; усе тимчасове зникає, коли сесія конференції завершується.

Збережений зразок з Налаштувань зберігається з вашим обліковим записом для однієї мети: він надсилається до рушія перекладу щоразу, коли ви приєднуєтеся до мітингу, щоб ваш перекладений голос міг бути озвученим з його допомогою, і більше ні для чого. Він зберігається, поки ви не натиснете Видалити на картці, що одразу повертає вас до стандартної розминки, і він видаляється разом з вашим обліковим записом. Гостьові користувачі не можуть його записати; це функція авторизованих користувачів за задумом.

Варто уточнити, чим не є жоден із зразків: це не одна з функцій запису InterMIND. Запис відео та аудіо мітингу — це окрема, навмисна дія, яку ви робите цілеспрямовано, з власними елементами керування. Зразок голосу — це вхідні дані для синтезатора мовлення: минущий в інтерактивному випадку, ваш, щоб зберегти або видалити — у збереженому.

Чому ніхто інший цього не випускає

Справа не в тому, що клонування голосу — це секрет. Справа в тому, що робити це у реальному часі, для кожного учасника, в обох напрямках, у межах односекундного бюджету, 23 мовами, не зберігаючи нічого, про що ви не просили — це інша проблема, ніж клонування голосу офлайн для подкасту.

Великі платформи оптимізують свій переклад для охоплення субтитрами та єдиного безпечного голосу диктора — це дешевий, надійний стандарт у масштабі. Збереження власного голосу кожного мовця означає, що етап синтезу має відстежувати кожного учасника незалежно і залишатися в межах того самого бюджету затримки, під яким працює решта пайплайну. Ми створили голосовий рушій самостійно, на власній інфраструктурі, саме це робить цей компроміс нашим рішенням. (Більше про те, чому рушій написаний нашим кодом: З чого складається один мітинг InterMIND.)

Куди це рухається: lip-sync

Збереження голосу — це половина більшої мети. Інша половина — це ваше обличчя.

Зараз ви чуєте іншу людину її власним голосом, але якщо ви на камері, її губи все ще рухаються у такт словам, які вона насправді сказала, — мовою, яку ви не розумієте. Наступний крок — lip-sync: перетворення рухів губ спікера у відповідність до перекладеного аудіо, щоб на вашому екрані здавалося, ніби він говорить вашою мовою.

Об'єднайте це, і вся суть цієї роботи стає очевидною. Двоє людей, які не мають спільної мови, сидять на відеодзвонику одне навпроти одного і бачать та чують одне одного так, ніби кожен є носієм мови іншого — той самий голос, те саме обличчя, без перекладача посередині, без робота, що читає сценарій.

Щоб прояснити статус: голос вже доступний сьогодні; lip-sync перебуває у дорожній карті, але ще не випущений. Ми вказуємо на цю кінцеву ціль, бо саме через неї робота над голосом має значення — переклад власним голосом — це не окрема функція, це перша половина ідеї "спілкуйтеся з ким завгодно, будь-якою мовою, залишаючись собою".

Де це послухати

Переклад власним голосом доступний сьогодні, для всіх 23 голосових мов — тих самих мов, що перелічені в документації. Нічого не потрібно вмикати окремо: коли в мітингу увімкнено переклад, учасники автоматично чують одне одного власними голосами. Будемо чесними щодо того, як це працює зараз: сьогодні голос уже впізнається як ваш, і ми активно працюємо над тим, щоб зробити його ще точнішим. Перейдіть і оцініть самі.

Перекладений мітинг має відчуватися так, ніби люди, які насправді в ньому перебувають, говорять одне з одним. Збереження власного голосу — це те, як це стає можливим.

Отримуйте нові публікації та оновлення продукту на email

Один лист на місяць із новими публікаціями та оновленнями продукту. Скасувати підписку можна будь-коли.