Twój własny głos

Jak InterMIND wypowiada tłumaczenie własnym głosem każdego z uczestników, zamiast syntetycznego lektora.

Twój własny głos

Gdy InterMIND tłumaczy Twoją wypowiedź dla innego uczestnika, nie słyszy on robota syntetyzującego mowę. Słyszy głos, który jest wyraźnie Twój — zachowujący Twoją barwę i sposób mówienia — wypowiadający teraz słowa w jego języku.

Działa to w obu kierunkach i dla każdego uczestnika niezależnie. Na spotkaniu, na którym pięć osób mówi w pięciu językach, każda z nich słyszy pozostałe cztery w swoim własnym języku, a każda z tych czterech osób nadal brzmi jak ona sama.

Jak to brzmi

Większość narzędzi do tłumaczeń na żywo zastępuje mówiącego jednym ogólnym, syntetycznym głosem. Rezultat jest zrozumiały, ale płaski — tracisz informację o tym, kto mówi, intonację i osobowość. InterMIND zachowuje głos mówiącego, dzięki czemu przetłumaczone spotkanie brzmi jak rozmowa między osobami, które w nim faktycznie uczestniczą, a nie jak ciąg komunikatów odczytywanych przez maszynę.

Jak to działa

InterMIND wykorzystuje kaskadowy potok, a etap głosu to ostatni krok:

  1. Rozpoznawanie mowy — Twoje słowa są transkrybowane w Twoim własnym języku w trakcie mówienia.
  2. Segmentacja — transkrypcja jest grupowana w stabilne fragmenty zdań (frazy), aby tłumaczenie mogło rozpocząć się, zanim skończysz zdanie.
  3. Tłumaczenie — każdy fragment jest stopniowo tłumaczony na język słuchacza.
  4. Synteza mowy — każdy przetłumaczony fragment jest wypowiadany z powrotem przy użyciu próbki Twojego własnego głosu i wysyłany do słuchacza.

Podczas gdy spotkanie wciąż zbiera wystarczająco dużo Twojej mowy, aby zmodelować Twój głos (przez mniej więcej pierwsze 5–10 sekund), synteza wykorzystuje fragment audio odpowiadający temu, co właśnie powiedziałeś w języku źródłowym. Gdy próbka jest już wystarczająco długa, system przestawia się na użycie tej próbki do wszystkiego, co następuje. W praktyce nie zauważasz przełączenia — w miarę trwania połączenia tłumaczenie brzmi coraz bardziej jak Ty. Nie będzie to bezbłędna imitacja Twojego głosu, ale to wyraźnie Ty, a nie ogólny lektor — i stale się poprawia, im więcej model Ciebie słyszy.

Języki

Tłumaczenie Twoim własnym głosem jest dostępne dla wszystkich 23 języków głosowych — tego samego zestawu wymienionego w sekcji Wybór języków. Nie ma nic do osobnego włączania: gdy tłumaczenie jest włączone, uczestnicy automatycznie słyszą Cię w Twoim własnym głosie.

Twoja zapisana próbka głosu (opcjonalnie)

Zalogowani użytkownicy mogą pominąć rozgrzewkę, jednorazowo nagrywając próbkę głosu w sekcji Ustawienia → Twój głos w tłumaczeniu: naciśnij Nagraj mój głos, powiedz liczby od jeden do dziesięciu w dowolnej kolejności, a próbka zapisze się sama, gdy zaświecą się wszystkie dziesięć. Od Twojego następnego spotkania Twoja przetłumaczona mowa będzie na niej oparta już od pierwszego zdania.

Karta Twój głos w tłumaczeniu w Ustawieniach: liczby od jeden do dziesięciu oraz przycisk Nagraj mój głos

Prywatność

Dwie próbki, dwa cykle życia. Próbka na żywo używana do rozgrzewki podczas spotkania jest efemeryczna: istnieje tylko przez czas trwania spotkania na żywo i nie jest nigdzie przechowywana; API i SDK Mind, które obsługują sesję w czasie rzeczywistym, nie przechowują żadnych danych po zakończeniu sesji konferencyjnej. Zapisana próbka z Ustawień jest przechowywana na Twoim koncie w jednym celu: nadawania głosu Twojej przetłumaczonej mowie. Jest wysyłana do silnika tłumaczeń za każdym razem, gdy dołączasz do spotkania, i jest usuwana w momencie, gdy ją usuniesz lub usuniesz swoje konto. Żadna z nich nie jest jedną z funkcji nagrywania wideo i głosu InterMIND, które są osobnymi, celowymi nagraniami uruchamianymi przez Ciebie.

Na planie działania: Lip-Sync

Słyszenie tłumaczenia we własnym głosie to pierwsza połowa większego celu. Następnym krokiem, nad którym pracujemy, jest lip-sync — dostosowanie ruchu warg mówiącego na kamerze w czasie, aby pasował do przetłumaczonego dźwięku, tak aby każdy uczestnik wydawał się mówić w języku drugiej osoby. W połączeniu z tłumaczeniem własnym głosem, celem jest połączenie, w którym osoby nieposiadające wspólnego języka widzą się i słyszą tak, jakby każda z nich mówiła w języku drugiej osoby tak, jakby był to jej język ojczysty.

To element na planie działania, a nie jeszcze wydana funkcja — opisane powyżej tłumaczenie własnym głosem jest już dziś dostępne.

Chcesz poznać pełen obraz techniczny? Zobacz Mów swoim własnym głosem — w języku, którego nie znasz na blogu.