Twój własny głos

Jak InterMIND wypowiada tłumaczenie głosem każdego z uczestników, zamiast syntetycznego lektora.

Twój własny głos

Kiedy InterMIND tłumaczy twoją mowę dla innego uczestnika, nie słyszy on zrobotyzowanego syntetycznego lektora. Słyszy głos, który jest wyraźnie twój — zachowujący twoją barwę i twój sposób mówienia — teraz wypowiadający słowa w jego języku.

Działa to w obu kierunkach i dla każdego uczestnika niezależnie. Na spotkaniu, na którym pięć osób mówi w pięciu językach, każda osoba słyszy pozostałe cztery w swoim własnym języku, a każda z tych czterech osób wciąż brzmi jak ona sama.

Jak to brzmi

Większość narzędzi do tłumaczenia na żywo zastępuje mówcę jednym ogólnym syntetycznym głosem. Rezultat jest zrozumiały, ale płaski — tracisz informację o tym, kto mówi, akcenty i osobowość. InterMIND zachowuje głos mówcy, więc przetłumaczone spotkanie przypomina rozmowę między osobami, które faktycznie w niej uczestniczą, a nie kolejkę ogłoszeń czytanych przez maszynę.

Jak to działa

InterMIND wykorzystuje kaskadowy potok przetwarzania, a etap głosowy jest ostatnim etapem:

  1. Rozpoznawanie mowy — twoje słowa są transkrybowane w twoim własnym języku, w miarę jak mówisz.
  2. Segmentacja — transkrypt jest grupowany w stabilne fragmenty zdań (części złożone) tak, aby tłumaczenie mogło rozpocząć się, zanim skończysz zdanie.
  3. Tłumaczenie — każdy fragment jest progresywnie tłumaczony na język słuchacza.
  4. Synteza mowy — każdy przetłumaczony fragment jest wypowiadany przy użyciu próbki twojego własnego głosu i wysyłany do słuchacza.

Póki na spotkaniu zbierana jest wystarczająca ilość twojej mowy do zamodelowania twojego głosu (w przybliżeniu pierwsze 5–10 sekund), synteza wykorzystuje fragment audio, który odpowiada temu, co właśnie powiedziałeś w swoim języku źródłowym. Gdy próbka jest wystarczająco długa, system przełącza się na jej użycie do wszystkiego, co następuje później. W praktyce nie zauważasz przełączenia — w miarę trwania połączenia tłumaczenie brzmi coraz bardziej jak ty. Nie będzie to bezbłędne naśladownictwo twojego głosu, ale rozpoznawalnie brzmi jak ty, a nie jak ogólny lektor — i stale się poprawia, w miarę jak model słyszy cię coraz więcej.

Języki

Tłumaczenie twoim własnym głosem jest dostępne we wszystkich 24 językach głosowych — tym samym zestawie, który wymieniono w sekcji Wybór języków. Nie trzeba niczego włączać osobno: gdy tłumaczenie jest włączone, uczestnicy automatycznie słyszą cię w twoim własnym głosie.

Prywatność

Próbka głosu użyta do syntezy jest efemeryczna. Istnieje tylko przez czas trwania spotkania na żywo i nie jest nigdzie przechowywana — interfejs Mind API i zestaw SDK, które obsługują sesję w czasie rzeczywistym, nie przechowują żadnych danych po zakończeniu sesji konferencyjnej. Ta próbka głosu nie jest powiązana z funkcjami nagrywania wideo i głosu w InterMIND, które są osobnymi, wyraźnymi nagraniami, które celowo uruchamiasz.

Na mapie drogowej: Lip-Sync

Słyszenie tłumaczenia twoim własnym głosem to pierwsza połowa większego celu. Następny krok, nad którym pracujemy, to lip-sync — dopasowanie w czasie ruchu ust mówiącego na kamerze do przetłumaczonego dźwięku, tak aby każdy uczestnik wyglądał na mówiącego w języku drugiej osoby. W połączeniu z tłumaczeniem własnym głosem, celem jest połączenie, w którym osoby, które nie mają wspólnego języka, widzą się i słyszą nawzajem, tak, jakby każda z nich posługiwała się językiem drugiej osoby jak ojczystym.

Jest to element na mapie drogowej, a nie jeszcze wdrożona funkcja — opisane powyżej tłumaczenie własnym głosem jest już dziś dostępne na żywo.

Chcesz poznać pełen obraz techniczny? Zobacz Mów własnym głosem — w języku, którego nie znasz na blogu.