Architektura

Mów własnym głosem — w języku, którego nie znasz

Większość narzędzi do tłumaczeń na żywo zastępuje Cię pojedynczym, zrobotyzowanym lektorem. InterMIND zachowuje Twój głos: każdy uczestnik słyszy tłumaczenie oryginalnym głosem mówiącego. Oto, jak działa kaskada, co dodaje opcjonalna zapisana próbka głosu w Ustawieniach i co jest przechowywane.

The Mind.com Team

Mów własnym głosem — w języku, którego nie znasz

Mów własnym głosem — w języku, którego nie znasz

Oto element tłumaczenia w czasie rzeczywistym, który prawie każdy robi źle i o którym prawie nikt nie mówi: głos, który słyszysz.

Możesz mieć doskonałe rozpoznawanie mowy i doskonałe tłumaczenie, a mimo to zakończyć ze spotkaniem, które brzmi jak maszyna czytająca listę. Ponieważ na ostatnim etapie — zamianie przetłumaczonego tekstu z powrotem na dźwięk — większość narzędzi po cichu zastępuje Ciebie jednym ogólnym syntetycznym lektorem. Osiem osób w pokoju, jeden głos robota dla nich wszystkich. Tracisz to, kto mówi, akcent, osobowość. Zrozumiałe, ale nie rozmowa.

InterMIND robi ten ostatni krok inaczej. Kiedy mówisz, inni uczestnicy słyszą tłumaczenie głosem, który jest wyraźnie Twój — przenosząc Twoją barwę i Twój sposób mówienia — teraz wypowiadając słowa w ich języku. To nie jest jeszcze bezbłędna imitacja; chodzi o to, że to Ty, a nie gotowy lektor, i to się poprawia. Działa to dla każdego uczestnika, w obie strony, w tym samym czasie.

Ten wpis to brakujący rozdział Inside the four translation pipelines that run InterMIND: tamten tekst wyjaśniał, jak dźwięk staje się przetłumaczonym dźwiękiem. Ten jest o tym, czyj głos wychodzi z drugiej strony.


Domyślne rozwiązanie, które oferują wszyscy, i dlaczego jest płaskie

Jeśli korzystałeś z tłumaczenia na żywo w którejkolwiek z dużych platform do spotkań, znasz ten dźwięk. Neutralny głos w równym tempie czyta tłumaczenie. To ten sam głos, niezależnie od tego, czy mówiącym jest Twój CEO otwierający spotkanie typu town hall, czy kolega żartujący sobie. Technologia pod spodem to synteza mowy z jednym stałym modelem głosu, a założeniem projektowym jest to, że zrozumiałość wystarczy.

Na prawdziwym spotkaniu nie wystarczy. Połowa tego, co przekazuje spotkanie, to kto to mówi i jak. Odbierz głos, a zamieniłeś dyskusję w transkrypcję, która akurat jest wypowiadana na głos. Ludzie przestają reagować na siebie i zaczynają czekać na swoją kolej.

Co zamiast tego robi InterMIND

Tłumaczenie działa jako kaskadowy potok — trzy specjalistyczne etapy w sekwencji, zamiast jednego modelu próbującego zrobić wszystko. Pierwsze dwa etapy są omówione we wpisie o potokach; etap głosowy to ten, o którym jest ten post:

  1. ASR — rozpoznawanie mowy. Twoje słowa są transkrybowane w Twoim własnym języku, gdy mówisz, na naszym własnym silniku — serwerze multimedialnym, który obsługuje połączenie (Mind API, OVH France) — więc tłumaczenie może zacząć się, zanim zdanie się skończy.
  2. MT — tłumaczenie. Transkrypcja jest grupowana w stabilne fragmenty zdań — klauzule — więc tłumaczenie może zacząć się, zanim skończysz zdanie, a każdy fragment jest progresywnie tłumaczony na język słuchacza.
  3. Zero-shot TTS — synteza głosu. Każdy przetłumaczony fragment jest wypowiadany z powrotem przy użyciu próbki Twojego własnego głosu i przesyłany strumieniowo do słuchacza.

To właśnie ten trzeci etap — ASR → MT → zero-shot TTS — daje ten efekt. „Zero-shot" oznacza, że system nie potrzebuje wstępnego nagrania ani sesji treningowej Twojego głosu. Modeluje Twój głos z dźwięku spotkania, w którym już jesteś.

Rozgrzewka: jak to szybko zaczyna brzmieć jak Ty

Problem jajka i kury kryje się w „użyciu próbki Twojego własnego głosu". Na samym początku połączenia system jeszcze Cię wystarczająco nie usłyszał, aby dobrze modelować Twój głos.

InterMIND radzi sobie z tym za pomocą progresywnej rozgrzewki:

  • Przez mniej więcej pierwsze 5–10 sekund, podczas gdy nadal zbiera wystarczająco dużo Twojej mowy, każdy przetłumaczony fragment jest syntetyzowany przy użyciu fragmentu audio, który pasuje do tego, co właśnie powiedziałeś w swoim języku źródłowym. Wygenerowany głos jest zakotwiczony w Twojej prawdziwej, bieżącej mowie.
  • Gdy tylko próbka jest wystarczająco długa — ta granica 5–10 sekund — system się na niej blokuje i używa jej do zsyntetyzowania całej reszty mowy.

W praktyce nie słyszysz przełączenia. W miarę jak rozmowa nabiera tempa, tłumaczenie brzmi coraz bardziej jak Ty — nie jest to idealny sobowtór Twojego głosu, ale wyraźnie Twój, zamiast maszyny, i poprawia się, im więcej model słyszy. Kombinacja progresywnego tłumaczenia (klauzula po klauzuli, nie zdanie po zdaniu) i progresywnego nadawania głosu to to, co utrzymuje całość w ramach budżetu opóźnień, zachowując przy tym ludzkie brzmienie.

Nagraj swój głos raz i pomiń rozgrzewkę

Rozgrzewka powyżej to to, co dzieje się domyślnie, bez żadnej konfiguracji. Od września 2026 r. dla zalogowanych użytkowników dostępna jest opcjonalna druga ścieżka: zapisana próbka głosu w sekcji Ustawienia → Twój głos w tłumaczeniu.

Nagranie to jeden gest. Naciśnij Nagraj mój głos, poczekaj na Mów teraz i powiedz liczby od jeden do dziesięciu w dowolnej kolejności. Każda liczba podświetla się na karcie, gdy silnik mowy ją słyszy; gdy wszystkie dziesięć się podświetlą, próbka jest sprawdzana i zapisywana sama przez siebie. Nie ma nic do odtworzenia ani potwierdzenia ani odliczania: karta zachowuje ten fragment Twojego nagrania, który zawiera liczby. Cichy pokój i słuchawki z mikrofonem dają najlepszy rezultat.

To, co zmienia zapisana próbka: od Twojego następnego spotkania syntezator zsyntetyzuje Twoje tłumaczenie przy jej użyciu już od pierwszego fragmentu, dzięki czemu druga strona słyszy Ciebie jako Ciebie od pierwszego zdania, a nie po rozgrzewce. Pod spodem to ta sama synteza zero-shot z lepszym punktem wyjścia; rozgrzewka na żywo nadal udoskonala głos w miarę trwania połączenia.

Nagranie jest weryfikowane przed zapisaniem. Musi to być 3 do 10 sekund wyraźnej mowy (okno wejściowe syntezatora): jeśli jest zbyt ciche, ucięte, składa się głównie z ciszy lub jest zagłuszone przez szum w tle, karta informuje Cię, co poprawić i prosi o kolejne nagranie. Liczby zostały wybrane jako fraza z praktycznego powodu: są krótkie, rozpoznawalne w każdym z 23 języków, a silnik może potwierdzić, że usłyszał wszystkie dziesięć, co zamienia „czy to nagranie się udało?" w widoczne tak.

Dwie próbki głosu, dwa cykle życia

To jest ta część, o którą zespół ds. bezpieczeństwa lub prawny pyta od razu, więc oto to wyłożone jasno. Są dwie różne próbki i one istnieją inaczej.

Próbka na żywo używana do rozgrzewki w trakcie spotkania jest efemeryczna. Istnieje tylko na czas sesji konferencyjnej na żywo, w celu głosowego oddania tłumaczenia, i nigdzie nie jest przechowywana. Mind API i SDK, które napędzają sesję w czasie rzeczywistym, nie przechowują żadnych danych; wszystko tymczasowe obumiera, gdy sesja konferencyjna się kończy.

Zapisana próbka z Ustawień jest przechowywana razem z Twoim kontem, w jednym celu: jest wysyłana do silnika tłumaczeń za każdym razem, gdy dołączasz do spotkania, aby Twoja przetłumaczona mowa mogła zostać z nią zsyntetyzowana, i do niczego innego. Pozostaje tam, aż naciśniesz Usuń na karcie, co natychmiast przywraca Cię do standardowej rozgrzewki, i jest usuwana razem z Twoim kontem. Goście nie mogą jej nagrać; z założenia jest to funkcja dla zalogowanych.

Warto precyzyjnie określić, czym żadna z próbek nie jest: nie jest jedną z funkcji nagrywania InterMIND. Nagrywanie wideo i audio ze spotkania to oddzielne, celowe działanie, które wykonujesz z zamiarem, z własnymi kontrolkami. Próbka głosu to wejście do syntezatora mowy: przejściowa w przypadku na żywo, Twoja do zachowania lub usunięcia w tej zapisanej.

Dlaczego nikt inny tego nie oferuje

To nie tak, że klonowanie głosu jest tajemnicą. Chodzi o to, że zrobienie tego na żywo, dla każdego uczestnika, w obie strony, w ramach budżetu poniżej jednej sekundy, w 23 językach, bez przechowywania czegokolwiek, o co nie prosiłeś to inny problem niż sklonowanie głosu offline do podcastu.

Duże platformy optymalizują swoje tłumaczenia pod kątem pokrycia napisów i jednego bezpiecznego głosu lektora — to tani, niezawodny standard w skali. Utrzymanie własnego głosu każdego mówcy oznacza, że etap syntezy musi śledzić każdego uczestnika niezależnie i mieścić się w tym samym budżecie opóźnień, pod którym żyje reszta potoku. Zbudowaliśmy silnik głosowy sami, na własnej infrastrukturze, co sprawia, że ten kompromis to nasz wybór. (Więcej o tym, dlaczego silnik to nasz własny kod: What one InterMIND meeting is built from.)

Dokąd to zmierza: lip-sync

Zachowanie Twojego głosu to połowa większego celu. Druga połowa to Twoja twarz.

Obecnie słyszysz drugą osobę w jej własnym głosie, ale jeśli masz włączoną kamerę, jej usta nadal poruszają się do słów, które faktycznie powiedziała — w języku, którego nie rozumiesz. Następnym krokiem jest lip-sync: zmiana czasu ruchu ust mówcy do przetłumaczonego dźwięku, tak aby na Twoim ekranie sprawiali wrażenie, jakby mówili Twoim językiem.

Połączenie tych dwóch rzeczy sprawia, że cały sens tej pracy staje się jasny. Dwie osoby, które nie mają wspólnego języka, siedzą po dwóch stronach połączenia wideo i widzą oraz słyszą się tak, jakby każda z nich była native speakerem języka drugiej — ten sam głos, ta sama twarz, bez tłumacza w środku, bez robota czytającego skrypt.

Dla jasności co do statusu: głos jest dostępny na żywo już dziś; lip-sync jest w planach, ale nie jest jeszcze wdrożone. Wskazujemy to miejsce docelowe, ponieważ to dlatego praca nad głosem ma znaczenie — tłumaczenie własnym głosem nie jest tą funkcją, to pierwsza połowa „rozmawiaj z każdym, w każdym języku, jako Ty".

Gdzie tego posłuchać

Tłumaczenie własnym głosem jest dostępne na żywo już dziś, w 23 językach głosowych — tych samych, które są wymienione w dokumentacji. Nie trzeba włączać niczego osobno: gdy tłumaczenie jest włączone w spotkaniu, uczestnicy automatycznie słyszą się nawzajem w swoich własnych głosach. Będziemy szczerzy co do jego obecnego stanu: dziś głos jest już wyraźnie Twój, a podobieństwo to coś, co aktywnie udoskonalamy. Idź posłuchać i sam oceniaj.

Przetłumaczone spotkanie powinno sprawiać wrażenie, jakby ludzie, którzy realnie w nim uczestniczą, ze sobą rozmawiali. Zachowanie Twojego głosu to sposób, w jaki to osiągamy.

Otrzymuj nowe wpisy i aktualizacje produktu e-mailem

Jeden e-mail miesięcznie z nowymi postami i aktualizacjami produktu. Wypisz się w dowolnym momencie.