Mów własnym głosem — w języku, którego nie znasz
Oto element tłumaczenia w czasie rzeczywistym, który prawie każdy robi źle i o którym prawie nikt nie mówi: głos, który słyszysz.
Możesz mieć doskonałe rozpoznawanie mowy i doskonałe tłumaczenie, a mimo to zakończyć ze spotkaniem, które brzmi jak maszyna czytająca listę. Ponieważ na ostatnim etapie — zamianie przetłumaczonego tekstu z powrotem na dźwięk — większość narzędzi po cichu zastępuje Ciebie jednym ogólnym syntetycznym lektorem. Osiem osób w pokoju, jeden głos robota dla nich wszystkich. Tracisz to, kto mówi, akcent, osobowość. Zrozumiałe, ale nie rozmowa.
InterMIND robi ten ostatni krok inaczej. Kiedy mówisz, inni uczestnicy słyszą tłumaczenie głosem, który jest wyraźnie Twój — przenosząc Twoją barwę i Twój sposób mówienia — teraz wypowiadając słowa w ich języku. To nie jest jeszcze bezbłędna imitacja; chodzi o to, że to Ty, a nie gotowy lektor, i to się poprawia. Działa to dla każdego uczestnika, w obie strony, w tym samym czasie.
Ten wpis to brakujący rozdział Inside the four translation pipelines that run InterMIND: tamten tekst wyjaśniał, jak dźwięk staje się przetłumaczonym dźwiękiem. Ten jest o tym, czyj głos wychodzi z drugiej strony.
Domyślne rozwiązanie, które oferują wszyscy, i dlaczego jest płaskie
Jeśli korzystałeś z tłumaczenia na żywo w którejkolwiek z dużych platform do spotkań, znasz ten dźwięk. Neutralny głos w równym tempie czyta tłumaczenie. To ten sam głos, niezależnie od tego, czy mówiącym jest Twój CEO otwierający spotkanie typu town hall, czy kolega żartujący sobie. Technologia pod spodem to synteza mowy z jednym stałym modelem głosu, a założeniem projektowym jest to, że zrozumiałość wystarczy.
Na prawdziwym spotkaniu nie wystarczy. Połowa tego, co przekazuje spotkanie, to kto to mówi i jak. Odbierz głos, a zamieniłeś dyskusję w transkrypcję, która akurat jest wypowiadana na głos. Ludzie przestają reagować na siebie i zaczynają czekać na swoją kolej.