Mluvte vlastním hlasem – v jazyce, kterým nemluvíte

Většina nástrojů pro živý překlad vás nahradí jediným robotickým vypravěčem. InterMIND zachovává váš hlas: každý účastník slyší překlad hlasem původního mluvčího. Takto to funguje v rámci kaskády, co přidává volitelný uložený hlasový vzorek v Nastavení a co se ukládá.

The Mind.com Team

Mluvte vlastním hlasem – v jazyce, kterým nemluvíte

Mluvte vlastním hlasem – v jazyce, kterým nemluvíte

Tady je ta část překladu v reálném čase, kterou téměř všichni dělají špatně a o které téměř nikdo nemluví: hlas, který slyšíte.

Můžete mít vynikající rozpoznávání řeči i vynikající překlad a přesto skončit se schůzkou, která působí jako stroj předčítající seznam. Poslední krok, tedy převod přeloženého textu zpět na zvuk, je totiž místo, kde většina nástrojů tiše nahradí vás jedním univerzálním syntetickým vypravěčem. Osm lidí v místnosti a jeden robotický hlas pro všechny. Ztrácíte, kdo právě mluví, důraz i osobnost. Je to srozumitelné, ale není to konverzace.

InterMIND dělá poslední krok jinak. Když mluvíte, ostatní účastníci slyší překlad hlasem, který je rozpoznatelně váš – nese vaši barvu hlasu a váš způsob řeči – a říká slova v jejich jazyce. Zatím to není bezchybná imitace. Jde o to, že je to váš hlas, a ne anonymní vypravěč, a stále se zlepšuje. Funguje to pro každého účastníka, v obou směrech, současně.

Tento článek je chybějící kapitola k textu Inside the four translation pipelines that run InterMIND: tamten vysvětloval, jak se zvuk mění na přeložený zvuk. Tento je o tom, čí hlas na druhém konci zazní.


Výchozí řešení, které dodávají všichni, a proč je ploché

Pokud jste někdy použili živý překlad v některé z velkých platforem pro schůzky, znáte ten zvuk. Neutrální, rovnoměrně zpomalený hlas čte překlad. Je to stejný hlas, ať už mluví váš generální ředitel při zahájení firemního setkání, nebo kolega, který vypráví vtip. Pod povrchem je převod textu na řeč s jedním pevným hlasovým modelem a předpokladem, že srozumitelnost stačí.

Na skutečné schůzce nestačí. Polovina toho, co schůzka sděluje, je kdo to říká a jak. Odeberte hlas a z diskuse se stane přepis, který se náhodou čte nahlas. Lidé přestanou reagovat jeden na druhého a začnou jen čekat, až na ně přijde řada.

Co dělá InterMIND jinak

Překlad běží jako kaskádový řetězec: tři specializované fáze za sebou místo jednoho modelu, který se snaží dělat všechno. První dvě fáze jsou popsány v článku o pipelinech; tento článek se věnuje hlasovému kroku:

  1. ASR – rozpoznávání řeči. Vaše slova se přepisují ve vašem jazyce, jak mluvíte, na našem vlastním enginu – mediálním serveru, který hovor přenáší (Mind API, OVH Francie) – takže překlad může začít dřív, než věta skončí.
  2. MT – překlad. Přepis se seskupuje do stabilních úseků vět – klauzí – takže překlad může začít dřív, než větu dokončíte, a každý úsek se postupně překládá do jazyka posluchače.
  3. Zero-shot TTS – syntéza hlasu. Každý přeložený úsek se pronese s použitím vzorku vašeho vlastního hlasu a streamuje se posluchači.

Právě tato třetí fáze – ASR → MT → zero-shot TTS – vytváří ten efekt. „Zero-shot“ znamená, že systém nepotřebuje předem nahraný vzorek ani trénovací relaci pro váš hlas. Vytvoří model vašeho hlasu ze zvuku schůzky, ve které právě jste.

Zahřívací fáze: jak to začne znít jako vy tak rychle

V úvaze „použít vzorek vašeho vlastního hlasu“ se skrývá problém slepice a vejce. Na samém začátku hovoru systém ještě neslyšel dost vaší řeči, aby váš hlas dobře namodeloval.

InterMIND to řeší postupným zahříváním:

  • Zhruba prvních 5–10 sekund, kdy ještě sbírá dostatek vaší řeči, se každý přeložený úsek syntetizuje pomocí zvukového úseku, který odpovídá tomu, co jste právě řekli ve zdrojovém jazyce. Hlas se tak opírá o vaši skutečnou, okamžitou řeč.
  • Jakmile je vzorek dostatečně dlouhý – tedy po uplynutí oněch 5–10 sekund – systém se na něj zaměří a použije ho k vyslovení všeho dalšího.

V praxi nezaznamenáte žádné přepnutí. Překlad zní čím dál víc jako vy, jak se konverzace rozbíhá – není to dokonalý dvojník vašeho hlasu, ale je zřetelně váš, a ne strojový, a zlepšuje se, jak model slyší víc. Kombinace postupného překladu (klauzi po klauzi, ne větu po větě) a postupného vyslovování je to, co udržuje celek pod limitem latence a zároveň zní lidsky.

Nahrajte hlas jednou a zahřívání přeskočte

Výše popsané zahřívání probíhá ve výchozím nastavení, bez jakékoli přípravy. Od září 2026 existuje volitelná druhá cesta pro přihlášené uživatele: uložený hlasový vzorek v Settings → Your voice in translation.

Nahrání je jediné gesto. Stiskněte Record my voice, počkejte na Speak now a řekněte čísla od jedné do deseti v libovolném pořadí. Každé číslo se na kartě rozsvítí, jakmile ho rozpoznávač řeči uslyší; když svítí všech deset, vzorek se zkontroluje a sám uloží. Není co přehrávat ani potvrzovat a neběží žádné odpočítávání: karta si ponechá tu část vašeho záznamu, která obsahuje čísla. Nejlepší výsledek dává tichá místnost a headset.

Co uložený vzorek mění: od vaší příští schůzky syntezátor vyslovuje váš překlad tímto vzorkem už od prvního úseku, takže druhá strana slyší vás jako vás od první věty, ne až po zahřívací fázi. Pod povrchem jde o stejnou zero-shot syntézu, jen s lepším výchozím bodem; živé zahřívání hlas během hovoru dál zpřesňuje.

Záznam se před uložením kontroluje. Musí obsahovat 3 až 10 sekund zřetelné řeči (to je vstupní okno syntezátoru): pokud je příliš tichý, oříznutý, převážně ticho nebo zahlcený hlukem pozadí, karta vám řekne, co opravit, a požádá o další pokus. Čísla jsme zvolili jako frázi z praktického důvodu: jsou krátká, rozpoznatelná ve všech 23 jazycích a engine dokáže potvrdit, že slyšel všech deset, takže otázka „fungovalo to nahrávání?“ dostane viditelné ano.

Dva hlasové vzorky, dvě doby života

Na tohle se bezpečnostní nebo právní tým ptá okamžitě, takže zde je to řečeno jasně. Existují dva různé vzorky a žijí odlišně.

Živý vzorek použitý pro zahřívání během schůzky je efemérní. Existuje jen po dobu živé konferenční relace, ve službě vyslovení překladu, a není nikde uložen. Mind API a SDK, které real-time relaci pohánějí, neuchovávají žádná data; vše dočasné zaniká, když konferenční relace skončí.

Uložený vzorek z Settings je uložen u vašeho účtu, za jediným účelem: odesílá se překladovému enginu při každém připojení ke schůzce, aby váš přeložený projev mohl být jím vyslovován, a k ničemu jinému. Zůstává, dokud na kartě nestisknete Remove, čímž se okamžitě vrátíte ke standardnímu zahřívání, a je smazán spolu s vaším účtem. Hosté ho nahrát nemohou; je to funkce pro přihlášené uživatele záměrně.

Stojí za to přesně říct, čím ani jeden vzorek není: není to žádná z funkcí nahrávání v InterMIND. Nahrávání videa a zvuku schůzky je samostatná, záměrná akce, kterou provedete cíleně, s vlastními ovládacími prvky. Hlasový vzorek je vstup pro řečový syntezátor: v živém případě přechodný, v uloženém případě váš, abyste si ho ponechali nebo smazali.

Proč to nikdo jiný nenabízí

Není to tím, že by klonování hlasu bylo tajemstvím. Je to tím, že dělat ho živě, pro každého účastníka zvlášť, v obou směrech, v limitu jedné sekundy, napříč 23 jazyky a bez ukládání čehokoli, o co jste nepožádali, je jiný problém než klonovat hlas offline pro podcast.

Velké platformy optimalizují překlad na pokrytí titulky a jednoho bezpečného vypravěče – to je levné a robustní výchozí řešení ve velkém měřítku. Zachování hlasu každého mluvčího znamená, že fáze syntézy musí sledovat každého účastníka nezávisle a držet se ve stejném limitu latence, v jakém žije zbytek řetězce. Hlasový engine jsme postavili sami, na vlastní infrastruktuře, a proto je to kompromis, o kterém rozhodujeme my. (Více o tom, proč je engine náš vlastní kód: What one InterMIND meeting is built from.)

Kam to směřuje: lip-sync

Zachování vašeho hlasu je jedna polovina většího cíle. Druhá polovina je váš obličej.

Právě teď slyšíte druhou osobu jejím vlastním hlasem, ale pokud jste na kameře, její rty se stále pohybují podle slov, která skutečně řekla – v jazyce, který nečtete. Dalším krokem je lip-sync: upravit časování úst mluvčího podle přeloženého zvuku, aby na vaší obrazovce vypadal, že mluví vaším jazykem.

Spojte obojí dohromady a smysl celé této práce vyjde najevo. Dva lidé, kteří nesdílejí žádný společný jazyk, sedí naproti sobě při videohovoru a vidí i slyší jeden druhého, jako by každý byl rodilým mluvčím jazyka toho druhého – stejný hlas, stejná tvář, žádný tlumočník uprostřed, žádný robot čtoucí scénář.

Pro jasnost ohledně stavu: hlas je dnes živý; lip-sync je v plánu, není nasazen. Cíl zmiňujeme proto, že vysvětluje, proč na hlasu záleží – překlad vlastním hlasem není ta funkce sama o sobě, je to první polovina věty „mluvit s kýmkoli, v jakémkoli jazyce, jako sám sebou“.

Kde si to poslechnout

Překlad vlastním hlasem je dnes živý, napříč všemi 23 hlasovými jazyky – stejnými jazyky, které jsou uvedeny v dokumentaci. Nic dalšího není třeba zapínat: když je ve schůzce zapnutý překlad, účastníci se automaticky slyší navzájem svými vlastními hlasy. Buďme upřímní, kde to stojí: dnes je hlas už rozpoznatelně váš a podobnost je něco, co aktivně posouváme blíž. Jděte si to poslechnout a posuďte sami.

Přeložená schůzka by měla působit jako rozhovor lidí, kteří v ní skutečně jsou. Zachování vašeho hlasu je cesta, jak se k tomu dostat.

Další v tématu Živý překlad

Všechny články v tématu Živý překlad
Turecký hlasový překladač: sloveso přichází až nakonec a právě to rozhoduje, který potřebujete
Živý překlad

Turecký hlasový překladač: sloveso přichází až nakonec a právě to rozhoduje, který potřebujete

V turečtině stojí sloveso – a také zápor a čas – na konci věty. Právě tento jediný fakt odděluje tři produkty prodávané jako „hlasový překladač“: aplikace pro telefon, překladatelská sluchátka a živý překlad meetingů. Co všechno dokáže každý z nich s tureckou větou a co ne, a proč vám počet jazyků, který uvádí dodavatel, o tomto jazykovém páru nic neříká.

The Mind.com Team

Simultánní tlumočník: člověk, platforma RSI, nebo AI – co váš vícejazyčný meeting skutečně potřebuje (2026)
Živý překlad

Simultánní tlumočník: člověk, platforma RSI, nebo AI – co váš vícejazyčný meeting skutečně potřebuje (2026)

„Simultánní tlumočník“ je profese; většina lidí však ve skutečnosti hledá řeč, která dorazí v jiném jazyce přesně ve chvíli, kdy se mluví. Tento průvodce odděluje tlumočnickou kabinu, platformu RSI a AI simultánní překlad, porovnává nástroje podle jejich dokumentace – Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND – a ptá se na to, co srovnání přehlížejí: kolik z meetingu se vám skutečně vrátí ve vašem jazyce a kde se zpracovávají data.

The Mind.com Team

Simultánní překlad: kabina, RSI, nebo AI — a které nástroje pro vaše meetingy (2026)
Živý překlad

Simultánní překlad: kabina, RSI, nebo AI — a které nástroje pro vaše meetingy (2026)

„Simultánní překlad“ zahrnuje tři různé reality: tlumočníka v kabině, vzdálené simultánní tlumočení (RSI) a AI překlad v reálném čase. Tento průvodce tyto tři přístupy odlišuje, porovnává zdokumentované nástroje — Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND — a klade otázku, kterou srovnávací články přeskakují: kolik z meetingu se vám skutečně vrátí ve vašem jazyce?

The Mind.com Team

Odebírejte nové články a novinky o produktu e-mailem

Jeden e-mail měsíčně s novými články a novinkami o produktu. Odhlásit se můžete kdykoli.