Pohled do čtyř překladových pipeline, na kterých běží InterMIND
Stará stránka /product/overview/how-it-works na mind.com je o několik velkých verzí pozadu. Popisuje jediný „překladový engine“ tak, jak to dělá většina stránek dodavatelů: jedna velká šipka od „vy mluvíte“ k „oni slyší“. Takové zjednodušení bylo už před dvěma lety nepřesné. Dnes je prostě chybné.
Pravda je, že InterMIND provozuje čtyři samostatné překladové pipeline. Každá řeší jiný problém, používá jiný engine, má jiný rozpočet latence a jinou kvalitativní obálku. Sdílejí výběr jazyka, ale ne engine.
Tohle je aktualizovaná odpověď na otázku „jak to funguje“.
Doprovodný článek: „Kolik jazyků podporujete?“ popisuje, co každá pipeline pokrývá (23 / 23 / 30 / 17). Tento příspěvek popisuje, co každá pipeline dělá — a proč je samostatnou věcí.
Proč je „jeden engine pro všechno“ lež
Platforma pro živé schůzky musí plnit nejméně čtyři úlohy najednou a ty se táhnou nesluečitelnými směry:
- Hlas v reálném čase — zvuk na vstupu, přeložený zvuk na výstupu, do jedné sekundy, každý posluchač ve svém jazyce. Tvrdým omezením je latence.
- Chat v reálném čase — krátké zprávy, rychle, se zachovanými úpravami, citacemi a HTML strukturou.
- Sdílené poznámky v reálném čase — společné psaní znak po znaku, se strukturní hierarchií (seznamy, nadpisy, zaškrtávací políčka), která musí přežít překlad.
- Asynchronní dokumentové soubory — 40stránkové PDF vložené do chatu. Žádný rozpočet latence. Tvrdým omezením je věrnost — formátování, tabulky, čísla stránek, písmo.
Můžete postavit jedno obří volání LLM, které se pokusí zvládnout všechny čtyři. Zkoušeli jsme to. Je špatné ve všech čtyřech. Rozpočet latence pro hlas znamená, že model nemůže přemýšlet; rozpočet věrnosti pro dokumenty znamená, že přemýšlet musí. Úprava chatové zprávy potřebuje rozdíl (diff) v jazyce posluchače; 40stránkové PDF potřebuje zachování formátu, které žádný tokenově streamující model nedá.
Takže provozujeme čtyři. Tady je každá z nich.