Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 hlasových poznámkách: proč InterMIND provozuje převod řeči na text na vlastní cloudové bráně vaší organizace (2026)

Změřili jsme služby převodu řeči na text ze tří cloudových bran, které si organizace v InterMIND může zvolit — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) a Amazon Transcribe — na stejných 153 hlasových poznámkách v 17 jazycích, jedním testovacím nástrojem, během jednoho dne. Najdete zde slovní chybovost podle jazyků, popis metody, limity jednotlivých API a vysvětlení, proč rozpoznávač následuje bránu, a ne žebříček.

The Mind.com Team

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 hlasových poznámkách: proč InterMIND provozuje převod řeči na text na vlastní cloudové bráně vaší organizace (2026)

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 hlasových zprávách: proč InterMIND provozuje převod řeči na text na vlastní cloudové bráně vaší organizace (2026)

Hlasová zpráva v kanálu InterMIND se změní v textovou zprávu, kterou každý člen týmu čte ve svém jazyce. Prvním krokem je převod řeči na text. Odborníci z IT a compliance se nás ale neptají „jak je přesný“, nýbrž „čí je to služba a kam zvuk putuje“.

Stručná odpověď: Azure AI Speech, řečová služba výchozí AI brány, ve vlastním tenantu InterMIND v Azure ve Švédsku (Sweden Central). K tomu řečové služby dvou dalších bran, které si organizace může zvolit. Všechny jsme změřili na stejných nahrávkách, takže volba stojí na číslech, ne na preferenci. Tento příspěvek ukazuje čísla, která za volbou stojí: stejných 153 nahrávek přes Azure AI Speech, Google Cloud Speech-to-Text a Amazon Transcribe ve stejný den. Přidává dvě fakta o každém API, která mají větší váhu než procentní bod přesnosti.

Pravidlo na prvním místě: jedna brána na organizaci

Každá AI funkce v InterMIND běží na jedné bráně jazykových modelů, kterou si organizace zvolí. Jde o souhrny schůzek, shrnutí dokumentů, asistenta psaní, Ask AI i Mii na schůzce. Ve výchozím nastavení je to Azure OpenAI v EU Data Zone, volitelně Google Vertex AI na multiregionálním endpointu EU nebo Amazon Bedrock ve Frankfurtu, vždy ve vlastním tenantu InterMIND. Úvahy za tímto řešením jsme vysvětlili v článku Meeting AI na vaší vlastní cloudové bráně. Pro většinu organizací je tato brána už na seznamu schválených subzpracovatelů, takže AI funkce nepřidává do seznamu žádnou další firmu.

Převod řeči na text u hlasových zpráv se dnes řídí stejným pravidlem na výchozí bráně. Každá ze tří bran má vedle jazykových modelů i řečovou službu, a právě tu tento příspěvek měří:

BránaŘečová službaRegion použitý v tomto testuJak API přijímá nahrávku
Azure OpenAI (Microsoft)Azure AI Speech, API rychlého přepisu (fast transcription)Sweden CentralJeden požadavek pro soubor až do 5 hodin a 500 MB (dokumentace fast transcription, ověřeno v září 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, model Chirp 3multiregion euSynchronní rozpoznávání je omezeno na 60 sekund a 10 MB; delší zvuk jde přes dávkové nebo streamované rozpoznávání (limity synchronního rozpoznávání, Chirp 3, ověřeno v září 2026)
Amazon Bedrock (AWS)Amazon Transcribe, streamingeu-central-1 (Frankfurt)Streamovaná relace přes HTTP/2 nebo WebSocket; vstupem je PCM, FLAC nebo Ogg-Opus (dokumentace streamingu, ověřeno v září 2026)

Rozpoznávači vždy říkáme mateřský jazyk mluvčího, tedy jazyk, který si člen nastavil v profilu. Automatická identifikace jazyka se nám při testování na krátkých nahrávkách ukázala jako nespolehlivá: čtyřsekundová ruská zpráva se vrátila jako angličtina. Takto produkt volá Azure dnes a test volá zbylé dvě služby stejně.

Co jsme měřili

Sada. 153 nahrávek v 17 jazycích. Je to 136 replik z dialogů, tedy dvou obchodních dialogů (vyjednávání smlouvy a denní stand-up) namluvených dvěma syntetickými hlasy produktu v deseti jazycích. K tomu 17 formálních textů: obchodní věty z FLORES-200 z naší veřejné benchmarkové metodiky překladu, namluvené syntetickým hlasem, po jednom na jazyk a dlouhé 71 až 109 sekund. Repliky z dialogů trvají 3 až 30 sekund, což odpovídá délce skutečné hlasové zprávy.

Metrika. Slovní chybovost (WER) vůči referenčnímu textu, tedy podíl slov zaměněných, vložených nebo vynechaných, a to po normalizaci velikosti písmen, interpunkce a mezer. Čínština a japonština se porovnávají po znacích. Znakovou chybovost jsme zaznamenali souběžně a vypovídá o tomtéž.

Testovací skript. Jeden skript, jeden stroj, jedna hodina dne 2026-09-16, každý engine přes všech 153 nahrávek. Azure a Amazon Transcribe dostaly každou nahrávku celou. Synchronní rozpoznávač Googlu přijme nejvýše 60 sekund, proto jsme 17 formálních nahrávek rozřezali v místech ticha na kusy kratší než 55 sekund a přepisy spojili. 136 nahrávek z dialogů šlo celých. Amazon Transcribe chce zvuk v tempu reálného času, takže skript mu ho podával čtyřikrát rychleji než reálný čas. Jeho údaj o latenci níže je proto spodní mez daná podáváním, ne službou.

Co to není. Jsou to syntetické hlasy v čistém zvuku, ne terénní nahrávky z telefonu v autě. Jeden den, jeden běh na nahrávku. Je to srovnání na zvuku, na kterém testujeme vlastní překladový řetězec, v jazycích, ve kterých naši uživatelé píší. Není to žebříček.

Výsledky: slovní chybovost podle jazyka

Průměrné WER na nahrávkách každého jazyka; každý engine vrátil přepis všech 153 nahrávek.

JazykNahrávkyAzure AI SpeechGoogle Chirp 3Amazon Transcribe
Arabština1332 %46 %26 %
Čínština133 %3 %8 %
Čeština11 %2 %3 %
Nizozemština12 %2 %3 %
Angličtina212 %5 %2 %
Francouzština135 %11 %12 %
Němčina137 %9 %13 %
Hindština1310 %10 %12 %
Maďarština19 %7 %8 %
Italština11 %1 %3 %
Japonština136 %5 %5 %
Korejština19 %11 %11 %
Polština11 %1 %2 %
Portugalština (Brazílie)135 %4 %6 %
Ruština2114 %10 %14 %
Španělština136 %5 %6 %
Turečtina14 %3 %4 %
Všech 153 nahrávek1539 %10 %10 %
Pouze repliky z dialogů1369 %11 %10 %
Pouze formální texty174 %5 %5 %
Doba zpracování ÷ délka zvuku0,100,220,41 (omezeno podáváním)

Jazyky s jedinou nahrávkou (pouze formální text) jsou uvedeny pro úplnost; údaj z jedné nahrávky je datový bod, ne míra chybovosti.

Co čísla říkají

  • Na celé sadě jsou všechny tři služby od sebe méně než o bod: 9 %, 10 % a 10 %. Každá ze 153 nahrávek se od každého enginu vrátila s přepisem, takže pokrytí všech 17 jazyků je u všech tří úplné.
  • Rozdíly jsou po jazycích a jdou oběma směry. Azure měl nejnižší chybovost u francouzštiny (5 % oproti 11 % a 12 %) a němčiny (7 % oproti 9 % a 13 %). Nejnižší chybovost sdílel u angličtiny (2 %, s Amazon Transcribe) a čínštiny (3 %, s Googlem). Amazon Transcribe měl nejnižší u arabštiny (26 % oproti 32 % a 46 %). Google měl nejnižší u ruštiny (10 % oproti 14 % a 14 %), portugalštiny, maďarštiny a turečtiny.
  • Arabština je těžká pro všechny tři. Nejlepší výsledek na arabských replikách z dialogů je jedno slovo ze čtyř chybně. To odpovídá tomu, co jsme viděli u překladu, kde jsme v srpnu 2026 stáhli arabštinu z výběru jazyka schůzky, dokud kvalita nesplní naši laťku (kolik jazyků podporujeme).
  • Doba zpracování je u všech tří výrazně pod reálným časem. Třicetisekundová zpráva trvá v tomto skriptu na Azure zhruba tři sekundy a na Googlu zhruba sedm. Údaj u Amazonu je určen tempem podávání zvuku.

Proč zůstává Azure AI Speech výchozí

Tři důvody, v pořadí, v jakém rozhodly.

1. Výchozí brána je Azure. Organizace, která si bránu nezvolila, provozuje své AI funkce na Azure OpenAI v EU Data Zone, takže její hlasové zprávy přepisuje Azure AI Speech ve stejném tenantu. Žádný další subzpracovatel, žádný další region. Microsoft uvádí, že Azure Speech neukládá ani nezpracovává data mimo region zdroje Speech (stránka regionů, ověřeno v září 2026). Náš zdroj je ve Sweden Central, který je pro fast transcription uveden.

2. Tvar API odpovídá hlasové zprávě. Hlasová zpráva v InterMIND může být dlouhá až deset minut (hlasové zprávy). Rychlý přepis v Azure přijme celou nahrávku v jednom požadavku. Synchronní rozpoznávání Googlu končí na 60 sekundách, takže desetiminutová zpráva potřebuje dávkové rozpoznávání přes úložiště (bucket) nebo streamovanou relaci. Amazon Transcribe streamuje, ale přijímá PCM, FLAC nebo Ogg-Opus, nikoli formáty, ve kterých nahrávají telefony a prohlížeče, takže zvuk je nejprve nutné překódovat. Obojí jde vyřešit, náš skript to řeší, ale v cestě každé zprávy je to více pohyblivých částí.

3. Čísla proti tomu nehovoří. Při 9 % oproti 10 % a 10 % není žádný engine na této sadě natolik lepší, aby ospravedlnil přesun hlasových zpráv mimo výchozí bránu. Kdyby Google nebo Amazon dosáhly poloviční chybovosti, řekl by to tento příspěvek.

Co to znamená pro organizace na Vertex AI nebo Bedrock

Pokud si vaše organizace zvolila jako bránu Google Vertex AI nebo Amazon Bedrock, vaše AI funkce běží tam. Hlasové zprávy v těchto organizacích zatím přicházejí jako nahrávka bez přepisu: Google Cloud Speech-to-Text a Amazon Transcribe jsme změřili, jak ukazuje tento příspěvek, ale do produktu je zatím nezapojili. Oprávnění i integrační kód existují. Tento příspěvek aktualizujeme, jakmile budou v cestě každé zprávy. Do té doby je hlasová zpráva v organizaci na Vertex AI nebo Bedrock přehratelná nahrávka. Organizace, která přepne bránu na Azure, dostane přepisy u zpráv odeslaných od tohoto okamžiku.

FAQ

Jakou službu převodu řeči na text InterMIND používá?

Pro hlasové zprávy v chatu Azure AI Speech (API rychlého přepisu) ve vlastním tenantu InterMIND v Azure ve Švédsku (Sweden Central), tedy řečovou službu výchozí AI brány. Živá řeč na schůzkách jde jinou cestou: běží na vlastním mediálním enginu InterMIND, Mind API, hostovaném u OVH ve Francii, a nikdy se nedotkne cloudové řečové služby (kde běží jedna schůzka).

Je Azure AI Speech přesnější než Google Speech-to-Text nebo Amazon Transcribe?

Na naší sadě 153 nahrávek hlasových zpráv v 17 jazycích, změřené ve stejný den se stejným skriptem, měl Azure AI Speech průměrnou slovní chybovost 9 %, Google Cloud Speech-to-Text (Chirp 3) 10 % a Amazon Transcribe 10 %. Podle jazyka se pořadí mění: Azure byl nejnižší u francouzštiny, angličtiny a čínštiny, Amazon Transcribe u arabštiny, Google u ruštiny. Na jiné sadě nahrávek se pořadí může lišit; tabulka výše je důkazem pro tu naši.

Co je slovní chybovost a jak se zde počítala?

Slovní chybovost je počet zaměněných, vložených a vynechaných slov dělený počtem slov v referenčním textu. Před porovnáním normalizujeme velikost písmen, interpunkci a mezery a čínštinu s japonštinou porovnáváme po znacích, protože tato písma neoddělují slova mezerami. Hodnota 9 % znamená zhruba jedno slovo z jedenácti odlišné od reference.

Opouští zvuk hlasové zprávy EU?

Ne. Nahrávka je uložena v objektovém úložišti InterMIND v EU a řečová služba, která ji přepisuje, běží v regionu EU: Sweden Central v Azure, multiregion eu v Google Cloud, Frankfurt v AWS. Úplný seznam stran a regionů najdete na stránce subzpracovatelů a na stránce důvěry.

Proč nerozpoznávat řeč na straně klienta, v aplikaci, aby zvuk nikdy neopustil telefon?

I to jsme změřili, v září 2026. Vestavěný rozpoznávač Chrome s lokálním zpracováním rozpoznal 0 ze 17 formálních nahrávek napříč jazyky produktu a jazykové pokrytí rozpoznávačů na straně klienta je daleko užší než 17 jazyků v tabulce výše. Rozpoznávání na straně klienta je směr, který znovu měříme, jak se platformy zlepšují. Dnes je cestou, která funguje pro každého člena v každém jazyce, cesta přes bránu.

Může naše organizace zvolit, která řečová služba přepisuje její hlasové zprávy?

Ne samostatně: vybírá se AI brána, kterou administrátor organizace volí na stránce Integrace. Na výchozí bráně přepisuje hlasové zprávy Azure AI Speech. Na Vertex AI a Amazon Bedrock se hlasové zprávy zatím nepřepisují, viz sekce výše.

Jak dlouhá může být hlasová zpráva a omezuje ji API?

Až deset minut. Rychlý přepis v Azure přijímá soubory až do 5 hodin a 500 MB v jednom požadavku, takže zpráva se přepíše jedním voláním. Synchronní rozpoznávání Googlu přijímá 60 sekund a 10 MB, proto skript dlouhé nahrávky rozřezal v místech ticha na kusy.

Proč se rozpoznávači říká jazyk mluvčího místo toho, aby ho detekoval?

Protože hlasová zpráva je krátká. Na čtyřsekundové nahrávce může automatická identifikace jazyka vrátit špatný jazyk. Ruská testovací zpráva se vrátila jako angličtina, kdežto jazyk z profilu člena je správně téměř pokaždé. Rozpoznávač dostane tento jazyk a jazyky místnosti jako kandidáty dostane, až když není znám.

Přepisuje zvuk schůzky stejná služba?

Ne. Živá řeč na schůzce se rozpoznává a překládá na vlastním enginu InterMIND (Mind API) na mediálním serveru, který hovor nese a který je hostován u OVH ve Francii, viz kde běží jedna schůzka. Cloudová brána vidí text, nikdy ne zvuk hovoru (meeting AI na vaší vlastní bráně).

Budete výsledky zveřejňovat znovu?

Skript se spouští jedním příkazem a oprávnění pro každý engine jsou připravena, takže tabulku lze přeměřit, kdykoli dodavatel vydá nový model. Když to změní obraz, tento příspěvek se aktualizuje s datem.


Vyzkoušejte si to sami


Zdroje: Microsoft — Azure AI Speech fast transcription (learn.microsoft.com) a tabulka regionů Speech (learn.microsoft.com); Google Cloud — model Chirp 3 (docs.cloud.google.com), limity synchronního rozpoznávání (docs.cloud.google.com) a podporované jazyky (docs.cloud.google.com); AWS — streaming Amazon Transcribe (docs.aws.amazon.com), endpointy a kvóty (docs.aws.amazon.com) a podporované jazyky (docs.aws.amazon.com); vše ověřeno v září 2026. Měření: InterMIND speech bench, 2026-09-16, 153 nahrávek, 17 jazyků.

Další v tématu IT a správci

Všechny články v tématu IT a správci
Jak zjistit, kdo spotřebovává vaše minuty překladu a úložiště — a dostat e-mail dříve, než narazíte na limit (2026)
IT a správci

Jak zjistit, kdo spotřebovává vaše minuty překladu a úložiště — a dostat e-mail dříve, než narazíte na limit (2026)

Každý limit v InterMIND se měří podle hostitele meetingu: minuty hlasového překladu v meetingech, které jste vytvořili, slova překladu chatu pro vaše účastníky, přeložené dokumenty a sdílené úložiště týmu. Stránka Billing zobrazuje každý měřič v klouzavém 30denním okně a e-mail vám přijde, když se přiblížíte limitu úložiště nebo poprvé dosáhnete limitu minut překladu. Co každý měřič počítá, co se stane po dosažení limitu — meeting pokračuje, překlad se pozastaví — a jak se 30denní okno samo obnovuje.

The Mind.com Team

Meeting AI na vaší vlastní cloudové bráně: jak souhrny, shrnutí a asistent během meetingu zůstávají uvnitř vašeho perimetru Azure, Google nebo AWS
IT a správci

Meeting AI na vaší vlastní cloudové bráně: jak souhrny, shrnutí a asistent během meetingu zůstávají uvnitř vašeho perimetru Azure, Google nebo AWS

Každý nástroj pro meetingy dnes nabízí AI a každá funkce AI přidává dalšího subzpracovatele. Takto InterMIND provozuje své funkce AI na bráně hyperscaleru, který vaše organizace už používá — Azure OpenAI v datové zóně EU, Google Vertex AI v EU, Amazon Bedrock ve vašem vlastním účtu AWS — s vypínačem pro každou organizaci zvlášť, a co může ověřit nákup.

The Mind.com Team

Je váš meeting důvěrný?
IT a správci

Je váš meeting důvěrný?

Na meetingech říkáte věci, které byste nikdy nenapsali — a pak meeting prochází cloudy, modely a zásadami uchovávání dat, které jste nikdy nečetli. Tři konkrétní otázky, které promění slovo „důvěrné“ z marketingové fráze na úvodní stránce v něco, co si můžete ověřit, a naše odpovědi na každou z nich.

The Mind.com Team

Odebírejte nové články a novinky o produktu e-mailem

Jeden e-mail měsíčně s novými články a novinkami o produktu. Odhlásit se můžete kdykoli.