Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 hlasových zprávách: proč InterMIND provozuje převod řeči na text na vlastní cloudové bráně vaší organizace (2026)
Hlasová zpráva v kanálu InterMIND se změní v textovou zprávu, kterou každý člen týmu čte ve svém jazyce. Prvním krokem je převod řeči na text. Odborníci z IT a compliance se nás ale neptají „jak je přesný“, nýbrž „čí je to služba a kam zvuk putuje“.
Stručná odpověď: Azure AI Speech, řečová služba výchozí AI brány, ve vlastním tenantu InterMIND v Azure ve Švédsku (Sweden Central). K tomu řečové služby dvou dalších bran, které si organizace může zvolit. Všechny jsme změřili na stejných nahrávkách, takže volba stojí na číslech, ne na preferenci. Tento příspěvek ukazuje čísla, která za volbou stojí: stejných 153 nahrávek přes Azure AI Speech, Google Cloud Speech-to-Text a Amazon Transcribe ve stejný den. Přidává dvě fakta o každém API, která mají větší váhu než procentní bod přesnosti.
Pravidlo na prvním místě: jedna brána na organizaci
Každá AI funkce v InterMIND běží na jedné bráně jazykových modelů, kterou si organizace zvolí. Jde o souhrny schůzek, shrnutí dokumentů, asistenta psaní, Ask AI i Mii na schůzce. Ve výchozím nastavení je to Azure OpenAI v EU Data Zone, volitelně Google Vertex AI na multiregionálním endpointu EU nebo Amazon Bedrock ve Frankfurtu, vždy ve vlastním tenantu InterMIND. Úvahy za tímto řešením jsme vysvětlili v článku Meeting AI na vaší vlastní cloudové bráně. Pro většinu organizací je tato brána už na seznamu schválených subzpracovatelů, takže AI funkce nepřidává do seznamu žádnou další firmu.
Převod řeči na text u hlasových zpráv se dnes řídí stejným pravidlem na výchozí bráně. Každá ze tří bran má vedle jazykových modelů i řečovou službu, a právě tu tento příspěvek měří:
| Brána | Řečová služba | Region použitý v tomto testu | Jak API přijímá nahrávku |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, API rychlého přepisu (fast transcription) | Sweden Central | Jeden požadavek pro soubor až do 5 hodin a 500 MB (dokumentace fast transcription, ověřeno v září 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, model Chirp 3 | multiregion eu | Synchronní rozpoznávání je omezeno na 60 sekund a 10 MB; delší zvuk jde přes dávkové nebo streamované rozpoznávání (limity synchronního rozpoznávání, Chirp 3, ověřeno v září 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | Streamovaná relace přes HTTP/2 nebo WebSocket; vstupem je PCM, FLAC nebo Ogg-Opus (dokumentace streamingu, ověřeno v září 2026) |
Rozpoznávači vždy říkáme mateřský jazyk mluvčího, tedy jazyk, který si člen nastavil v profilu. Automatická identifikace jazyka se nám při testování na krátkých nahrávkách ukázala jako nespolehlivá: čtyřsekundová ruská zpráva se vrátila jako angličtina. Takto produkt volá Azure dnes a test volá zbylé dvě služby stejně.