Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 wiadomościach głosowych: dlaczego InterMIND uruchamia rozpoznawanie mowy na własnej bramie chmurowej Twojej organizacji (2026)
Wiadomość głosowa na kanale InterMIND zamienia się w wiadomość tekstową, którą każdy współpracownik czyta w swoim własnym języku. Pierwszym krokiem tego procesu jest rozpoznawanie mowy (speech-to-text), a pytanie, jakie zadają nam działy IT i zespoły ds. zgodności, nie brzmi „jak dokładne jest to rozwiązanie", lecz „czyja to usługa i dokąd trafia dźwięk".
Krótka odpowiedź: Azure AI Speech, usługa rozpoznawania mowy domyślnej bramy AI, we własnym tenancie Azure firmy InterMIND w regionie Sweden Central — oraz usługi rozpoznawania mowy dwóch pozostałych bram, które organizacja może wybrać, zmierzone na tych samych nagraniach, tak by wybór był liczbą, a nie preferencją. Ten wpis pokazuje liczby stojące za tym wyborem — te same 153 nagrania przepuszczone tego samego dnia przez Azure AI Speech, Google Cloud Speech-to-Text i Amazon Transcribe — oraz dwa fakty o każdym API, które mają większe znaczenie niż jeden punkt procentowy dokładności.
Zasada na początek: jedna brama na organizację
Każda funkcja AI w InterMIND — podsumowania spotkań, streszczenia dokumentów, asystent pisania, Ask AI oraz Mia podczas spotkania — działa na jednej bramie modelu językowego wybranej przez organizację: domyślnie Azure OpenAI w strefie EU Data Zone, a do wyboru także Google Vertex AI na punkcie końcowym multi-region UE lub Amazon Bedrock we Frankfurcie — każda z nich we własnym tenancie InterMIND. Uzasadnienie takiego podejścia wyjaśniliśmy we wpisie AI spotkań na własnej bramie chmurowej: dla większości organizacji ta brama znajduje się już na zatwierdzonej liście subprocesorów, więc funkcja AI nie dodaje do niej żadnej nowej firmy.
Rozpoznawanie mowy dla wiadomości głosowych stosuje się dziś do tej samej zasady na domyślnej bramie, a każda z trzech bram ma usługę rozpoznawania mowy obok swoich modeli językowych — i to właśnie mierzy ten wpis:
| Brama | Usługa rozpoznawania mowy | Region użyty w tym teście | Jak API przyjmuje nagranie |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | Sweden Central | Jedno żądanie dla pliku o długości do 5 godzin i rozmiarze do 500 MB (dokumentacja fast transcription, sprawdzono we wrześniu 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, model Chirp 3 | multi-region eu | Rozpoznawanie synchroniczne jest ograniczone do 60 sekund i 10 MB; dłuższe nagrania przechodzą przez rozpoznawanie wsadowe (batch) lub strumieniowe (limity synchroniczne, Chirp 3, sprawdzono we wrześniu 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | Sesja strumieniowa przez HTTP/2 lub WebSocket; dane wejściowe w formacie PCM, FLAC lub Ogg-Opus (dokumentacja streamingu, sprawdzono we wrześniu 2026) |
W każdym przypadku rozpoznawaniu podaje się język mówiącego — język ustawiony przez użytkownika w profilu — ponieważ automatyczna identyfikacja języka okazała się w naszych testach zawodna na krótkich nagraniach: czterosekundowa notatka po rosyjsku została rozpoznana jako angielska. Tak dziś produkt wywołuje Azure, a test wywołuje pozostałe dwie usługi w ten sam sposób.