Architektura

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 notatkach głosowych: dlaczego InterMIND uruchamia rozpoznawanie mowy w bramce chmurowej Twojej organizacji (2026)

Zmierzyliśmy usługi rozpoznawania mowy trzech bramek chmurowych, które organizacja InterMIND może wybrać — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) i Amazon Transcribe — na tych samych 153 klipach z notatkami głosowymi w 17 językach, przy użyciu jednego narzędzia, w jeden dzień. Współczynniki błędów słownych dla poszczególnych języków, metodologia, ograniczenia każdego API oraz powody, dla których rozpoznawanie podąża za bramką, a nie za rankingiem.

The Mind.com Team

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 notatkach głosowych: dlaczego InterMIND uruchamia rozpoznawanie mowy w bramce chmurowej Twojej organizacji (2026)

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 wiadomościach głosowych: dlaczego InterMIND uruchamia rozpoznawanie mowy na własnej bramie chmurowej Twojej organizacji (2026)

Wiadomość głosowa na kanale InterMIND zamienia się w wiadomość tekstową, którą każdy współpracownik czyta w swoim własnym języku. Pierwszym krokiem tego procesu jest rozpoznawanie mowy (speech-to-text), a pytanie, jakie zadają nam działy IT i zespoły ds. zgodności, nie brzmi „jak dokładne jest to rozwiązanie", lecz „czyja to usługa i dokąd trafia dźwięk".

Krótka odpowiedź: Azure AI Speech, usługa rozpoznawania mowy domyślnej bramy AI, we własnym tenancie Azure firmy InterMIND w regionie Sweden Central — oraz usługi rozpoznawania mowy dwóch pozostałych bram, które organizacja może wybrać, zmierzone na tych samych nagraniach, tak by wybór był liczbą, a nie preferencją. Ten wpis pokazuje liczby stojące za tym wyborem — te same 153 nagrania przepuszczone tego samego dnia przez Azure AI Speech, Google Cloud Speech-to-Text i Amazon Transcribe — oraz dwa fakty o każdym API, które mają większe znaczenie niż jeden punkt procentowy dokładności.

Zasada na początek: jedna brama na organizację

Każda funkcja AI w InterMIND — podsumowania spotkań, streszczenia dokumentów, asystent pisania, Ask AI oraz Mia podczas spotkania — działa na jednej bramie modelu językowego wybranej przez organizację: domyślnie Azure OpenAI w strefie EU Data Zone, a do wyboru także Google Vertex AI na punkcie końcowym multi-region UE lub Amazon Bedrock we Frankfurcie — każda z nich we własnym tenancie InterMIND. Uzasadnienie takiego podejścia wyjaśniliśmy we wpisie AI spotkań na własnej bramie chmurowej: dla większości organizacji ta brama znajduje się już na zatwierdzonej liście subprocesorów, więc funkcja AI nie dodaje do niej żadnej nowej firmy.

Rozpoznawanie mowy dla wiadomości głosowych stosuje się dziś do tej samej zasady na domyślnej bramie, a każda z trzech bram ma usługę rozpoznawania mowy obok swoich modeli językowych — i to właśnie mierzy ten wpis:

BramaUsługa rozpoznawania mowyRegion użyty w tym teścieJak API przyjmuje nagranie
Azure OpenAI (Microsoft)Azure AI Speech, fast transcription APISweden CentralJedno żądanie dla pliku o długości do 5 godzin i rozmiarze do 500 MB (dokumentacja fast transcription, sprawdzono we wrześniu 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, model Chirp 3multi-region euRozpoznawanie synchroniczne jest ograniczone do 60 sekund i 10 MB; dłuższe nagrania przechodzą przez rozpoznawanie wsadowe (batch) lub strumieniowe (limity synchroniczne, Chirp 3, sprawdzono we wrześniu 2026)
Amazon Bedrock (AWS)Amazon Transcribe, streamingeu-central-1 (Frankfurt)Sesja strumieniowa przez HTTP/2 lub WebSocket; dane wejściowe w formacie PCM, FLAC lub Ogg-Opus (dokumentacja streamingu, sprawdzono we wrześniu 2026)

W każdym przypadku rozpoznawaniu podaje się język mówiącego — język ustawiony przez użytkownika w profilu — ponieważ automatyczna identyfikacja języka okazała się w naszych testach zawodna na krótkich nagraniach: czterosekundowa notatka po rosyjsku została rozpoznana jako angielska. Tak dziś produkt wywołuje Azure, a test wywołuje pozostałe dwie usługi w ten sam sposób.

Co zmierzyliśmy

Zbiór. 153 nagrania w 17 językach: 136 tur dialogowych — dwa biznesowe dialogi (negocjacje kontraktu i codzienny stand-up) wypowiedziane przez dwa syntetyczne głosy produktu w dziesięciu językach — plus 17 fragmentów formalnych, czyli biznesowe zdania FLORES-200 z naszego publicznego benchmarku tłumaczeń odczytane przez syntetyczny głos, po jednym na język, trwające od 71 do 109 sekund. Tury dialogowe trwają od 3 do 30 sekund, czyli tyle, ile realna wiadomość głosowa.

Metryka. Word error rate (WER, współczynnik błędów słów) względem tekstu referencyjnego — czyli odsetek słów podstawionych, wstawionych lub usuniętych — po znormalizowaniu wielkości liter, interpunkcji i białych znaków; chiński i japoński są porównywane na poziomie znaków. Równolegle rejestrowano współczynnik błędów znaków (CER), który pokazuje ten sam obraz.

Narzędzie testowe. Jeden skrypt, jedna maszyna, jedna godzina w dniu 2026-09-16, każdy silnik na wszystkich 153 nagraniach. Azure i Amazon Transcribe przyjmowały każde nagranie w całości. Rozpoznawanie synchroniczne Google przyjmuje maksymalnie 60 sekund, więc 17 fragmentów formalnych podzielono w miejscach ciszy na części krótsze niż 55 sekund, a transkrypty połączono; 136 nagrań dialogowych przetworzono w całości. Amazon Transcribe oczekuje dźwięku podawanego w tempie zgodnym z czasem rzeczywistym, więc narzędzie testowe podawało go cztery razy szybciej niż w czasie rzeczywistym; podana niżej wartość opóźnienia dla tej usługi jest zatem dolną granicą wyznaczoną przez sposób podawania danych, a nie przez samą usługę.

Czym to nie jest. Syntetyczne głosy w cichym nagraniu, a nie nagrania terenowe z telefonu w samochodzie. Jeden dzień, jedno uruchomienie na nagranie. To porównanie na dźwięku, na którym testowany jest nasz własny potok tłumaczeniowy, w językach, w jakich piszą nasi użytkownicy — a nie ranking.

Wyniki: współczynnik błędów słów w podziale na języki

Średni WER dla nagrań w poszczególnych językach; każdy silnik zwrócił transkrypcję dla wszystkich 153 nagrań.

JęzykNagraniaAzure AI SpeechGoogle Chirp 3Amazon Transcribe
arabski1332%46%26%
chiński133%3%8%
czeski11%2%3%
niderlandzki12%2%3%
angielski212%5%2%
francuski135%11%12%
niemiecki137%9%13%
hindi1310%10%12%
węgierski19%7%8%
włoski11%1%3%
japoński136%5%5%
koreański19%11%11%
polski11%1%2%
portugalski (Brazylia)135%4%6%
rosyjski2114%10%14%
hiszpański136%5%6%
turecki14%3%4%
Wszystkie 153 nagrania1539%10%10%
Tylko tury dialogowe1369%11%10%
Tylko fragmenty formalne174%5%5%
Czas przetwarzania ÷ długość nagrania0.100.220.41 (ograniczone tempem podawania)

Języki reprezentowane przez pojedyncze nagranie (tylko fragment formalny) pokazano dla kompletności; wynik z jednego nagrania to pojedynczy punkt danych, a nie miarodajny wskaźnik.

Co mówią te liczby

  • Na całym zbiorze wyniki trzech usług różnią się o nie więcej niż jeden punkt procentowy: 9%, 10% i 10%. Każde z 153 nagrań zostało zwrócone z transkrypcją przez każdy z silników — pokrycie 17 języków jest kompletne u wszystkich trzech.
  • Różnice widać na poziomie poszczególnych języków i działają one w obie strony. Azure miał najniższy współczynnik błędów dla francuskiego (5% wobec 11% i 12%) oraz niemieckiego (7% wobec 9% i 13%), a najniższy wynik dzielił z konkurencją dla angielskiego (2%, razem z Amazon Transcribe) i chińskiego (3%, razem z Google). Amazon Transcribe miał najniższy wynik dla arabskiego (26% wobec 32% i 46%). Google miał najniższy wynik dla rosyjskiego (10% wobec 14% i 14%), portugalskiego, węgierskiego i tureckiego.
  • Arabski jest trudny dla wszystkich trzech usług. Najlepszy wynik na arabskich nagraniach dialogowych to błąd w co czwartym słowie. Jest to spójne z tym, co zaobserwowaliśmy po stronie tłumaczeń, gdzie w sierpniu 2026 wycofaliśmy arabski z listy języków spotkań, dopóki jakość nie osiągnie naszego progu (ile języków obsługujemy).
  • Czas przetwarzania jest u wszystkich trzech wyraźnie krótszy niż czas rzeczywisty. 30-sekundowa notatka zajmuje w tym teście około trzech sekund na Azure i około siedmiu na Google; wynik Amazon jest zdominowany przez ograniczone tempo podawania danych.

Dlaczego Azure AI Speech pozostaje domyślnym wyborem

Trzy powody, w kolejności, w jakiej zdecydowały o wyborze.

1. Domyślną bramą jest Azure. Organizacja, która nie wybrała bramy, uruchamia swoje funkcje AI na Azure OpenAI w strefie EU Data Zone, więc jej wiadomości głosowe są transkrybowane przez Azure AI Speech w tym samym tenancie. Żadnego dodatkowego subprocesora, żadnego dodatkowego regionu. Microsoft deklaruje, że Azure Speech nie przechowuje ani nie przetwarza danych poza regionem zasobu Speech (strona regionów, sprawdzono we wrześniu 2026); nasz zasób znajduje się w regionie Sweden Central, który jest wymieniony jako obsługujący fast transcription.

2. Kształt API pasuje do wiadomości głosowej. Wiadomość głosowa w InterMIND może trwać do dziesięciu minut (wiadomości głosowe). Fast transcription Azure przyjmuje całe nagranie w jednym żądaniu. Rozpoznawanie synchroniczne Google zatrzymuje się na 60 sekundach, więc dziesięciominutowa notatka wymaga rozpoznawania wsadowego przez zasobnik magazynu lub sesji strumieniowej; Amazon Transcribe działa strumieniowo, ale przyjmuje PCM, FLAC lub Ogg-Opus, a nie formaty, w jakich nagrywają telefony i przeglądarki, więc dźwięk trzeba najpierw przekodować. Oba te problemy da się rozwiązać — nasze narzędzie testowe je rozwiązuje — ale to więcej ruchomych elementów na drodze każdej notatki.

3. Liczby nie przemawiają przeciwko temu wyborowi. Przy 9% wobec 10% i 10% żaden silnik w tym zbiorze nie jest na tyle lepszy, by uzasadnić przeniesienie wiadomości głosowych poza domyślną bramę. Gdyby Google lub Amazon osiągnęły połowę tego współczynnika błędów, ten wpis by to napisał.

Co to oznacza dla organizacji korzystających z Vertex AI lub Bedrock

Jeśli Twoja organizacja wybrała jako bramę Google Vertex AI lub Amazon Bedrock, jej funkcje AI działają właśnie tam. Wiadomości głosowe w takich organizacjach docierają obecnie jako nagranie bez transkrypcji: zmierzyliśmy Google Cloud Speech-to-Text i Amazon Transcribe, jak pokazuje ten wpis, ale nie zostały one jeszcze podłączone do produktu. Uprawnienia i kod integracji już istnieją; ten wpis zostanie zaktualizowany, gdy znajdą się na drodze każdej notatki. Do tego czasu wiadomość głosowa w organizacji korzystającej z Vertex AI lub Bedrock to nagranie do odtworzenia; organizacja, która przełączy bramę na Azure, otrzymuje transkrypcje dla notatek wysłanych od tego momentu.

Najczęściej zadawane pytania

Z jakiej usługi rozpoznawania mowy korzysta InterMIND?

Do wiadomości głosowych na czacie — Azure AI Speech (fast transcription API) we własnym tenancie Azure InterMIND w regionie Sweden Central, czyli usługa rozpoznawania mowy domyślnej bramy AI. Mowa na żywo podczas spotkań przebiega inną ścieżką: działa na własnym silniku medialnym InterMIND, Mind API, hostowanym u OVH we Francji, i nigdy nie dotyka żadnej chmurowej usługi rozpoznawania mowy (gdzie faktycznie odbywa się spotkanie).

Czy Azure AI Speech jest dokładniejsze niż Google Speech-to-Text lub Amazon Transcribe?

Na naszym zbiorze 153 nagrań wiadomości głosowych w 17 językach, zmierzonym tego samego dnia tym samym narzędziem, Azure AI Speech osiągnął średni współczynnik błędów słów 9%, Google Cloud Speech-to-Text (Chirp 3) 10%, a Amazon Transcribe 10%. W podziale na języki kolejność się zmienia: Azure był najlepszy dla francuskiego, angielskiego i chińskiego, Amazon Transcribe dla arabskiego, a Google dla rosyjskiego. Na innym zbiorze nagrań ranking może wyglądać inaczej; powyższa tabela jest dowodem dla naszego zbioru.

Czym jest word error rate i jak został tu obliczony?

Word error rate to liczba słów podstawionych, wstawionych i usuniętych podzielona przez liczbę słów w tekście referencyjnym. Przed porównaniem normalizujemy wielkość liter, interpunkcję i białe znaki, a chiński i japoński porównujemy na poziomie znaków, ponieważ w tych pismach słowa nie są oddzielane spacjami. Wynik 9% oznacza, że mniej więcej co jedenaste słowo różni się od tekstu referencyjnego.

Czy dźwięk wiadomości głosowej opuszcza UE?

Nie. Nagranie jest przechowywane w magazynie obiektowym InterMIND w UE, a usługa rozpoznawania mowy, która je transkrybuje, działa w regionie UE: Sweden Central na Azure, multi-region eu na Google Cloud, Frankfurt na AWS. Pełna lista podmiotów i regionów znajduje się na stronie subprocesorów oraz na stronie zaufania.

Dlaczego nie rozpoznawać mowy po stronie klienta, w aplikacji, tak by dźwięk nigdy nie opuszczał telefonu?

Zmierzyliśmy również to, we wrześniu 2026. Wbudowany rozpoznawacz Chrome z lokalnym przetwarzaniem poprawnie rozpoznał 0 z 17 fragmentów formalnych we wszystkich językach produktu, a pokrycie językowe rozpoznawaczy po stronie klienta jest znacznie węższe niż 17 języków z powyższej tabeli. Rozpoznawanie po stronie klienta to kierunek, który ponownie zmierzymy, gdy platformy się rozwiną; dziś to ścieżka przez bramę działa dla każdego członka zespołu w każdym języku.

Czy nasza organizacja może wybrać, która usługa rozpoznawania mowy transkrybuje jej wiadomości głosowe?

Nie osobno: administrator organizacji wybiera bramę AI na stronie Integracje. Na domyślnej bramie wiadomości głosowe są transkrybowane przez Azure AI Speech. Na Vertex AI i Amazon Bedrock wiadomości głosowe nie są jeszcze transkrybowane — patrz sekcja powyżej.

Jak długa może być wiadomość głosowa i czy API to ogranicza?

Do dziesięciu minut. Fast transcription Azure przyjmuje pliki o długości do 5 godzin i rozmiarze do 500 MB w jednym żądaniu, więc notatka jest transkrybowana w jednym wywołaniu. Rozpoznawanie synchroniczne Google przyjmuje 60 sekund i 10 MB, dlatego narzędzie testowe dzieliło długie nagrania na części w miejscach ciszy.

Dlaczego rozpoznawaczowi podaje się język mówiącego, zamiast go wykrywać?

Ponieważ wiadomość głosowa jest krótka. Na czterosekundowym nagraniu automatyczna identyfikacja języka może zwrócić błędny wynik — testowa notatka po rosyjsku została rozpoznana jako angielska; język ustawiony w profilu użytkownika jest właściwy niemal za każdym razem. Rozpoznawacz otrzymuje ten język, a dopiero gdy jest on nieznany, otrzymuje jako kandydatów języki używane w danym pokoju.

Czy dźwięk spotkania jest transkrybowany przez tę samą usługę?

Nie. Mowa na żywo podczas spotkania jest rozpoznawana i tłumaczona na własnym silniku InterMIND (Mind API) na serwerze medialnym, który obsługuje połączenie, hostowanym u OVH we Francji — patrz gdzie faktycznie odbywa się spotkanie. Brama chmurowa widzi tekst, nigdy dźwięk połączenia (AI spotkań na własnej bramie).

Czy opublikujecie wyniki ponownie?

Narzędzie testowe uruchamia się jedną komendą, a uprawnienia dla każdego silnika są już skonfigurowane, więc tabelę można zmierzyć ponownie, gdy dostawca wypuści nowy model. Gdy zmieni to obraz sytuacji, ten wpis zostanie zaktualizowany wraz z datą.


Przekonaj się sam


Źródła: Microsoft — Azure AI Speech fast transcription (learn.microsoft.com) oraz tabela regionów Speech (learn.microsoft.com); Google Cloud — model Chirp 3 (docs.cloud.google.com), limity rozpoznawania synchronicznego (docs.cloud.google.com) oraz obsługiwane języki (docs.cloud.google.com); AWS — Amazon Transcribe streaming (docs.aws.amazon.com), punkty końcowe i limity (docs.aws.amazon.com) oraz obsługiwane języki (docs.aws.amazon.com); wszystkie sprawdzone we wrześniu 2026. Pomiar: InterMIND speech bench, 2026-09-16, 153 nagrania, 17 języków.

Otrzymuj nowe wpisy i aktualizacje produktu e-mailem

Jeden e-mail miesięcznie z nowymi postami i aktualizacjami produktu. Wypisz się w dowolnym momencie.