[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-pl-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_pl\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 notatkach głosowych: dlaczego InterMIND uruchamia rozpoznawanie mowy w bramce chmurowej Twojej organizacji (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-na-153-wiadomościach-głosowych-dlaczego-intermind-uruchamia-rozpoznawanie-mowy-na-własnej-bramie-chmurowej-twojej-organizacji-2026","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe na 153 wiadomościach głosowych: dlaczego InterMIND uruchamia rozpoznawanie mowy na własnej bramie chmurowej Twojej organizacji (2026)",[20,21,22],"p",{},"Wiadomość głosowa na kanale InterMIND zamienia się w wiadomość tekstową, którą każdy współpracownik czyta w swoim własnym języku. Pierwszym krokiem tego procesu jest rozpoznawanie mowy (speech-to-text), a pytanie, jakie zadają nam działy IT i zespoły ds. zgodności, nie brzmi „jak dokładne jest to rozwiązanie\", lecz „czyja to usługa i dokąd trafia dźwięk\".",[20,24,25],{},"Krótka odpowiedź: Azure AI Speech, usługa rozpoznawania mowy domyślnej bramy AI, we własnym tenancie Azure firmy InterMIND w regionie Sweden Central — oraz usługi rozpoznawania mowy dwóch pozostałych bram, które organizacja może wybrać, zmierzone na tych samych nagraniach, tak by wybór był liczbą, a nie preferencją. Ten wpis pokazuje liczby stojące za tym wyborem — te same 153 nagrania przepuszczone tego samego dnia przez Azure AI Speech, Google Cloud Speech-to-Text i Amazon Transcribe — oraz dwa fakty o każdym API, które mają większe znaczenie niż jeden punkt procentowy dokładności.",[27,28,30],"h2",{"id":29},"zasada-na-początek-jedna-brama-na-organizację","Zasada na początek: jedna brama na organizację",[20,32,33,34,39],{},"Każda funkcja AI w InterMIND — podsumowania spotkań, streszczenia dokumentów, asystent pisania, Ask AI oraz Mia podczas spotkania — działa na jednej bramie modelu językowego wybranej przez organizację: domyślnie Azure OpenAI w strefie EU Data Zone, a do wyboru także Google Vertex AI na punkcie końcowym multi-region UE lub Amazon Bedrock we Frankfurcie — każda z nich we własnym tenancie InterMIND. Uzasadnienie takiego podejścia wyjaśniliśmy we wpisie ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","AI spotkań na własnej bramie chmurowej",": dla większości organizacji ta brama znajduje się już na zatwierdzonej liście subprocesorów, więc funkcja AI nie dodaje do niej żadnej nowej firmy.",[20,41,42],{},"Rozpoznawanie mowy dla wiadomości głosowych stosuje się dziś do tej samej zasady na domyślnej bramie, a każda z trzech bram ma usługę rozpoznawania mowy obok swoich modeli językowych — i to właśnie mierzy ten wpis:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Brama",[53,57,58],{},"Usługa rozpoznawania mowy",[53,60,61],{},"Region użyty w tym teście",[53,63,64],{},"Jak API przyjmuje nagranie",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, fast transcription API",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Jedno żądanie dla pliku o długości do 5 godzin i rozmiarze do 500 MB (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","dokumentacja fast transcription",", sprawdzono we wrześniu 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, model Chirp 3",[71,106,107,108],{},"multi-region ",[109,110,111],"code",{},"eu",[71,113,114,115,120,121,93],{},"Rozpoznawanie synchroniczne jest ograniczone do 60 sekund i 10 MB; dłuższe nagrania przechodzą przez rozpoznawanie wsadowe (batch) lub strumieniowe (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"limity synchroniczne",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, streaming",[71,138,139],{},"eu-central-1 (Frankfurt)",[71,141,142,143,93],{},"Sesja strumieniowa przez HTTP\u002F2 lub WebSocket; dane wejściowe w formacie PCM, FLAC lub Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"dokumentacja streamingu",[20,149,150],{},"W każdym przypadku rozpoznawaniu podaje się język mówiącego — język ustawiony przez użytkownika w profilu — ponieważ automatyczna identyfikacja języka okazała się w naszych testach zawodna na krótkich nagraniach: czterosekundowa notatka po rosyjsku została rozpoznana jako angielska. Tak dziś produkt wywołuje Azure, a test wywołuje pozostałe dwie usługi w ten sam sposób.",[27,152,154],{"id":153},"co-zmierzyliśmy","Co zmierzyliśmy",[20,156,157,160,161,165],{},[74,158,159],{},"Zbiór."," 153 nagrania w 17 językach: 136 tur dialogowych — dwa biznesowe dialogi (negocjacje kontraktu i codzienny stand-up) wypowiedziane przez dwa syntetyczne głosy produktu w dziesięciu językach — plus 17 fragmentów formalnych, czyli biznesowe zdania FLORES-200 z naszego ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","publicznego benchmarku tłumaczeń"," odczytane przez syntetyczny głos, po jednym na język, trwające od 71 do 109 sekund. Tury dialogowe trwają od 3 do 30 sekund, czyli tyle, ile realna wiadomość głosowa.",[20,167,168,171],{},[74,169,170],{},"Metryka."," Word error rate (WER, współczynnik błędów słów) względem tekstu referencyjnego — czyli odsetek słów podstawionych, wstawionych lub usuniętych — po znormalizowaniu wielkości liter, interpunkcji i białych znaków; chiński i japoński są porównywane na poziomie znaków. Równolegle rejestrowano współczynnik błędów znaków (CER), który pokazuje ten sam obraz.",[20,173,174,177],{},[74,175,176],{},"Narzędzie testowe."," Jeden skrypt, jedna maszyna, jedna godzina w dniu 2026-09-16, każdy silnik na wszystkich 153 nagraniach. Azure i Amazon Transcribe przyjmowały każde nagranie w całości. Rozpoznawanie synchroniczne Google przyjmuje maksymalnie 60 sekund, więc 17 fragmentów formalnych podzielono w miejscach ciszy na części krótsze niż 55 sekund, a transkrypty połączono; 136 nagrań dialogowych przetworzono w całości. Amazon Transcribe oczekuje dźwięku podawanego w tempie zgodnym z czasem rzeczywistym, więc narzędzie testowe podawało go cztery razy szybciej niż w czasie rzeczywistym; podana niżej wartość opóźnienia dla tej usługi jest zatem dolną granicą wyznaczoną przez sposób podawania danych, a nie przez samą usługę.",[20,179,180,183],{},[74,181,182],{},"Czym to nie jest."," Syntetyczne głosy w cichym nagraniu, a nie nagrania terenowe z telefonu w samochodzie. Jeden dzień, jedno uruchomienie na nagranie. To porównanie na dźwięku, na którym testowany jest nasz własny potok tłumaczeniowy, w językach, w jakich piszą nasi użytkownicy — a nie ranking.",[27,185,187],{"id":186},"wyniki-współczynnik-błędów-słów-w-podziale-na-języki","Wyniki: współczynnik błędów słów w podziale na języki",[20,189,190],{},"Średni WER dla nagrań w poszczególnych językach; każdy silnik zwrócił transkrypcję dla wszystkich 153 nagrań.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Język",[53,201,202],{},"Nagrania",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"arabski",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"chiński",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"czeski",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"niderlandzki",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"angielski",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"francuski",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"niemiecki",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"hindi",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"węgierski",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"włoski",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"japoński",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"koreański",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"polski",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"portugalski (Brazylia)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"rosyjski",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"hiszpański",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"turecki",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Wszystkie 153 nagrania",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Tylko tury dialogowe",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Tylko fragmenty formalne",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Czas przetwarzania ÷ długość nagrania",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (ograniczone tempem podawania)",[20,522,523],{},"Języki reprezentowane przez pojedyncze nagranie (tylko fragment formalny) pokazano dla kompletności; wynik z jednego nagrania to pojedynczy punkt danych, a nie miarodajny wskaźnik.",[27,525,527],{"id":526},"co-mówią-te-liczby","Co mówią te liczby",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"Na całym zbiorze wyniki trzech usług różnią się o nie więcej niż jeden punkt procentowy:"," 9%, 10% i 10%. Każde z 153 nagrań zostało zwrócone z transkrypcją przez każdy z silników — pokrycie 17 języków jest kompletne u wszystkich trzech.",[532,539,540,543],{},[74,541,542],{},"Różnice widać na poziomie poszczególnych języków i działają one w obie strony."," Azure miał najniższy współczynnik błędów dla francuskiego (5% wobec 11% i 12%) oraz niemieckiego (7% wobec 9% i 13%), a najniższy wynik dzielił z konkurencją dla angielskiego (2%, razem z Amazon Transcribe) i chińskiego (3%, razem z Google). Amazon Transcribe miał najniższy wynik dla arabskiego (26% wobec 32% i 46%). Google miał najniższy wynik dla rosyjskiego (10% wobec 14% i 14%), portugalskiego, węgierskiego i tureckiego.",[532,545,546,549,550,554],{},[74,547,548],{},"Arabski jest trudny dla wszystkich trzech usług."," Najlepszy wynik na arabskich nagraniach dialogowych to błąd w co czwartym słowie. Jest to spójne z tym, co zaobserwowaliśmy po stronie tłumaczeń, gdzie w sierpniu 2026 wycofaliśmy arabski z listy języków spotkań, dopóki jakość nie osiągnie naszego progu (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","ile języków obsługujemy",").",[532,556,557,560],{},[74,558,559],{},"Czas przetwarzania jest u wszystkich trzech wyraźnie krótszy niż czas rzeczywisty."," 30-sekundowa notatka zajmuje w tym teście około trzech sekund na Azure i około siedmiu na Google; wynik Amazon jest zdominowany przez ograniczone tempo podawania danych.",[27,562,564],{"id":563},"dlaczego-azure-ai-speech-pozostaje-domyślnym-wyborem","Dlaczego Azure AI Speech pozostaje domyślnym wyborem",[20,566,567],{},"Trzy powody, w kolejności, w jakiej zdecydowały o wyborze.",[20,569,570,573,574,579],{},[74,571,572],{},"1. Domyślną bramą jest Azure."," Organizacja, która nie wybrała bramy, uruchamia swoje funkcje AI na Azure OpenAI w strefie EU Data Zone, więc jej wiadomości głosowe są transkrybowane przez Azure AI Speech w tym samym tenancie. Żadnego dodatkowego subprocesora, żadnego dodatkowego regionu. Microsoft deklaruje, że Azure Speech nie przechowuje ani nie przetwarza danych poza regionem zasobu Speech (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"strona regionów",", sprawdzono we wrześniu 2026); nasz zasób znajduje się w regionie Sweden Central, który jest wymieniony jako obsługujący fast transcription.",[20,581,582,585,586,590],{},[74,583,584],{},"2. Kształt API pasuje do wiadomości głosowej."," Wiadomość głosowa w InterMIND może trwać do dziesięciu minut (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","wiadomości głosowe","). Fast transcription Azure przyjmuje całe nagranie w jednym żądaniu. Rozpoznawanie synchroniczne Google zatrzymuje się na 60 sekundach, więc dziesięciominutowa notatka wymaga rozpoznawania wsadowego przez zasobnik magazynu lub sesji strumieniowej; Amazon Transcribe działa strumieniowo, ale przyjmuje PCM, FLAC lub Ogg-Opus, a nie formaty, w jakich nagrywają telefony i przeglądarki, więc dźwięk trzeba najpierw przekodować. Oba te problemy da się rozwiązać — nasze narzędzie testowe je rozwiązuje — ale to więcej ruchomych elementów na drodze każdej notatki.",[20,592,593,596],{},[74,594,595],{},"3. Liczby nie przemawiają przeciwko temu wyborowi."," Przy 9% wobec 10% i 10% żaden silnik w tym zbiorze nie jest na tyle lepszy, by uzasadnić przeniesienie wiadomości głosowych poza domyślną bramę. Gdyby Google lub Amazon osiągnęły połowę tego współczynnika błędów, ten wpis by to napisał.",[27,598,600],{"id":599},"co-to-oznacza-dla-organizacji-korzystających-z-vertex-ai-lub-bedrock","Co to oznacza dla organizacji korzystających z Vertex AI lub Bedrock",[20,602,603],{},"Jeśli Twoja organizacja wybrała jako bramę Google Vertex AI lub Amazon Bedrock, jej funkcje AI działają właśnie tam. Wiadomości głosowe w takich organizacjach docierają obecnie jako nagranie bez transkrypcji: zmierzyliśmy Google Cloud Speech-to-Text i Amazon Transcribe, jak pokazuje ten wpis, ale nie zostały one jeszcze podłączone do produktu. Uprawnienia i kod integracji już istnieją; ten wpis zostanie zaktualizowany, gdy znajdą się na drodze każdej notatki. Do tego czasu wiadomość głosowa w organizacji korzystającej z Vertex AI lub Bedrock to nagranie do odtworzenia; organizacja, która przełączy bramę na Azure, otrzymuje transkrypcje dla notatek wysłanych od tego momentu.",[27,605,607],{"id":606},"najczęściej-zadawane-pytania","Najczęściej zadawane pytania",[20,609,610],{},[74,611,612],{},"Z jakiej usługi rozpoznawania mowy korzysta InterMIND?",[20,614,615,616,554],{},"Do wiadomości głosowych na czacie — Azure AI Speech (fast transcription API) we własnym tenancie Azure InterMIND w regionie Sweden Central, czyli usługa rozpoznawania mowy domyślnej bramy AI. Mowa na żywo podczas spotkań przebiega inną ścieżką: działa na własnym silniku medialnym InterMIND, Mind API, hostowanym u OVH we Francji, i nigdy nie dotyka żadnej chmurowej usługi rozpoznawania mowy (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","gdzie faktycznie odbywa się spotkanie",[20,621,622],{},[74,623,624],{},"Czy Azure AI Speech jest dokładniejsze niż Google Speech-to-Text lub Amazon Transcribe?",[20,626,627],{},"Na naszym zbiorze 153 nagrań wiadomości głosowych w 17 językach, zmierzonym tego samego dnia tym samym narzędziem, Azure AI Speech osiągnął średni współczynnik błędów słów 9%, Google Cloud Speech-to-Text (Chirp 3) 10%, a Amazon Transcribe 10%. W podziale na języki kolejność się zmienia: Azure był najlepszy dla francuskiego, angielskiego i chińskiego, Amazon Transcribe dla arabskiego, a Google dla rosyjskiego. Na innym zbiorze nagrań ranking może wyglądać inaczej; powyższa tabela jest dowodem dla naszego zbioru.",[20,629,630],{},[74,631,632],{},"Czym jest word error rate i jak został tu obliczony?",[20,634,635],{},"Word error rate to liczba słów podstawionych, wstawionych i usuniętych podzielona przez liczbę słów w tekście referencyjnym. Przed porównaniem normalizujemy wielkość liter, interpunkcję i białe znaki, a chiński i japoński porównujemy na poziomie znaków, ponieważ w tych pismach słowa nie są oddzielane spacjami. Wynik 9% oznacza, że mniej więcej co jedenaste słowo różni się od tekstu referencyjnego.",[20,637,638],{},[74,639,640],{},"Czy dźwięk wiadomości głosowej opuszcza UE?",[20,642,643,644,646,647,651,652,656],{},"Nie. Nagranie jest przechowywane w magazynie obiektowym InterMIND w UE, a usługa rozpoznawania mowy, która je transkrybuje, działa w regionie UE: Sweden Central na Azure, multi-region ",[109,645,111],{}," na Google Cloud, Frankfurt na AWS. Pełna lista podmiotów i regionów znajduje się na ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","stronie subprocesorów"," oraz na ",[35,653,655],{"href":654},"\u002Ftrust","stronie zaufania",".",[20,658,659],{},[74,660,661],{},"Dlaczego nie rozpoznawać mowy po stronie klienta, w aplikacji, tak by dźwięk nigdy nie opuszczał telefonu?",[20,663,664],{},"Zmierzyliśmy również to, we wrześniu 2026. Wbudowany rozpoznawacz Chrome z lokalnym przetwarzaniem poprawnie rozpoznał 0 z 17 fragmentów formalnych we wszystkich językach produktu, a pokrycie językowe rozpoznawaczy po stronie klienta jest znacznie węższe niż 17 języków z powyższej tabeli. Rozpoznawanie po stronie klienta to kierunek, który ponownie zmierzymy, gdy platformy się rozwiną; dziś to ścieżka przez bramę działa dla każdego członka zespołu w każdym języku.",[20,666,667],{},[74,668,669],{},"Czy nasza organizacja może wybrać, która usługa rozpoznawania mowy transkrybuje jej wiadomości głosowe?",[20,671,672],{},"Nie osobno: administrator organizacji wybiera bramę AI na stronie Integracje. Na domyślnej bramie wiadomości głosowe są transkrybowane przez Azure AI Speech. Na Vertex AI i Amazon Bedrock wiadomości głosowe nie są jeszcze transkrybowane — patrz sekcja powyżej.",[20,674,675],{},[74,676,677],{},"Jak długa może być wiadomość głosowa i czy API to ogranicza?",[20,679,680],{},"Do dziesięciu minut. Fast transcription Azure przyjmuje pliki o długości do 5 godzin i rozmiarze do 500 MB w jednym żądaniu, więc notatka jest transkrybowana w jednym wywołaniu. Rozpoznawanie synchroniczne Google przyjmuje 60 sekund i 10 MB, dlatego narzędzie testowe dzieliło długie nagrania na części w miejscach ciszy.",[20,682,683],{},[74,684,685],{},"Dlaczego rozpoznawaczowi podaje się język mówiącego, zamiast go wykrywać?",[20,687,688],{},"Ponieważ wiadomość głosowa jest krótka. Na czterosekundowym nagraniu automatyczna identyfikacja języka może zwrócić błędny wynik — testowa notatka po rosyjsku została rozpoznana jako angielska; język ustawiony w profilu użytkownika jest właściwy niemal za każdym razem. Rozpoznawacz otrzymuje ten język, a dopiero gdy jest on nieznany, otrzymuje jako kandydatów języki używane w danym pokoju.",[20,690,691],{},[74,692,693],{},"Czy dźwięk spotkania jest transkrybowany przez tę samą usługę?",[20,695,696,697,699,700,554],{},"Nie. Mowa na żywo podczas spotkania jest rozpoznawana i tłumaczona na własnym silniku InterMIND (Mind API) na serwerze medialnym, który obsługuje połączenie, hostowanym u OVH we Francji — patrz ",[35,698,619],{"href":618},". Brama chmurowa widzi tekst, nigdy dźwięk połączenia (",[35,701,702],{"href":37},"AI spotkań na własnej bramie",[20,704,705],{},[74,706,707],{},"Czy opublikujecie wyniki ponownie?",[20,709,710],{},"Narzędzie testowe uruchamia się jedną komendą, a uprawnienia dla każdego silnika są już skonfigurowane, więc tabelę można zmierzyć ponownie, gdy dostawca wypuści nowy model. Gdy zmieni to obraz sytuacji, ten wpis zostanie zaktualizowany wraz z datą.",[712,713],"hr",{},[27,715,717],{"id":716},"przekonaj-się-sam","Przekonaj się sam",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Dowiedz się, jak działają wiadomości głosowe"," — nagrywanie, limit dziesięciu minut i dokąd trafia dźwięk.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Zobacz listę subprocesorów"," — dostawca, kraj, cel i region dla każdego podmiotu przetwarzającego Twoje dane.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Wypróbuj demo na żywo"," — produkcyjny potok tłumaczeniowy na Twoim własnym dźwięku, bez rejestracji.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Źródła: Microsoft — Azure AI Speech fast transcription (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") oraz tabela regionów Speech (",[35,759,756],{"href":576,"rel":760},[91],"); Google Cloud — model Chirp 3 (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), limity rozpoznawania synchronicznego (",[35,768,765],{"href":117,"rel":769},[91],") oraz obsługiwane języki (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — Amazon Transcribe streaming (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), punkty końcowe i limity (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); wszystkie sprawdzone we wrześniu 2026. Pomiar: InterMIND speech bench, 2026-09-16, 153 nagrania, 17 języków.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Zmierzyliśmy usługi rozpoznawania mowy trzech bramek chmurowych, które organizacja InterMIND może wybrać — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) i Amazon Transcribe — na tych samych 153 klipach z notatkami głosowymi w 17 językach, przy użyciu jednego narzędzia, w jeden dzień. Współczynniki błędów słownych dla poszczególnych języków, metodologia, ograniczenia każdego API oraz powody, dla których rozpoznawanie podąża za bramką, a nie za rankingiem.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","q6wShY632FCgB6ys2FUY1JuhJLBpFr9dHyVPgd6wcBs",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Płać tylko za osoby, które z tego korzystają: InterMIND przechodzi na rozliczanie za aktywnych członków","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Plany Pro i Business kończą ze sprzedażą ręcznie przypisywanych miejsc. Zaproś cały zespół; każde odnowienie zlicza członków aktywnych w ciągu poprzednich 28 dni i rozlicza się tylko za nich. Członek, który przestaje być aktywny, zachowuje dostęp i nic nie kosztuje; goście spotkań i uczestnicy zewnętrznych kanałów pozostają bezpłatni. Co oznacza aktywność, jak liczba ta zmienia się w cyklu rozliczeniowym, co mówi list przed odnowieniem i co ulega zmianie na stronie rozliczeń.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Napisy tłumaczone na żywo dla całej publiczności: czego wymagają Zoom, Teams i Google Meet oraz jak każdy uczestnik czyta we własnym języku (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Jeden mówca, publiczność posługująca się dziesięcioma językami. Tłumaczone napisy są dostępne w Zoom, Microsoft Teams i Google Meet — każde za inną licencją i każde inaczej odpowiadające na to samo pytanie: kto decyduje, w jakich językach publiczność może czytać. Teams pozwala organizatorowi spotkania ogólnego wybrać z góry sześć języków (dziesięć w Teams Premium); pary językowe w Zoom są ustalane w ustawieniach konta gospodarza; Google Meet ogranicza tłumaczone napisy do płatnych edycji Workspace. Udokumentowane zestawienie wraz z opisem, jak to działa w InterMIND, gdzie język napisów jest ustawieniem po stronie samego uczestnika, a sala jest tłumaczona również głosowo."]