[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-de-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_de\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe bei 153 Sprachnotizen: Warum InterMIND Speech-to-Text über das Cloud-Gateway Ihrer eigenen Organisation ausführt (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-bei-153-sprachnachrichten-warum-intermind-speech-to-text-im-eigenen-cloud-gateway-ihrer-organisation-ausführt-2026","Azure AI Speech vs. Google Chirp 3 vs. Amazon Transcribe bei 153 Sprachnachrichten: Warum InterMIND Speech-to-Text im eigenen Cloud-Gateway Ihrer Organisation ausführt (2026)",[20,21,22],"p",{},"Eine Sprachnachricht in einem InterMIND-Channel wird zu einer Textnachricht, die jedes Teammitglied in seiner eigenen Sprache liest. Der erste Schritt dabei ist Speech-to-Text, und die Frage, die wir von IT- und Compliance-Prüfern hören, lautet nicht „Wie genau ist es?“, sondern „Wessen Dienst ist es, und wohin geht das Audio?“",[20,24,25],{},"Die kurze Antwort: Azure AI Speech, der Sprachdienst des Standard-AI-Gateways, im eigenen Azure-Tenant von InterMIND in Sweden Central — sowie die Sprachdienste der beiden anderen Gateways, die eine Organisation wählen kann, gemessen an denselben Clips, damit die Wahl auf einer Zahl beruht und nicht auf einer Präferenz. Dieser Beitrag zeigt die Zahlen hinter dieser Wahl — dieselben 153 Clips durch Azure AI Speech, Google Cloud Speech-to-Text und Amazon Transcribe am selben Tag — sowie die zwei Fakten zu jeder API, die mehr zählen als ein Prozentpunkt Genauigkeit.",[27,28,30],"h2",{"id":29},"die-regel-zuerst-ein-gateway-pro-organisation","Die Regel zuerst: ein Gateway pro Organisation",[20,32,33,34,39],{},"Jede KI-Funktion in InterMIND — Meeting-Zusammenfassungen, Dokumentzusammenfassungen, der Schreibassistent, Ask AI und Mia im Meeting — läuft auf einem Sprachmodell-Gateway, das die Organisation auswählt: standardmäßig Azure OpenAI in der EU Data Zone, wahlweise Google Vertex AI am EU-Multiregion-Endpunkt oder Amazon Bedrock in Frankfurt, jeweils im eigenen Tenant von InterMIND. Die Begründung dafür haben wir in ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","Meeting-KI im eigenen Cloud-Gateway"," erläutert: Für die meisten Organisationen steht dieses Gateway bereits auf der genehmigten Liste der Unterauftragsverarbeiter, sodass eine KI-Funktion kein neues Unternehmen zu dieser Liste hinzufügt.",[20,41,42],{},"Speech-to-Text für Sprachnachrichten folgt heute auf dem Standard-Gateway derselben Regel, und jedes der drei Gateways verfügt neben seinen Sprachmodellen über einen eigenen Sprachdienst — genau das misst dieser Beitrag:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Gateway",[53,57,58],{},"Sprachdienst",[53,60,61],{},"In diesem Test verwendete Region",[53,63,64],{},"Wie die API eine Aufnahme entgegennimmt",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, Fast-Transcription-API",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Eine Anfrage für eine Datei bis zu 5 Stunden und 500 MB (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","Fast-Transcription-Dokumentation",", Stand September 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, Chirp-3-Modell",[71,106,107,111],{},[108,109,110],"code",{},"eu","-Multiregion",[71,113,114,115,120,121,93],{},"Die synchrone Erkennung ist auf 60 Sekunden und 10 MB begrenzt; längeres Audio läuft über Batch- oder Streaming-Erkennung (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"Sync-Limits",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, Streaming",[71,138,139],{},"eu-central-1 (Frankfurt)",[71,141,142,143,93],{},"Eine Streaming-Sitzung über HTTP\u002F2 oder WebSocket; Eingabeformat PCM, FLAC oder Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"Streaming-Dokumentation",[20,149,150],{},"Dem Erkennungsdienst wird in jedem Fall die eigene Sprache des Sprechers mitgeteilt — die Sprache, die ein Mitglied in seinem Profil eingestellt hat —, weil sich die automatische Sprachidentifikation bei kurzen Clips in unseren Tests als unzuverlässig erwiesen hat: Eine vier Sekunden lange russische Nachricht kam als Englisch zurück. So ruft das Produkt Azure heute auf, und der Test ruft die beiden anderen Dienste auf dieselbe Weise auf.",[27,152,154],{"id":153},"was-wir-gemessen-haben","Was wir gemessen haben",[20,156,157,160,161,165],{},[74,158,159],{},"Das Set."," 153 Clips in 17 Sprachen: 136 Dialog-Turns — zwei Geschäftsdialoge (eine Vertragsverhandlung und ein tägliches Stand-up), gesprochen von den beiden synthetischen Stimmen des Produkts in zehn Sprachen — plus 17 formelle Passagen, die FLORES-200-Geschäftssätze unseres ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","öffentlichen Übersetzungs-Benchmarks",", vorgelesen von einer synthetischen Stimme, eine pro Sprache und 71 bis 109 Sekunden lang. Die Dialog-Turns sind 3 bis 30 Sekunden lang, die Länge einer echten Sprachnachricht.",[20,167,168,171],{},[74,169,170],{},"Die Metrik."," Wortfehlerrate (Word Error Rate, WER) gegenüber dem Referenztext — der Anteil ersetzter, eingefügter oder gelöschter Wörter — nach Normalisierung von Groß-\u002FKleinschreibung, Zeichensetzung und Leerzeichen; Chinesisch und Japanisch werden pro Zeichen verglichen. Die Zeichenfehlerrate wurde parallel erfasst und erzählt dieselbe Geschichte.",[20,173,174,177],{},[74,175,176],{},"Der Testaufbau."," Ein Skript, eine Maschine, eine Stunde am 2026-09-16, jede Engine über alle 153 Clips. Azure und Amazon Transcribe verarbeiteten jeden Clip vollständig. Der synchrone Erkennungsdienst von Google akzeptiert höchstens 60 Sekunden, daher wurden die 17 formellen Clips an Sprechpausen in Stücke unter 55 Sekunden zerlegt und die Transkripte anschließend zusammengefügt; die 136 Dialog-Clips liefen vollständig. Amazon Transcribe erwartet Audio in Echtzeit-Tempo, daher hat der Testaufbau die Daten viermal schneller als Echtzeit eingespeist; die untenstehende Latenzangabe ist deshalb eine durch die Zuspielung gesetzte Untergrenze, nicht ein Wert des Dienstes selbst.",[20,179,180,183],{},[74,181,182],{},"Was dies nicht ist."," Synthetische Stimmen in ruhigem Audio, keine Feldaufnahmen von einem Telefon im Auto. Ein Tag, ein Durchlauf pro Clip. Es ist ein Vergleich anhand des Audios, mit dem unsere eigene Übersetzungspipeline getestet wird, in den Sprachen, in denen unsere Nutzer schreiben — kein Ranking.",[27,185,187],{"id":186},"ergebnisse-wortfehlerrate-pro-sprache","Ergebnisse: Wortfehlerrate pro Sprache",[20,189,190],{},"Durchschnittliche WER für die Clips jeder Sprache; jede Engine lieferte für alle 153 Clips ein Transkript.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Sprache",[53,201,202],{},"Clips",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"Arabisch",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"Chinesisch",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"Tschechisch",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"Niederländisch",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"Englisch",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"Französisch",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"Deutsch",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"Hindi",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"Ungarisch",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"Italienisch",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"Japanisch",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"Koreanisch",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"Polnisch",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"Portugiesisch (Brasilien)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"Russisch",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"Spanisch",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"Türkisch",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Alle 153 Clips",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Nur Dialog-Turns",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Nur formelle Passagen",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Verarbeitungszeit ÷ Audiolänge",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (zuspielungsbegrenzt)",[20,522,523],{},"Sprachen mit nur einem Clip (nur die formelle Passage) werden der Vollständigkeit halber angezeigt; ein Wert aus einem einzigen Clip ist ein Datenpunkt, keine Rate.",[27,525,527],{"id":526},"was-die-zahlen-sagen","Was die Zahlen sagen",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"Über das gesamte Set liegen die drei Dienste innerhalb eines Prozentpunkts:"," 9 %, 10 % und 10 %. Für jeden der 153 Clips lieferte jede Engine ein Transkript — die Abdeckung der 17 Sprachen ist bei allen dreien vollständig.",[532,539,540,543],{},[74,541,542],{},"Die Unterschiede zeigen sich pro Sprache, und sie gehen in beide Richtungen."," Azure hatte die niedrigste Fehlerrate bei Französisch (5 % gegenüber 11 % und 12 %) und Deutsch (7 % gegenüber 9 % und 13 %) und lag bei Englisch (2 %, gleichauf mit Amazon Transcribe) und Chinesisch (3 %, gleichauf mit Google) gemeinsam an der Spitze. Amazon Transcribe hatte die niedrigste Fehlerrate bei Arabisch (26 % gegenüber 32 % und 46 %). Google hatte die niedrigste bei Russisch (10 % gegenüber 14 % und 14 %), Portugiesisch, Ungarisch und Türkisch.",[532,545,546,549,550,554],{},[74,547,548],{},"Arabisch ist für alle drei schwierig."," Das beste Ergebnis bei den arabischen Dialog-Clips liegt bei jedem vierten Wort falsch. Das deckt sich mit dem, was wir auf der Übersetzungsseite gesehen haben, wo wir Arabisch im August 2026 aus der Sprachauswahl für Meetings entfernt haben, bis die Qualität unsere Messlatte erreicht (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","Wie viele Sprachen wir unterstützen",").",[532,556,557,560],{},[74,558,559],{},"Die Verarbeitungszeit liegt bei allen dreien deutlich unter Echtzeit."," Eine 30 Sekunden lange Nachricht benötigt in diesem Testaufbau auf Azure etwa drei Sekunden und auf Google etwa sieben; der Amazon-Wert wird von der getakteten Zuspielung dominiert.",[27,562,564],{"id":563},"warum-azure-ai-speech-der-standard-bleibt","Warum Azure AI Speech der Standard bleibt",[20,566,567],{},"Drei Gründe, in der Reihenfolge, die den Ausschlag gab.",[20,569,570,573,574,579],{},[74,571,572],{},"1. Das Standard-Gateway ist Azure."," Eine Organisation, die kein Gateway ausgewählt hat, betreibt ihre KI-Funktionen auf Azure OpenAI in der EU Data Zone, sodass ihre Sprachnachrichten von Azure AI Speech im selben Tenant transkribiert werden. Kein zusätzlicher Unterauftragsverarbeiter, keine zusätzliche Region. Microsoft erklärt, dass Azure Speech Daten nicht außerhalb der Region der Speech-Ressource speichert oder verarbeitet (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"Regionen-Übersicht",", Stand September 2026); unsere Ressource befindet sich in Sweden Central, das für Fast Transcription gelistet ist.",[20,581,582,585,586,590],{},[74,583,584],{},"2. Die Form der API passt zu einer Sprachnachricht."," Eine Sprachnachricht in InterMIND kann bis zu zehn Minuten lang sein (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","Sprachnachrichten","). Die Fast Transcription von Azure nimmt die gesamte Aufnahme in einer einzigen Anfrage entgegen. Die synchrone Erkennung von Google endet bei 60 Sekunden, sodass eine zehnminütige Nachricht Batch-Erkennung über einen Storage-Bucket oder eine Streaming-Sitzung benötigt; Amazon Transcribe streamt, akzeptiert aber PCM, FLAC oder Ogg-Opus statt der Formate, in denen Telefone und Browser aufnehmen, sodass das Audio zunächst transkodiert werden muss. Beides ist lösbar — der Testaufbau löst es —, aber es sind mehr bewegliche Teile im Pfad jeder Nachricht.",[20,592,593,596],{},[74,594,595],{},"3. Die Zahlen sprechen nicht dagegen."," Bei 9 % gegenüber 10 % und 10 % ist keine Engine in diesem Set so viel besser, dass sich ein Umzug der Sprachnachrichten vom Standard-Gateway rechtfertigen würde. Hätten Google oder Amazon bei der halben Fehlerrate gelegen, würde dieser Beitrag das so sagen.",[27,598,600],{"id":599},"was-das-für-organisationen-auf-vertex-ai-oder-bedrock-bedeutet","Was das für Organisationen auf Vertex AI oder Bedrock bedeutet",[20,602,603],{},"Wenn Ihre Organisation Google Vertex AI oder Amazon Bedrock als Gateway ausgewählt hat, laufen Ihre KI-Funktionen dort. Sprachnachrichten kommen in diesen Organisationen derzeit als Aufnahme ohne Transkript an: Wir haben Google Cloud Speech-to-Text und Amazon Transcribe gemessen, wie dieser Beitrag zeigt, aber noch nicht in das Produkt eingebunden. Die Berechtigungen und der Integrationscode sind vorhanden; dieser Beitrag wird aktualisiert, sobald sie im Pfad jeder Nachricht liegen. Bis dahin ist eine Sprachnachricht in einer Vertex-AI- oder Bedrock-Organisation eine abspielbare Aufnahme; eine Organisation, die ihr Gateway zu Azure wechselt, erhält Transkripte für Nachrichten, die ab diesem Zeitpunkt gesendet werden.",[27,605,607],{"id":606},"faq","FAQ",[20,609,610],{},[74,611,612],{},"Welchen Speech-to-Text-Dienst verwendet InterMIND?",[20,614,615,616,554],{},"Für Sprachnachrichten im Chat: Azure AI Speech (Fast-Transcription-API) im eigenen Azure-Tenant von InterMIND in Sweden Central — der Sprachdienst des Standard-AI-Gateways. Live-Sprache in Meetings läuft über einen anderen Pfad: Sie läuft auf der eigenen Media-Engine von InterMIND, der Mind API, gehostet bei OVH in Frankreich, und kommt niemals mit einem Cloud-Sprachdienst in Berührung (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","wo ein Meeting tatsächlich läuft",[20,621,622],{},[74,623,624],{},"Ist Azure AI Speech genauer als Google Speech-to-Text oder Amazon Transcribe?",[20,626,627],{},"Bei unserem Set von 153 Sprachnachrichten-Clips in 17 Sprachen, gemessen am selben Tag mit demselben Testaufbau, hatte Azure AI Speech eine durchschnittliche Wortfehlerrate von 9 %, Google Cloud Speech-to-Text (Chirp 3) 10 % und Amazon Transcribe 10 %. Pro Sprache ändert sich die Reihenfolge: Azure lag bei Französisch, Englisch und Chinesisch vorn, Amazon Transcribe bei Arabisch, Google bei Russisch. Bei einem anderen Set von Aufnahmen kann die Rangfolge abweichen; die obige Tabelle ist der Beleg für unser Set.",[20,629,630],{},[74,631,632],{},"Was ist die Wortfehlerrate, und wie wurde sie hier berechnet?",[20,634,635],{},"Die Wortfehlerrate ist die Anzahl der ersetzten, eingefügten und gelöschten Wörter geteilt durch die Anzahl der Wörter im Referenztext. Vor dem Vergleich normalisieren wir Groß-\u002FKleinschreibung, Zeichensetzung und Leerzeichen und vergleichen Chinesisch und Japanisch pro Zeichen, da diese Schriftsysteme Wörter nicht durch Leerzeichen trennen. Eine Rate von 9 % bedeutet, dass etwa jedes elfte Wort vom Referenztext abweicht.",[20,637,638],{},[74,639,640],{},"Verlässt das Audio einer Sprachnachricht die EU?",[20,642,643,644,646,647,651,652,656],{},"Nein. Die Aufnahme wird im Objektspeicher von InterMIND innerhalb der EU gespeichert, und der Sprachdienst, der sie transkribiert, läuft in einer EU-Region: Sweden Central bei Azure, die ",[108,645,110],{},"-Multiregion bei Google Cloud, Frankfurt bei AWS. Die vollständige Liste der Beteiligten und Regionen finden Sie auf der ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","Seite der Unterauftragsverarbeiter"," und der ",[35,653,655],{"href":654},"\u002Ftrust","Trust-Seite",".",[20,658,659],{},[74,660,661],{},"Warum wird Sprache nicht clientseitig in der App erkannt, damit das Audio das Telefon nie verlässt?",[20,663,664],{},"Das haben wir im September 2026 ebenfalls gemessen. Der integrierte Erkennungsdienst von Chrome mit lokaler Verarbeitung erkannte 0 von 17 formellen Clips über die Produktsprachen hinweg, und die Sprachabdeckung clientseitiger Erkennungsdienste ist deutlich schmaler als die 17 Sprachen in der obigen Tabelle. Clientseitige Erkennung ist eine Richtung, die wir erneut messen, sobald sich die Plattformen weiterentwickeln; heute ist der Gateway-Pfad derjenige, der für jedes Mitglied in jeder Sprache funktioniert.",[20,666,667],{},[74,668,669],{},"Kann unsere Organisation wählen, welcher Sprachdienst ihre Sprachnachrichten transkribiert?",[20,671,672],{},"Nicht separat: Ein Organisationsadministrator wählt auf der Integrationsseite das KI-Gateway aus. Beim Standard-Gateway werden Sprachnachrichten von Azure AI Speech transkribiert. Bei Vertex AI und Amazon Bedrock werden Sprachnachrichten noch nicht transkribiert — siehe den Abschnitt oben.",[20,674,675],{},[74,676,677],{},"Wie lang darf eine Sprachnachricht sein, und begrenzt die API das?",[20,679,680],{},"Bis zu zehn Minuten. Die Fast Transcription von Azure akzeptiert Dateien bis zu 5 Stunden und 500 MB in einer einzigen Anfrage, sodass eine Nachricht in einem einzigen Aufruf transkribiert wird. Die synchrone Erkennung von Google akzeptiert 60 Sekunden und 10 MB, weshalb der Testaufbau die langen Clips an Sprechpausen in Stücke zerlegt hat.",[20,682,683],{},[74,684,685],{},"Warum wird dem Erkennungsdienst die Sprache des Sprechers mitgeteilt, anstatt sie zu erkennen?",[20,687,688],{},"Weil eine Sprachnachricht kurz ist. Bei einem vier Sekunden langen Clip kann die automatische Sprachidentifikation die falsche Sprache liefern — eine russische Testnachricht kam als Englisch zurück; die im Profil eines Mitglieds hinterlegte Sprache stimmt fast immer. Der Erkennungsdienst erhält diese Sprache, und nur wenn sie unbekannt ist, erhält er die Sprachen des Raums als Kandidaten.",[20,690,691],{},[74,692,693],{},"Wird das Meeting-Audio vom selben Dienst transkribiert?",[20,695,696,697,699,700,554],{},"Nein. Live-Sprache in einem Meeting wird auf der eigenen Engine von InterMIND (der Mind API) erkannt und übersetzt, auf dem Media-Server, der den Anruf trägt, gehostet bei OVH in Frankreich — siehe ",[35,698,619],{"href":618},". Das Cloud-Gateway sieht Text, niemals das Audio eines Anrufs (",[35,701,702],{"href":37},"Meeting-KI im eigenen Gateway",[20,704,705],{},[74,706,707],{},"Werden Sie die Ergebnisse erneut veröffentlichen?",[20,709,710],{},"Der Testaufbau läuft mit einem einzigen Befehl, und die Berechtigungen für jede Engine sind vorhanden, sodass die Tabelle erneut gemessen werden kann, sobald ein Anbieter ein neues Modell ausliefert. Wenn sich dadurch das Bild ändert, wird dieser Beitrag mit dem Datum aktualisiert.",[712,713],"hr",{},[27,715,717],{"id":716},"überzeugen-sie-sich-selbst","Überzeugen Sie sich selbst",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Lesen Sie, wie Sprachnachrichten funktionieren"," — Aufnahme, das Zehn-Minuten-Limit und wohin das Audio geht.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Sehen Sie sich die Liste der Unterauftragsverarbeiter an"," — Anbieter, Land, Zweck und Region für jede Partei, die Ihre Daten verarbeitet.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Testen Sie die Live-Demo"," — die Produktions-Übersetzungspipeline mit Ihrem eigenen Audio, ohne Anmeldung.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Quellen: Microsoft — Azure AI Speech Fast Transcription (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") und Tabelle der Speech-Regionen (",[35,759,756],{"href":576,"rel":760},[91],"); Google Cloud — Chirp-3-Modell (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), Limits der synchronen Erkennung (",[35,768,765],{"href":117,"rel":769},[91],") und unterstützte Sprachen (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — Amazon Transcribe Streaming (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), Endpunkte und Kontingente (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); alle Stand September 2026. Messung: InterMIND Speech Bench, 2026-09-16, 153 Clips, 17 Sprachen.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Wir haben die Speech-to-Text-Dienste der drei Cloud-Gateways, die einer InterMIND-Organisation zur Auswahl stehen — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) und Amazon Transcribe — an denselben 153 Sprachnotiz-Clips in 17 Sprachen, mit einem Test-Harness, an einem Tag gemessen. Wortfehlerraten pro Sprache, die Methodik, die Grenzen der einzelnen APIs und warum der Recogniser dem Gateway statt dem Leaderboard folgt.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","41fQiN4yAT3HoScsRD6Ngj1DBHi6p-RNGqzJspPBj_o",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Nur zahlen, wer es nutzt: InterMIND wechselt zur Abrechnung nach aktiven Mitgliedern","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Pro und Business verkaufen keine manuell zugewiesenen Arbeitsplätze mehr. Laden Sie Ihr gesamtes Team ein; bei jeder Verlängerung werden die Mitglieder gezählt, die in den vergangenen 28 Tagen aktiv waren, und nur diese werden berechnet. Ein inaktives Mitglied behält seinen Zugriff und kostet nichts; Meeting-Gäste und externe Channel-Teilnehmer bleiben kostenlos. Was als aktiv gilt, wie sich die Zahl innerhalb eines Abrechnungszyklus entwickelt, was im Schreiben vor der Verlängerung steht und was sich auf Ihrer Abrechnungsseite ändert.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Live-übersetzte Untertitel für das gesamte Publikum: Was Zoom, Teams und Google Meet erfordern und wie jeder Teilnehmer in seiner eigenen Sprache liest (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Ein Sprecher, ein Publikum in zehn Sprachen. Übersetzte Untertitel gibt es in Zoom, Microsoft Teams und Google Meet – jeweils hinter einer anderen Lizenz, und jede beantwortet dieselbe Frage anders: Wer entscheidet, in welchen Sprachen das Publikum lesen darf. Teams ermöglicht einem Town-Hall-Organisator die Vorauswahl von sechs Sprachen (zehn mit Teams Premium); die Sprachpaare bei Zoom werden durch die Kontoeinstellungen des Hosts festgelegt; Google Meet beschränkt übersetzte Untertitel auf kostenpflichtige Workspace-Editionen. Die dokumentierte Übersicht, sowie die Funktionsweise in InterMIND, bei der die Sprache der Untertitel eine Einstellung auf der Seite des Teilnehmers selbst ist und der Meeting-Raum zusätzlich per Sprache übersetzt wird."]