Azure AI Speech vs. Google Chirp 3 vs. Amazon Transcribe bei 153 Sprachnachrichten: Warum InterMIND Speech-to-Text im eigenen Cloud-Gateway Ihrer Organisation ausführt (2026)
Eine Sprachnachricht in einem InterMIND-Channel wird zu einer Textnachricht, die jedes Teammitglied in seiner eigenen Sprache liest. Der erste Schritt dabei ist Speech-to-Text, und die Frage, die wir von IT- und Compliance-Prüfern hören, lautet nicht „Wie genau ist es?“, sondern „Wessen Dienst ist es, und wohin geht das Audio?“
Die kurze Antwort: Azure AI Speech, der Sprachdienst des Standard-AI-Gateways, im eigenen Azure-Tenant von InterMIND in Sweden Central — sowie die Sprachdienste der beiden anderen Gateways, die eine Organisation wählen kann, gemessen an denselben Clips, damit die Wahl auf einer Zahl beruht und nicht auf einer Präferenz. Dieser Beitrag zeigt die Zahlen hinter dieser Wahl — dieselben 153 Clips durch Azure AI Speech, Google Cloud Speech-to-Text und Amazon Transcribe am selben Tag — sowie die zwei Fakten zu jeder API, die mehr zählen als ein Prozentpunkt Genauigkeit.
Die Regel zuerst: ein Gateway pro Organisation
Jede KI-Funktion in InterMIND — Meeting-Zusammenfassungen, Dokumentzusammenfassungen, der Schreibassistent, Ask AI und Mia im Meeting — läuft auf einem Sprachmodell-Gateway, das die Organisation auswählt: standardmäßig Azure OpenAI in der EU Data Zone, wahlweise Google Vertex AI am EU-Multiregion-Endpunkt oder Amazon Bedrock in Frankfurt, jeweils im eigenen Tenant von InterMIND. Die Begründung dafür haben wir in Meeting-KI im eigenen Cloud-Gateway erläutert: Für die meisten Organisationen steht dieses Gateway bereits auf der genehmigten Liste der Unterauftragsverarbeiter, sodass eine KI-Funktion kein neues Unternehmen zu dieser Liste hinzufügt.
Speech-to-Text für Sprachnachrichten folgt heute auf dem Standard-Gateway derselben Regel, und jedes der drei Gateways verfügt neben seinen Sprachmodellen über einen eigenen Sprachdienst — genau das misst dieser Beitrag:
| Gateway | Sprachdienst | In diesem Test verwendete Region | Wie die API eine Aufnahme entgegennimmt |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, Fast-Transcription-API | Sweden Central | Eine Anfrage für eine Datei bis zu 5 Stunden und 500 MB (Fast-Transcription-Dokumentation, Stand September 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, Chirp-3-Modell | eu-Multiregion | Die synchrone Erkennung ist auf 60 Sekunden und 10 MB begrenzt; längeres Audio läuft über Batch- oder Streaming-Erkennung (Sync-Limits, Chirp 3, Stand September 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, Streaming | eu-central-1 (Frankfurt) | Eine Streaming-Sitzung über HTTP/2 oder WebSocket; Eingabeformat PCM, FLAC oder Ogg-Opus (Streaming-Dokumentation, Stand September 2026) |
Dem Erkennungsdienst wird in jedem Fall die eigene Sprache des Sprechers mitgeteilt — die Sprache, die ein Mitglied in seinem Profil eingestellt hat —, weil sich die automatische Sprachidentifikation bei kurzen Clips in unseren Tests als unzuverlässig erwiesen hat: Eine vier Sekunden lange russische Nachricht kam als Englisch zurück. So ruft das Produkt Azure heute auf, und der Test ruft die beiden anderen Dienste auf dieselbe Weise auf.