Azure AI Speech versus Google Chirp 3 versus Amazon Transcribe op 153 spraakberichten: waarom InterMIND spraak-naar-tekst uitvoert op de eigen cloudgateway van uw organisatie (2026)
Een spraakbericht in een InterMIND-kanaal wordt een tekstbericht dat elk teamlid in zijn of haar eigen taal leest. De eerste stap daarin is spraak-naar-tekst, en de vraag die we van IT- en compliancebeoordelaars krijgen, is niet "hoe nauwkeurig is het", maar "van wie is de dienst, en waar gaat de audio naartoe".
Het korte antwoord: Azure AI Speech, de spraakdienst van de standaard-AI-gateway, in InterMINDs eigen Azure-tenant in Sweden Central — en de spraakdiensten van de twee andere gateways die een organisatie kan kiezen, gemeten op dezelfde clips zodat de keuze een getal is, geen voorkeur. Deze post laat de cijfers achter die keuze zien — dezelfde 153 clips door Azure AI Speech, Google Cloud Speech-to-Text en Amazon Transcribe op dezelfde dag — en de twee feiten over elke API die zwaarder wegen dan een procentpunt nauwkeurigheid.
De regel komt eerst: één gateway per organisatie
Elke AI-functie in InterMIND — meetingsamenvattingen, documentsamenvattingen, de schrijfassistent, Ask AI en Mia tijdens de meeting — draait op één taalmodel-gateway die de organisatie kiest: standaard Azure OpenAI in de EU Data Zone, naar keuze Google Vertex AI op het EU-multiregio-eindpunt of Amazon Bedrock in Frankfurt, telkens in InterMINDs eigen tenant. We hebben de redenering uitgelegd in Meeting-AI op uw eigen cloudgateway: voor de meeste organisaties staat die gateway al op de goedgekeurde lijst van subverwerkers, dus voegt een AI-functie geen nieuw bedrijf aan die lijst toe.
Spraak-naar-tekst voor spraakberichten volgt vandaag dezelfde regel op de standaardgateway, en elk van de drie gateways heeft een spraakdienst naast zijn taalmodellen — en dat is wat deze post meet:
| Gateway | Spraakdienst | Regio gebruikt in deze test | Hoe de API een opname verwerkt |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription-API | Sweden Central | Eén verzoek voor een bestand tot 5 uur en 500 MB (documentatie fast transcription, gecontroleerd september 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, Chirp 3-model | eu-multiregio | Synchrone herkenning is beperkt tot 60 seconden en 10 MB; langere audio gaat via batch- of streamingherkenning (synchrone limieten, Chirp 3, gecontroleerd september 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | Een streamingsessie via HTTP/2 of WebSocket; invoer is PCM, FLAC of Ogg-Opus (documentatie streaming, gecontroleerd september 2026) |
De herkenner krijgt in elk geval de eigen taal van de spreker te horen — de taal die een lid in zijn of haar profiel heeft ingesteld — omdat automatische taalherkenning in onze tests onbetrouwbaar bleek bij korte clips: een Russisch bericht van vier seconden kwam terug als Engels. Zo roept het product Azure vandaag aan, en op dezelfde manier roept de test de andere twee aan.