Architectuur

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe op 153 spraaknotities: waarom InterMIND spraak-naar-tekst uitvoert op de eigen cloudgateway van uw organisatie (2026)

We maten de spraak-naar-tekst-diensten van de drie cloudgateways die een InterMIND-organisatie kan kiezen — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) en Amazon Transcribe — op dezelfde 153 spraaknotitie-fragmenten in 17 talen, één testomgeving, één dag. Woordfoutpercentages per taal, de methode, de beperkingen van elke API, en waarom de herkenningsengine de gateway volgt in plaats van het klassement.

The Mind.com Team

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe op 153 spraaknotities: waarom InterMIND spraak-naar-tekst uitvoert op de eigen cloudgateway van uw organisatie (2026)

Azure AI Speech versus Google Chirp 3 versus Amazon Transcribe op 153 spraakberichten: waarom InterMIND spraak-naar-tekst uitvoert op de eigen cloudgateway van uw organisatie (2026)

Een spraakbericht in een InterMIND-kanaal wordt een tekstbericht dat elk teamlid in zijn of haar eigen taal leest. De eerste stap daarin is spraak-naar-tekst, en de vraag die we van IT- en compliancebeoordelaars krijgen, is niet "hoe nauwkeurig is het", maar "van wie is de dienst, en waar gaat de audio naartoe".

Het korte antwoord: Azure AI Speech, de spraakdienst van de standaard-AI-gateway, in InterMINDs eigen Azure-tenant in Sweden Central — en de spraakdiensten van de twee andere gateways die een organisatie kan kiezen, gemeten op dezelfde clips zodat de keuze een getal is, geen voorkeur. Deze post laat de cijfers achter die keuze zien — dezelfde 153 clips door Azure AI Speech, Google Cloud Speech-to-Text en Amazon Transcribe op dezelfde dag — en de twee feiten over elke API die zwaarder wegen dan een procentpunt nauwkeurigheid.

De regel komt eerst: één gateway per organisatie

Elke AI-functie in InterMIND — meetingsamenvattingen, documentsamenvattingen, de schrijfassistent, Ask AI en Mia tijdens de meeting — draait op één taalmodel-gateway die de organisatie kiest: standaard Azure OpenAI in de EU Data Zone, naar keuze Google Vertex AI op het EU-multiregio-eindpunt of Amazon Bedrock in Frankfurt, telkens in InterMINDs eigen tenant. We hebben de redenering uitgelegd in Meeting-AI op uw eigen cloudgateway: voor de meeste organisaties staat die gateway al op de goedgekeurde lijst van subverwerkers, dus voegt een AI-functie geen nieuw bedrijf aan die lijst toe.

Spraak-naar-tekst voor spraakberichten volgt vandaag dezelfde regel op de standaardgateway, en elk van de drie gateways heeft een spraakdienst naast zijn taalmodellen — en dat is wat deze post meet:

GatewaySpraakdienstRegio gebruikt in deze testHoe de API een opname verwerkt
Azure OpenAI (Microsoft)Azure AI Speech, fast transcription-APISweden CentralEén verzoek voor een bestand tot 5 uur en 500 MB (documentatie fast transcription, gecontroleerd september 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, Chirp 3-modeleu-multiregioSynchrone herkenning is beperkt tot 60 seconden en 10 MB; langere audio gaat via batch- of streamingherkenning (synchrone limieten, Chirp 3, gecontroleerd september 2026)
Amazon Bedrock (AWS)Amazon Transcribe, streamingeu-central-1 (Frankfurt)Een streamingsessie via HTTP/2 of WebSocket; invoer is PCM, FLAC of Ogg-Opus (documentatie streaming, gecontroleerd september 2026)

De herkenner krijgt in elk geval de eigen taal van de spreker te horen — de taal die een lid in zijn of haar profiel heeft ingesteld — omdat automatische taalherkenning in onze tests onbetrouwbaar bleek bij korte clips: een Russisch bericht van vier seconden kwam terug als Engels. Zo roept het product Azure vandaag aan, en op dezelfde manier roept de test de andere twee aan.

Wat we hebben gemeten

De set. 153 clips in 17 talen: 136 dialoogbeurten — twee zakelijke dialogen (een contractonderhandeling en een dagelijkse stand-up) ingesproken door de twee synthetische stemmen van het product in tien talen — plus 17 formele passages, de FLORES-200-zakelijke zinnen uit onze publieke vertaalbenchmark voorgelezen door een synthetische stem, één per taal en 71 tot 109 seconden lang. De dialoogbeurten duren 3 tot 30 seconden, de lengte van een echt spraakbericht.

De metriek. Word error rate (WER) ten opzichte van de referentietekst — het aandeel woorden dat is vervangen, toegevoegd of weggelaten — na normalisatie van hoofdlettergebruik, interpunctie en witruimte; Chinees en Japans worden per teken vergeleken. De character error rate werd er parallel bij bijgehouden en vertelt hetzelfde verhaal.

De testopstelling. Eén script, één machine, één uur op 2026-09-16, elke engine over alle 153 clips. Azure en Amazon Transcribe verwerkten elke clip in zijn geheel. Googles synchrone herkenner accepteert maximaal 60 seconden, dus de 17 formele clips werden bij stiltes in stukken onder de 55 seconden geknipt en de transcripten weer samengevoegd; de 136 dialoogclips werden in hun geheel verwerkt. Amazon Transcribe wil audio op realtime-tempo, dus de testopstelling voerde het vier keer sneller dan realtime aan; het onderstaande latentiecijfer is daarom een ondergrens die door de aanvoer wordt bepaald, niet door de dienst.

Wat dit niet is. Synthetische stemmen in rustige audio, geen praktijkopnames van een telefoon in een auto. Eén dag, één run per clip. Het is een vergelijking op de audio waarop onze eigen vertaalpijplijn wordt getest, in de talen waarin onze gebruikers schrijven — geen ranglijst.

Resultaten: word error rate per taal

Gemiddelde WER op de clips van elke taal; elke engine leverde voor alle 153 clips een transcript.

TaalClipsAzure AI SpeechGoogle Chirp 3Amazon Transcribe
Arabisch1332%46%26%
Chinees133%3%8%
Tsjechisch11%2%3%
Nederlands12%2%3%
Engels212%5%2%
Frans135%11%12%
Duits137%9%13%
Hindi1310%10%12%
Hongaars19%7%8%
Italiaans11%1%3%
Japans136%5%5%
Koreaans19%11%11%
Pools11%1%2%
Portugees (Brazilië)135%4%6%
Russisch2114%10%14%
Spaans136%5%6%
Turks14%3%4%
Alle 153 clips1539%10%10%
Alleen dialoogbeurten1369%11%10%
Alleen formele passages174%5%5%
Verwerkingstijd ÷ audioduur0,100,220,41 (beperkt door aanvoer)

Talen met slechts één clip (alleen de formele passage) worden voor de volledigheid getoond; een cijfer op basis van één clip is een datapunt, geen percentage.

Wat de cijfers zeggen

  • Over de hele set zitten de drie diensten binnen één procentpunt van elkaar: 9%, 10% en 10%. Elk van de 153 clips leverde bij elke engine een transcript op — de dekking van de 17 talen is bij alle drie compleet.
  • De verschillen zitten per taal, en die gaan beide kanten op. Azure had het laagste foutenpercentage bij Frans (5% tegenover 11% en 12%) en Duits (7% tegenover 9% en 13%), en deelde de laagste plek bij Engels (2%, samen met Amazon Transcribe) en Chinees (3%, samen met Google). Amazon Transcribe scoorde het laagst bij Arabisch (26% tegenover 32% en 46%). Google scoorde het laagst bij Russisch (10% tegenover 14% en 14%), Portugees, Hongaars en Turks.
  • Arabisch is voor alle drie lastig. Het beste resultaat op de Arabische dialoogclips is één op de vier woorden fout. Dat komt overeen met wat we aan de vertaalkant zagen, waar we Arabisch in augustus 2026 uit de taalkeuze voor meetings hebben teruggetrokken totdat de kwaliteit onze lat haalt (hoeveel talen we ondersteunen).
  • De verwerkingstijd ligt bij alle drie ruim onder realtime. Een bericht van 30 seconden duurt in deze testopstelling ongeveer drie seconden op Azure en ongeveer zeven op Google; het cijfer voor Amazon wordt bepaald door de vertraagde aanvoer.

Waarom Azure AI Speech de standaard blijft

Drie redenen, in de volgorde die de doorslag gaf.

1. De standaardgateway is Azure. Een organisatie die geen gateway heeft gekozen, draait haar AI-functies op Azure OpenAI in de EU Data Zone, waardoor haar spraakberichten worden getranscribeerd door Azure AI Speech in dezelfde tenant. Geen extra subverwerker, geen extra regio. Microsoft geeft aan dat Azure Speech geen gegevens opslaat of verwerkt buiten de regio van de Speech-resource (regiopagina, gecontroleerd september 2026); onze resource bevindt zich in Sweden Central, wat vermeld staat voor fast transcription.

2. De vorm van de API past bij een spraakbericht. Een spraakbericht in InterMIND kan tot tien minuten lang zijn (spraakberichten). Azures fast transcription verwerkt de hele opname in één verzoek. Googles synchrone herkenning stopt bij 60 seconden, dus een bericht van tien minuten vereist batchherkenning via een storage bucket of een streamingsessie; Amazon Transcribe streamt, maar accepteert PCM, FLAC of Ogg-Opus in plaats van de formaten waarin telefoons en browsers opnemen, waardoor de audio eerst wordt getranscodeerd. Beide zijn oplosbaar — de testopstelling lost ze op — maar het zijn meer bewegende onderdelen in het pad van elk bericht.

3. De cijfers pleiten er niet tegen. Met 9% tegenover 10% en 10% is geen enkele engine in deze set genoeg beter om te rechtvaardigen dat spraakberichten van de standaardgateway worden gehaald. Als Google of Amazon op de helft van het foutenpercentage was uitgekomen, zou deze post dat zeggen.

Wat dit betekent voor organisaties op Vertex AI of Bedrock

Als uw organisatie Google Vertex AI of Amazon Bedrock als gateway heeft gekozen, draaien uw AI-functies daar. Spraakberichten in die organisaties komen momenteel binnen als een opname zonder transcript: we hebben Google Cloud Speech-to-Text en Amazon Transcribe gemeten, zoals deze post laat zien, maar hebben ze nog niet in het product geïntegreerd. De rechten en de integratiecode zijn er al; deze post wordt bijgewerkt zodra ze in het pad van elk bericht zitten. Tot die tijd is een spraakbericht in een Vertex AI- of Bedrock-organisatie een afspeelbare opname; een organisatie die haar gateway naar Azure omzet, krijgt vanaf dat moment transcripten bij de verzonden berichten.

FAQ

Welke spraak-naar-tekstdienst gebruikt InterMIND?

Voor spraakberichten in chat: Azure AI Speech (fast transcription-API) in InterMINDs eigen Azure-tenant in Sweden Central — de spraakdienst van de standaard-AI-gateway. Live spraak in meetings volgt een ander pad: dat draait op InterMINDs eigen media-engine, de Mind API, gehost bij OVH in Frankrijk, en komt nooit in aanraking met een cloud-spraakdienst (waar één meeting daadwerkelijk draait).

Is Azure AI Speech nauwkeuriger dan Google Speech-to-Text of Amazon Transcribe?

Op onze set van 153 spraakbericht-clips in 17 talen, op dezelfde dag met dezelfde testopstelling gemeten, had Azure AI Speech een gemiddelde word error rate van 9%, Google Cloud Speech-to-Text (Chirp 3) 10% en Amazon Transcribe 10%. Per taal verandert de volgorde: Azure scoorde het laagst bij Frans, Engels en Chinees, Amazon Transcribe bij Arabisch, Google bij Russisch. Op een andere set opnames kan de rangschikking anders uitvallen; de tabel hierboven is het bewijs voor de onze.

Wat is word error rate, en hoe is die hier berekend?

Word error rate is het aantal vervangen, toegevoegde en weggelaten woorden gedeeld door het aantal woorden in de referentietekst. We normaliseren hoofdlettergebruik, interpunctie en witruimte voordat we vergelijken, en vergelijken Chinees en Japans per teken omdat die schriften woorden niet met spaties scheiden. Een percentage van 9% betekent dat ruwweg één op de elf woorden afwijkt van de referentie.

Verlaat de audio van een spraakbericht de EU?

Nee. De opname wordt opgeslagen in InterMINDs objectopslag in de EU, en de spraakdienst die deze transcribeert, draait in een EU-regio: Sweden Central bij Azure, de eu-multiregio bij Google Cloud, Frankfurt bij AWS. De volledige lijst van partijen en regio's staat op de pagina met subverwerkers en de trustpagina.

Waarom wordt spraak niet client-side herkend, in de app, zodat de audio de telefoon nooit verlaat?

Dat hebben we ook gemeten, in september 2026. De ingebouwde herkenner van Chrome met lokale verwerking herkende 0 van de 17 formele clips over de producttalen heen, en de taaldekking van client-side herkenners is veel smaller dan de 17 talen in de tabel hierboven. Client-side herkenning is een richting die we opnieuw meten naarmate de platforms verbeteren; vandaag is het gatewaypad datgene wat voor elk lid in elke taal werkt.

Kan onze organisatie kiezen welke spraakdienst haar spraakberichten transcribeert?

Niet apart: de AI-gateway is wat een organisatiebeheerder kiest op de Integraties-pagina. Op de standaardgateway worden spraakberichten getranscribeerd door Azure AI Speech. Bij Vertex AI en Amazon Bedrock worden spraakberichten nog niet getranscribeerd — zie de sectie hierboven.

Hoe lang mag een spraakbericht zijn, en beperkt de API dat?

Tot tien minuten. Azures fast transcription accepteert bestanden tot 5 uur en 500 MB in één verzoek, dus een bericht wordt in één aanroep getranscribeerd. Googles synchrone herkenning accepteert 60 seconden en 10 MB, en daarom knipte de testopstelling de lange clips bij stiltes in stukken.

Waarom krijgt de herkenner de taal van de spreker te horen in plaats van die te detecteren?

Omdat een spraakbericht kort is. Bij een clip van vier seconden kan automatische taalherkenning de verkeerde taal opleveren — een Russisch testbericht kwam terug als Engels; de profieltaal van een lid klopt bijna altijd. De herkenner krijgt die taal, en alleen wanneer die onbekend is, krijgt hij de talen van de ruimte als kandidaten.

Wordt de meetingaudio door dezelfde dienst getranscribeerd?

Nee. Live spraak in een meeting wordt herkend en vertaald op InterMINDs eigen engine (de Mind API) op de mediaserver die het gesprek draagt, gehost bij OVH in Frankrijk — zie waar één meeting daadwerkelijk draait. De cloudgateway ziet tekst, nooit de audio van een gesprek (meeting-AI op uw eigen gateway).

Publiceert u de resultaten opnieuw?

De testopstelling draait met één commando, en de rechten voor elke engine staan klaar, dus de tabel kan opnieuw worden gemeten zodra een leverancier een nieuw model uitbrengt. Wanneer dat het beeld verandert, wordt deze post bijgewerkt met de datum.


Overtuig uzelf


Bronnen: Microsoft — Azure AI Speech fast transcription (learn.microsoft.com) en Speech-regiotabel (learn.microsoft.com); Google Cloud — Chirp 3-model (docs.cloud.google.com), limieten voor synchrone herkenning (docs.cloud.google.com) en ondersteunde talen (docs.cloud.google.com); AWS — Amazon Transcribe streaming (docs.aws.amazon.com), eindpunten en quota's (docs.aws.amazon.com) en ondersteunde talen (docs.aws.amazon.com); allemaal gecontroleerd in september 2026. Meting: InterMIND speech bench, 2026-09-16, 153 clips, 17 talen.

Ontvang nieuwe berichten en productupdates via e-mail

Eén e-mail per maand met nieuwe berichten en productupdates. U kunt zich op elk moment afmelden.