Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe sur 153 notes vocales : pourquoi InterMIND exécute la reconnaissance vocale sur la passerelle cloud propre à votre organisation (2026)
Une note vocale dans un canal InterMIND devient un message texte que chaque coéquipier lit dans sa propre langue. La première étape de ce processus est la reconnaissance vocale (speech-to-text), et la question que nous posent les équipes IT et conformité n'est pas « quelle est sa précision » mais « à qui appartient ce service, et où va l'audio ».
La réponse courte : Azure AI Speech, le service vocal de la passerelle IA par défaut, dans le tenant Azure propre à InterMIND en Sweden Central — ainsi que les services vocaux des deux autres passerelles qu'une organisation peut choisir, mesurés sur les mêmes extraits afin que le choix repose sur un chiffre, pas une préférence. Cet article présente les chiffres derrière ce choix — les mêmes 153 extraits passés par Azure AI Speech, Google Cloud Speech-to-Text et Amazon Transcribe le même jour — ainsi que les deux faits sur chaque API qui comptent plus qu'un point de pourcentage de précision.
La règle avant tout : une passerelle par organisation
Chaque fonctionnalité IA d'InterMIND — comptes rendus de réunion, résumés de documents, l'assistant de rédaction, Ask AI et Mia pendant la réunion — s'exécute sur une seule passerelle de modèle de langage choisie par l'organisation : Azure OpenAI dans l'EU Data Zone par défaut, Google Vertex AI sur le point de terminaison multirégional UE, ou Amazon Bedrock à Francfort au choix, chacune dans le tenant propre à InterMIND. Nous avons expliqué ce raisonnement dans l'IA de réunion sur votre propre passerelle cloud : pour la plupart des organisations, cette passerelle figure déjà sur la liste des sous-traitants approuvés, si bien qu'une fonctionnalité IA n'ajoute aucune nouvelle entreprise à cette liste.
Aujourd'hui, la reconnaissance vocale des notes vocales suit la même règle sur la passerelle par défaut, et chacune des trois passerelles dispose d'un service vocal à côté de ses modèles de langage — c'est ce que cet article mesure :
| Passerelle | Service vocal | Région utilisée dans ce test | Comment l'API traite un enregistrement |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, API de transcription rapide | Sweden Central | Une seule requête pour un fichier jusqu'à 5 heures et 500 Mo (documentation de la transcription rapide, vérifié en septembre 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, modèle Chirp 3 | multirégion eu | La reconnaissance synchrone est limitée à 60 secondes et 10 Mo ; les audios plus longs passent par la reconnaissance par lot ou en flux continu (limites de la reconnaissance synchrone, Chirp 3, vérifié en septembre 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, en flux continu | eu-central-1 (Francfort) | Une session en flux continu via HTTP/2 ou WebSocket ; l'entrée est au format PCM, FLAC ou Ogg-Opus (documentation du streaming, vérifié en septembre 2026) |
Dans tous les cas, le moteur de reconnaissance reçoit la langue propre du locuteur — la langue que le membre a définie dans son profil — car l'identification automatique de la langue s'est révélée peu fiable sur des extraits courts lors de nos tests : une note russe de quatre secondes a été reconnue comme de l'anglais. C'est ainsi que le produit appelle Azure aujourd'hui, et le test appelle les deux autres services de la même manière.