[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-fr-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_fr\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe sur 153 notes vocales : pourquoi InterMIND exécute la transcription vocale sur la passerelle cloud de votre organisation (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-sur-153-notes-vocales-pourquoi-intermind-exécute-la-reconnaissance-vocale-sur-la-passerelle-cloud-propre-à-votre-organisation-2026","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe sur 153 notes vocales : pourquoi InterMIND exécute la reconnaissance vocale sur la passerelle cloud propre à votre organisation (2026)",[20,21,22],"p",{},"Une note vocale dans un canal InterMIND devient un message texte que chaque coéquipier lit dans sa propre langue. La première étape de ce processus est la reconnaissance vocale (speech-to-text), et la question que nous posent les équipes IT et conformité n'est pas « quelle est sa précision » mais « à qui appartient ce service, et où va l'audio ».",[20,24,25],{},"La réponse courte : Azure AI Speech, le service vocal de la passerelle IA par défaut, dans le tenant Azure propre à InterMIND en Sweden Central — ainsi que les services vocaux des deux autres passerelles qu'une organisation peut choisir, mesurés sur les mêmes extraits afin que le choix repose sur un chiffre, pas une préférence. Cet article présente les chiffres derrière ce choix — les mêmes 153 extraits passés par Azure AI Speech, Google Cloud Speech-to-Text et Amazon Transcribe le même jour — ainsi que les deux faits sur chaque API qui comptent plus qu'un point de pourcentage de précision.",[27,28,30],"h2",{"id":29},"la-règle-avant-tout-une-passerelle-par-organisation","La règle avant tout : une passerelle par organisation",[20,32,33,34,39],{},"Chaque fonctionnalité IA d'InterMIND — comptes rendus de réunion, résumés de documents, l'assistant de rédaction, Ask AI et Mia pendant la réunion — s'exécute sur une seule passerelle de modèle de langage choisie par l'organisation : Azure OpenAI dans l'EU Data Zone par défaut, Google Vertex AI sur le point de terminaison multirégional UE, ou Amazon Bedrock à Francfort au choix, chacune dans le tenant propre à InterMIND. Nous avons expliqué ce raisonnement dans ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","l'IA de réunion sur votre propre passerelle cloud"," : pour la plupart des organisations, cette passerelle figure déjà sur la liste des sous-traitants approuvés, si bien qu'une fonctionnalité IA n'ajoute aucune nouvelle entreprise à cette liste.",[20,41,42],{},"Aujourd'hui, la reconnaissance vocale des notes vocales suit la même règle sur la passerelle par défaut, et chacune des trois passerelles dispose d'un service vocal à côté de ses modèles de langage — c'est ce que cet article mesure :",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Passerelle",[53,57,58],{},"Service vocal",[53,60,61],{},"Région utilisée dans ce test",[53,63,64],{},"Comment l'API traite un enregistrement",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, API de transcription rapide",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Une seule requête pour un fichier jusqu'à 5 heures et 500 Mo (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","documentation de la transcription rapide",", vérifié en septembre 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, modèle Chirp 3",[71,106,107,108],{},"multirégion ",[109,110,111],"code",{},"eu",[71,113,114,115,120,121,93],{},"La reconnaissance synchrone est limitée à 60 secondes et 10 Mo ; les audios plus longs passent par la reconnaissance par lot ou en flux continu (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"limites de la reconnaissance synchrone",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, en flux continu",[71,138,139],{},"eu-central-1 (Francfort)",[71,141,142,143,93],{},"Une session en flux continu via HTTP\u002F2 ou WebSocket ; l'entrée est au format PCM, FLAC ou Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"documentation du streaming",[20,149,150],{},"Dans tous les cas, le moteur de reconnaissance reçoit la langue propre du locuteur — la langue que le membre a définie dans son profil — car l'identification automatique de la langue s'est révélée peu fiable sur des extraits courts lors de nos tests : une note russe de quatre secondes a été reconnue comme de l'anglais. C'est ainsi que le produit appelle Azure aujourd'hui, et le test appelle les deux autres services de la même manière.",[27,152,154],{"id":153},"ce-que-nous-avons-mesuré","Ce que nous avons mesuré",[20,156,157,160,161,165],{},[74,158,159],{},"L'échantillon."," 153 extraits dans 17 langues : 136 tours de dialogue — deux dialogues professionnels (une négociation de contrat et un point d'équipe quotidien) prononcés par les deux voix synthétiques du produit dans dix langues — plus 17 passages formels, les phrases professionnelles FLORES-200 de notre ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","benchmark public de traduction"," lues par une voix synthétique, une par langue, d'une durée de 71 à 109 secondes. Les tours de dialogue durent de 3 à 30 secondes, la longueur d'une note vocale réelle.",[20,167,168,171],{},[74,169,170],{},"La métrique."," Le taux d'erreur sur les mots (Word Error Rate, WER) par rapport au texte de référence — la proportion de mots substitués, insérés ou supprimés — après normalisation de la casse, de la ponctuation et des espaces ; le chinois et le japonais sont comparés au niveau du caractère. Le taux d'erreur sur les caractères a été relevé en parallèle et raconte la même histoire.",[20,173,174,177],{},[74,175,176],{},"Le banc de test."," Un script, une machine, une heure le 2026-09-16, chaque moteur passé sur les 153 extraits. Azure et Amazon Transcribe ont traité chaque extrait dans son intégralité. Le moteur de reconnaissance synchrone de Google se limite à 60 secondes, les 17 extraits formels ont donc été découpés aux silences en segments de moins de 55 secondes puis les transcriptions ont été assemblées ; les 136 extraits de dialogue ont été traités intégralement. Amazon Transcribe attend un audio au rythme temps réel, le banc de test l'a donc alimenté quatre fois plus vite que le temps réel ; le chiffre de latence ci-dessous est donc un plancher fixé par le débit d'alimentation, pas par le service.",[20,179,180,183],{},[74,181,182],{},"Ce que ceci n'est pas."," Des voix synthétiques dans un audio silencieux, pas des enregistrements de terrain captés par un téléphone dans une voiture. Une journée, une exécution par extrait. C'est une comparaison sur l'audio utilisé pour tester notre propre pipeline de traduction, dans les langues que nos utilisateurs écrivent — pas un classement.",[27,185,187],{"id":186},"résultats-taux-derreur-sur-les-mots-par-langue","Résultats : taux d'erreur sur les mots par langue",[20,189,190],{},"WER moyen sur les extraits de chaque langue ; chaque moteur a renvoyé une transcription pour les 153 extraits.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Langue",[53,201,202],{},"Extraits",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"Arabe",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"Chinois",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"Tchèque",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"Néerlandais",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"Anglais",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"Français",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"Allemand",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"Hindi",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"Hongrois",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"Italien",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"Japonais",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"Coréen",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"Polonais",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"Portugais (Brésil)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"Russe",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"Espagnol",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"Turc",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Les 153 extraits",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Tours de dialogue uniquement",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Passages formels uniquement",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Temps de traitement ÷ durée audio",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (limité par le débit d'alimentation)",[20,522,523],{},"Les langues ne comportant qu'un seul extrait (le passage formel uniquement) sont indiquées à titre indicatif ; un chiffre basé sur un seul extrait est un point de donnée, pas un taux.",[27,525,527],{"id":526},"ce-que-disent-les-chiffres","Ce que disent les chiffres",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"Sur l'ensemble de l'échantillon, les trois services se tiennent à un point de pourcentage près :"," 9 %, 10 % et 10 %. Chacun des 153 extraits a renvoyé une transcription pour chaque moteur — la couverture des 17 langues est complète sur les trois.",[532,539,540,543],{},[74,541,542],{},"Les différences se situent par langue, et dans les deux sens."," Azure affichait le taux d'erreur le plus bas en français (5 % contre 11 % et 12 %) et en allemand (7 % contre 9 % et 13 %), et était ex æquo au plus bas en anglais (2 %, avec Amazon Transcribe) et en chinois (3 %, avec Google). Amazon Transcribe était le plus bas en arabe (26 % contre 32 % et 46 %). Google était le plus bas en russe (10 % contre 14 % et 14 %), en portugais, en hongrois et en turc.",[532,545,546,549,550,554],{},[74,547,548],{},"L'arabe est difficile pour les trois."," Le meilleur résultat sur les extraits de dialogue en arabe est d'un mot sur quatre incorrect. C'est cohérent avec ce que nous avons constaté côté traduction, où nous avons retiré l'arabe du sélecteur de langues de réunion en août 2026 en attendant que la qualité atteigne notre seuil (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","combien de langues nous prenons en charge",").",[532,556,557,560],{},[74,558,559],{},"Le temps de traitement est largement inférieur au temps réel pour les trois."," Dans ce banc de test, une note de 30 secondes prend environ trois secondes sur Azure et environ sept sur Google ; le chiffre d'Amazon est dominé par le débit d'alimentation cadencé.",[27,562,564],{"id":563},"pourquoi-azure-ai-speech-reste-le-choix-par-défaut","Pourquoi Azure AI Speech reste le choix par défaut",[20,566,567],{},"Trois raisons, dans l'ordre qui a guidé ce choix.",[20,569,570,573,574,579],{},[74,571,572],{},"1. La passerelle par défaut est Azure."," Une organisation qui n'a pas choisi de passerelle exécute ses fonctionnalités IA sur Azure OpenAI dans l'EU Data Zone, ses notes vocales sont donc transcrites par Azure AI Speech dans le même tenant. Aucun sous-traitant supplémentaire, aucune région supplémentaire. Microsoft indique qu'Azure Speech ne stocke ni ne traite de données en dehors de la région de la ressource Speech (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"page des régions",", vérifié en septembre 2026) ; notre ressource se trouve en Sweden Central, une région répertoriée pour la transcription rapide.",[20,581,582,585,586,590],{},[74,583,584],{},"2. La forme de l'API convient à une note vocale."," Une note vocale InterMIND peut durer jusqu'à dix minutes (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","notes vocales","). La transcription rapide d'Azure prend l'enregistrement entier en une seule requête. La reconnaissance synchrone de Google s'arrête à 60 secondes, une note de dix minutes nécessite donc une reconnaissance par lot via un bucket de stockage ou une session en flux continu ; Amazon Transcribe fonctionne en flux continu, mais accepte du PCM, du FLAC ou de l'Ogg-Opus plutôt que les formats dans lesquels les téléphones et navigateurs enregistrent, l'audio doit donc d'abord être transcodé. Les deux problèmes sont résolubles — le banc de test les résout — mais ce sont autant de rouages supplémentaires sur le chemin de chaque note.",[20,592,593,596],{},[74,594,595],{},"3. Les chiffres ne plaident pas en sa défaveur."," À 9 % contre 10 % et 10 %, aucun moteur de cet échantillon n'est suffisamment meilleur pour justifier de déplacer les notes vocales hors de la passerelle par défaut. Si Google ou Amazon avait obtenu la moitié du taux d'erreur, cet article le dirait.",[27,598,600],{"id":599},"ce-que-cela-signifie-pour-les-organisations-sur-vertex-ai-ou-bedrock","Ce que cela signifie pour les organisations sur Vertex AI ou Bedrock",[20,602,603],{},"Si votre organisation a choisi Google Vertex AI ou Amazon Bedrock comme passerelle, vos fonctionnalités IA s'y exécutent. Dans ces organisations, les notes vocales arrivent actuellement sous forme d'enregistrement sans transcription : nous avons mesuré Google Cloud Speech-to-Text et Amazon Transcribe, comme le montre cet article, mais nous ne les avons pas encore intégrés au produit. Les autorisations et le code d'intégration existent déjà ; cet article sera mis à jour lorsqu'ils seront sur le chemin de chaque note. D'ici là, une note vocale dans une organisation Vertex AI ou Bedrock reste un enregistrement lisible ; une organisation qui bascule sa passerelle vers Azure obtient des transcriptions sur les notes envoyées à partir de ce moment.",[27,605,607],{"id":606},"faq","FAQ",[20,609,610],{},[74,611,612],{},"Quel service de reconnaissance vocale InterMIND utilise-t-il ?",[20,614,615,616,554],{},"Pour les notes vocales dans le chat, Azure AI Speech (API de transcription rapide) dans le tenant Azure propre à InterMIND en Sweden Central — le service vocal de la passerelle IA par défaut. La voix en direct pendant les réunions suit un chemin différent : elle s'exécute sur le moteur multimédia propre à InterMIND, la Mind API, hébergée chez OVH en France, et ne touche jamais un service vocal cloud (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","où se déroule réellement une réunion",[20,621,622],{},[74,623,624],{},"Azure AI Speech est-il plus précis que Google Speech-to-Text ou Amazon Transcribe ?",[20,626,627],{},"Sur notre échantillon de 153 extraits de notes vocales en 17 langues, mesuré le même jour avec le même banc de test, Azure AI Speech a obtenu un taux d'erreur moyen sur les mots de 9 %, Google Cloud Speech-to-Text (Chirp 3) de 10 % et Amazon Transcribe de 10 %. Par langue, le classement change : Azure était le plus bas en français, en anglais et en chinois, Amazon Transcribe en arabe, Google en russe. Sur un autre échantillon d'enregistrements, le classement peut différer ; le tableau ci-dessus constitue la preuve pour le nôtre.",[20,629,630],{},[74,631,632],{},"Qu'est-ce que le taux d'erreur sur les mots, et comment a-t-il été calculé ici ?",[20,634,635],{},"Le taux d'erreur sur les mots est le nombre de mots substitués, insérés et supprimés divisé par le nombre de mots du texte de référence. Nous normalisons la casse, la ponctuation et les espaces avant la comparaison, et nous comparons le chinois et le japonais au niveau du caractère car ces écritures ne séparent pas les mots par des espaces. Un taux de 9 % signifie qu'environ un mot sur onze diffère de la référence.",[20,637,638],{},[74,639,640],{},"L'audio d'une note vocale sort-il de l'UE ?",[20,642,643,644,646,647,651,652,656],{},"Non. L'enregistrement est stocké dans le stockage objet d'InterMIND dans l'UE, et le service vocal qui le transcrit s'exécute dans une région de l'UE : Sweden Central sur Azure, la multirégion ",[109,645,111],{}," sur Google Cloud, Francfort sur AWS. La liste complète des parties et des régions figure sur la ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","page des sous-traitants"," et la ",[35,653,655],{"href":654},"\u002Ftrust","page de confiance",".",[20,658,659],{},[74,660,661],{},"Pourquoi ne pas reconnaître la voix côté client, dans l'application, pour que l'audio ne quitte jamais le téléphone ?",[20,663,664],{},"Nous avons aussi mesuré cela, en septembre 2026. Le moteur de reconnaissance intégré à Chrome, avec traitement local, n'a reconnu correctement 0 des 17 extraits formels dans les langues du produit, et la couverture linguistique des moteurs de reconnaissance côté client est bien plus restreinte que les 17 langues du tableau ci-dessus. La reconnaissance côté client est une piste que nous réévaluons à mesure que les plateformes progressent ; aujourd'hui, le chemin par la passerelle est celui qui fonctionne pour chaque membre dans chaque langue.",[20,666,667],{},[74,668,669],{},"Notre organisation peut-elle choisir quel service vocal transcrit ses notes vocales ?",[20,671,672],{},"Pas séparément : c'est la passerelle IA que l'administrateur de l'organisation choisit sur la page Intégrations. Sur la passerelle par défaut, les notes vocales sont transcrites par Azure AI Speech. Sur Vertex AI et Amazon Bedrock, les notes vocales ne sont pas encore transcrites — voir la section ci-dessus.",[20,674,675],{},[74,676,677],{},"Quelle est la durée maximale d'une note vocale, et l'API la limite-t-elle ?",[20,679,680],{},"Jusqu'à dix minutes. La transcription rapide d'Azure accepte des fichiers jusqu'à 5 heures et 500 Mo en une seule requête, une note est donc transcrite en un seul appel. La reconnaissance synchrone de Google accepte 60 secondes et 10 Mo, c'est pourquoi le banc de test a découpé les extraits longs en segments aux silences.",[20,682,683],{},[74,684,685],{},"Pourquoi le moteur de reconnaissance reçoit-il la langue du locuteur plutôt que de la détecter ?",[20,687,688],{},"Parce qu'une note vocale est courte. Sur un extrait de quatre secondes, l'identification automatique de la langue peut renvoyer la mauvaise langue — une note de test en russe a été reconnue comme de l'anglais ; la langue du profil d'un membre est correcte presque à chaque fois. Le moteur de reconnaissance reçoit cette langue, et ce n'est que lorsqu'elle est inconnue qu'il reçoit les langues du canal comme candidates.",[20,690,691],{},[74,692,693],{},"L'audio de réunion est-il transcrit par le même service ?",[20,695,696,697,699,700,554],{},"Non. La voix en direct pendant une réunion est reconnue et traduite sur le moteur propre à InterMIND (la Mind API) sur le serveur multimédia qui porte l'appel, hébergé chez OVH en France — voir ",[35,698,619],{"href":618},". La passerelle cloud voit du texte, jamais l'audio d'un appel (",[35,701,702],{"href":37},"l'IA de réunion sur votre propre passerelle",[20,704,705],{},[74,706,707],{},"Publierez-vous à nouveau les résultats ?",[20,709,710],{},"Le banc de test s'exécute sur une seule commande, et les autorisations de chaque moteur sont en place, ce qui permet de refaire les mesures du tableau quand un fournisseur publie un nouveau modèle. Si le résultat change, cet article est mis à jour avec la date.",[712,713],"hr",{},[27,715,717],{"id":716},"à-vous-de-voir","À vous de voir",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Découvrez comment fonctionnent les notes vocales"," — l'enregistrement, la limite de dix minutes, et la destination de l'audio.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Consultez la liste des sous-traitants"," — fournisseur, pays, finalité et région pour chaque partie qui traite vos données.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Essayez la démo en direct"," — le pipeline de traduction de production sur votre propre audio, sans inscription.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Sources : Microsoft — transcription rapide d'Azure AI Speech (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") et tableau des régions Speech (",[35,759,756],{"href":576,"rel":760},[91],") ; Google Cloud — modèle Chirp 3 (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), limites de la reconnaissance synchrone (",[35,768,765],{"href":117,"rel":769},[91],") et langues prises en charge (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],") ; AWS — Amazon Transcribe en flux continu (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), points de terminaison et quotas (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],") ; tout vérifié en septembre 2026. Mesure : banc de test vocal InterMIND, 2026-09-16, 153 extraits, 17 langues.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Nous avons mesuré les services de transcription vocale des trois passerelles cloud qu'une organisation InterMIND peut choisir — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) et Amazon Transcribe — sur les mêmes 153 extraits de notes vocales dans 17 langues, avec un seul outil de test, en une seule journée. Taux d'erreur par mot et par langue, la méthode, les limites de chaque API, et pourquoi le module de reconnaissance suit la passerelle plutôt que le classement.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","5Su_YXS04dMT99b5IP_TRBSBoGskEydn8lLPCUiLkIE",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Payez uniquement pour les personnes qui l'utilisent : InterMIND passe à la facturation par membre actif","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Les offres Pro et Business cessent de vendre des sièges attribués manuellement. Invitez toute votre équipe ; chaque renouvellement comptabilise les membres actifs au cours des 28 jours précédents et ne facture qu'eux. Un membre qui devient inactif conserve son accès et ne coûte rien ; les invités aux réunions et les participants externes aux canaux restent gratuits. Ce qui est considéré comme actif, comment le nombre évolue au cours d'un cycle de facturation, ce que dit le courrier avant le renouvellement et ce qui change sur votre page de facturation.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Sous-titres traduits en direct pour tout l'auditoire : ce que Zoom, Teams et Google Meet exigent, et comment chaque participant lit dans sa propre langue (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Un orateur, un auditoire dans dix langues. Les sous-titres traduits existent dans Zoom, Microsoft Teams et Google Meet — chacun derrière une licence différente, et chacun répondant différemment à la même question : qui décide dans quelles langues l'auditoire peut lire. Teams permet à un organisateur de réunion publique de présélectionner six langues (dix avec Teams Premium) ; les paires de Zoom sont définies par les paramètres du compte de l'hôte ; Google Meet limite les sous-titres traduits aux éditions Workspace payantes. La cartographie documentée, ainsi que son fonctionnement dans InterMIND, où la langue des sous-titres est un paramètre du côté du participant lui-même et où la salle est également traduite par la voix."]