[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-es-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_es\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe en 153 notas de voz: por qué InterMIND ejecuta la transcripción de voz a texto en la pasarela en la nube propia de su organización (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-en-153-notas-de-voz-por-qué-intermind-ejecuta-la-conversión-de-voz-a-texto-en-la-puerta-de-enlace-en-la-nube-propia-de-su-organización-2026","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe en 153 notas de voz: por qué InterMIND ejecuta la conversión de voz a texto en la puerta de enlace en la nube propia de su organización (2026)",[20,21,22],"p",{},"Una nota de voz en un canal de InterMIND se convierte en un mensaje de texto que cada miembro del equipo lee en su propio idioma. El primer paso de ese proceso es la conversión de voz a texto, y la pregunta que nos hacen los responsables de TI y cumplimiento no es «qué tan precisa es», sino «de quién es el servicio y adónde va el audio».",[20,24,25],{},"La respuesta breve: Azure AI Speech, el servicio de voz de la puerta de enlace de IA predeterminada, en el tenant propio de InterMIND en Azure en Sweden Central, y los servicios de voz de las otras dos puertas de enlace que una organización puede elegir, medidos con los mismos clips para que la elección sea una cifra y no una preferencia. Esta publicación muestra las cifras detrás de esa elección —los mismos 153 clips procesados el mismo día por Azure AI Speech, Google Cloud Speech-to-Text y Amazon Transcribe— y los dos datos sobre cada API que importan más que un punto porcentual de precisión.",[27,28,30],"h2",{"id":29},"la-regla-viene-primero-una-puerta-de-enlace-por-organización","La regla viene primero: una puerta de enlace por organización",[20,32,33,34,39],{},"Todas las funciones de IA de InterMIND —los resúmenes de reuniones, los resúmenes de documentos, el asistente de redacción, Ask AI y Mia en la reunión— se ejecutan en una única puerta de enlace de modelos de lenguaje que la organización elige: Azure OpenAI en la EU Data Zone de forma predeterminada, Google Vertex AI en el endpoint multirregional de la UE o Amazon Bedrock en Frankfurt, a elección, cada una en el tenant propio de InterMIND. Explicamos el razonamiento en ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","La IA de reuniones en su propia puerta de enlace en la nube",": para la mayoría de las organizaciones, esa puerta de enlace ya está en la lista de subencargados aprobados, por lo que una función de IA no añade ninguna empresa nueva a la lista.",[20,41,42],{},"La conversión de voz a texto para las notas de voz sigue hoy la misma regla en la puerta de enlace predeterminada, y cada una de las tres puertas de enlace cuenta con un servicio de voz junto a sus modelos de lenguaje, que es justo lo que mide esta publicación:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Gateway",[53,57,58],{},"Servicio de voz",[53,60,61],{},"Región usada en esta prueba",[53,63,64],{},"Cómo recibe la API una grabación",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, API de transcripción rápida",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Una sola solicitud para un archivo de hasta 5 horas y 500 MB (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","documentación de transcripción rápida",", verificado en septiembre de 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, modelo Chirp 3",[71,106,107,108],{},"multirregión ",[109,110,111],"code",{},"eu",[71,113,114,115,120,121,93],{},"El reconocimiento síncrono está limitado a 60 segundos y 10 MB; el audio más largo pasa por reconocimiento por lotes o en streaming (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"límites de sincronización",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, streaming",[71,138,139],{},"eu-central-1 (Frankfurt)",[71,141,142,143,93],{},"Una sesión en streaming sobre HTTP\u002F2 o WebSocket; la entrada es PCM, FLAC u Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"documentación de streaming",[20,149,150],{},"En todos los casos se le indica al motor de reconocimiento el propio idioma de quien habla —el idioma que cada miembro configuró en su perfil— porque la identificación automática del idioma resultó poco fiable en clips cortos durante nuestras pruebas: una nota en ruso de cuatro segundos volvió transcrita como inglés. Así es como el producto llama hoy a Azure, y la prueba llama de la misma manera a los otros dos.",[27,152,154],{"id":153},"qué-medimos","Qué medimos",[20,156,157,160,161,165],{},[74,158,159],{},"El conjunto."," 153 clips en 17 idiomas: 136 turnos de diálogo —dos diálogos empresariales (una negociación de contrato y una reunión diaria de seguimiento) pronunciados por las dos voces sintéticas del producto en diez idiomas— más 17 pasajes formales, las frases empresariales de FLORES-200 de nuestro ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","benchmark de traducción público"," leídas por una voz sintética, una por idioma y de entre 71 y 109 segundos de duración. Los turnos de diálogo duran entre 3 y 30 segundos, la duración de una nota de voz real.",[20,167,168,171],{},[74,169,170],{},"La métrica."," La tasa de error de palabras (WER, por sus siglas en inglés) frente al texto de referencia —la fracción de palabras sustituidas, insertadas o eliminadas— tras normalizar mayúsculas\u002Fminúsculas, puntuación y espacios en blanco; el chino y el japonés se comparan por carácter. También se registró la tasa de error por carácter, y cuenta la misma historia.",[20,173,174,177],{},[74,175,176],{},"El arnés de prueba."," Un único script, una única máquina, una hora el 2026-09-16, cada motor procesando los 153 clips. Azure y Amazon Transcribe recibieron cada clip completo. El reconocimiento síncrono de Google admite como máximo 60 segundos, por lo que los 17 clips formales se cortaron en los silencios en fragmentos de menos de 55 segundos y las transcripciones se unieron; los 136 clips de diálogo se procesaron completos. Amazon Transcribe requiere el audio a un ritmo de tiempo real, por lo que el arnés se lo suministró cuatro veces más rápido que en tiempo real; por ello, la cifra de latencia indicada más abajo es un mínimo determinado por el suministro, no por el servicio.",[20,179,180,183],{},[74,181,182],{},"Lo que esto no es."," Voces sintéticas en audio silencioso, no grabaciones de campo desde un teléfono en un coche. Un día, una ejecución por clip. Es una comparación sobre el audio con el que se pone a prueba nuestro propio pipeline de traducción, en los idiomas en los que escriben nuestros usuarios, no una clasificación general.",[27,185,187],{"id":186},"resultados-tasa-de-error-de-palabras-por-idioma","Resultados: tasa de error de palabras por idioma",[20,189,190],{},"WER medio en los clips de cada idioma; los tres motores devolvieron una transcripción para los 153 clips.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Idioma",[53,201,202],{},"Clips",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"Árabe",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"Chino",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"Checo",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"Neerlandés",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"Inglés",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"Francés",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"Alemán",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"Hindi",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"Húngaro",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"Italiano",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"Japonés",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"Coreano",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"Polaco",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"Portugués (Brasil)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"Ruso",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"Español",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"Turco",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Los 153 clips",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Solo turnos de diálogo",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Solo pasajes formales",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Tiempo de procesamiento ÷ duración del audio",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (limitado por la alimentación)",[20,522,523],{},"Los idiomas con un solo clip (únicamente el pasaje formal) se muestran para tener el cuadro completo; una cifra basada en un solo clip es un dato puntual, no una tasa.",[27,525,527],{"id":526},"qué-dicen-las-cifras","Qué dicen las cifras",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"En el conjunto total, los tres servicios están dentro de un punto porcentual entre sí:"," 9 %, 10 % y 10 %. Los 153 clips obtuvieron transcripción de todos los motores; la cobertura de los 17 idiomas es completa en los tres.",[532,539,540,543],{},[74,541,542],{},"Las diferencias son por idioma, y van en ambos sentidos."," Azure tuvo la tasa de error más baja en francés (5 % frente a 11 % y 12 %) y en alemán (7 % frente a 9 % y 13 %), y empató en el primer puesto en inglés (2 %, junto con Amazon Transcribe) y en chino (3 %, junto con Google). Amazon Transcribe tuvo la tasa más baja en árabe (26 % frente a 32 % y 46 %). Google tuvo la tasa más baja en ruso (10 % frente a 14 % y 14 %), portugués, húngaro y turco.",[532,545,546,549,550,554],{},[74,547,548],{},"El árabe es difícil para los tres."," El mejor resultado en los clips de diálogo en árabe es una palabra de cada cuatro incorrecta. Esto es coherente con lo que observamos del lado de la traducción, donde retiramos el árabe del selector de idiomas de reunión en agosto de 2026 hasta que su calidad supere nuestro umbral (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","cuántos idiomas admitimos",").",[532,556,557,560],{},[74,558,559],{},"El tiempo de procesamiento está muy por debajo del tiempo real en los tres."," En este arnés, una nota de 30 segundos tarda unos tres segundos en Azure y unos siete en Google; la cifra de Amazon está dominada por el ritmo de la alimentación de datos.",[27,562,564],{"id":563},"por-qué-azure-ai-speech-sigue-siendo-la-opción-predeterminada","Por qué Azure AI Speech sigue siendo la opción predeterminada",[20,566,567],{},"Tres razones, en el orden en que se decidió.",[20,569,570,573,574,579],{},[74,571,572],{},"1. La puerta de enlace predeterminada es Azure."," Una organización que no ha elegido una puerta de enlace ejecuta sus funciones de IA en Azure OpenAI en la EU Data Zone, por lo que sus notas de voz se transcriben mediante Azure AI Speech en el mismo tenant. Ningún subencargado adicional, ninguna región adicional. Microsoft indica que Azure Speech no almacena ni procesa datos fuera de la región del recurso de Speech (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"página de regiones",", verificado en septiembre de 2026); nuestro recurso está en Sweden Central, que figura entre las regiones habilitadas para la transcripción rápida.",[20,581,582,585,586,590],{},[74,583,584],{},"2. La forma de la API encaja con una nota de voz."," Una nota de voz en InterMIND puede durar hasta diez minutos (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","notas de voz","). La transcripción rápida de Azure procesa toda la grabación en una sola solicitud. El reconocimiento síncrono de Google se detiene a los 60 segundos, así que una nota de diez minutos necesita reconocimiento por lotes a través de un bucket de almacenamiento o una sesión en streaming; Amazon Transcribe funciona en streaming, pero acepta PCM, FLAC u Ogg-Opus en lugar de los formatos en los que graban los teléfonos y navegadores, por lo que el audio se transcodifica primero. Ambos casos tienen solución —el arnés los resuelve—, pero suponen más piezas móviles en el camino de cada nota.",[20,592,593,596],{},[74,594,595],{},"3. Las cifras no van en su contra."," Con un 9 % frente a un 10 % y un 10 %, ningún motor de este conjunto es lo bastante mejor como para justificar sacar las notas de voz de la puerta de enlace predeterminada. Si Google o Amazon hubieran obtenido la mitad de la tasa de error, esta publicación lo diría.",[27,598,600],{"id":599},"qué-significa-esto-para-las-organizaciones-que-usan-vertex-ai-o-bedrock","Qué significa esto para las organizaciones que usan Vertex AI o Bedrock",[20,602,603],{},"Si su organización eligió Google Vertex AI o Amazon Bedrock como puerta de enlace, sus funciones de IA se ejecutan allí. Las notas de voz en esas organizaciones llegan hoy como una grabación sin transcripción: hemos medido Google Cloud Speech-to-Text y Amazon Transcribe, como muestra esta publicación, pero todavía no los hemos integrado en el producto. Los permisos y el código de integración ya existen; esta publicación se actualizará cuando formen parte del camino de cada nota. Hasta entonces, una nota de voz en una organización con Vertex AI o Bedrock es una grabación reproducible; una organización que cambie su puerta de enlace a Azure obtendrá transcripciones en las notas enviadas a partir de ese momento.",[27,605,607],{"id":606},"preguntas-frecuentes","Preguntas frecuentes",[20,609,610],{},[74,611,612],{},"¿Qué servicio de voz a texto usa InterMIND?",[20,614,615,616,554],{},"Para las notas de voz en el chat, Azure AI Speech (API de transcripción rápida) en el tenant propio de InterMIND en Azure, en Sweden Central: el servicio de voz de la puerta de enlace de IA predeterminada. El habla en vivo en las reuniones sigue un camino distinto: se ejecuta en el motor multimedia propio de InterMIND, la Mind API, alojado en OVH en Francia, y nunca pasa por ningún servicio de voz en la nube (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","dónde se ejecuta realmente una reunión",[20,621,622],{},[74,623,624],{},"¿Es Azure AI Speech más preciso que Google Speech-to-Text o Amazon Transcribe?",[20,626,627],{},"En nuestro conjunto de 153 clips de notas de voz en 17 idiomas, medidos el mismo día con el mismo arnés, Azure AI Speech tuvo una tasa de error de palabras media del 9 %, Google Cloud Speech-to-Text (Chirp 3) del 10 % y Amazon Transcribe del 10 %. Por idioma el orden cambia: Azure fue el más bajo en francés, inglés y chino; Amazon Transcribe, en árabe; Google, en ruso. Con un conjunto de grabaciones distinto la clasificación puede variar; la tabla anterior es la evidencia para el nuestro.",[20,629,630],{},[74,631,632],{},"¿Qué es la tasa de error de palabras y cómo se calculó aquí?",[20,634,635],{},"La tasa de error de palabras es el número de palabras sustituidas, insertadas y eliminadas dividido entre el número de palabras del texto de referencia. Normalizamos mayúsculas\u002Fminúsculas, puntuación y espacios en blanco antes de comparar, y comparamos el chino y el japonés por carácter porque esas escrituras no separan las palabras con espacios. Una tasa del 9 % significa que, aproximadamente, una palabra de cada once difiere de la referencia.",[20,637,638],{},[74,639,640],{},"¿El audio de una nota de voz sale de la UE?",[20,642,643,644,646,647,651,652,656],{},"No. La grabación se almacena en el almacenamiento de objetos de InterMIND en la UE, y el servicio de voz que la transcribe se ejecuta en una región de la UE: Sweden Central en Azure, la multirregión ",[109,645,111],{}," en Google Cloud, Frankfurt en AWS. La lista completa de partes y regiones está en la ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","página de subencargados"," y en la ",[35,653,655],{"href":654},"\u002Ftrust","página de confianza",".",[20,658,659],{},[74,660,661],{},"¿Por qué no reconocer el habla en el propio dispositivo, dentro de la app, para que el audio nunca salga del teléfono?",[20,663,664],{},"Eso también lo medimos, en septiembre de 2026. El motor de reconocimiento integrado de Chrome, con procesamiento local, reconoció correctamente 0 de los 17 clips formales en los idiomas del producto, y la cobertura de idiomas de los motores de reconocimiento en el dispositivo es mucho más reducida que los 17 idiomas de la tabla anterior. El reconocimiento en el dispositivo es una dirección que volvemos a medir a medida que las plataformas mejoran; hoy en día el camino por la puerta de enlace es el que funciona para todos los miembros en todos los idiomas.",[20,666,667],{},[74,668,669],{},"¿Puede nuestra organización elegir qué servicio de voz transcribe sus notas de voz?",[20,671,672],{},"No de forma independiente: lo que un administrador de la organización elige en la página de Integraciones es la puerta de enlace de IA. En la puerta de enlace predeterminada, las notas de voz se transcriben con Azure AI Speech. En Vertex AI y Amazon Bedrock, las notas de voz aún no se transcriben; consulte la sección anterior.",[20,674,675],{},[74,676,677],{},"¿Cuánto puede durar una nota de voz, y la API lo limita?",[20,679,680],{},"Hasta diez minutos. La transcripción rápida de Azure acepta archivos de hasta 5 horas y 500 MB en una sola solicitud, por lo que una nota se transcribe en una única llamada. El reconocimiento síncrono de Google acepta 60 segundos y 10 MB, razón por la cual el arnés cortó los clips largos en fragmentos aprovechando los silencios.",[20,682,683],{},[74,684,685],{},"¿Por qué se le indica al motor de reconocimiento el idioma de quien habla en lugar de detectarlo?",[20,687,688],{},"Porque una nota de voz es corta. En un clip de cuatro segundos, la identificación automática del idioma puede devolver un idioma equivocado —una nota de prueba en ruso volvió transcrita como inglés—; el idioma del perfil de un miembro acierta casi siempre. Al motor de reconocimiento se le proporciona ese idioma, y solo cuando se desconoce recibe los idiomas de la sala como candidatos.",[20,690,691],{},[74,692,693],{},"¿El audio de la reunión se transcribe con el mismo servicio?",[20,695,696,697,699,700,554],{},"No. El habla en vivo de una reunión se reconoce y traduce en el motor propio de InterMIND (la Mind API), en el servidor multimedia que transporta la llamada, alojado en OVH en Francia; véase ",[35,698,619],{"href":618},". La puerta de enlace en la nube ve texto, nunca el audio de una llamada (",[35,701,702],{"href":37},"la IA de reuniones en su propia puerta de enlace",[20,704,705],{},[74,706,707],{},"¿Volverán a publicar los resultados?",[20,709,710],{},"El arnés se ejecuta con un solo comando, y los permisos de cada motor ya están configurados, así que la tabla se puede volver a medir cuando un proveedor lance un nuevo modelo. Cuando cambie el panorama, esta publicación se actualizará con la fecha.",[712,713],"hr",{},[27,715,717],{"id":716},"compruébelo-usted-mismo","Compruébelo usted mismo",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Lea cómo funcionan las notas de voz"," — la grabación, el límite de diez minutos y adónde va el audio.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Consulte la lista de subencargados"," — proveedor, país, finalidad y región de cada parte que procesa sus datos.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Pruebe la demo en vivo"," — el pipeline de traducción en producción sobre su propio audio, sin necesidad de registrarse.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Fuentes: Microsoft — Azure AI Speech fast transcription (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") y tabla de regiones de Speech (",[35,759,756],{"href":576,"rel":760},[91],"); Google Cloud — modelo Chirp 3 (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), límites del reconocimiento síncrono (",[35,768,765],{"href":117,"rel":769},[91],") e idiomas admitidos (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — Amazon Transcribe streaming (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), endpoints y cuotas (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); todo verificado en septiembre de 2026. Medición: banco de pruebas de voz de InterMIND, 2026-09-16, 153 clips, 17 idiomas.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Medimos los servicios de transcripción de voz a texto de las tres pasarelas en la nube que una organización de InterMIND puede elegir — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) y Amazon Transcribe — en los mismos 153 clips de notas de voz en 17 idiomas, un mismo entorno de prueba, un mismo día. Tasas de error de palabras por idioma, el método, los límites de cada API y por qué el reconocedor sigue la pasarela en lugar de la tabla de clasificación.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","MqUyIymkjr1Myp761IqHFe-y6Dpfrn6NlqCx_wvi6rQ",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Pague solo por quienes lo usan: InterMIND pasa a la facturación por miembro activo","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Pro y Business dejan de vender puestos que asigna manualmente. Invite a todo su equipo; cada renovación cuenta los miembros que estuvieron activos en los 28 días anteriores y factura solo por ellos. Un miembro que pasa a estar inactivo mantiene su acceso y no tiene coste; los invitados a reuniones y los participantes de canales externos siguen siendo gratuitos. Qué cuenta como activo, cómo se mueve el número dentro de un ciclo de facturación, qué dice la carta antes de la renovación y qué cambia en su página de facturación.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Subtítulos traducidos en vivo para toda la audiencia: lo que Zoom, Teams y Google Meet requieren, y cómo cada asistente lee en su propio idioma (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Un orador, una audiencia en diez idiomas. Los subtítulos traducidos existen en Zoom, Microsoft Teams y Google Meet — cada uno detrás de una licencia diferente, y cada uno respondiendo de manera distinta a la misma pregunta: quién decide en qué idiomas puede leer la audiencia. Teams permite a un organizador de asamblea preseleccionar seis idiomas (diez con Teams Premium); los pares de Zoom se configuran en los ajustes de la cuenta del anfitrión; Google Meet restringe los subtítulos traducidos a las ediciones de pago de Workspace. El mapa documentado, junto a cómo funciona en InterMIND, donde el idioma de los subtítulos es un ajuste del lado del propio asistente y la sala se traduce también por voz."]