Arquitectura

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe en 153 notas de voz: por qué InterMIND ejecuta la transcripción de voz a texto en la pasarela en la nube propia de su organización (2026)

Medimos los servicios de transcripción de voz a texto de las tres pasarelas en la nube que una organización de InterMIND puede elegir — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) y Amazon Transcribe — en los mismos 153 clips de notas de voz en 17 idiomas, un mismo entorno de prueba, un mismo día. Tasas de error de palabras por idioma, el método, los límites de cada API y por qué el reconocedor sigue la pasarela en lugar de la tabla de clasificación.

The Mind.com Team

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe en 153 notas de voz: por qué InterMIND ejecuta la transcripción de voz a texto en la pasarela en la nube propia de su organización (2026)

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe en 153 notas de voz: por qué InterMIND ejecuta la conversión de voz a texto en la puerta de enlace en la nube propia de su organización (2026)

Una nota de voz en un canal de InterMIND se convierte en un mensaje de texto que cada miembro del equipo lee en su propio idioma. El primer paso de ese proceso es la conversión de voz a texto, y la pregunta que nos hacen los responsables de TI y cumplimiento no es «qué tan precisa es», sino «de quién es el servicio y adónde va el audio».

La respuesta breve: Azure AI Speech, el servicio de voz de la puerta de enlace de IA predeterminada, en el tenant propio de InterMIND en Azure en Sweden Central, y los servicios de voz de las otras dos puertas de enlace que una organización puede elegir, medidos con los mismos clips para que la elección sea una cifra y no una preferencia. Esta publicación muestra las cifras detrás de esa elección —los mismos 153 clips procesados el mismo día por Azure AI Speech, Google Cloud Speech-to-Text y Amazon Transcribe— y los dos datos sobre cada API que importan más que un punto porcentual de precisión.

La regla viene primero: una puerta de enlace por organización

Todas las funciones de IA de InterMIND —los resúmenes de reuniones, los resúmenes de documentos, el asistente de redacción, Ask AI y Mia en la reunión— se ejecutan en una única puerta de enlace de modelos de lenguaje que la organización elige: Azure OpenAI en la EU Data Zone de forma predeterminada, Google Vertex AI en el endpoint multirregional de la UE o Amazon Bedrock en Frankfurt, a elección, cada una en el tenant propio de InterMIND. Explicamos el razonamiento en La IA de reuniones en su propia puerta de enlace en la nube: para la mayoría de las organizaciones, esa puerta de enlace ya está en la lista de subencargados aprobados, por lo que una función de IA no añade ninguna empresa nueva a la lista.

La conversión de voz a texto para las notas de voz sigue hoy la misma regla en la puerta de enlace predeterminada, y cada una de las tres puertas de enlace cuenta con un servicio de voz junto a sus modelos de lenguaje, que es justo lo que mide esta publicación:

GatewayServicio de vozRegión usada en esta pruebaCómo recibe la API una grabación
Azure OpenAI (Microsoft)Azure AI Speech, API de transcripción rápidaSweden CentralUna sola solicitud para un archivo de hasta 5 horas y 500 MB (documentación de transcripción rápida, verificado en septiembre de 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, modelo Chirp 3multirregión euEl reconocimiento síncrono está limitado a 60 segundos y 10 MB; el audio más largo pasa por reconocimiento por lotes o en streaming (límites de sincronización, Chirp 3, verificado en septiembre de 2026)
Amazon Bedrock (AWS)Amazon Transcribe, streamingeu-central-1 (Frankfurt)Una sesión en streaming sobre HTTP/2 o WebSocket; la entrada es PCM, FLAC u Ogg-Opus (documentación de streaming, verificado en septiembre de 2026)

En todos los casos se le indica al motor de reconocimiento el propio idioma de quien habla —el idioma que cada miembro configuró en su perfil— porque la identificación automática del idioma resultó poco fiable en clips cortos durante nuestras pruebas: una nota en ruso de cuatro segundos volvió transcrita como inglés. Así es como el producto llama hoy a Azure, y la prueba llama de la misma manera a los otros dos.

Qué medimos

El conjunto. 153 clips en 17 idiomas: 136 turnos de diálogo —dos diálogos empresariales (una negociación de contrato y una reunión diaria de seguimiento) pronunciados por las dos voces sintéticas del producto en diez idiomas— más 17 pasajes formales, las frases empresariales de FLORES-200 de nuestro benchmark de traducción público leídas por una voz sintética, una por idioma y de entre 71 y 109 segundos de duración. Los turnos de diálogo duran entre 3 y 30 segundos, la duración de una nota de voz real.

La métrica. La tasa de error de palabras (WER, por sus siglas en inglés) frente al texto de referencia —la fracción de palabras sustituidas, insertadas o eliminadas— tras normalizar mayúsculas/minúsculas, puntuación y espacios en blanco; el chino y el japonés se comparan por carácter. También se registró la tasa de error por carácter, y cuenta la misma historia.

El arnés de prueba. Un único script, una única máquina, una hora el 2026-09-16, cada motor procesando los 153 clips. Azure y Amazon Transcribe recibieron cada clip completo. El reconocimiento síncrono de Google admite como máximo 60 segundos, por lo que los 17 clips formales se cortaron en los silencios en fragmentos de menos de 55 segundos y las transcripciones se unieron; los 136 clips de diálogo se procesaron completos. Amazon Transcribe requiere el audio a un ritmo de tiempo real, por lo que el arnés se lo suministró cuatro veces más rápido que en tiempo real; por ello, la cifra de latencia indicada más abajo es un mínimo determinado por el suministro, no por el servicio.

Lo que esto no es. Voces sintéticas en audio silencioso, no grabaciones de campo desde un teléfono en un coche. Un día, una ejecución por clip. Es una comparación sobre el audio con el que se pone a prueba nuestro propio pipeline de traducción, en los idiomas en los que escriben nuestros usuarios, no una clasificación general.

Resultados: tasa de error de palabras por idioma

WER medio en los clips de cada idioma; los tres motores devolvieron una transcripción para los 153 clips.

IdiomaClipsAzure AI SpeechGoogle Chirp 3Amazon Transcribe
Árabe1332%46%26%
Chino133%3%8%
Checo11%2%3%
Neerlandés12%2%3%
Inglés212%5%2%
Francés135%11%12%
Alemán137%9%13%
Hindi1310%10%12%
Húngaro19%7%8%
Italiano11%1%3%
Japonés136%5%5%
Coreano19%11%11%
Polaco11%1%2%
Portugués (Brasil)135%4%6%
Ruso2114%10%14%
Español136%5%6%
Turco14%3%4%
Los 153 clips1539%10%10%
Solo turnos de diálogo1369%11%10%
Solo pasajes formales174%5%5%
Tiempo de procesamiento ÷ duración del audio0.100.220.41 (limitado por la alimentación)

Los idiomas con un solo clip (únicamente el pasaje formal) se muestran para tener el cuadro completo; una cifra basada en un solo clip es un dato puntual, no una tasa.

Qué dicen las cifras

  • En el conjunto total, los tres servicios están dentro de un punto porcentual entre sí: 9 %, 10 % y 10 %. Los 153 clips obtuvieron transcripción de todos los motores; la cobertura de los 17 idiomas es completa en los tres.
  • Las diferencias son por idioma, y van en ambos sentidos. Azure tuvo la tasa de error más baja en francés (5 % frente a 11 % y 12 %) y en alemán (7 % frente a 9 % y 13 %), y empató en el primer puesto en inglés (2 %, junto con Amazon Transcribe) y en chino (3 %, junto con Google). Amazon Transcribe tuvo la tasa más baja en árabe (26 % frente a 32 % y 46 %). Google tuvo la tasa más baja en ruso (10 % frente a 14 % y 14 %), portugués, húngaro y turco.
  • El árabe es difícil para los tres. El mejor resultado en los clips de diálogo en árabe es una palabra de cada cuatro incorrecta. Esto es coherente con lo que observamos del lado de la traducción, donde retiramos el árabe del selector de idiomas de reunión en agosto de 2026 hasta que su calidad supere nuestro umbral (cuántos idiomas admitimos).
  • El tiempo de procesamiento está muy por debajo del tiempo real en los tres. En este arnés, una nota de 30 segundos tarda unos tres segundos en Azure y unos siete en Google; la cifra de Amazon está dominada por el ritmo de la alimentación de datos.

Por qué Azure AI Speech sigue siendo la opción predeterminada

Tres razones, en el orden en que se decidió.

1. La puerta de enlace predeterminada es Azure. Una organización que no ha elegido una puerta de enlace ejecuta sus funciones de IA en Azure OpenAI en la EU Data Zone, por lo que sus notas de voz se transcriben mediante Azure AI Speech en el mismo tenant. Ningún subencargado adicional, ninguna región adicional. Microsoft indica que Azure Speech no almacena ni procesa datos fuera de la región del recurso de Speech (página de regiones, verificado en septiembre de 2026); nuestro recurso está en Sweden Central, que figura entre las regiones habilitadas para la transcripción rápida.

2. La forma de la API encaja con una nota de voz. Una nota de voz en InterMIND puede durar hasta diez minutos (notas de voz). La transcripción rápida de Azure procesa toda la grabación en una sola solicitud. El reconocimiento síncrono de Google se detiene a los 60 segundos, así que una nota de diez minutos necesita reconocimiento por lotes a través de un bucket de almacenamiento o una sesión en streaming; Amazon Transcribe funciona en streaming, pero acepta PCM, FLAC u Ogg-Opus en lugar de los formatos en los que graban los teléfonos y navegadores, por lo que el audio se transcodifica primero. Ambos casos tienen solución —el arnés los resuelve—, pero suponen más piezas móviles en el camino de cada nota.

3. Las cifras no van en su contra. Con un 9 % frente a un 10 % y un 10 %, ningún motor de este conjunto es lo bastante mejor como para justificar sacar las notas de voz de la puerta de enlace predeterminada. Si Google o Amazon hubieran obtenido la mitad de la tasa de error, esta publicación lo diría.

Qué significa esto para las organizaciones que usan Vertex AI o Bedrock

Si su organización eligió Google Vertex AI o Amazon Bedrock como puerta de enlace, sus funciones de IA se ejecutan allí. Las notas de voz en esas organizaciones llegan hoy como una grabación sin transcripción: hemos medido Google Cloud Speech-to-Text y Amazon Transcribe, como muestra esta publicación, pero todavía no los hemos integrado en el producto. Los permisos y el código de integración ya existen; esta publicación se actualizará cuando formen parte del camino de cada nota. Hasta entonces, una nota de voz en una organización con Vertex AI o Bedrock es una grabación reproducible; una organización que cambie su puerta de enlace a Azure obtendrá transcripciones en las notas enviadas a partir de ese momento.

Preguntas frecuentes

¿Qué servicio de voz a texto usa InterMIND?

Para las notas de voz en el chat, Azure AI Speech (API de transcripción rápida) en el tenant propio de InterMIND en Azure, en Sweden Central: el servicio de voz de la puerta de enlace de IA predeterminada. El habla en vivo en las reuniones sigue un camino distinto: se ejecuta en el motor multimedia propio de InterMIND, la Mind API, alojado en OVH en Francia, y nunca pasa por ningún servicio de voz en la nube (dónde se ejecuta realmente una reunión).

¿Es Azure AI Speech más preciso que Google Speech-to-Text o Amazon Transcribe?

En nuestro conjunto de 153 clips de notas de voz en 17 idiomas, medidos el mismo día con el mismo arnés, Azure AI Speech tuvo una tasa de error de palabras media del 9 %, Google Cloud Speech-to-Text (Chirp 3) del 10 % y Amazon Transcribe del 10 %. Por idioma el orden cambia: Azure fue el más bajo en francés, inglés y chino; Amazon Transcribe, en árabe; Google, en ruso. Con un conjunto de grabaciones distinto la clasificación puede variar; la tabla anterior es la evidencia para el nuestro.

¿Qué es la tasa de error de palabras y cómo se calculó aquí?

La tasa de error de palabras es el número de palabras sustituidas, insertadas y eliminadas dividido entre el número de palabras del texto de referencia. Normalizamos mayúsculas/minúsculas, puntuación y espacios en blanco antes de comparar, y comparamos el chino y el japonés por carácter porque esas escrituras no separan las palabras con espacios. Una tasa del 9 % significa que, aproximadamente, una palabra de cada once difiere de la referencia.

¿El audio de una nota de voz sale de la UE?

No. La grabación se almacena en el almacenamiento de objetos de InterMIND en la UE, y el servicio de voz que la transcribe se ejecuta en una región de la UE: Sweden Central en Azure, la multirregión eu en Google Cloud, Frankfurt en AWS. La lista completa de partes y regiones está en la página de subencargados y en la página de confianza.

¿Por qué no reconocer el habla en el propio dispositivo, dentro de la app, para que el audio nunca salga del teléfono?

Eso también lo medimos, en septiembre de 2026. El motor de reconocimiento integrado de Chrome, con procesamiento local, reconoció correctamente 0 de los 17 clips formales en los idiomas del producto, y la cobertura de idiomas de los motores de reconocimiento en el dispositivo es mucho más reducida que los 17 idiomas de la tabla anterior. El reconocimiento en el dispositivo es una dirección que volvemos a medir a medida que las plataformas mejoran; hoy en día el camino por la puerta de enlace es el que funciona para todos los miembros en todos los idiomas.

¿Puede nuestra organización elegir qué servicio de voz transcribe sus notas de voz?

No de forma independiente: lo que un administrador de la organización elige en la página de Integraciones es la puerta de enlace de IA. En la puerta de enlace predeterminada, las notas de voz se transcriben con Azure AI Speech. En Vertex AI y Amazon Bedrock, las notas de voz aún no se transcriben; consulte la sección anterior.

¿Cuánto puede durar una nota de voz, y la API lo limita?

Hasta diez minutos. La transcripción rápida de Azure acepta archivos de hasta 5 horas y 500 MB en una sola solicitud, por lo que una nota se transcribe en una única llamada. El reconocimiento síncrono de Google acepta 60 segundos y 10 MB, razón por la cual el arnés cortó los clips largos en fragmentos aprovechando los silencios.

¿Por qué se le indica al motor de reconocimiento el idioma de quien habla en lugar de detectarlo?

Porque una nota de voz es corta. En un clip de cuatro segundos, la identificación automática del idioma puede devolver un idioma equivocado —una nota de prueba en ruso volvió transcrita como inglés—; el idioma del perfil de un miembro acierta casi siempre. Al motor de reconocimiento se le proporciona ese idioma, y solo cuando se desconoce recibe los idiomas de la sala como candidatos.

¿El audio de la reunión se transcribe con el mismo servicio?

No. El habla en vivo de una reunión se reconoce y traduce en el motor propio de InterMIND (la Mind API), en el servidor multimedia que transporta la llamada, alojado en OVH en Francia; véase dónde se ejecuta realmente una reunión. La puerta de enlace en la nube ve texto, nunca el audio de una llamada (la IA de reuniones en su propia puerta de enlace).

¿Volverán a publicar los resultados?

El arnés se ejecuta con un solo comando, y los permisos de cada motor ya están configurados, así que la tabla se puede volver a medir cuando un proveedor lance un nuevo modelo. Cuando cambie el panorama, esta publicación se actualizará con la fecha.


Compruébelo usted mismo


Fuentes: Microsoft — Azure AI Speech fast transcription (learn.microsoft.com) y tabla de regiones de Speech (learn.microsoft.com); Google Cloud — modelo Chirp 3 (docs.cloud.google.com), límites del reconocimiento síncrono (docs.cloud.google.com) e idiomas admitidos (docs.cloud.google.com); AWS — Amazon Transcribe streaming (docs.aws.amazon.com), endpoints y cuotas (docs.aws.amazon.com) e idiomas admitidos (docs.aws.amazon.com); todo verificado en septiembre de 2026. Medición: banco de pruebas de voz de InterMIND, 2026-09-16, 153 clips, 17 idiomas.

Reciba nuevos artículos y actualizaciones del producto por correo electrónico

Un correo al mes con nuevas publicaciones y actualizaciones del producto. Cancela la suscripción en cualquier momento.