Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe en 153 notas de voz: por qué InterMIND ejecuta la conversión de voz a texto en la puerta de enlace en la nube propia de su organización (2026)
Una nota de voz en un canal de InterMIND se convierte en un mensaje de texto que cada miembro del equipo lee en su propio idioma. El primer paso de ese proceso es la conversión de voz a texto, y la pregunta que nos hacen los responsables de TI y cumplimiento no es «qué tan precisa es», sino «de quién es el servicio y adónde va el audio».
La respuesta breve: Azure AI Speech, el servicio de voz de la puerta de enlace de IA predeterminada, en el tenant propio de InterMIND en Azure en Sweden Central, y los servicios de voz de las otras dos puertas de enlace que una organización puede elegir, medidos con los mismos clips para que la elección sea una cifra y no una preferencia. Esta publicación muestra las cifras detrás de esa elección —los mismos 153 clips procesados el mismo día por Azure AI Speech, Google Cloud Speech-to-Text y Amazon Transcribe— y los dos datos sobre cada API que importan más que un punto porcentual de precisión.
La regla viene primero: una puerta de enlace por organización
Todas las funciones de IA de InterMIND —los resúmenes de reuniones, los resúmenes de documentos, el asistente de redacción, Ask AI y Mia en la reunión— se ejecutan en una única puerta de enlace de modelos de lenguaje que la organización elige: Azure OpenAI en la EU Data Zone de forma predeterminada, Google Vertex AI en el endpoint multirregional de la UE o Amazon Bedrock en Frankfurt, a elección, cada una en el tenant propio de InterMIND. Explicamos el razonamiento en La IA de reuniones en su propia puerta de enlace en la nube: para la mayoría de las organizaciones, esa puerta de enlace ya está en la lista de subencargados aprobados, por lo que una función de IA no añade ninguna empresa nueva a la lista.
La conversión de voz a texto para las notas de voz sigue hoy la misma regla en la puerta de enlace predeterminada, y cada una de las tres puertas de enlace cuenta con un servicio de voz junto a sus modelos de lenguaje, que es justo lo que mide esta publicación:
| Gateway | Servicio de voz | Región usada en esta prueba | Cómo recibe la API una grabación |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, API de transcripción rápida | Sweden Central | Una sola solicitud para un archivo de hasta 5 horas y 500 MB (documentación de transcripción rápida, verificado en septiembre de 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, modelo Chirp 3 | multirregión eu | El reconocimiento síncrono está limitado a 60 segundos y 10 MB; el audio más largo pasa por reconocimiento por lotes o en streaming (límites de sincronización, Chirp 3, verificado en septiembre de 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | Una sesión en streaming sobre HTTP/2 o WebSocket; la entrada es PCM, FLAC u Ogg-Opus (documentación de streaming, verificado en septiembre de 2026) |
En todos los casos se le indica al motor de reconocimiento el propio idioma de quien habla —el idioma que cada miembro configuró en su perfil— porque la identificación automática del idioma resultó poco fiable en clips cortos durante nuestras pruebas: una nota en ruso de cuatro segundos volvió transcrita como inglés. Así es como el producto llama hoy a Azure, y la prueba llama de la misma manera a los otros dos.