Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe em 153 notas de voz: por que a InterMIND executa a conversão de fala em texto no gateway de nuvem da própria organização (2026)
Uma nota de voz em um canal do InterMIND se transforma em uma mensagem de texto que cada colega de equipe lê no próprio idioma. A primeira etapa desse processo é a conversão de fala em texto, e a pergunta que recebemos das equipes de TI e de conformidade não é "qual é a precisão", mas sim "de quem é o serviço e para onde vai o áudio".
A resposta rápida: o Azure AI Speech, o serviço de fala do gateway de IA padrão, no próprio tenant do InterMIND na Azure, em Sweden Central — e os serviços de fala dos outros dois gateways que uma organização pode escolher, medidos nos mesmos clipes para que a escolha seja um número, não uma preferência. Este post mostra os números por trás dessa escolha — os mesmos 153 clipes processados pelo Azure AI Speech, pelo Google Cloud Speech-to-Text e pelo Amazon Transcribe no mesmo dia — e os dois fatos sobre cada API que importam mais do que um ponto percentual de precisão.
A regra vem primeiro: um gateway por organização
Todo recurso de IA no InterMIND — resumos de reunião, resumos de documentos, o assistente de escrita, o Ask AI e a Mia durante a reunião — é executado em um único gateway de modelo de linguagem escolhido pela organização: Azure OpenAI na EU Data Zone por padrão, Google Vertex AI no endpoint multirregional da UE ou Amazon Bedrock em Frankfurt, por escolha, cada um no próprio tenant do InterMIND. Explicamos o raciocínio em IA de reunião no seu próprio gateway de nuvem: para a maioria das organizações, esse gateway já está na lista de subprocessadores aprovados, então um recurso de IA não adiciona nenhuma empresa nova a essa lista.
A conversão de fala em texto para notas de voz segue a mesma regra no gateway padrão atualmente, e cada um dos três gateways tem um serviço de fala ao lado de seus modelos de linguagem — que é o que este post mede:
| Gateway | Serviço de fala | Região usada neste teste | Como a API recebe uma gravação |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, API de transcrição rápida (fast transcription) | Sweden Central | Uma requisição para um arquivo de até 5 horas e 500 MB (documentação de transcrição rápida, verificado em setembro de 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, modelo Chirp 3 | multirregião eu | O reconhecimento síncrono é limitado a 60 segundos e 10 MB; áudios mais longos passam por reconhecimento em lote (batch) ou por streaming (limites de sincronização, Chirp 3, verificado em setembro de 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | Uma sessão de streaming via HTTP/2 ou WebSocket; a entrada é em PCM, FLAC ou Ogg-Opus (documentação de streaming, verificado em setembro de 2026) |
Em todos os casos, o reconhecedor recebe o idioma do próprio falante — o idioma que o membro definiu em seu perfil — porque a identificação automática de idioma se mostrou pouco confiável em clipes curtos em nossos testes: uma nota em russo de quatro segundos voltou como inglês. É assim que o produto chama o Azure hoje, e o teste chama os outros dois serviços da mesma forma.