Arquitetura

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe em 153 notas de voz: por que a InterMIND executa o speech-to-text no gateway de nuvem da sua organização (2026)

Medimos os serviços de speech-to-text dos três gateways de nuvem que uma organização da InterMIND pode escolher — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) e Amazon Transcribe — nos mesmos 153 clipes de notas de voz em 17 idiomas, uma suíte de testes, um dia. Taxas de erro de palavras por idioma, o método, os limites de cada API e por que o reconhecedor segue o gateway em vez do ranking.

The Mind.com Team

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe em 153 notas de voz: por que a InterMIND executa o speech-to-text no gateway de nuvem da sua organização (2026)

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe em 153 notas de voz: por que a InterMIND executa a conversão de fala em texto no gateway de nuvem da própria organização (2026)

Uma nota de voz em um canal do InterMIND se transforma em uma mensagem de texto que cada colega de equipe lê no próprio idioma. A primeira etapa desse processo é a conversão de fala em texto, e a pergunta que recebemos das equipes de TI e de conformidade não é "qual é a precisão", mas sim "de quem é o serviço e para onde vai o áudio".

A resposta rápida: o Azure AI Speech, o serviço de fala do gateway de IA padrão, no próprio tenant do InterMIND na Azure, em Sweden Central — e os serviços de fala dos outros dois gateways que uma organização pode escolher, medidos nos mesmos clipes para que a escolha seja um número, não uma preferência. Este post mostra os números por trás dessa escolha — os mesmos 153 clipes processados pelo Azure AI Speech, pelo Google Cloud Speech-to-Text e pelo Amazon Transcribe no mesmo dia — e os dois fatos sobre cada API que importam mais do que um ponto percentual de precisão.

A regra vem primeiro: um gateway por organização

Todo recurso de IA no InterMIND — resumos de reunião, resumos de documentos, o assistente de escrita, o Ask AI e a Mia durante a reunião — é executado em um único gateway de modelo de linguagem escolhido pela organização: Azure OpenAI na EU Data Zone por padrão, Google Vertex AI no endpoint multirregional da UE ou Amazon Bedrock em Frankfurt, por escolha, cada um no próprio tenant do InterMIND. Explicamos o raciocínio em IA de reunião no seu próprio gateway de nuvem: para a maioria das organizações, esse gateway já está na lista de subprocessadores aprovados, então um recurso de IA não adiciona nenhuma empresa nova a essa lista.

A conversão de fala em texto para notas de voz segue a mesma regra no gateway padrão atualmente, e cada um dos três gateways tem um serviço de fala ao lado de seus modelos de linguagem — que é o que este post mede:

GatewayServiço de falaRegião usada neste testeComo a API recebe uma gravação
Azure OpenAI (Microsoft)Azure AI Speech, API de transcrição rápida (fast transcription)Sweden CentralUma requisição para um arquivo de até 5 horas e 500 MB (documentação de transcrição rápida, verificado em setembro de 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, modelo Chirp 3multirregião euO reconhecimento síncrono é limitado a 60 segundos e 10 MB; áudios mais longos passam por reconhecimento em lote (batch) ou por streaming (limites de sincronização, Chirp 3, verificado em setembro de 2026)
Amazon Bedrock (AWS)Amazon Transcribe, streamingeu-central-1 (Frankfurt)Uma sessão de streaming via HTTP/2 ou WebSocket; a entrada é em PCM, FLAC ou Ogg-Opus (documentação de streaming, verificado em setembro de 2026)

Em todos os casos, o reconhecedor recebe o idioma do próprio falante — o idioma que o membro definiu em seu perfil — porque a identificação automática de idioma se mostrou pouco confiável em clipes curtos em nossos testes: uma nota em russo de quatro segundos voltou como inglês. É assim que o produto chama o Azure hoje, e o teste chama os outros dois serviços da mesma forma.

O que medimos

O conjunto. 153 clipes em 17 idiomas: 136 falas de diálogo — dois diálogos de negócios (uma negociação de contrato e um daily stand-up) falados pelas duas vozes sintéticas do produto em dez idiomas — mais 17 passagens formais, as frases de negócios do FLORES-200 do nosso benchmark público de tradução, lidas por uma voz sintética, uma por idioma, com duração de 71 a 109 segundos. As falas de diálogo têm de 3 a 30 segundos, a duração de uma nota de voz real.

A métrica. Taxa de erro de palavras (word error rate, WER) em relação ao texto de referência — a fração de palavras substituídas, inseridas ou excluídas — após normalizar maiúsculas/minúsculas, pontuação e espaços em branco; chinês e japonês são comparados por caractere. A taxa de erro de caracteres foi registrada em paralelo e conta a mesma história.

O harness (ambiente de teste). Um único script, uma única máquina, uma hora em 2026-09-16, cada motor processando os 153 clipes. O Azure e o Amazon Transcribe receberam cada clipe inteiro. O reconhecedor síncrono do Google aceita no máximo 60 segundos, então os 17 clipes formais foram cortados em silêncios em partes de menos de 55 segundos e as transcrições foram unidas; os 136 clipes de diálogo foram enviados inteiros. O Amazon Transcribe espera áudio em ritmo de tempo real, então o harness o alimentou quatro vezes mais rápido que o tempo real; por isso, o número de latência abaixo é um piso definido pela alimentação, não pelo serviço.

O que isto não é. Vozes sintéticas em áudio silencioso, não gravações de campo feitas por um celular dentro de um carro. Um dia, uma execução por clipe. É uma comparação feita sobre o áudio no qual nosso próprio pipeline de tradução é testado, nos idiomas em que nossos usuários escrevem — não um ranking.

Resultados: taxa de erro de palavras por idioma

WER médio nos clipes de cada idioma; todos os motores retornaram uma transcrição para os 153 clipes.

IdiomaClipesAzure AI SpeechGoogle Chirp 3Amazon Transcribe
Árabe1332%46%26%
Chinês133%3%8%
Tcheco11%2%3%
Holandês12%2%3%
Inglês212%5%2%
Francês135%11%12%
Alemão137%9%13%
Hindi1310%10%12%
Húngaro19%7%8%
Italiano11%1%3%
Japonês136%5%5%
Coreano19%11%11%
Polonês11%1%2%
Português (Brasil)135%4%6%
Russo2114%10%14%
Espanhol136%5%6%
Turco14%3%4%
Todos os 153 clipes1539%10%10%
Apenas falas de diálogo1369%11%10%
Apenas passagens formais174%5%5%
Tempo de processamento ÷ duração do áudio0.100.220.41 (limitado pela alimentação)

Idiomas com um único clipe (apenas a passagem formal) são exibidos para fins de completude; um número baseado em um único clipe é um ponto de dado, não uma taxa.

O que os números dizem

  • No conjunto completo, os três serviços ficam dentro de um ponto percentual entre si: 9%, 10% e 10%. Todos os 153 clipes retornaram uma transcrição de cada motor — a cobertura dos 17 idiomas é completa nos três.
  • As diferenças ocorrem por idioma, e vão nos dois sentidos. O Azure teve a menor taxa de erro em francês (5% contra 11% e 12%) e alemão (7% contra 9% e 13%), e ficou empatado na menor taxa em inglês (2%, com o Amazon Transcribe) e chinês (3%, com o Google). O Amazon Transcribe teve a menor taxa em árabe (26% contra 32% e 46%). O Google teve a menor taxa em russo (10% contra 14% e 14%), português, húngaro e turco.
  • O árabe é difícil para os três. O melhor resultado nos clipes de diálogo em árabe é de uma palavra errada em cada quatro. Isso é consistente com o que vimos no lado da tradução, onde retiramos o árabe do seletor de idiomas de reunião em agosto de 2026 até que a qualidade atinja nosso padrão (quantos idiomas oferecemos suporte).
  • O tempo de processamento fica bem abaixo do tempo real nos três. Uma nota de 30 segundos leva cerca de três segundos no Azure e cerca de sete no Google, neste ambiente de teste; o número da Amazon é dominado pela alimentação em ritmo controlado.

Por que o Azure AI Speech continua sendo o padrão

Três motivos, na ordem em que pesaram na decisão.

1. O gateway padrão é o Azure. Uma organização que não escolheu um gateway executa seus recursos de IA no Azure OpenAI na EU Data Zone, então suas notas de voz são transcritas pelo Azure AI Speech no mesmo tenant. Nenhum subprocessador adicional, nenhuma região adicional. A Microsoft afirma que o Azure Speech não armazena nem processa dados fora da região do recurso de fala (página de regiões, verificado em setembro de 2026); nosso recurso está em Sweden Central, que consta na lista de regiões para transcrição rápida.

2. O formato da API se encaixa em uma nota de voz. Uma nota de voz no InterMIND pode ter até dez minutos (notas de voz). A transcrição rápida do Azure recebe a gravação inteira em uma única requisição. O reconhecimento síncrono do Google para em 60 segundos, então uma nota de dez minutos precisa de reconhecimento em lote via um bucket de armazenamento ou de uma sessão de streaming; o Amazon Transcribe usa streaming, mas aceita PCM, FLAC ou Ogg-Opus em vez dos formatos em que celulares e navegadores gravam, então o áudio precisa ser transcodificado antes. Ambos os casos são solucionáveis — o harness resolve isso — mas representam mais peças em movimento no caminho de cada nota.

3. Os números não contrariam essa escolha. Com 9% contra 10% e 10%, nenhum motor deste conjunto é significativamente melhor para justificar mover as notas de voz para fora do gateway padrão. Se o Google ou a Amazon tivessem apresentado a metade da taxa de erro, este post diria isso claramente.

O que isso significa para organizações no Vertex AI ou no Bedrock

Se sua organização escolheu o Google Vertex AI ou o Amazon Bedrock como gateway, seus recursos de IA são executados ali. As notas de voz nessas organizações atualmente chegam como uma gravação sem transcrição: medimos o Google Cloud Speech-to-Text e o Amazon Transcribe, como este post mostra, mas ainda não os integramos ao produto. As permissões e o código de integração já existem; este post será atualizado quando eles estiverem no caminho de cada nota. Até então, uma nota de voz em uma organização com Vertex AI ou Bedrock é uma gravação reproduzível; uma organização que mudar seu gateway para o Azure passa a receber transcrições nas notas enviadas a partir daquele momento.

Perguntas frequentes

Qual serviço de conversão de fala em texto o InterMIND usa?

Para notas de voz no chat, o Azure AI Speech (API de transcrição rápida) no próprio tenant do InterMIND na Azure, em Sweden Central — o serviço de fala do gateway de IA padrão. A fala em tempo real nas reuniões segue um caminho diferente: é executada no próprio mecanismo de mídia do InterMIND, a Mind API, hospedada na OVH, na França, e nunca passa por um serviço de fala em nuvem (onde uma reunião é executada).

O Azure AI Speech é mais preciso que o Google Speech-to-Text ou o Amazon Transcribe?

No nosso conjunto de 153 clipes de notas de voz em 17 idiomas, medidos no mesmo dia com o mesmo ambiente de teste, o Azure AI Speech teve uma taxa média de erro de palavras de 9%, o Google Cloud Speech-to-Text (Chirp 3) de 10% e o Amazon Transcribe de 10%. Por idioma, a ordem muda: o Azure teve a menor taxa em francês, inglês e chinês; o Amazon Transcribe, em árabe; o Google, em russo. Em um conjunto diferente de gravações, a classificação pode mudar; a tabela acima é a evidência para o nosso conjunto.

O que é a taxa de erro de palavras, e como ela foi calculada aqui?

A taxa de erro de palavras é o número de palavras substituídas, inseridas e excluídas dividido pelo número de palavras no texto de referência. Normalizamos maiúsculas/minúsculas, pontuação e espaços em branco antes de comparar, e comparamos chinês e japonês por caractere, porque esses sistemas de escrita não separam palavras com espaços. Uma taxa de 9% significa que aproximadamente uma palavra em cada onze difere da referência.

O áudio de uma nota de voz sai da UE?

Não. A gravação é armazenada no object storage do InterMIND na UE, e o serviço de fala que a transcreve é executado em uma região da UE: Sweden Central no Azure, a multirregião eu no Google Cloud, Frankfurt na AWS. A lista completa de partes e regiões está na página de subprocessadores e na página de confiança.

Por que não reconhecer a fala no lado do cliente, dentro do app, para que o áudio nunca saia do celular?

Também medimos isso, em setembro de 2026. O reconhecedor nativo do Chrome, com processamento local, reconheceu 0 dos 17 clipes formais nos idiomas do produto, e a cobertura de idiomas dos reconhecedores no lado do cliente é muito mais limitada do que os 17 idiomas da tabela acima. O reconhecimento no lado do cliente é uma direção que medimos novamente conforme as plataformas evoluem; hoje, o caminho pelo gateway é o que funciona para todos os membros, em todos os idiomas.

Nossa organização pode escolher qual serviço de fala transcreve suas notas de voz?

Não separadamente: o que o administrador da organização escolhe na página Integrações é o gateway de IA. No gateway padrão, as notas de voz são transcritas pelo Azure AI Speech. No Vertex AI e no Amazon Bedrock, as notas de voz ainda não são transcritas — veja a seção acima.

Quanto tempo uma nota de voz pode durar, e a API limita isso?

Até dez minutos. A transcrição rápida do Azure aceita arquivos de até 5 horas e 500 MB em uma única requisição, então uma nota é transcrita em uma única chamada. O reconhecimento síncrono do Google aceita 60 segundos e 10 MB, motivo pelo qual o harness cortou os clipes longos em partes nos silêncios.

Por que o reconhecedor recebe o idioma do falante em vez de detectá-lo?

Porque uma nota de voz é curta. Em um clipe de quatro segundos, a identificação automática de idioma pode retornar o idioma errado — uma nota de teste em russo voltou como inglês; o idioma do perfil do membro está correto quase sempre. O reconhecedor recebe esse idioma, e só quando ele é desconhecido é que recebe os idiomas da sala como candidatos.

O áudio da reunião é transcrito pelo mesmo serviço?

Não. A fala em tempo real em uma reunião é reconhecida e traduzida no próprio mecanismo do InterMIND (a Mind API), no servidor de mídia que transporta a chamada, hospedado na OVH, na França — veja onde uma reunião é executada. O gateway de nuvem vê apenas texto, nunca o áudio de uma chamada (IA de reunião no seu próprio gateway).

Vocês vão publicar os resultados de novo?

O harness é executado com um único comando, e as permissões de todos os motores já estão configuradas, então a tabela pode ser remedida quando um fornecedor lançar um novo modelo. Quando isso mudar o quadro geral, este post será atualizado com a data.


Veja por si mesmo


Fontes: Microsoft — Azure AI Speech, transcrição rápida (learn.microsoft.com) e tabela de regiões do Speech (learn.microsoft.com); Google Cloud — modelo Chirp 3 (docs.cloud.google.com), limites do reconhecimento síncrono (docs.cloud.google.com) e idiomas suportados (docs.cloud.google.com); AWS — Amazon Transcribe streaming (docs.aws.amazon.com), endpoints e cotas (docs.aws.amazon.com) e idiomas suportados (docs.aws.amazon.com); tudo verificado em setembro de 2026. Medição: InterMIND speech bench, 2026-09-16, 153 clipes, 17 idiomas.

Receba novos posts e atualizações do produto por e-mail

Um e-mail por mês com novas publicações e atualizações do produto. Cancele a inscrição a qualquer momento.