Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe su 153 note vocali: perché InterMIND esegue lo speech-to-text sul cloud gateway della tua organizzazione (2026)
Una nota vocale in un canale InterMIND diventa un messaggio di testo che ogni collega legge nella propria lingua. Il primo passaggio di questo processo è lo speech-to-text, e la domanda che riceviamo dai revisori IT e compliance non è "quanto è accurato" ma "di chi è il servizio, e dove va l'audio".
La risposta breve: Azure AI Speech, il servizio vocale del gateway AI predefinito, nel tenant Azure proprietario di InterMIND in Sweden Central — e i servizi vocali degli altri due gateway che un'organizzazione può scegliere, misurati sugli stessi clip in modo che la scelta sia un numero, non una preferenza. Questo articolo mostra i numeri dietro questa scelta — gli stessi 153 clip elaborati da Azure AI Speech, Google Cloud Speech-to-Text e Amazon Transcribe nello stesso giorno — e i due fatti su ciascuna API che contano più di un punto percentuale di accuratezza.
La regola viene prima di tutto: un gateway per organizzazione
Ogni funzionalità AI in InterMIND — i riepiloghi delle riunioni, i riassunti dei documenti, l'assistente di scrittura, Ask AI e Mia nella riunione — funziona su un unico gateway di modelli linguistici scelto dall'organizzazione: Azure OpenAI nella EU Data Zone per impostazione predefinita, Google Vertex AI sull'endpoint multi-regione UE oppure Amazon Bedrock a Francoforte a scelta, ciascuno nel tenant proprietario di InterMIND. Abbiamo spiegato questa logica in L'AI delle riunioni sul tuo cloud gateway: per la maggior parte delle organizzazioni quel gateway è già nell'elenco dei sub-responsabili approvati, quindi una funzionalità AI non aggiunge nessuna nuova azienda all'elenco.
Lo speech-to-text per le note vocali segue oggi la stessa regola sul gateway predefinito, e ciascuno dei tre gateway dispone di un servizio vocale accanto ai propri modelli linguistici — ed è proprio questo che misura l'articolo:
| Gateway | Servizio vocale | Regione usata in questo test | Come l'API riceve una registrazione |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, API di trascrizione rapida | Sweden Central | Un'unica richiesta per un file fino a 5 ore e 500 MB (documentazione della trascrizione rapida, verificato a settembre 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, modello Chirp 3 | multi-regione eu | Il riconoscimento sincrono è limitato a 60 secondi e 10 MB; l'audio più lungo passa attraverso il riconoscimento batch o in streaming (limiti del riconoscimento sincrono, Chirp 3, verificato a settembre 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Francoforte) | Una sessione di streaming su HTTP/2 o WebSocket; l'input è in formato PCM, FLAC o Ogg-Opus (documentazione dello streaming, verificato a settembre 2026) |
In ogni caso il motore di riconoscimento riceve indicazione della lingua parlata dall'utente — la lingua impostata da ciascun membro nel proprio profilo — perché l'identificazione automatica della lingua si è rivelata inaffidabile sui clip brevi nei nostri test: una nota in russo di quattro secondi è stata restituita come inglese. È così che il prodotto chiama oggi Azure, ed è così che il test ha chiamato allo stesso modo gli altri due servizi.