[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-it-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_it\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe su 153 note vocali: perché InterMIND esegue la conversione da voce a testo sul cloud gateway della tua organizzazione (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-su-153-note-vocali-perché-intermind-esegue-lo-speech-to-text-sul-cloud-gateway-della-tua-organizzazione-2026","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe su 153 note vocali: perché InterMIND esegue lo speech-to-text sul cloud gateway della tua organizzazione (2026)",[20,21,22],"p",{},"Una nota vocale in un canale InterMIND diventa un messaggio di testo che ogni collega legge nella propria lingua. Il primo passaggio di questo processo è lo speech-to-text, e la domanda che riceviamo dai revisori IT e compliance non è \"quanto è accurato\" ma \"di chi è il servizio, e dove va l'audio\".",[20,24,25],{},"La risposta breve: Azure AI Speech, il servizio vocale del gateway AI predefinito, nel tenant Azure proprietario di InterMIND in Sweden Central — e i servizi vocali degli altri due gateway che un'organizzazione può scegliere, misurati sugli stessi clip in modo che la scelta sia un numero, non una preferenza. Questo articolo mostra i numeri dietro questa scelta — gli stessi 153 clip elaborati da Azure AI Speech, Google Cloud Speech-to-Text e Amazon Transcribe nello stesso giorno — e i due fatti su ciascuna API che contano più di un punto percentuale di accuratezza.",[27,28,30],"h2",{"id":29},"la-regola-viene-prima-di-tutto-un-gateway-per-organizzazione","La regola viene prima di tutto: un gateway per organizzazione",[20,32,33,34,39],{},"Ogni funzionalità AI in InterMIND — i riepiloghi delle riunioni, i riassunti dei documenti, l'assistente di scrittura, Ask AI e Mia nella riunione — funziona su un unico gateway di modelli linguistici scelto dall'organizzazione: Azure OpenAI nella EU Data Zone per impostazione predefinita, Google Vertex AI sull'endpoint multi-regione UE oppure Amazon Bedrock a Francoforte a scelta, ciascuno nel tenant proprietario di InterMIND. Abbiamo spiegato questa logica in ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","L'AI delle riunioni sul tuo cloud gateway",": per la maggior parte delle organizzazioni quel gateway è già nell'elenco dei sub-responsabili approvati, quindi una funzionalità AI non aggiunge nessuna nuova azienda all'elenco.",[20,41,42],{},"Lo speech-to-text per le note vocali segue oggi la stessa regola sul gateway predefinito, e ciascuno dei tre gateway dispone di un servizio vocale accanto ai propri modelli linguistici — ed è proprio questo che misura l'articolo:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Gateway",[53,57,58],{},"Servizio vocale",[53,60,61],{},"Regione usata in questo test",[53,63,64],{},"Come l'API riceve una registrazione",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, API di trascrizione rapida",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Un'unica richiesta per un file fino a 5 ore e 500 MB (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","documentazione della trascrizione rapida",", verificato a settembre 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, modello Chirp 3",[71,106,107,108],{},"multi-regione ",[109,110,111],"code",{},"eu",[71,113,114,115,120,121,93],{},"Il riconoscimento sincrono è limitato a 60 secondi e 10 MB; l'audio più lungo passa attraverso il riconoscimento batch o in streaming (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"limiti del riconoscimento sincrono",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, streaming",[71,138,139],{},"eu-central-1 (Francoforte)",[71,141,142,143,93],{},"Una sessione di streaming su HTTP\u002F2 o WebSocket; l'input è in formato PCM, FLAC o Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"documentazione dello streaming",[20,149,150],{},"In ogni caso il motore di riconoscimento riceve indicazione della lingua parlata dall'utente — la lingua impostata da ciascun membro nel proprio profilo — perché l'identificazione automatica della lingua si è rivelata inaffidabile sui clip brevi nei nostri test: una nota in russo di quattro secondi è stata restituita come inglese. È così che il prodotto chiama oggi Azure, ed è così che il test ha chiamato allo stesso modo gli altri due servizi.",[27,152,154],{"id":153},"cosa-abbiamo-misurato","Cosa abbiamo misurato",[20,156,157,160,161,165],{},[74,158,159],{},"Il set."," 153 clip in 17 lingue: 136 turni di dialogo — due dialoghi aziendali (una trattativa contrattuale e uno stand-up quotidiano) pronunciati dalle due voci sintetiche del prodotto in dieci lingue — più 17 passaggi formali, le frasi aziendali FLORES-200 del nostro ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","benchmark pubblico di traduzione"," lette da una voce sintetica, una per lingua e della durata di 71-109 secondi. I turni di dialogo durano da 3 a 30 secondi, la lunghezza di una vera nota vocale.",[20,167,168,171],{},[74,169,170],{},"La metrica."," Il word error rate (WER) rispetto al testo di riferimento — la frazione di parole sostituite, inserite o eliminate — dopo la normalizzazione di maiuscole\u002Fminuscole, punteggiatura e spaziatura; cinese e giapponese sono confrontati per carattere. Il character error rate è stato registrato in parallelo e racconta la stessa storia.",[20,173,174,177],{},[74,175,176],{},"Il banco di test."," Uno script, una macchina, un'ora il 2026-09-16, ogni motore su tutti i 153 clip. Azure e Amazon Transcribe hanno elaborato ogni clip per intero. Il riconoscimento sincrono di Google accetta al massimo 60 secondi, quindi i 17 clip formali sono stati tagliati in corrispondenza dei silenzi in segmenti inferiori a 55 secondi e le trascrizioni sono state poi unite; i 136 clip di dialogo sono stati elaborati per intero. Amazon Transcribe richiede audio a un ritmo in tempo reale, quindi il banco di test lo ha alimentato quattro volte più velocemente del tempo reale; la cifra di latenza riportata sotto è quindi un limite minimo imposto dall'alimentazione, non dal servizio.",[20,179,180,183],{},[74,181,182],{},"Cosa non è."," Voci sintetiche in audio silenzioso, non registrazioni sul campo da un telefono in auto. Un giorno, un'esecuzione per clip. È un confronto sull'audio su cui viene testata la nostra stessa pipeline di traduzione, nelle lingue in cui scrivono i nostri utenti — non una classifica.",[27,185,187],{"id":186},"risultati-word-error-rate-per-lingua","Risultati: word error rate per lingua",[20,189,190],{},"WER medio sui clip di ciascuna lingua; ogni motore ha restituito una trascrizione per tutti i 153 clip.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Lingua",[53,201,202],{},"Clip",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"Arabo",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"Cinese",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"Ceco",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"Olandese",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"Inglese",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"Francese",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"Tedesco",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"Hindi",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"Ungherese",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"Italiano",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"Giapponese",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"Coreano",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"Polacco",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"Portoghese (Brasile)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"Russo",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"Spagnolo",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"Turco",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Tutti i 153 clip",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Solo turni di dialogo",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Solo passaggi formali",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Tempo di elaborazione ÷ durata audio",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (limitato dall'alimentazione)",[20,522,523],{},"Le lingue con un solo clip (solo il passaggio formale) sono mostrate per completezza; un valore su un solo clip è un dato puntuale, non un tasso.",[27,525,527],{"id":526},"cosa-dicono-i-numeri","Cosa dicono i numeri",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"Sull'intero set i tre servizi si distanziano di al massimo un punto:"," 9%, 10% e 10%. Ognuno dei 153 clip è tornato con una trascrizione da ogni motore — la copertura delle 17 lingue è completa su tutti e tre.",[532,539,540,543],{},[74,541,542],{},"Le differenze si manifestano per lingua, e vanno in entrambe le direzioni."," Azure ha ottenuto il tasso di errore più basso su francese (5% contro 11% e 12%) e tedesco (7% contro 9% e 13%), ed è a pari merito per il valore più basso su inglese (2%, con Amazon Transcribe) e cinese (3%, con Google). Amazon Transcribe ha ottenuto il valore più basso sull'arabo (26% contro 32% e 46%). Google ha ottenuto il valore più basso su russo (10% contro 14% e 14%), portoghese, ungherese e turco.",[532,545,546,549,550,554],{},[74,547,548],{},"L'arabo è difficile per tutti e tre."," Il miglior risultato sui clip di dialogo in arabo è una parola sbagliata su quattro. Questo è coerente con quanto osservato sul lato traduzione, dove abbiamo ritirato l'arabo dal selettore delle lingue nelle riunioni ad agosto 2026 finché la qualità non supera la nostra soglia (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","quante lingue supportiamo",").",[532,556,557,560],{},[74,558,559],{},"Il tempo di elaborazione è ben al di sotto del tempo reale per tutti e tre."," In questo banco di test, una nota di 30 secondi impiega circa tre secondi su Azure e circa sette su Google; la cifra di Amazon è dominata dall'alimentazione temporizzata.",[27,562,564],{"id":563},"perché-azure-ai-speech-resta-il-servizio-predefinito","Perché Azure AI Speech resta il servizio predefinito",[20,566,567],{},"Tre motivi, nell'ordine in cui hanno determinato la scelta.",[20,569,570,573,574,579],{},[74,571,572],{},"1. Il gateway predefinito è Azure."," Un'organizzazione che non ha scelto un gateway esegue le proprie funzionalità AI su Azure OpenAI nella EU Data Zone, quindi le sue note vocali vengono trascritte da Azure AI Speech nello stesso tenant. Nessun sub-responsabile aggiuntivo, nessuna regione aggiuntiva. Microsoft dichiara che Azure Speech non memorizza né elabora dati al di fuori della regione della risorsa Speech (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"pagina delle regioni",", verificato a settembre 2026); la nostra risorsa si trova in Sweden Central, che è elencata per la trascrizione rapida.",[20,581,582,585,586,590],{},[74,583,584],{},"2. La forma dell'API si adatta a una nota vocale."," Una nota vocale in InterMIND può durare fino a dieci minuti (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","note vocali","). La trascrizione rapida di Azure elabora l'intera registrazione in un'unica richiesta. Il riconoscimento sincrono di Google si ferma a 60 secondi, quindi una nota di dieci minuti richiede il riconoscimento batch tramite un bucket di storage o una sessione di streaming; Amazon Transcribe funziona in streaming, ma accetta PCM, FLAC o Ogg-Opus anziché i formati in cui registrano telefoni e browser, quindi l'audio deve prima essere transcodificato. Entrambi i problemi sono risolvibili — il banco di test li risolve — ma rappresentano più elementi in movimento nel percorso di ogni nota.",[20,592,593,596],{},[74,594,595],{},"3. I numeri non depongono contro questa scelta."," Con il 9% contro il 10% e il 10%, nessun motore su questo set è abbastanza migliore da giustificare lo spostamento delle note vocali fuori dal gateway predefinito. Se Google o Amazon avessero ottenuto la metà del tasso di errore, questo articolo lo direbbe.",[27,598,600],{"id":599},"cosa-significa-questo-per-le-organizzazioni-su-vertex-ai-o-bedrock","Cosa significa questo per le organizzazioni su Vertex AI o Bedrock",[20,602,603],{},"Se la tua organizzazione ha scelto Google Vertex AI o Amazon Bedrock come gateway, le sue funzionalità AI funzionano lì. Le note vocali in queste organizzazioni arrivano attualmente come registrazione senza trascrizione: abbiamo misurato Google Cloud Speech-to-Text e Amazon Transcribe, come mostra questo articolo, ma non li abbiamo ancora integrati nel prodotto. I permessi e il codice di integrazione esistono già; questo articolo verrà aggiornato quando saranno inseriti nel percorso di ogni nota. Fino ad allora, una nota vocale in un'organizzazione su Vertex AI o Bedrock è una registrazione riproducibile; un'organizzazione che passa il proprio gateway ad Azure ottiene le trascrizioni sulle note inviate da quel momento in poi.",[27,605,607],{"id":606},"domande-frequenti","Domande frequenti",[20,609,610],{},[74,611,612],{},"Quale servizio di speech-to-text utilizza InterMIND?",[20,614,615,616,554],{},"Per le note vocali in chat, Azure AI Speech (API di trascrizione rapida) nel tenant Azure proprietario di InterMIND in Sweden Central — il servizio vocale del gateway AI predefinito. Il parlato dal vivo nelle riunioni segue un percorso diverso: funziona sul motore multimediale proprietario di InterMIND, la Mind API, ospitata presso OVH in Francia, e non tocca mai un servizio vocale cloud (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","dove si svolge una riunione",[20,621,622],{},[74,623,624],{},"Azure AI Speech è più accurato di Google Speech-to-Text o Amazon Transcribe?",[20,626,627],{},"Sul nostro set di 153 clip di note vocali in 17 lingue, misurato nello stesso giorno con lo stesso banco di test, Azure AI Speech ha ottenuto un word error rate medio del 9%, Google Cloud Speech-to-Text (Chirp 3) del 10% e Amazon Transcribe del 10%. Per lingua l'ordine cambia: Azure è risultato più basso su francese, inglese e cinese, Amazon Transcribe sull'arabo, Google sul russo. Su un set di registrazioni diverso la classifica può cambiare; la tabella sopra è la prova per il nostro set.",[20,629,630],{},[74,631,632],{},"Cos'è il word error rate, e come è stato calcolato qui?",[20,634,635],{},"Il word error rate è il numero di parole sostituite, inserite ed eliminate diviso per il numero di parole nel testo di riferimento. Normalizziamo maiuscole\u002Fminuscole, punteggiatura e spaziatura prima del confronto, e confrontiamo cinese e giapponese per carattere perché questi sistemi di scrittura non separano le parole con spazi. Un tasso del 9% significa che circa una parola su undici differisce dal riferimento.",[20,637,638],{},[74,639,640],{},"L'audio di una nota vocale esce dall'UE?",[20,642,643,644,646,647,651,652,656],{},"No. La registrazione viene archiviata nell'object storage di InterMIND nell'UE, e il servizio vocale che la trascrive funziona in una regione UE: Sweden Central su Azure, la multi-regione ",[109,645,111],{}," su Google Cloud, Francoforte su AWS. L'elenco completo delle parti e delle regioni è disponibile nella ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","pagina dei sub-responsabili"," e nella ",[35,653,655],{"href":654},"\u002Ftrust","pagina della fiducia",".",[20,658,659],{},[74,660,661],{},"Perché non riconoscere il parlato lato client, nell'app, in modo che l'audio non lasci mai il telefono?",[20,663,664],{},"Abbiamo misurato anche questo, a settembre 2026. Il motore di riconoscimento integrato di Chrome, con elaborazione locale, ha riconosciuto correttamente 0 dei 17 clip formali nelle lingue del prodotto, e la copertura linguistica dei motori lato client è molto più ristretta delle 17 lingue nella tabella sopra. Il riconoscimento lato client è una direzione che rimisuriamo man mano che le piattaforme migliorano; oggi il percorso tramite gateway è quello che funziona per ogni membro in ogni lingua.",[20,666,667],{},[74,668,669],{},"La nostra organizzazione può scegliere quale servizio vocale trascrive le sue note vocali?",[20,671,672],{},"Non separatamente: ciò che un amministratore dell'organizzazione seleziona nella pagina Integrazioni è il gateway AI. Sul gateway predefinito, le note vocali vengono trascritte da Azure AI Speech. Su Vertex AI e Amazon Bedrock, le note vocali non vengono ancora trascritte — vedi la sezione precedente.",[20,674,675],{},[74,676,677],{},"Quanto può durare una nota vocale, e l'API la limita?",[20,679,680],{},"Fino a dieci minuti. La trascrizione rapida di Azure accetta file fino a 5 ore e 500 MB in un'unica richiesta, quindi una nota viene trascritta con una sola chiamata. Il riconoscimento sincrono di Google accetta 60 secondi e 10 MB, motivo per cui il banco di test ha tagliato i clip lunghi in segmenti in corrispondenza dei silenzi.",[20,682,683],{},[74,684,685],{},"Perché al motore di riconoscimento viene indicata la lingua di chi parla invece di rilevarla automaticamente?",[20,687,688],{},"Perché una nota vocale è breve. Su un clip di quattro secondi, l'identificazione automatica della lingua può restituire la lingua sbagliata — una nota di prova in russo è tornata come inglese; la lingua impostata nel profilo di un membro è corretta quasi sempre. Il motore di riconoscimento riceve quella lingua, e solo quando non è nota riceve le lingue della stanza come candidate.",[20,690,691],{},[74,692,693],{},"L'audio della riunione viene trascritto dallo stesso servizio?",[20,695,696,697,699,700,554],{},"No. Il parlato dal vivo in una riunione viene riconosciuto e tradotto sul motore proprietario di InterMIND (la Mind API) sul server multimediale che gestisce la chiamata, ospitato presso OVH in Francia — vedi ",[35,698,619],{"href":618},". Il cloud gateway vede il testo, mai l'audio di una chiamata (",[35,701,702],{"href":37},"l'AI delle riunioni sul tuo gateway",[20,704,705],{},[74,706,707],{},"Pubblicherete di nuovo i risultati?",[20,709,710],{},"Il banco di test funziona con un solo comando, e i permessi di ogni motore sono già configurati, quindi la tabella può essere rimisurata quando un fornitore rilascia un nuovo modello. Quando la situazione cambia, questo articolo viene aggiornato con la data.",[712,713],"hr",{},[27,715,717],{"id":716},"provalo-di-persona","Provalo di persona",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Scopri come funzionano le note vocali"," — registrazione, il limite di dieci minuti e dove va l'audio.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Consulta l'elenco dei sub-responsabili"," — fornitore, paese, finalità e regione per ogni parte che elabora i tuoi dati.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Prova la demo dal vivo"," — la pipeline di traduzione in produzione sul tuo audio, senza registrazione.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Fonti: Microsoft — Azure AI Speech, trascrizione rapida (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") e tabella delle regioni Speech (",[35,759,756],{"href":576,"rel":760},[91],"); Google Cloud — modello Chirp 3 (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), limiti del riconoscimento sincrono (",[35,768,765],{"href":117,"rel":769},[91],") e lingue supportate (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — streaming di Amazon Transcribe (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), endpoint e quote (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); tutto verificato a settembre 2026. Misurazione: InterMIND speech bench, 2026-09-16, 153 clip, 17 lingue.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Abbiamo misurato i servizi di conversione da voce a testo dei tre cloud gateway che un'organizzazione InterMIND può scegliere — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) e Amazon Transcribe — sugli stessi 153 clip di note vocali in 17 lingue, un unico sistema di test, un solo giorno. Tassi di errore per parola per lingua, il metodo, i limiti di ciascuna API e perché il riconoscitore segue il gateway invece che la classifica.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","YatvM2f0G-GRM3L-qTYSMzEtH9x6fCOfehg9wDxV_VQ",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Paga solo per le persone che lo usano: InterMIND passa alla fatturazione per membro attivo","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Pro e Business smettono di vendere postazioni assegnate manualmente. Invita tutto il team; ogni rinnovo conteggia i membri attivi nei 28 giorni precedenti e fattura solo quelli. Un membro che diventa inattivo mantiene l'accesso senza alcun costo; gli ospiti delle riunioni e i partecipanti ai canali esterni restano gratuiti. Cosa conta come attivo, come varia il numero all'interno di un ciclo di fatturazione, cosa dice la lettera prima del rinnovo e cosa cambia nella tua pagina di fatturazione.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Sottotitoli tradotti in diretta per tutto il pubblico: i requisiti di Zoom, Teams e Google Meet e come ogni partecipante legge nella propria lingua (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Un oratore, un pubblico in dieci lingue. I sottotitoli tradotti esistono in Zoom, Microsoft Teams e Google Meet — ciascuno dietro una licenza diversa, e ciascuno risponde in modo diverso alla stessa domanda: chi decide quali lingue il pubblico può leggere. Teams consente a un organizzatore di town hall di preselezionare sei lingue (dieci con Teams Premium); le coppie di Zoom sono impostate dalle impostazioni dell'account dell'host; Google Meet limita i sottotitoli tradotti alle edizioni a pagamento di Workspace. La mappa documentata, accanto a come funziona in InterMIND, dove la lingua dei sottotitoli è un'impostazione dal lato del partecipante e la stanza è tradotta anche tramite voce."]