[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-it-\u002Fown-voice-translation":3},{"page":4,"surround":343},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":330,"demo-cta":331,"description":332,"extension":333,"genre":334,"heroOrder":335,"image":336,"meta":337,"navigation":338,"no-translate":331,"path":339,"rank-country":335,"rank-keywords":335,"rank-tag":335,"seo":340,"stem":341,"updated":335,"__hash__":342},"blog_it\u002Fblog\u002Fown-voice-translation.md","Parla con la tua voce — in una lingua che non parli",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":318},"minimark",[14,18,26,34,45,56,59,64,67,78,82,93,123,130,134,141,144,163,173,177,180,195,206,213,217,224,234,238,245,256,259,266,270,286,315],[15,16,6],"h1",{"id":17},"parla-con-la-tua-voce-in-una-lingua-che-non-parli",[19,20,21,22],"p",{},"Ecco la parte della traduzione in tempo reale che quasi tutti sbagliano, e di cui quasi nessuno parla: ",[23,24,25],"strong",{},"la voce che senti.",[19,27,28,29,33],{},"Puoi avere un riconoscimento vocale eccellente e una traduzione eccellente, e ritrovarti comunque in una riunione che sembra una macchina che legge un elenco. Perché l'ultimo passaggio — trasformare il testo tradotto di nuovo in suono — è dove la maggior parte degli strumenti sostituisce silenziosamente ",[30,31,32],"em",{},"te"," con un unico narratore sintetico generico. Otto persone nella stanza, una voce robotica per tutti. Perdi chi sta parlando, l'enfasi, la personalità. Comprensibile, ma non una conversazione.",[19,35,36,37,40,41,44],{},"InterMIND affronta l'ultimo passaggio in modo diverso. Quando parli, gli altri partecipanti ascoltano la traduzione in una voce ",[23,38,39],{},"chiaramente riconoscibile come tua"," — che mantiene il tuo timbro e il tuo modo di parlare — ora mentre pronuncia le parole nella loro lingua. Non è ancora un'imitazione perfetta; il punto è che sei ",[30,42,43],{},"tu"," anziché un narratore standard, e sta migliorando. Funziona per ogni partecipante, in entrambe le direzioni, contemporaneamente.",[19,46,47,48,55],{},"Questo post è il capitolo mancante di ",[49,50,52],"a",{"href":51},"\u002Fblog\u002Finside-the-translation-pipelines",[30,53,54],{},"Dentro le quattro pipeline di traduzione che guidano InterMIND",": quell'articolo spiegava come l'audio diventa audio tradotto. Questo riguarda la voce di chi esce dall'altra parte.",[57,58],"hr",{},[60,61,63],"h2",{"id":62},"il-predefinito-che-tutti-rilasciano-e-perché-è-piatto","Il predefinito che tutti rilasciano, e perché è piatto",[19,65,66],{},"Se hai usato la traduzione in diretta in una delle grandi piattaforme di riunioni, conosci il suono. Una voce neutra e dal ritmo uniforme legge la traduzione. È la stessa voce che il relatore sia il tuo CEO che apre un town hall o un collega che fa una battuta. La tecnologia sottostante è il text-to-speech con un unico modello vocale fisso, e il presupposto di progettazione è che l'intelligibilità sia sufficiente.",[19,68,69,70,73,74,77],{},"In una riunione reale non lo è. Metà di ciò che comunica una riunione è ",[30,71,72],{},"chi"," lo sta dicendo e ",[30,75,76],{},"come",". Privata della voce, hai trasformato una discussione in una trascrizione che per caso viene letta ad alta voce. Le persone smettono di reagire tra loro e iniziano ad aspettare il proprio turno.",[60,79,81],{"id":80},"cosa-fa-invece-intermind","Cosa fa invece InterMIND",[19,83,84,85,88,89,92],{},"La traduzione viene eseguita come una ",[23,86,87],{},"pipeline a cascata"," — tre fasi specializzate in sequenza invece di un unico modello che cerca di fare tutto. Le prime due fasi sono trattate nel ",[49,90,91],{"href":51},"post sulle pipeline","; la fase della voce è quella di cui parla questo post:",[94,95,96,103,113],"ol",{},[97,98,99,102],"li",{},[23,100,101],{},"ASR — riconoscimento vocale."," Le tue parole vengono trascritte nella tua lingua, nel tuo browser, mentre parli. (Eseguirlo localmente evita un round-trip e offre il ritardo più basso possibile prima che la traduzione possa anche solo iniziare.)",[97,104,105,108,109,112],{},[23,106,107],{},"MT — traduzione."," La trascrizione viene raggruppata in frammenti di frase stabili — ",[30,110,111],{},"clausole"," — in modo che la traduzione possa iniziare prima che tu abbia finito la frase, e ogni frammento viene tradotto progressivamente nella lingua dell'ascoltatore.",[97,114,115,118,119,122],{},[23,116,117],{},"Zero-shot TTS — sintesi vocale."," Ogni frammento tradotto viene pronunciato ",[23,120,121],{},"utilizzando un campione della tua voce",", e trasmesso in streaming all'ascoltatore.",[19,124,125,126,129],{},"È quella terza fase — ASR → MT → ",[23,127,128],{},"zero-shot TTS"," — a produrre l'effetto. \"Zero-shot\" significa che il sistema non ha bisogno di una registrazione pre-registrata o di una sessione di addestramento per la tua voce. Modella la tua voce dall'audio della riunione in cui ti trovi già.",[60,131,133],{"id":132},"il-riscaldamento-come-inizia-a-suonare-come-te-così-in-fretta","Il riscaldamento: come inizia a suonare come te così in fretta",[19,135,136,137,140],{},"C'è un problema dell'uovo e della gallina nascosto in \"usa un campione della tua voce\". All'inizio di una chiamata, il sistema non ti ha ancora ",[30,138,139],{},"sentito"," abbastanza per modellare bene la tua voce.",[19,142,143],{},"InterMIND lo gestisce con un riscaldamento progressivo:",[145,146,147,157],"ul",{},[97,148,149,152,153,156],{},[23,150,151],{},"Per all'incirca i primi 5–10 secondi",", mentre sta ancora raccogliendo abbastanza del tuo parlato, ogni frammento tradotto viene sintetizzato utilizzando il frammento audio che corrisponde a ciò che ",[30,154,155],{},"hai appena detto"," nella tua lingua di origine. La vocalizzazione è ancorata al tuo parlato reale e immediato.",[97,158,159,162],{},[23,160,161],{},"Una volta che c'è un campione sufficientemente lungo"," — quel segno dei 5–10 secondi — il sistema vi si fissa e lo utilizza per vocalizzare tutto ciò che segue.",[19,164,165,166,169,170,172],{},"In pratica non senti uno scatto di interruttore. La traduzione suona più come te man mano che la conversazione procede — non un doppio perfetto della tua voce, ma chiaramente tua piuttosto che di una macchina, e in miglioramento man mano che il modello ascolta di più. La combinazione di traduzione ",[30,167,168],{},"progressiva"," (clausola per clausola, non frase per frase) e vocalizzazione ",[30,171,168],{}," è ciò che mantiene tutto entro il budget di latenza pur suonando umano.",[60,174,176],{"id":175},"il-campione-vocale-non-viene-mai-archiviato","Il campione vocale non viene mai archiviato",[19,178,179],{},"Questa è la parte su cui un team di sicurezza o legale chiede spiegazioni immediatamente, quindi eccola chiaramente.",[19,181,182,183,186,187,190,191,194],{},"Il campione vocale utilizzato per la sintesi è ",[23,184,185],{},"effimero",". Esiste solo per la sessione di conferenza in diretta, al servizio della vocalizzazione della traduzione, e ",[23,188,189],{},"non viene archiviato da nessuna parte",". La Mind API e l'SDK che alimentano la sessione in tempo reale non conservano ",[23,192,193],{},"alcun dato"," — tutto ciò che è temporaneo svanisce quando la sessione di conferenza termina.",[19,196,197,198,201,202,205],{},"Vale la pena essere precisi su cosa ",[30,199,200],{},"non è"," questo campione: non è una delle funzionalità di ",[23,203,204],{},"registrazione"," di InterMIND. Registrare video e audio di una riunione è un'azione separata e deliberata che compi di proposito, con i suoi controlli. Il campione della voce propria non è una registrazione — è un input transitorio per il sintetizzatore vocale che non sopravvive mai alla chiamata.",[19,207,208,209,212],{},"Questo conta oltre l'igiene della privacy. \"Parla con la tua voce\" è esattamente il tipo di funzionalità che ",[30,210,211],{},"suona"," come se dovesse implicare l'archiviazione di un'impronta vocale da qualche parte. Non è così. La versione onesta è la storia migliore: la tua voce viene modellata sul momento e sparisce quando riagganci.",[60,214,216],{"id":215},"perché-nessun-altro-rilascia-questo","Perché nessun altro rilascia questo",[19,218,219,220,223],{},"Non è che il voice cloning sia un segreto. È che farlo ",[23,221,222],{},"in diretta, per partecipante, in entrambe le direzioni, con un budget di un secondo, in 24 lingue, senza archiviare nulla"," è un problema diverso rispetto al clonare una voce offline per un podcast.",[19,225,226,227,233],{},"Le grandi piattaforme ottimizzano la loro traduzione per la copertura dei sottotitoli e una singola voce narrante sicura — questo è l'impostazione predefinita economica e robusta su larga scala. Mantenere la voce originale di ogni relatore significa che la fase di sintesi deve monitorare ogni partecipante in modo indipendente e rimanere entro lo stesso budget di latenza in cui opera il resto della pipeline. Abbiamo costruito noi stessi il motore vocale, sulla nostra infrastruttura, ed è questo che rende quel compromesso una nostra scelta. (Maggiori dettagli sul perché il motore è codice nostro: ",[49,228,230],{"href":229},"\u002Fblog\u002Fwhat-one-intermind-meeting-is-built-from",[30,231,232],{},"Da cosa è composta una riunione su InterMIND",".)",[60,235,237],{"id":236},"dove-sta-andando-tutto-questo-lip-sync","Dove sta andando tutto questo: lip-sync",[19,239,240,241,244],{},"Mantenere la tua voce è metà di un obiettivo più grande. L'altra metà è il tuo ",[23,242,243],{},"viso",".",[19,246,247,248,251,252,255],{},"In questo momento senti l'altra persona con la sua voce, ma se sei in video, le sue labbra si muovono ancora seguendo le parole che ha effettivamente detto — in una lingua che non capisci. Il passo successivo è il ",[23,249,250],{},"lip-sync",": ricalibrare i movimenti della bocca del relatore sull'audio tradotto, in modo che sul tuo schermo sembri parlare ",[30,253,254],{},"la tua"," lingua.",[19,257,258],{},"Mettendo insieme le due cose, l'intero scopo di questo lavoro prende forma. Due persone che non condividono alcuna lingua comune si siedono di fronte a una videochiamata e si vedono e si sentono come se ciascuno fosse un madrelingua della lingua dell'altro — stessa voce, stesso viso, nessun interprete nel mezzo, nessun robot che legge un copione.",[19,260,261,262,265],{},"Per essere chiari sullo stato: ",[23,263,264],{},"la voce è attiva oggi; il lip-sync è nella roadmap, non è stato ancora rilasciato."," Stiamo indicando la destinazione perché è per questo che il lavoro sulla voce conta — la traduzione con la propria voce non è la funzionalità, è la prima metà di \"parla con chiunque, in qualsiasi lingua, come te stesso\".",[60,267,269],{"id":268},"dove-ascoltarlo","Dove ascoltarlo",[19,271,272,273,276,277,281,282,285],{},"La traduzione con la propria voce è ",[23,274,275],{},"attiva oggi, in tutte le 21 lingue vocali"," — le stesse lingue elencate nella ",[49,278,280],{"href":279},"\u002Fdocs\u002Ftranslation\u002Flanguages","documentazione",". Non c'è nulla da attivare separatamente: quando la traduzione è abilitata in una riunione, i partecipanti si ascoltano automaticamente l'un l'altro con le proprie voci. Saremo onesti su dove si trova: oggi la voce è già chiaramente riconoscibile come ",[30,283,284],{},"tua",", e la somiglianza è qualcosa che stiamo spingendo attivamente per avvicinarla di più. Vai ad ascoltare e giudica tu stesso.",[145,287,288,297,306],{},[97,289,290,296],{},[23,291,292],{},[49,293,295],{"href":294},"\u002Fdemo","Prova la demo"," — esegue la pipeline vocale in diretta sul tuo audio in una qualsiasi delle 24 lingue.",[97,298,299,305],{},[23,300,301],{},[49,302,304],{"href":303},"\u002Fbenchmark","Vedi i numeri sulla qualità"," — la stessa pipeline di produzione, valutata mensilmente su FLORES-200, con la distribuzione completa pubblicata per coppia di lingue.",[97,307,308,314],{},[23,309,310],{},[49,311,313],{"href":312},"\u002Fdocs\u002Ftranslation\u002Fown-voice","Come funziona, nella documentazione"," — la versione breve di questo post.",[19,316,317],{},"Una riunione tradotta dovrebbe dare l'impressione che le persone che vi partecipano realmente stiano parlando tra loro. Mantenere la tua voce è il modo in cui si arriva a questo.",{"title":319,"searchDepth":320,"depth":321,"links":322},"",2,3,[323,324,325,326,327,328,329],{"id":62,"depth":320,"text":63},{"id":80,"depth":320,"text":81},{"id":132,"depth":320,"text":133},{"id":175,"depth":320,"text":176},{"id":215,"depth":320,"text":216},{"id":236,"depth":320,"text":237},{"id":268,"depth":320,"text":269},"2026-06-13",false,"La maggior parte degli strumenti di traduzione in diretta ti sostituisce con un unico narratore robotico. InterMIND conserva la tua voce: ogni partecipante ascolta la traduzione con la voce originale di chi parla. Ecco come fa la cascata — e perché il campione vocale non viene mai archiviato.","md","editorial",null,"\u002Fblog\u002Fown-voice-translation.svg",{},true,"\u002Fblog\u002Fown-voice-translation",{"title":6,"description":332},"blog\u002Fown-voice-translation","Nyspq13rS5Al2cu3pR7Lmo-o9Ur2oBdbxzEv86C6Dg0",[344,349],{"title":345,"path":346,"stem":347,"description":348,"children":-1},"Abbiamo completato il nostro audit GDPR. Ecco cosa abbiamo effettivamente chiuso.","\u002Fblog\u002Fgdpr-audit-what-we-closed","blog\u002Fgdpr-audit-what-we-closed","Il badge \"conforme al GDPR\" di un fornitore non significa nulla senza il lavoro che c'è dietro. Abbiamo eseguito un audit completo della nostra codebase rispetto agli obblighi GDPR che ricadono su un responsabile del trattamento dei dati — cancellazione, conservazione, sub-processori, runtime UE — ed ecco ogni elemento che abbiamo chiuso, verificato rispetto al codice.",{"title":350,"path":351,"stem":352,"description":353,"children":-1},"Traduzione in diretta di Microsoft Teams: come funziona e dove si ferma","\u002Fblog\u002Fteams-live-translation","blog\u002Fteams-live-translation","Teams può tradurre una riunione in diretta in tre modi: sottotitoli tradotti, l'agente AI Interpreter e canali di interpretazione umana. Cosa richiede ciascuno, quanto costa e i limiti che determinano se è adatto alla tua riunione."]