Architettura

Parla con la tua voce — in una lingua che non parli

La maggior parte degli strumenti di traduzione in tempo reale ti sostituisce con un unico narratore robotico. InterMIND mantiene la tua voce: ogni partecipante sente la traduzione nella voce originale di chi parla. Ecco come funziona la cascata, cosa aggiunge il campione vocale salvato opzionale nelle Impostazioni, e cosa viene memorizzato.

The Mind.com Team

Parla con la tua voce — in una lingua che non parli

Parla con la tua voce — in una lingua che non parli

Ecco l'aspetto della traduzione in tempo reale che quasi tutti sbagliano, e di cui quasi nessuno parla: la voce che ascolti.

Puoi avere un riconoscimento vocale eccellente e una traduzione eccellente, e ritrovarti comunque con una riunione che sembra una macchina che legge un elenco. Perché l'ultimo passaggio — la trasformazione del testo tradotto di nuovo in suono — è dove la maggior parte degli strumenti sostituisce silenziosamente te con un unico narratore sintetico generico. Otto persone nella stanza, un'unica voce robotica per tutti. Perdi chi sta parlando, l'enfasi, la personalità. Comprensibile, ma non una conversazione.

InterMIND affronta l'ultimo passaggio in modo diverso. Quando parli, gli altri partecipanti ascoltano la traduzione con una voce chiaramente riconoscibile come la tua — che porta il tuo timbro e il tuo modo di parlare — mentre pronuncia le parole nella loro lingua. Non è ancora un'imitazione perfetta; il punto è che sei tu anziché un narratore prefabbricato, e sta migliorando. Funziona per ogni partecipante, in entrambe le direzioni, contemporaneamente.

Questo post è il capitolo mancante di Dentro le quattro pipeline di traduzione che alimentano InterMIND: quel pezzo spiegava come l'audio diventa audio tradotto. Questo riguarda di chi è la voce che esce dall'altra parte.


Il predefinito che tutti offrono, e perché è piatto

Se hai usato la traduzione live in una delle grandi piattaforme di meeting, conosci il suono. Una voce neutra e dal ritmo uniforme legge la traduzione. È la stessa voce che si tratti del tuo CEO che apre una town hall o di un collega che fa una battuta. La tecnologia sottostante è la sintesi vocale (text-to-speech) con un unico modello di voce fisso, e il presupposto di design è che l'intelligibilità sia sufficiente.

In una vera riunione non lo è. Metà di ciò che una riunione comunica è chi lo sta dicendo e come. Eliminando la voce trasformi una discussione in una trascrizione che per caso viene letta ad alta voce. Le persone smettono di reagire tra loro e iniziano ad aspettare il proprio turno.

Cosa fa invece InterMIND

La traduzione viene eseguita come una pipeline a cascata — tre fasi specializzate in sequenza anziché un unico modello che cerca di fare tutto. Le prime due fasi sono trattate nel post sulle pipeline; la fase della voce è quella di cui parla questo post:

  1. ASR — riconoscimento vocale. Le tue parole vengono trascritte nella tua lingua, mentre parli, sul nostro motore proprietario — il media server che gestisce la chiamata (Mind API, OVH Francia) — in modo che la traduzione possa iniziare prima che la frase finisca.
  2. MT — traduzione. La trascrizione viene raggruppata in frammenti di frase stabili — clausole — in modo che la traduzione possa iniziare prima che tu abbia finito la frase, e ogni frammento viene tradotto progressivamente nella lingua dell'ascoltatore.
  3. Zero-shot TTS — sintesi vocale. Ogni frammento tradotto viene pronunciato utilizzando un campione della tua stessa voce, e trasmesso all'ascoltatore.

È questa terza fase — ASR → MT → zero-shot TTS — a produrre l'effetto. "Zero-shot" significa che il sistema non ha bisogno di una registrazione preventiva o di una sessione di addestramento per la tua voce. Modella la tua voce dall'audio della riunione a cui stai già partecipando.

Il warm-up: come inizia a suonare come te così in fretta

C'è un problema dell'uovo e della gallina nascosto in "usa un campione della tua stessa voce". All'inizio di una chiamata, il sistema non ti ha ancora sentito abbastanza per modellare bene la tua voce.

InterMIND gestisce la cosa con un warm-up progressivo:

  • Per all'incirca i primi 5–10 secondi, mentre sta ancora raccogliendo abbastanza del tuo parlato, ogni frammento tradotto viene sintetizzato utilizzando il frammento audio che corrisponde a ciò che hai appena detto nella tua lingua di origine. La vocalizzazione è ancorata al tuo parlato reale e immediato.
  • Una volta ottenuto un campione sufficientemente lungo — quel limite di 5–10 secondi — il sistema vi si fissa e lo usa per dare voce a tutto il resto.

Nella pratica non senti scattare un interruttore. La traduzione suona sempre più come te man mano che la conversazione procede — non un duplicato perfetto della tua voce, ma chiaramente tua anziché di una macchina, e in via di miglioramento man mano che il modello ascolta di più. La combinazione di traduzione progressiva (clausola per clausola, non frase per frase) e di vocalizzazione progressiva è ciò che mantiene l'intero processo entro il budget di latenza pur suonando umano.

Registra la tua voce una sola volta e salta il warm-up

Il warm-up di cui sopra è ciò che accade per impostazione predefinita, senza alcuna configurazione. Da settembre 2026 esiste un secondo percorso opzionale per gli utenti che hanno effettuato l'accesso: un campione vocale salvato in Settings → Your voice in translation.

La registrazione è un solo gesto. Premi Record my voice, attendi Speak now, e pronuncia i numeri da uno a dieci in qualsiasi ordine. Ogni numero si illumina sulla scheda man mano che il motore vocale lo sente; quando tutti e dieci sono illuminati, il campione viene verificato e salvato da solo. Non c'è nulla da riprodurre o confermare, e nessun conto alla rovescia: la scheda conserva la porzione della tua registrazione che contiene i numeri. Una stanza tranquilla e un auricolare offrono il risultato migliore.

Ciò che cambia con il campione salvato: dalla tua prossima riunione, il sintetizzatore vocalizza la tua traduzione con esso fin dal primo frammento, così l'altra parte ti sente per come sei fin dalla prima frase invece che dopo il warm-up. Sotto il cofano è la stessa sintesi zero-shot con un punto di partenza migliore; il warm-up live perfeziona ancora la voce man mano che la chiamata procede.

La registrazione viene filtrata prima di essere memorizzata. Dev'essere lunga da 3 a 10 secondi di parlato chiaro (la finestra di input del sintetizzatore): troppo silenziosa, tagliata, per lo più muta o sommersa dal rumore di fondo, e la scheda ti dice cosa correggere e ti chiede un'altra registrazione. I numeri sono stati scelti come frase per un motivo pratico: sono brevi, riconoscibili in ognuna delle 23 lingue, e il motore può confermare di averli sentiti tutti e dieci, il che trasforma "la registrazione è andata bene?" in un "sì" visibile.

Due campioni vocali, due durate

Questa è la parte su cui un team di sicurezza o legale chiede subito spiegazioni, quindi eccola chiaramente. Ci sono due campioni diversi, e vivono in modo differente.

Il campione live utilizzato per il warm-up in riunione è effimero. Esiste solo per la sessione di conferenza in diretta, al servizio della vocalizzazione della traduzione, e non viene memorizzato da nessuna parte. La Mind API e l'SDK che alimentano la sessione in tempo reale non conservano alcun dato; tutto ciò che è temporaneo muore al termine della sessione di conferenza.

Il campione salvato da Settings viene memorizzato con il tuo account, per uno scopo: viene inviato al motore di traduzione ogni volta che ti unisci a una riunione affinché il tuo parlato tradotto possa essere vocalizzato con esso, e per nient'altro. Rimane finché non premi Remove sulla scheda, il che ti riporta immediatamente al warm-up standard, e viene eliminato insieme al tuo account. Gli ospiti non possono registrarne uno; è una funzione riservata agli utenti autenticati per scelta progettuale.

Vale la pena essere precisi su ciò che nessuno dei due campioni è: non è una delle funzioni di registrazione di InterMIND. Registrare audio e video di una riunione è un'azione separata e deliberata che fai di proposito, con i suoi controlli. Un campione vocale è un input per il sintetizzatore vocale: transitorio nel caso live, tuo da conservare o eliminare in quello salvato.

Perché nessun altro offre questo

Non è che la clonazione vocale sia un segreto. È che farlo in tempo reale, per partecipante, in entrambe le direzioni, entro un budget di un secondo, in 23 lingue, senza memorizzare nulla che tu non abbia richiesto è un problema diverso rispetto alla clonazione di una voce offline per un podcast.

Le grandi piattaforme ottimizzano la loro traduzione per la copertura dei sottotitoli e per un'unica voce narrante sicura — questo è il predefinito economico e robusto su larga scala. Mantenere la voce originale di chi parla significa che la fase di sintesi deve tracciare ogni partecipante in modo indipendente e rimanere entro lo stesso budget di latenza in cui vive il resto della pipeline. Abbiamo costruito il motore vocale noi stessi, sulla nostra infrastruttura, ed è questo che rende quel compromesso una nostra scelta. (Maggiori dettagli sul perché il motore è codice nostro: Da cosa è composta una riunione su InterMIND.)

Dove andremo: lip-sync

Mantenere la tua voce metà di un obiettivo più grande. L'altra metà è il tuo viso.

In questo momento senti l'altra persona con la sua voce, ma se sei a camera, le sue labbra si muovono ancora seguendo le parole che ha effettivamente pronunciato — in una lingua che non leggi. Il passo successivo è il lip-sync: la risincronizzazione dei movimenti della bocca di chi parla in base all'audio tradotto, in modo che sul tuo schermo sembri parlare la tua lingua.

Mettile insieme e l'intero senso di questo lavoro prende forma. Due persone che non condividono alcuna lingua comune siedono di fronte a una videochiamata e si vedono e si sentono come se ciascuno fosse un madrelingua della lingua dell'altro — stessa voce, stesso viso, nessun interprete nel mezzo, nessun robot che legge un copione.

Per essere chiari sullo stato dei lavori: la voce è attiva oggi; il lip-sync è sulla roadmap, non è ancora rilasciato. Stiamo indicando la destinazione perché è per questo che il lavoro sulla voce conta — la traduzione con la propria voce non è la funzione, è la prima metà di "parla con chiunque, in qualsiasi lingua, come te stesso."

Dove ascoltarlo

La traduzione con la propria voce è disponibile oggi, in tutte le 23 lingue vocali — le stesse lingue elencate nei docs. Non c'è nulla da attivare separatamente: quando la traduzione è abilitata in una riunione, i partecipanti si sentono automaticamente l'un l'altro con le proprie voci. Saremo onesti su dove ci troviamo: oggi la voce è già riconoscibilmente tua, e la somiglianza è qualcosa che stiamo spingendo attivamente ad avvicinarsi. Vai ad ascoltare e giudica da te.

Una riunione tradotta dovrebbe dare l'impressione che le persone che vi partecipano realmente stiano parlando tra loro. Mantenere la tua voce è il modo in cui si raggiunge questo obiettivo.

Ricevi nuovi post e aggiornamenti del prodotto via email

Un'email al mese con nuovi post e aggiornamenti sul prodotto. Disiscriviti in qualsiasi momento.