Dentro le quattro pipeline di traduzione che alimentano InterMIND
La vecchia pagina /product/overview/how-it-works su mind.com è rimasta indietro di diverse versioni principali. Descrive un unico "motore di traduzione" come fanno le pagine della maggior parte dei fornitori — una grande freccia da "tu parli" a "loro ascoltano". Quell'immagine era già una semplificazione due anni fa. Oggi è sbagliata.
La verità è che InterMIND utilizza quattro pipeline di traduzione separate, ciascuna delle quali risolve un problema diverso con un motore diverso, un budget di latenza diverso e un livello di qualità diverso. Condividono un selettore di lingua. Non condividono un motore.
Questa è la risposta aggiornata a "come funziona".
Un articolo complementare: "Quante lingue supportate?" illustra ciò che ogni pipeline copre (23 / 23 / 30 / 17). Questo post illustra cosa fa ogni pipeline — e perché è unica.
Perché "un unico motore per tutto" è una bugia
Una piattaforma di riunioni in diretta ha almeno quattro compiti da svolgere contemporaneamente, e questi vanno in direzioni incompatibili:
- Voce in tempo reale — audio in ingresso, audio tradotto in uscita, in meno di un secondo, ogni partecipante nella propria lingua. Il vincolo rigoroso è la latenza.
- Testo della chat in tempo reale — messaggi brevi, veloci, con modifiche, citazioni e struttura HTML preservata.
- Note condivise in tempo reale — digitazione collaborativa carattere per carattere, con gerarchia strutturale (elenchi, intestazioni, caselle di controllo) che deve sopravvivere alla traduzione.
- File di documenti asincroni — un PDF di 40 pagine rilasciato in chat. Nessun budget di latenza. Il vincolo rigoroso è la fedeltà — formattazione, tabelle, numeri di pagina, caratteri.
Puoi creare un'unica gigantesca chiamata LLM che cerca di fare tutte e quattro le cose. Ci abbiamo provato. È scarso in tutte e quattro. Il budget di latenza per la voce significa che il modello non può pensare; il budget di fedeltà per i documenti significa che il modello deve farlo. Una modifica in chat necessita di un diff nella lingua del partecipante; un PDF di 40 pagine richiede la preservazione del formato che nessun modello di token-streaming ti offre.
Quindi ne utilizziamo quattro. Ecco ciascuna di esse.