Perché il marketing sulla qualità della traduzione è rotto — e cosa pubblichiamo noi
Aprite il sito di qualsiasi fornitore di traduzione in diretta. Vedrete sempre gli stessi numeri:
- "Oltre 200 lingue"
- "Oltre 6.000 coppie di lingue"
- "Il primo al mondo" / "La massima precisione"
- "Preciso al 99%"
Ora provate a trovare — in una qualsiasi di quelle pagine dei fornitori — cosa significano quei numeri per una riunione che state per avviare. Qualità per lingua. Metodologia riproducibile. Dimensione del campione. Punteggio nel tempo. Divulgazione onesta su dove il modello è debole.
Non la troverete. Non nel materiale marketing, e raramente nella documentazione.
Questo è l'equilibrio della categoria. Esiste per tre motivi:
- La maggior parte dei fornitori non possiede un proprio motore di traduzione. Instradano le richieste tramite OpenAI, Google, DeepL, Microsoft o una combinazione di questi. Pubblicare dati sulla qualità per ogni coppia significherebbe valutare il modello di qualcun altro — non c'è alcun valore di marketing nel farlo.
- I dati onesti sulla qualità sono difficili da mettere su un cartellone. Un singolo punteggio è rumoroso. Una distribuzione è più utile ma più difficile da comprimere. Un
trend degli ultimi sei mesiè ancora più utile, e ancora più difficile da comprimere. - I reparti acquisti non hanno ancora reagito. Gli acquirenti prendono i numeri del marketing per buoni, e così l'equilibrio si mantiene.
L'equilibrio non durerà. La prossima categoria di acquirenti — farmaceutico, legale, finanziario, audit, settore pubblico — porrà domande più difficili di "quante lingue". Abbiamo creato /benchmark perché pensiamo che non debbano accontentarsi della parola di un fornitore.
Cosa non vi dicono i numeri del marketing
"Oltre 200 lingue" significa che un fornitore ha un modello che emette testo in 200 lingue. La qualità tra queste lingue varia da livello di produzione per le coppie principali (EN↔DE, EN↔ES, EN↔FR) a malapena utilizzabile per le coppie con poche risorse. Senza un'analisi per coppia, non potete dire da che parte di quella linea cadrà la vostra riunione.
"Oltre 6.000 coppie di lingue" è la combinatoria N × N su 80 lingue di origine. Dire che supportate 6.000 coppie è la parte facile. Dire che una coppia specifica è abbastanza buona per una revisione CAPA, una negoziazione contrattuale o una conference call sui risultati — quella è la parte che non troverete nella brochure.
"Preciso al 99%", senza specificare cosa è stato misurato, rispetto a quale riferimento, su quale campione, da quale giudice — è privo di contenuto. La qualità della traduzione non ha uno scalare universale. Ha una distribuzione che dipende dalla coppia di lingue, dal dominio dei contenuti, dalla qualità audio (per la voce), dal budget di latenza e da cosa significa "abbastanza buono" per il caso d'uso specifico.
Cosa un acquirente deve davvero sapere
Le domande che compaiono nelle vere revisioni DPA e nelle valutazioni degli acquisti:
- Qualità per coppia — come si comporta su DE↔EN, EN↔AR, JA↔KO, nello specifico?
- Dimensione del campione — su quante esecuzioni si basa il numero dichiarato? Dieci? Diecimila?
- Metodologia — chi giudica le traduzioni, rispetto a quale riferimento, con quale griglia di valutazione?
- Distribuzione, non media — com'è il 10% nel peggiore dei casi? Il 10% migliore? La mediana?
- Deriva nel tempo — una determinata coppia è migliorata o peggiorata dall'ultima volta che avete pubblicato un numero?
- Cosa non misurate — cosa non rileva esplicitamente il vostro benchmark?
Nessuna di queste è senza risposta. Semplicemente non sono nella pagina marketing di nessuno.
Cosa pubblichiamo
/benchmark è la nostra risposta. La metodologia si trova in /benchmark/methodology — scritta prima che sapessimo che l'avreste letta.
Tre cose la separano dagli standard della categoria.
1. Traffico reale, non una suite curata
Ogni punteggio nel benchmark pubblico proviene da una reale esecuzione di test su /demo. Non preselezioniamo le coppie che ottengono buoni risultati. La stessa pipeline che serve la demo di un acquirente è quella che viene misurata.
2. Il giudice è nominato
Principale: google/gemini-3.5-flash. Fallback: anthropic/claude-sonnet-5. Entrambi tramite Vercel AI Gateway. Il giudice fa parte della metodologia — divulgato per nome. Quando cambiamo il giudice (l'abbiamo fatto, quando i modelli vengono ritirati), le righe storiche riportano il giudice che le ha effettivamente valutate; i vecchi punteggi non vengono mai ricalcolati silenziosamente.
3. La distribuzione è il dato, non la media
Ogni riga pubblicata mostra mediana, p10, p90, min, max e dimensione del campione — non un singolo numero. Un singolo numero per una coppia di traduzione è rumore. La forma della distribuzione è il segnale.
Pratiche che la categoria non ha adottato
- Le coppie con punteggi bassi non sono nascoste. L'accesso all'indice pubblico è subordinato a
≥ 10 IP distinti, ≥ 10 esecuzioni, mediana ≥ 60— ma chiunque può creare un deep link direttamente a qualsiasi coppia e vedere i numeri reali, incluse le coppie che ottengono scarsi risultati questo mese. - I problemi noti sono documentati. Quando il framework di test della chat non funzionava per alcune settimane all'inizio del 2026, quel periodo è stato escluso dall'indice e annotato per iscritto nella pagina della metodologia. La storia non viene riscritta silenziosamente.
- Ciò che deliberatamente NON rivendichiamo è un'intera sezione sulla pagina della metodologia. Diciamo dove il giudice LLM stesso è imperfetto. Diciamo cosa non misuriamo (latenza, costi, soddisfazione degli utenti, errori lato ASR prima ancora che la traduzione venga eseguita). Dichiariamo che i nostri stessi smoke test automatici fanno parte del traffico.
Un filtro per la prossima valutazione dei fornitori
Se state valutando qualsiasi piattaforma per riunioni multilingue — la nostra o un'altra — la metodologia è la pagina che vale la pena leggere. I numeri stessi sono la parte facile.
Un filtro pratico per qualsiasi fornitore in questa categoria:
- Chiedete dati di qualità per coppia di lingue e per mese sul traffico reale. Non un benchmark curato. Non un aggregato.
- Chiedete qual è il loro giudice, cosa non misurano esplicitamente e cosa è cambiato negli ultimi sei mesi.
- Chiedete cosa succede quando il punteggio di una coppia scende — lo dicono a qualcuno o lo correggono silenziosamente?
Se il fornitore ha tutte e tre le risposte per iscritto, valutatelo seriamente. Se non le ha, state comprando marketing — non qualità della traduzione.
Provatelo voi stessi
- Prova la demo in diretta — esegue la pipeline di traduzione di produzione sul vostro audio, la valuta con lo stesso giudice che valuta il benchmark pubblico e vi mostra l'output.
- Visualizza il benchmark — ogni coppia di lingue pubblicata, ogni mese, con la distribuzione completa.
- Leggi la metodologia — come vengono calcolati i numeri, cosa includono e cosa no.
Non dovrete fidarvi della nostra parola per nulla di tutto ciò. Questo è il punto.
Fonti: gli identificatori dei giudici, le soglie di accesso e le regole di esclusione sopra riportati sono verificati rispetto al codice distribuito e pubblicati su /benchmark/methodology; i giudici sono serviti tramite Vercel AI Gateway; le affermazioni di marketing citate all'inizio sono formulazioni tipiche della categoria, non citazioni di un fornitore specifico; verificato ad agosto 2026.