Metodologia

Il benchmark della qualità di traduzione di InterMIND è prodotto automaticamente dalla nostra suite di test: un'esecuzione sintetica settimanale fa passare un insieme di riferimento fisso attraverso la stessa pipeline di traduzione che alimenta la /demo pubblica, con le stesse modalità per ogni coppia di lingue. È sintetico e riproducibile: nulla qui è curato o selezionato ad hoc e nel processo di valutazione non interviene alcuna persona.

Come funziona un singolo test

Un test riproduce un file audio di riferimento (test vocale) o invia un testo di riferimento (test chat) da una lingua di partenza, attraverso la nostra pipeline di traduzione in tempo reale, verso una lingua di destinazione. La traduzione ottenuta riceve un punteggio da 0 a 100 assegnato da un giudice LLM, rispetto a una traduzione di riferimento canonica.

Giudice LLM: google/gemini-3.8-flash come principale, anthropic/claude-sonnet-5 come ripiego (tramite Vercel AI Gateway). Per tutte le coppie si usano lo stesso prompt, la stessa griglia di valutazione e gli stessi testi di riferimento.

Come si aggrega un mese

  1. Ogni esecuzione completa del benchmark viene registrata in demo_test_runs con i punteggi per lingua di destinazione. Le anteprime di singole coppie sono escluse: solo le esecuzioni complete su più lingue alimentano le mediane.
  2. Per ogni combinazione (lingua di partenza, lingua di destinazione, tipo di test, settimana) manteniamo l'esecuzione più recente, quindi aggreghiamo per mese: in questo modo una singola fonte non può spostare le mediane ripetendo una coppia nell'arco di una settimana.
  3. Dall'insieme deduplicato calcoliamo mediana, minimo, massimo, p10, p90, media e dimensione del campione.
  4. Salviamo un'istantanea dei singoli punteggi, in modo che, una volta chiuso un mese, i numeri restino stabili anche dopo che le esecuzioni grezze sono state eliminate dal TTL.

Quando una coppia compare nell'indice pubblico

Una riga (coppia × tipo di test × mese) è idonea per l'indice pubblico e la sitemap quando raggiunge una dimensione minima del campione e una soglia minima di punteggio mediano (più bassa per il test vocale, che comporta un inevitabile rumore dell'ASR). Poiché il dataset proviene da un'unica fonte automatizzata e non da molti visitatori indipendenti, per questi dati sintetici il requisito di fonti uniche è attenuato: le soglie di dimensione del campione e di qualità continuano ad applicarsi.

Le coppie che non raggiungono le soglie restano accessibili tramite link diretto: le soglie regolano solo ciò che vedono i motori di ricerca. Non nascondiamo i punteggi bassi a chi li chiede direttamente.

Cosa NON affermiamo deliberatamente

  • Un singolo punteggio non è affidabile. Una coppia che funziona bene può oscillare di 30 punti tra un'esecuzione e l'altra, perché sia l'ASR sia il giudizio dell'LLM sono soggetti a rumore. Per questo ogni pagina mostra una distribuzione e non un singolo numero.
  • Il giudice LLM stesso è imperfetto. In futuro potremmo cambiarlo o adottare un doppio giudice; in tal caso le righe storiche riporteranno l'identificativo del giudice.
  • Il benchmark non misura latenza, costi, disponibilità o soddisfazione degli utenti. Questi aspetti sono documentati altrove.
  • Il dataset è sintetico: è prodotto dalla nostra suite automatizzata, non da traffico indipendente di terze parti. Lo dichiariamo esplicitamente, senza lasciar intendere l'esistenza di un panel esterno.

Trasparenza sui risultati

Quando in un mese la qualità di una determinata coppia cala, il dato resta visibile. Quando un bug viene corretto e il mese successivo i punteggi risalgono, il miglioramento è visibile sulla stessa pagina. Non riscriviamo mai gli aggregati storici. Gli amministratori possono solo nascondere singoli mesi dall'indice pubblico; non possono modificare i numeri già pubblicati.

Problemi noti che incidono sui dati storici

  • Harness dei test chat, prima del 2026-04-23: la pipeline automatizzata dei test chat presentava errori per singole lingue. Gli aggregati chat dei mesi precedenti possono mostrare punteggi inferiori rispetto all'effettiva qualità di traduzione di quei periodi. I mesi interessati sono conservati nel database ma esclusi dall'indice pubblico; il grafico dell'andamento mostrerà un salto in corrispondenza della correzione.

Domande

Non sei d'accordo con qualcosa? Apri una issue o scrivici. Aggiorneremo questa pagina e segnaleremo la modifica.