Méthodologie

Le benchmark de qualité de traduction d'InterMIND est produit automatiquement par notre propre suite de tests : une exécution synthétique hebdomadaire fait passer sur un jeu de référence fixe le même pipeline de traduction que celui qui alimente la /demo publique, de la même manière pour chaque paire de langues. Il est synthétique et reproductible : rien ici n'est trié sur le volet ni sélectionné à dessein, et aucun humain n'intervient dans la notation.

Comment fonctionne un test

Un test lit un fichier audio de référence (test vocal) ou envoie un texte de référence (test de chat) d'une langue source vers une langue cible, à travers notre pipeline de traduction en direct. La traduction obtenue est notée de 0 à 100 par un juge LLM, par rapport à une traduction de référence canonique.

Juge LLM : google/gemini-3.8-flash en principal, anthropic/claude-sonnet-5 en secours (via Vercel AI Gateway). Le même prompt, la même grille d'évaluation et les mêmes textes de référence sont utilisés pour toutes les paires.

Comment un mois est agrégé

  1. Chaque exécution complète du benchmark est enregistrée dans demo_test_runs avec les scores par langue cible. Les aperçus d'une seule paire sont exclus : seules les exécutions complètes multilingues alimentent les médianes.
  2. Pour chaque combinaison (langue source, langue cible, type de test, semaine), nous conservons l'exécution la plus récente, puis nous agrégeons par mois, de sorte qu'une source unique ne puisse pas faire varier les médianes en répétant une paire au cours d'une même semaine.
  3. À partir de l'ensemble dédoublonné, nous calculons la médiane, le minimum, le maximum, les percentiles p10 et p90, la moyenne et la taille de l'échantillon.
  4. Nous conservons un instantané des scores individuels afin qu'une fois un mois clos, les chiffres restent stables, même après la suppression des exécutions brutes par TTL.

Quand une paire apparaît dans l'index public

Une ligne (paire × type de test × mois) est éligible à l'index public et au sitemap lorsqu'elle atteint une taille d'échantillon minimale et un seuil de score médian (un seuil plus bas pour la voix, qui comporte un bruit de reconnaissance vocale (ASR) inévitable). Comme le jeu de données provient d'une source automatisée unique et non de nombreux visiteurs indépendants, l'exigence de sources uniques est assouplie pour ces données synthétiques : les seuils de taille d'échantillon et de qualité continuent de s'appliquer.

Les paires qui n'atteignent pas ces seuils restent accessibles par lien direct : les seuils ne filtrent que ce que voient les moteurs de recherche. Nous ne cachons pas les scores faibles à ceux qui nous les demandent directement.

Ce que nous ne prétendons délibérément PAS

  • Un score isolé n'est pas fiable. Une paire qui se comporte bien peut varier de 30 points d'une exécution à l'autre, car l'ASR et le jugement du LLM sont tous deux bruités. C'est pourquoi chaque page présente une distribution, et non un chiffre unique.
  • Le juge LLM lui-même est imparfait. Nous pourrons en changer ou recourir à un double jugement à l'avenir ; les lignes historiques porteront alors l'identifiant du juge.
  • Le benchmark ne mesure ni la latence, ni le coût, ni la disponibilité, ni la satisfaction des utilisateurs. Ces éléments sont documentés ailleurs.
  • Le jeu de données est synthétique : il est produit par notre propre suite automatisée, et non par du trafic tiers indépendant. Nous l'indiquons explicitement plutôt que de laisser croire à un panel externe.

Transparence sur les résultats

Lorsqu'un mois se dégrade en qualité pour une paire donnée, il reste visible. Lorsqu'un bug est corrigé et que le mois suivant progresse, l'amélioration est visible sur la même page. Nous ne réécrivons jamais les agrégats historiques. Les administrateurs peuvent seulement masquer des mois individuels de l'index public ; ils ne peuvent pas modifier les chiffres déjà publiés.

Problèmes connus affectant les données historiques

  • Banc de test du chat, avant le 2026-04-23 : le pipeline de test automatisé du chat présentait des défaillances propres à certaines langues. Les agrégats du chat des mois antérieurs peuvent afficher des scores inférieurs à la qualité de traduction réelle de ces périodes. Les mois concernés sont conservés dans la base de données mais exclus de l'index public ; le graphique de tendance présentera un changement de palier au moment de la correction.

Questions

Vous n'êtes pas d'accord avec un point ? Ouvrez un ticket ou écrivez-nous. Nous mettrons à jour cette page et signalerons la modification.