Méthodologie

Pourquoi le marketing de la qualité de traduction est défaillant — et ce que nous publions à la place

Tous les fournisseurs de traduction publient le nombre de langues prises en charge. Aucun ne publie de qualité vérifiable par paire de langues sur du trafic réel. Pourquoi cet écart a de l'importance lors de votre prochaine évaluation d'achat — et ce que nous publions à la place.

The Mind.com Team

Pourquoi le marketing de la qualité de traduction est défaillant — et ce que nous publions à la place

Pourquoi le marketing de la qualité de traduction est défaillant — et ce que nous publions à la place

Ouvrez le site de n'importe quel fournisseur de traduction en direct. Vous y verrez les mêmes types de chiffres :

  • « Plus de 200 langues »
  • « Plus de 6 000 paires de langues »
  • « Le premier au monde » / « La précision la plus élevée »
  • « 99 % de précision »

Essayez maintenant de trouver — sur l'une quelconque de ces pages de fournisseurs — ce que ces chiffres signifient pour la réunion que vous êtes sur le point de lancer. Qualité par langue. Méthodologie reproductible. Taille de l'échantillon. Évolution du score dans le temps. Divulgation honnête des points faibles du modèle.

Vous ne le trouverez pas. Ni dans le texte marketing, et rarement dans la documentation.

C'est l'équilibre de cette catégorie. Il existe pour trois raisons :

  1. La plupart des fournisseurs ne possèdent pas leur propre moteur de traduction. Ils acheminent les requêtes via OpenAI, Google, DeepL, Microsoft ou une combinaison de ces acteurs. Publier des données de qualité par paire reviendrait à évaluer le modèle d'un autre — cela n'a aucune valeur marketing.
  2. Les données de qualité honnêtes sont difficiles à mettre sur une affiche. Un score unique est bruité. Une distribution est plus utile, mais plus difficile à résumer. Une tendance sur les six derniers mois est encore plus utile, et encore plus difficile à résumer.
  3. Les directions des achats ne se sont pas encore opposées. Les acheteurs acceptent les chiffres marketing pour argent comptant, et l'équilibre se maintient.

Cet équilibre ne durera pas. La prochaine catégorie d'acheteurs — le secteur pharmaceutique, le domaine juridique, la finance, l'audit, le secteur public — posera des questions plus pointues que « combien de langues ». Nous avons construit /benchmark parce que nous pensons qu'ils ne devraient pas avoir à se fier à la parole d'un fournisseur.


Ce que les chiffres marketing ne vous disent pas

« Plus de 200 langues » signifie qu'un fournisseur possède un modèle qui génère du texte dans 200 langues. La qualité pour ces langues varie de niveau production pour les paires majeures (EN↔DE, EN↔ES, EN↔FR) à peine utilisable pour les paires à faibles ressources. Sans une répartition par paire, vous ne pouvez pas dire de quel côté de cette ligne votre réunion se situera.

« Plus de 6 000 paires de langues » repose sur la combinatoire N × N de 80 langues source. Affirmer que l'on prend en charge 6 000 paires est la partie facile. Affirmer qu'une paire spécifique est suffisamment fiable pour une révision CAPA, une négociation de contrat ou un appel sur les résultats financiers — c'est la partie qui ne figure pas dans la brochure.

« 99 % de précision », sans préciser ce qui a été mesuré, par rapport à quelle référence, sur quel échantillon, par quel juge — est vide de sens. La qualité de traduction n'a pas d'échelle universelle. Elle possède une distribution qui dépend de la paire de langues, du domaine de contenu, de la qualité audio (pour la voix), du budget de latence et de ce que « suffisamment bon » signifie pour le cas d'usage spécifique.


Ce qu'un acheteur doit réellement savoir

Les questions qui apparaissent dans les véritables revues DPA et les évaluations d'achat :

  1. Qualité par paire — comment se comporte-t-il sur DE↔EN, EN↔AR, JA↔KO, concrètement ?
  2. Taille de l'échantillon — sur combien d'exécutions votre chiffre publié repose-t-il ? Dix ? Dix mille ?
  3. Méthodologie — qui évalue les traductions, par rapport à quelle référence, et selon quelle grille d'évaluation ?
  4. Distribution, et non moyenne — à quoi ressemblent les 10 % les plus défavorables ? Les 10 % les plus favorables ? La médiane ?
  5. Dérive dans le temps — une paire donnée s'est-elle améliorée ou dégradée depuis votre dernière publication de chiffres ?
  6. Ce que vous ne mesurez pas — qu'est-ce que votre benchmark ne capture pas explicitement ?

Aucune de ces questions n'est impossible à répondre. Elles ne figurent simplement sur la page marketing de personne.


Ce que nous publions

/benchmark est notre réponse. La méthodologie se trouve sur /benchmark/methodology — rédigée avant que nous sachions que vous la liriez.

Trois éléments la distinguent des normes de la catégorie.

1. Du trafic réel, pas une suite sélectionnée

Chaque score du benchmark public provient d'une exécution de test réelle sur /demo. Nous ne sélectionnons pas à l'avance les paires qui obtiennent de bons résultats. Le même pipeline qui sert la démo d'un acheteur est celui qui est mesuré.

2. Le juge est nommé

Principal : google/gemini-3.5-flash. Repli : anthropic/claude-sonnet-5. Tous deux via Vercel AI Gateway. Le juge fait partie de la méthodologie — divulgué par son nom. Lorsque nous changeons de juge (ce que nous avons fait, à mesure que les modèles sont retirés), les lignes historiques conservent le juge qui les a réellement évaluées ; les anciens scores ne sont jamais recalculés en silence.

3. La distribution est la donnée, pas la moyenne

Chaque ligne publiée indique la médiane, p10, p90, le minimum, le maximum et la taille de l'échantillon — et non un seul chiffre. Un chiffre unique pour une paire de traduction est du bruit. La forme de la distribution est le signal.


Des pratiques que la catégorie n'a pas adoptées

  • Les paires à faible score ne sont pas masquées. L'index public est conditionné par ≥ 10 adresses IP distinctes, ≥ 10 exécutions, médiane ≥ 60 — mais n'importe qui peut lier directement n'importe quelle paire et voir les chiffres réels, y compris les paires qui s'en sortent mal ce mois-ci.
  • Les problèmes connus sont documentés. Lorsque le harnais de test du chat a été en panne pendant quelques semaines au début de l'année 2026, cette période a été supprimée de l'index et mentionnée par écrit sur la page de méthodologie. L'historique n'est pas réécrit silencieusement.
  • Ce que nous ne revendiquons délibérément PAS est une section complète sur la page de méthodologie. Nous indiquons là où le juge LLM lui-même est imparfait. Nous précisons ce que nous ne mesurons pas (latence, coût, satisfaction utilisateur, erreurs côté ASR avant même que la traduction ne s'exécute). Nous révélons que nos propres tests de fumée automatisés font partie du trafic.

Un filtre pour la prochaine évaluation de fournisseur

Si vous évaluez n'importe quelle plateforme de réunion multilingue — la nôtre ou une autre — la méthodologie est la page qui mérite d'être lue. Les chiffres eux-mêmes sont la partie facile.

Un filtre pratique pour n'importe quel fournisseur de cette catégorie :

  • Demandez des données de qualité par paire de langues et par mois sur du trafic réel. Pas un benchmark sélectionné. Pas un agrégat.
  • Demandez quel est leur juge, ce qu'ils ne mesurent pas explicitement, et ce qui a changé au cours des six derniers mois.
  • Demandez ce qu'il se passe lorsque le score d'une paire chute — préviennent-ils quelqu'un, ou le corrigent-ils silencieusement ?

Si le fournisseur répond par écrit aux trois questions, évaluez-le sérieusement. Dans le cas contraire, vous achetez du marketing — pas de la qualité de traduction.


Essayez par vous-même

  • Essayez la démo en direct — exécute le pipeline de traduction de production sur votre audio, l'évalue à l'aide du même juge que celui qui évalue le benchmark public, et vous montre le résultat.
  • Consultez le benchmark — chaque paire de langues publiée, chaque mois, avec la distribution complète.
  • Lisez la méthodologie — comment les chiffres sont calculés, ce qu'ils incluent, ce qu'ils n'incluent pas.

Vous n'aurez pas besoin de nous croire sur parole pour tout cela. C'est précisément le but.


Sources : les identifiants des juges, les seuils de filtrage et les règles de suppression ci-dessus sont vérifiés par rapport au code livré et publiés sur /benchmark/methodology ; les juges sont servis via Vercel AI Gateway ; les affirmations marketing citées en haut de page sont des formulations typiques de la catégorie, et non des citations d'un fournisseur nommé ; vérifié en août 2026.

Recevez les nouveaux articles et mises à jour du produit par e-mail

Un e-mail par mois avec de nouveaux articles et des mises à jour du produit. Désabonnement à tout moment.