Waarom marketing rond vertaalkwaliteit kapot is — en wat wij in plaats daarvan publiceren
Open de website van elke leverancier van live vertaling. U zult dezelfde soorten cijfers zien:
- "200+ talen"
- "6.000+ taalparen"
- "Wereldwijd de eerste" / "Hoogste nauwkeurigheid"
- "99% nauwkeurig"
Probeer nu eens te vinden — op een van die leverancierspagina's — wat die cijfers betekenen voor een vergadering die u gaat houden. Kwaliteit per taal. Reproduceerbare methodologie. Steekproefgrootte. Score over tijd. Eerlijke openbaarmaking van waar het model zwak is.
U zult het niet vinden. Niet in de marketingteksten, en zelden in de documentatie.
Dit is het evenwicht van de categorie. Het bestaat om drie redenen:
- De meeste leveranciers zijn niet eigenaar van hun vertaalmachine. Ze routeren via OpenAI, Google, DeepL, Microsoft, of een combinatie daarvan. Het publiceren van kwaliteitsgegevens per taalpaar zou betekenen dat men het model van een ander benchmarkt — daar schuilt geen marketingwaarde in.
- Eerlijke kwaliteitsgegevens zijn moeilijk op een billboard te zetten. Een enkele score is ruisachtig. Een verdeling is nuttiger, maar moeilijker samen te vatten. Een
last-six-months trendis nóg nuttiger, en nog moeilijker. - Inkoopafdelingen hebben nog niet tegengesproken. Kopers accepteren de marketingcijfers zonder meer, en dus houdt het evenwicht stand.
Dit evenwicht zal niet standhouden. De volgende klasse kopers — farmacie, juridisch, financieel, audit, publieke sector — gaat moeilijkere vragen stellen dan "hoeveel talen". We hebben /benchmark gebouwd omdat we vinden dat ze niet op het woord van een leverancier af zouden moeten gaan.
Wat de marketingcijfers u niet vertellen
"200+ talen" betekent dat een leverancier een model heeft dat tekst in 200 talen genereert. De kwaliteit over die talen varieert van productieklaar voor grote taalparen (EN↔DE, EN↔ES, EN↔FR) tot nauwelijks bruikbaar voor low-resource taalparen. Zonder een uitsplitsing per paar kunt u niet zien aan welke kant van die lijn uw vergadering zal belanden.
"6.000+ taalparen" is N × N combinatoriek op 80 brontalen. Zeggen dat je 6.000 paren ondersteunt is het makkelijke deel. Zeggen dat een specifiek paar goed genoeg is voor een CAPA-beoordeling, een contractonderhandeling, of een winstpresentatie — dat is het deel dat niet in de brochure staat.
"99% nauwkeurig", zonder specificatie van wat er is gemeten, waartegen, op welke steekproef, door welke beoordelaar — is inhoudsloos. Vertaalkwaliteit kent geen universele scalar. Het heeft een verdeling die afhankt van het taalpaar, het domein van de inhoud, de audiokwaliteit (voor spraak), het latentiebudget, en wat "goed genoeg" betekent voor het specifieke gebruik.