Methodologie
De vertaalkwaliteitsbenchmark van InterMIND wordt automatisch geproduceerd door onze eigen testsuite: een wekelijkse synthetische run stuurt over een vaste referentieset dezelfde vertaalpijplijn aan die ook de openbare /demo aandrijft, voor elk taalpaar op dezelfde manier. De run is synthetisch en reproduceerbaar: niets hier is geselecteerd of cherry-picked, en er zit geen mens in de scoringslus.
Hoe een afzonderlijke test werkt
Een testrun speelt een referentie-audiobestand af (spraaktest) of verstuurt een referentietekst (chattest) vanuit een brontaal via onze live vertaalpijplijn naar een doeltaal. De resulterende vertaling krijgt van een LLM-beoordelaar een score van 0–100 ten opzichte van een canonieke referentievertaling.
LLM-beoordelaar: google/gemini-3.8-flash als primaire, anthropic/claude-sonnet-5 als fallback (via Vercel AI Gateway). Voor alle paren worden dezelfde prompt, hetzelfde beoordelingsraster en dezelfde referentieteksten gebruikt.
Hoe een maand wordt geaggregeerd
- Elke voltooide volledige benchmarkrun wordt vastgelegd in
demo_test_runs, met scores per doeltaal. Previews van afzonderlijke paren worden uitgesloten: alleen volledige runs met meerdere talen voeden de medianen. - Per combinatie van (brontaal, doeltaal, testtype, week) bewaren we de laatste run en aggregeren we daarna per maand, zodat één bron de medianen niet kan beïnvloeden door een paar binnen één week te herhalen.
- Uit de ontdubbelde set berekenen we de mediaan, het minimum, het maximum, p10, p90, het gemiddelde en de steekproefgrootte.
- We leggen de afzonderlijke scores vast in een snapshot, zodat de cijfers stabiel blijven zodra een maand is afgesloten, ook nadat de ruwe runs door TTL zijn verwijderd.
Wanneer een paar in de openbare index verschijnt
Een rij (paar × testtype × maand) komt in aanmerking voor de openbare index en de sitemap wanneer die een minimale steekproefgrootte en een ondergrens voor de mediaanscore haalt (voor spraak geldt een lagere ondergrens vanwege onvermijdelijke ASR-ruis). Omdat de dataset uit één geautomatiseerde bron komt in plaats van uit veel onafhankelijke bezoekers, is de eis van unieke bronnen voor deze synthetische data versoepeld; de ondergrenzen voor steekproefgrootte en kwaliteit blijven wel gelden.
Paren die de drempel niet halen, blijven bereikbaar via een directe link: de drempels bepalen alleen wat zoekmachines te zien krijgen. We verbergen lage scores voor niemand die er rechtstreeks naar vraagt.
Wat we bewust NIET beweren
- Een enkele score is niet betrouwbaar. Een goed presterend paar kan tussen runs 30 punten schommelen, omdat zowel ASR als LLM-beoordeling ruis bevatten. Daarom toont elke pagina een verdeling en geen enkel getal.
- De LLM-beoordelaar zelf is onvolmaakt. Mogelijk stappen we in de toekomst over op een andere beoordelaar of werken we met twee beoordelaars; historische rijen krijgen dan de identificatie van de beoordelaar mee.
- De benchmark meet geen latentie, kosten, beschikbaarheid of gebruikerstevredenheid. Die staan elders.
- De dataset is synthetisch: geproduceerd door onze eigen geautomatiseerde suite, niet door onafhankelijk verkeer van derden. Dat maken we expliciet duidelijk in plaats van een extern panel te suggereren.
Eerlijke cijfers
Wanneer een maand voor een bepaald paar in kwaliteit daalt, blijft dat zichtbaar. Wanneer een bug is opgelost en de volgende maand omhoogspringt, is die verbetering zichtbaar op dezelfde pagina. We herschrijven historische aggregaties nooit. Beheerders kunnen alleen afzonderlijke maanden uit de openbare index verbergen; ze kunnen de cijfers die al zijn gepubliceerd niet wijzigen.
Bekende problemen die historische data beïnvloeden
- Chattest-harnas, vóór 2026-04-23: de geautomatiseerde chattestpijplijn had storingen per taal. Chat-aggregaties uit eerdere maanden tonen mogelijk lagere scores dan de werkelijke vertaalkwaliteit in die periodes. Getroffen maanden worden in de database bewaard, maar zijn onderdrukt in de openbare index; de trendgrafiek toont een stapverandering op het moment van de oplossing.
Vragen
Het ergens niet mee eens? Open een issue of schrijf ons. We werken deze pagina bij en vermelden de wijziging.