Metodika

Benchmark kvality překladu InterMIND vzniká automaticky v naší vlastní testovací sadě: týdenní syntetický běh spouští stejný překladový řetězec, který pohání veřejné /demo, nad pevnou referenční sadou, a to pro každou jazykovou dvojici stejným způsobem. Je syntetický a reprodukovatelný – nic zde není vybíráno ani upravováno a v procesu hodnocení není žádný člověk.

Jak probíhá jeden test

Testovací běh přehraje referenční zvukový soubor (hlasový test) nebo odešle referenční text (chatový test) ze zdrojového jazyka přes náš živý překladový řetězec do cílového jazyka. Výsledný překlad je ohodnocen LLM hodnotitelem na škále 0–100 oproti kanonickému referenčnímu překladu.

LLM hodnotitel: primárně google/gemini-3.8-flash, záložně anthropic/claude-sonnet-5 (přes Vercel AI Gateway). Pro všechny dvojice se používá stejný prompt, stejná hodnoticí rubrika a stejné referenční texty.

Jak se agreguje měsíc

  1. Každý dokončený úplný benchmarkový běh se zaznamenává do demo_test_runs se skóre pro jednotlivé cílové jazyky. Náhledy jednotlivých dvojic jsou vyloučeny – mediány vstupují pouze z úplných vícejazyčných běhů.
  2. Pro každou kombinaci (zdrojový jazyk, cílový jazyk, typ testu, týden) ponecháváme nejnovější běh a poté agregujeme po měsících – jediný zdroj tak nemůže výrazně ovlivnit mediány opakováním téže dvojice během jednoho týdne.
  3. Z deduplikované množiny počítáme medián, minimum, maximum, p10, p90, průměr a velikost vzorku.
  4. Jednotlivá skóre ukládáme jako snímek, aby po uzavření měsíce čísla zůstala stabilní, i když jsou surové běhy smazány podle TTL.

Kdy se dvojice objeví ve veřejném indexu

Řádek (dvojice × typ testu × měsíc) je způsobilý pro veřejný index a sitemapu, pokud splní minimální velikost vzorku a spodní hranici mediánu skóre (pro hlas je tato hranice nižší, protože zahrnuje nevyhnutelný šum ASR). Protože datová sada pochází z jediného automatizovaného zdroje, a nikoli z mnoha nezávislých návštěvníků, požadavek na unikátní zdroje se u těchto syntetických dat uplatňuje mírněji – hranice pro velikost vzorku a kvalitu však platí nadále.

Dvojice, které hranice nesplní, zůstávají dostupné přímým odkazem – prahové hodnoty ovlivňují jen to, co vidí vyhledávače. Nízká skóre před nikým, kdo se na ně přímo zeptá, neskrýváme.

Co záměrně NETVRDÍME

  • Jediné skóre není důvěryhodné. U dobře fungující dvojice se výsledek mezi běhy může lišit až o 30 bodů, protože ASR i hodnocení LLM jsou zatížené šumem. Proto každá stránka zobrazuje rozložení, nikoli jediné číslo.
  • Samotný LLM hodnotitel není dokonalý. V budoucnu můžeme hodnotitele změnit nebo použít dva; historické řádky v takovém případě ponesou identifikátor hodnotitele.
  • Benchmark neměří latenci, náklady, dostupnost ani spokojenost uživatelů. Tyto údaje najdete jinde.
  • Datová sada je syntetická – vytvořená naší vlastní automatizovanou sadou, nikoli nezávislým provozem třetích stran. Říkáme to otevřeně, místo abychom naznačovali externí panel.

Upřímný přístup

Když měsíc u konkrétní dvojice zaznamená pokles kvality, zůstává viditelný. Když je chyba opravena a následující měsíc skočí nahoru, zlepšení je vidět na téže stránce. Historické agregace nikdy nepřepisujeme. Administrátoři mohou z veřejného indexu skrýt pouze jednotlivé měsíce; čísla, která již byla zveřejněna, měnit nemohou.

Známé problémy ovlivňující historická data

  • Testovací rozhraní chatu před 2026-04-23: automatizovaný řetězec chatových testů měl chyby u jednotlivých jazyků. Chatové agregace z dřívějších měsíců proto mohou vykazovat nižší skóre, než odpovídá skutečné kvalitě překladu v daných obdobích. Dotčené měsíce zůstávají v databázi, ale jsou z veřejného indexu potlačeny; graf trendu v místě opravy ukáže skokovou změnu.

Dotazy

Nesouhlasíte s něčím z tohoto textu? Založte issue nebo nám napište. Tuto stránku aktualizujeme a změnu poznamenáme.