Metodologia

Benchmark jakości tłumaczeń InterMIND jest tworzony automatycznie przez nasz własny zestaw testów: cotygodniowy test syntetyczny uruchamia ten sam potok tłumaczeniowy, który obsługuje publiczne /demo, na stałym zestawie referencyjnym, w taki sam sposób dla każdej pary językowej. Jest syntetyczny i powtarzalny — nic tu nie jest wyselekcjonowane ani dobrane pod tezę, a w procesie oceniania nie uczestniczy żaden człowiek.

Jak działa pojedynczy test

Test odtwarza referencyjny plik audio (test głosowy) lub wysyła referencyjny tekst (test czatu) z języka źródłowego przez nasz potok tłumaczenia na żywo do języka docelowego. Otrzymane tłumaczenie jest oceniane w skali 0–100 przez model LLM pełniący rolę sędziego, względem wzorcowego tłumaczenia referencyjnego.

Sędzia LLM: google/gemini-3.8-flash jako podstawowy, anthropic/claude-sonnet-5 jako zapasowy (przez Vercel AI Gateway). Ten sam prompt, ta sama rubryka oceny i te same teksty referencyjne są używane dla wszystkich par.

Jak agregowany jest miesiąc

  1. Każde ukończone pełne uruchomienie benchmarku jest zapisywane w demo_test_runs wraz z wynikami dla poszczególnych języków docelowych. Podglądy pojedynczych par są wykluczone — do median trafiają wyłącznie pełne uruchomienia wielojęzyczne.
  2. Dla każdej kombinacji (język źródłowy, język docelowy, typ testu, tydzień) zachowujemy najnowsze uruchomienie, a następnie agregujemy dane miesięcznie — dzięki temu pojedyncze źródło nie może wpłynąć na mediany, powtarzając parę w ciągu tygodnia.
  3. Ze zdeduplikowanego zbioru obliczamy medianę, minimum, maksimum, p10, p90, średnią oraz liczebność próby.
  4. Zapisujemy migawki poszczególnych wyników, aby po zamknięciu miesiąca liczby pozostawały stabilne nawet po usunięciu surowych uruchomień przez TTL.

Kiedy para pojawia się w publicznym indeksie

Wiersz (para × typ testu × miesiąc) kwalifikuje się do publicznego indeksu i mapy witryny, gdy spełnia minimalną liczebność próby oraz próg mediany wyniku (niższy próg dla głosu, który wiąże się z nieuniknionym szumem ASR). Ponieważ zbiór danych pochodzi z jednego zautomatyzowanego źródła, a nie od wielu niezależnych odwiedzających, wymóg unikalnych źródeł jest dla tych danych syntetycznych złagodzony — progi liczebności próby i jakości nadal obowiązują.

Pary, które nie osiągają progów, pozostają dostępne przez bezpośredni link — progi decydują wyłącznie o tym, co widzą wyszukiwarki. Nie ukrywamy niskich wyników przed nikim, kto o nie bezpośrednio zapyta.

Czego świadomie NIE twierdzimy

  • Pojedynczy wynik nie jest wiarygodny. Dobrze działająca para może wahać się o 30 punktów między uruchomieniami, ponieważ zarówno ASR, jak i ocena LLM są zaszumione. Dlatego każda strona pokazuje rozkład, a nie pojedynczą liczbę.
  • Sam sędzia LLM jest niedoskonały. W przyszłości możemy go zmienić lub zastosować dwóch sędziów; wiersze historyczne będą wtedy zawierać identyfikator sędziego.
  • Benchmark nie mierzy opóźnień, kosztów, dostępności ani satysfakcji użytkowników. Te kwestie opisujemy gdzie indziej.
  • Zbiór danych jest syntetyczny — wytworzony przez nasz własny zautomatyzowany zestaw testów, a nie przez niezależny ruch podmiotów trzecich. Mówimy o tym wprost, zamiast sugerować istnienie zewnętrznego panelu.

Uczciwe podejście

Gdy jakość dla danej pary w jakimś miesiącu spada — pozostaje to widoczne. Gdy błąd zostaje naprawiony, a w kolejnym miesiącu wynik rośnie — poprawa jest widoczna na tej samej stronie. Nigdy nie przepisujemy historycznych agregatów. Administratorzy mogą jedynie ukryć poszczególne miesiące w publicznym indeksie; nie mogą zmienić liczb, które zostały już opublikowane.

Znane problemy wpływające na dane historyczne

  • Środowisko testów czatu, przed 2026-04-23: zautomatyzowany potok testów czatu miał awarie dla poszczególnych języków. Agregaty czatu z wcześniejszych miesięcy mogą pokazywać niższe wyniki niż faktyczna jakość tłumaczeń w tamtych okresach. Dotknięte miesiące są zachowane w bazie danych, ale usunięte z publicznego indeksu; wykres trendu pokaże skokową zmianę w momencie poprawki.

Pytania

Nie zgadzasz się z czymś, co tu napisaliśmy? Zgłoś problem lub napisz do nas. Zaktualizujemy tę stronę i odnotujemy zmianę.