Metodologia
Benchmark jakości tłumaczeń InterMIND jest tworzony automatycznie przez nasz własny zestaw testów: cotygodniowy test syntetyczny uruchamia ten sam potok tłumaczeniowy, który obsługuje publiczne /demo, na stałym zestawie referencyjnym, w taki sam sposób dla każdej pary językowej. Jest syntetyczny i powtarzalny — nic tu nie jest wyselekcjonowane ani dobrane pod tezę, a w procesie oceniania nie uczestniczy żaden człowiek.
Jak działa pojedynczy test
Test odtwarza referencyjny plik audio (test głosowy) lub wysyła referencyjny tekst (test czatu) z języka źródłowego przez nasz potok tłumaczenia na żywo do języka docelowego. Otrzymane tłumaczenie jest oceniane w skali 0–100 przez model LLM pełniący rolę sędziego, względem wzorcowego tłumaczenia referencyjnego.
Sędzia LLM: google/gemini-3.8-flash jako podstawowy, anthropic/claude-sonnet-5 jako zapasowy (przez Vercel AI Gateway). Ten sam prompt, ta sama rubryka oceny i te same teksty referencyjne są używane dla wszystkich par.
Jak agregowany jest miesiąc
- Każde ukończone pełne uruchomienie benchmarku jest zapisywane w
demo_test_runswraz z wynikami dla poszczególnych języków docelowych. Podglądy pojedynczych par są wykluczone — do median trafiają wyłącznie pełne uruchomienia wielojęzyczne. - Dla każdej kombinacji (język źródłowy, język docelowy, typ testu, tydzień) zachowujemy najnowsze uruchomienie, a następnie agregujemy dane miesięcznie — dzięki temu pojedyncze źródło nie może wpłynąć na mediany, powtarzając parę w ciągu tygodnia.
- Ze zdeduplikowanego zbioru obliczamy medianę, minimum, maksimum, p10, p90, średnią oraz liczebność próby.
- Zapisujemy migawki poszczególnych wyników, aby po zamknięciu miesiąca liczby pozostawały stabilne nawet po usunięciu surowych uruchomień przez TTL.
Kiedy para pojawia się w publicznym indeksie
Wiersz (para × typ testu × miesiąc) kwalifikuje się do publicznego indeksu i mapy witryny, gdy spełnia minimalną liczebność próby oraz próg mediany wyniku (niższy próg dla głosu, który wiąże się z nieuniknionym szumem ASR). Ponieważ zbiór danych pochodzi z jednego zautomatyzowanego źródła, a nie od wielu niezależnych odwiedzających, wymóg unikalnych źródeł jest dla tych danych syntetycznych złagodzony — progi liczebności próby i jakości nadal obowiązują.
Pary, które nie osiągają progów, pozostają dostępne przez bezpośredni link — progi decydują wyłącznie o tym, co widzą wyszukiwarki. Nie ukrywamy niskich wyników przed nikim, kto o nie bezpośrednio zapyta.
Czego świadomie NIE twierdzimy
- Pojedynczy wynik nie jest wiarygodny. Dobrze działająca para może wahać się o 30 punktów między uruchomieniami, ponieważ zarówno ASR, jak i ocena LLM są zaszumione. Dlatego każda strona pokazuje rozkład, a nie pojedynczą liczbę.
- Sam sędzia LLM jest niedoskonały. W przyszłości możemy go zmienić lub zastosować dwóch sędziów; wiersze historyczne będą wtedy zawierać identyfikator sędziego.
- Benchmark nie mierzy opóźnień, kosztów, dostępności ani satysfakcji użytkowników. Te kwestie opisujemy gdzie indziej.
- Zbiór danych jest syntetyczny — wytworzony przez nasz własny zautomatyzowany zestaw testów, a nie przez niezależny ruch podmiotów trzecich. Mówimy o tym wprost, zamiast sugerować istnienie zewnętrznego panelu.
Uczciwe podejście
Gdy jakość dla danej pary w jakimś miesiącu spada — pozostaje to widoczne. Gdy błąd zostaje naprawiony, a w kolejnym miesiącu wynik rośnie — poprawa jest widoczna na tej samej stronie. Nigdy nie przepisujemy historycznych agregatów. Administratorzy mogą jedynie ukryć poszczególne miesiące w publicznym indeksie; nie mogą zmienić liczb, które zostały już opublikowane.
Znane problemy wpływające na dane historyczne
- Środowisko testów czatu, przed 2026-04-23: zautomatyzowany potok testów czatu miał awarie dla poszczególnych języków. Agregaty czatu z wcześniejszych miesięcy mogą pokazywać niższe wyniki niż faktyczna jakość tłumaczeń w tamtych okresach. Dotknięte miesiące są zachowane w bazie danych, ale usunięte z publicznego indeksu; wykres trendu pokaże skokową zmianę w momencie poprawki.
Pytania
Nie zgadzasz się z czymś, co tu napisaliśmy? Zgłoś problem lub napisz do nas. Zaktualizujemy tę stronę i odnotujemy zmianę.