Benchmark jakości tłumaczenia AI
Jak dobrze InterMIND naprawdę tłumaczy – mierzone przez nasz zautomatyzowany zestaw testów na stałym zbiorze benchmarkowym FLORES-200, dla każdej pary językowej, co miesiąc. Syntetyczne i powtarzalne, a nie starannie wybrane średnie.
wiadomości pisane, tłumaczone w treści rozmowy
jeden wynik dla rozpoznawania mowy i tłumaczenia, od początku do końca
Wynik = wierność semantyczna względem tłumaczenia referencyjnego (0–100). Im wyżej, tym lepiej.
Tłumaczenie czatu tekstowego
Wiadomości pisane, tłumaczone w treści rozmowy w chwili wysłania.
Średnia jakość dla każdego języka · Q4 2026względem Q3 2026
Każdy słupek obejmuje wszystkie przebiegi tłumaczące na dany język lub z niego w tym kwartale. Przerywana kreska oznacza poprzedni kwartał.
Faded bars have a thin sample (<3 runs) — read them as provisional.
Tłumaczenie głosu
Mowa na żywo, transkrybowana i tłumaczona w czasie rzeczywistym – trudniejszy problem typu end-to-end.
Średnia jakość dla każdego języka · Q4 2026względem Q3 2026
Każdy słupek obejmuje wszystkie przebiegi tłumaczące na dany język lub z niego w tym kwartale. Przerywana kreska oznacza poprzedni kwartał.
Faded bars have a thin sample (<3 runs) — read them as provisional.
Jakość w czasie
Mediana miesięczna dla każdej modalności, od momentu rozpoczęcia publikacji.
Te liczby pochodzą z prawdziwych sesji
Każdy przebieg na demo na żywo jest oceniany automatycznie i uwzględniany w benchmarku z kolejnego miesiąca. Sesja wygląda tak:
Pełna tabela danych
Każda opublikowana para i miesiąc – mediana, zakres i wielkość próby. Z możliwością sortowania według dowolnej kolumny.