Dlaczego marketing jakości tłumaczeń jest wadliwy — i co publikujemy zamiast tego
Otwórz stronę dowolnego dostawcy tłumaczeń na żywo. Zobaczysz te same rodzaje liczb:
- „200+ języków”
- „6000+ par językowych”
- „Pierwszy na świecie” / „Najwyższa dokładność”
- „99% dokładności”
Spróbuj teraz znaleźć — na jakiejkolwiek z tych stron — co te liczby oznaczają dla spotkania, które masz zamiar przeprowadzić. Jakość dla poszczególnych języków. Powtarzalna metodologia. Wielkość próby. Wynik na przestrzeni czasu. Szczere ujawnienie, gdzie model ma słabości.
Nie znajdziesz tego. Nie w tekstach marketingowych, i rzadko w dokumentacji.
To jest stan równowagi tej kategorii. Istnieje z trzech powodów:
- Większość dostawców nie posiada własnego silnika tłumaczeń. Przekierowują ruch przez OpenAI, Google, DeepL, Microsoft lub jakąś ich kombinację. Publikowanie danych o jakości dla poszczególnych par oznaczałoby testowanie modelu kogoś innego — nie ma w tym żadnej wartości marketingowej.
- Szczere dane o jakości trudno umieścić na billboardzie. Pojedynczy wynik jest zaszumiony. Rozkład jest bardziej użyteczny, ale trudniejszy do skompresowania.
trend z ostatnich sześciu miesięcyjest jeszcze bardziej użyteczny, a jeszcze trudniejszy. - Działy zakupów jeszcze tego nie zakwestionowały. Klienci akceptują liczby z materiałów marketingowych za wartość nominalną, dlatego stan równowagi się utrzymuje.
Ten stan równowagi się nie utrzyma. Następna klasa nabywców — farmacja, prawo, finanse, audyt, sektor publiczny — zada trudniejsze pytania niż „ile języków”. Stworzyliśmy /benchmark, ponieważ uważamy, że nie powinni musieć ufać dostawcy na słowo.
Czego liczby z materiałów marketingowych ci nie mówią
„200+ języków” oznacza, że dostawca ma model, który generuje tekst w 200 językach. Jakość w tych językach waha się od gotowej do produkcji dla głównych par (EN↔DE, EN↔ES, EN↔FR) do ledwo użytecznej dla par niskozasobowych. Bez podziału na poszczególne pary nie możesz stwierdzić, po której stronie tej granicy wyląduje Twoje spotkanie.
„6000+ par językowych” to kombinatoryka N × N na 80 językach źródłowych. Powiedzenie, że obsługuje się 6000 par, to łatwa część. Stwierdzenie, że jakakolwiek konkretna para jest wystarczająco dobra do przeglądu CAPA, negocjacji kontraktu lub telekonferencji wynikowej — to jest ta część, której nie ma w broszurze.
„99% dokładności”, bez określenia, co było mierzone, w odniesieniu do czego, na jakiej próbie, przez jakiego sędziego — jest pozbawione treści. Jakość tłumaczenia nie ma uniwersalnej skalarnej miary. Ma rozkład, który zależy od pary języków, dziedziny treści, jakości dźwięku (dla głosu), budżetu opóźnień i tego, co „wystarczająco dobre” oznacza w konkretnym przypadku użycia.
Co nabywca faktycznie musi wiedzieć
Pytania, które pojawiają się w prawdziwych przeglądach DPA i ewaluacjach zakupowych:
- Jakość dla poszczególnych par — jak to działa na DE↔EN, EN↔AR, JA↔KO, konkretnie?
- Wielkość próby — na ilu uruchomieniach opiera się zgłaszana liczba? Dziesięciu? Dziesięciu tysiącach?
- Metodologia — kto ocenia tłumaczenia, w odniesieniu do czego, według jakich kryteriów?
- Rozkład, a nie średnia — jak wygląda najgorsze 10%? Najlepsze 10%? Mediana?
- Dryf w czasie — czy dana para polepszyła się, czy pogorszyła od czasu, gdy ostatnio opublikowano wynik?
- Czego nie mierzysz — czego twój benchmark wprost nie obejmuje?
Żadne z tych pytań nie jest bez odpowiedzi. Po prostu nie ma ich na żadnej stronie marketingowej.
Co publikujemy
/benchmark to nasza odpowiedź. Metodologia znajduje się na stronie /benchmark/methodology — napisana, zanim wiedzieliśmy, że to przeczytasz.
Trzy rzeczy odróżniają to od norm kategorii.
1. Ruch rzeczywisty, a nie wyselekcjonowany zestaw
Każdy wynik w publicznym benchmarku pochodzi z rzeczywistego uruchomienia testowego /demo. Nie wybieramy z góry par, które dobrze wypadają. Ten sam proces, który obsługuje demo nabywcy, podlega pomiarowi.
2. Sędzia jest podany z nazwy
Główny: google/gemini-3.5-flash. Zapasowy: anthropic/claude-sonnet-5. Oba przez Vercel AI Gateway. Sędzia jest częścią metodologii — ujawniony z nazwy. Gdy zmieniamy sędziego (a zmienialiśmy, gdy modele są wycofywane), historyczne wiersze zachowują sędziego, który faktycznie je ocenił; stare wyniki nigdy nie są po cichu ponownie oceniane.
3. Rozkład to dane, a nie średnia
Każdy opublikowany wiersz pokazuje medianę, p10, p90, min, max i wielkość próby — a nie pojedynczą liczbę. Pojedyncza liczba dla pary języków to szum. Kształt rozkładu jest sygnałem.
Praktyki, których kategoria nie przyjęła
- Pary z niskim wynikiem nie są ukrywane. Indeks publiczny jest filtrowany przez
≥ 10 różnych adresów IP, ≥ 10 uruchomień, mediana ≥ 60— ale każdy może bezpośrednio utworzyć link do dowolnej pary i zobaczyć prawdziwe liczby, w tym pary, które w tym miesiącu radzą sobie słabo. - Znane problemy są udokumentowane. Gdy narzędzie testowe czatu było uszkodzone przez kilka tygodni na początku 2026 roku, ten okres został pominięty w indeksie i odnotowany na piśmie na stronie metodologii. Historia nie jest po cichu przepisywana.
- Czego celowo NIE twierdzimy to pełna sekcja na stronie metodologii. Mówimy, gdzie sam sędzia LLM jest niedoskonały. Mówimy, czego nie mierzymy (opóźnienia, koszty, zadowolenie użytkowników, błędy po stronie ASR zanim tłumaczenie w ogóle się uruchomi). Ujawniamy, że nasze własne zautomatyzowane testy dymne są częścią ruchu.
Filtr do kolejnej ewaluacji dostawcy
Jeśli oceniasz jakąkolwiek wielojęzyczną platformę do spotkań — naszą lub inną — to metodologia to strona warta przeczytania. Same liczby to łatwa część.
Praktyczny filtr dla każdego dostawcy w tej kategorii:
- Poproś o dane dotyczące jakości dla poszczególnych par językowych w ujęciu miesięcznym z ruchu rzeczywistego. Nie o wyselekcjonowany benchmark. Nie o zagregowane dane.
- Zapytaj, kim jest ich sędzia, czego wprost nie mierzą i co zmieniło się w ciągu ostatnich sześciu miesięcy.
- Zapytaj, co się dzieje, gdy wynik pary spada — czy informują kogoś, czy naprawiają to po cichu?
Jeśli dostawca ma wszystkie trzy odpowiedzi na piśmie, oceniaj go poważnie. Jeśli nie, kupujesz marketing — a nie jakość tłumaczeń.
Wypróbuj to sam
- Wypróbuj demo na żywo — uruchamia produkcyjny proces tłumaczeń na Twoim dźwięku, ocenia go za pomocą tego samego sędziego, który ocenia publiczny benchmark, i pokazuje Ci efekt.
- Zobacz benchmark — każda opublikowana para języków, co miesiąc, z pełnym rozkładem.
- Przeczytaj metodologię — jak liczby są obliczane, co obejmują, a czego nie.
Nie będziesz musiał ufać nam na słowo w jakiejkolwiek z tych kwestii. O to właśnie chodzi.
Źródła: powyższe identyfikatory sędziów, progi filtrowania i reguły pomijania są zweryfikowane względem dostarczonego kodu i opublikowane na stronie /benchmark/methodology; sędziowie są obsługiwani przez Vercel AI Gateway; twierdzenia marketingowe cytowane na początku to typowe sformułowania w tej kategorii, a nie cytaty konkretnego dostawcy; sprawdzone w sierpniu 2026 r.