Wewnątrz czterech potoków tłumaczeń obsługujących InterMIND
Stara strona /product/overview/how-it-works na mind.com jest nieaktualna od kilku dużych wersji. Opisuje pojedynczy "silnik tłumaczeń" w taki sam sposób, jak strony większości dostawców — jedna duża strzałka od "mówisz" do "słyszą". Ten obraz był uproszczeniem już dwa lata temu. Dziś jest błędny.
Prawda jest taka, że InterMIND obsługuje cztery osobne potoki tłumaczeń, z których każdy rozwiązuje inny problem za pomocą innego silnika, innego budżetu opóźnień i innej ramy jakościowej. Współdzielą one wybór języka. Nie współdzielą silnika.
To jest zaktualizowana odpowiedź na pytanie "jak to działa".
Tekst towarzyszący: "Ile języków obsługujecie?" omawia to, co każdy potok obejmuje (23 / 23 / 30 / 17). Ten post omawia to, co każdy potok robi — i dlaczego jest czymś odrębnym.
Dlaczego "jeden silnik do wszystkiego" to kłamstwo
Platforma spotkań na żywo ma do wykonania co najmniej cztery zadania naraz, a te zadania ciągną w niekompatybilnych kierunkach:
- Głos w czasie rzeczywistym — dźwięk na wejściu, przetłumaczony dźwięk na wyjściu, w czasie poniżej jednej sekundy, każdy widz w swoim własnym języku. Twardym ograniczeniem jest opóźnienie.
- Tekst czatu w czasie rzeczywistym — krótkie wiadomości, szybko, z zachowaniem edycji, cytatów i struktury HTML.
- Współdzielone notatki w czasie rzeczywistym — wspólne wpisywanie znak po znaku, z hierarchią strukturalną (listy, nagłówki, pola wyboru), która musi przetrwać tłumaczenie.
- Asynchroniczne pliki dokumentów — 40-stronicowy plik PDF wrzucony na czat. Brak budżetu na opóźnienia. Twardym ograniczeniem jest wierność — formatowanie, tabele, numery stron, czcionki.
Można zbudować jedno gigantyczne wywołanie LLM, które próbuje wykonać wszystkie cztery zadania. Próbowaliśmy. Radzi sobie źle we wszystkich czterech. Budżet opóźnień dla głosu oznacza, że model nie może myśleć; budżet wierności dla dokumentów oznacza, że model musi myśleć. Edycja na czacie wymaga diff'a w języku widza; 40-stronicowy plik PDF wymaga zachowania formatowania, którego żaden model strumieniujący tokeny nie zapewnia.
Dlatego obsługujemy cztery. Oto każdy z nich.