Innerhalb der vier Übersetzungspipelines, die InterMIND antreiben
Die alte /product/overview/how-it-works-Seite auf mind.com ist mehrere Hauptversionen alt. Sie beschreibt eine einzelne "Übersetzungs-Engine", wie es die meisten Anbieterseiten tun – ein großer Pfeil von "Sie sprechen" zu "sie hören". Dieses Bild war schon vor zwei Jahren eine Vereinfachung. Heute ist es falsch.
Die Wahrheit ist, dass InterMIND vier separate Übersetzungspipelines betreibt, von denen jede ein anderes Problem mit einer anderen Engine, einem anderen Latenzbudget und einer anderen Qualitätsgrenze löst. Sie teilen sich einen Sprachwähler. Sie teilen sich nicht eine Engine.
Dies ist die aktualisierte Antwort auf "wie funktioniert das".
Ein Begleitartikel: "Wie viele Sprachen unterstützen Sie?" behandelt, was jede Pipeline abdeckt (23 / 23 / 30 / 17). Dieser Beitrag behandelt, was jede Pipeline tut – und warum sie ihr eigenes Ding ist.
Warum "eine Engine für alles" eine Lüge ist
Eine Live-Meeting-Plattform hat mindestens vier Aufgaben gleichzeitig zu erledigen, die in unvereinbare Richtungen weisen:
- Echtzeit-Sprache – Audio rein, übersetztes Audio raus, unter einer Sekunde, jeder Zuschauer in seiner eigenen Sprache. Die harte Einschränkung ist die Latenz.
- Echtzeit-Chat-Text – kurze Nachrichten, schnell, mit erhaltenen Bearbeitungen, Zitaten und HTML-Struktur.
- Echtzeit-geteilte Notizen – zeichenweises gemeinsames Tippen, mit einer strukturellen Hierarchie (Listen, Überschriften, Kontrollkästchen), die die Übersetzung überstehen muss.
- Asynchrone Dokumentdateien – ein 40-seitiges PDF, das in den Chat gezogen wird. Kein Latenzbudget. Die harte Einschränkung ist die Treue – Formatierung, Tabellen, Seitenzahlen, Schriftart.
Man kann einen riesigen LLM-Aufruf bauen, der versucht, alle vier zu erledigen. Wir haben es versucht. Er ist in allen vier schlecht. Das Latenzbudget für Sprache bedeutet, dass das Modell nicht nachdenken kann; das Treue-Budget für Dokumente bedeutet, dass das Modell nachdenken muss. Eine Chat-Bearbeitung benötigt einen Diff in der Sprache des Zuschauers; ein 40-seitiges PDF benötigt Formaterhaltung, die Ihnen kein Token-Streaming-Modell bietet.
Also betreiben wir vier. Hier ist jede einzelne.