Methodik

Der Benchmark zur Übersetzungsqualität von InterMIND wird automatisch von unserer eigenen Test-Suite erstellt: Ein wöchentlicher synthetischer Lauf steuert dieselbe Übersetzungs-Pipeline an, die auch die öffentliche /demo antreibt, und zwar über ein festes Referenzset und für jedes Sprachpaar auf dieselbe Weise. Er ist synthetisch und reproduzierbar – nichts davon ist kuratiert oder handverlesen, und die Bewertung erfolgt ohne menschliche Beteiligung.

So funktioniert ein einzelner Test

Ein Testlauf spielt eine Referenz-Audiodatei (Voice-Test) ab oder sendet einen Referenztext (Chat-Test) von einer Ausgangssprache durch unsere Live-Übersetzungs-Pipeline in eine Zielsprache. Die resultierende Übersetzung wird von einem LLM-Judge anhand einer kanonischen Referenzübersetzung auf einer Skala von 0–100 bewertet.

LLM-Judge: google/gemini-3.8-flash als primäres Modell, anthropic/claude-sonnet-5 als Fallback (über das Vercel AI Gateway). Für alle Sprachpaare werden derselbe Prompt, dieselbe Bewertungsrubrik und dieselben Referenztexte verwendet.

So wird ein Monat aggregiert

  1. Jeder abgeschlossene vollständige Benchmark-Lauf wird in demo_test_runs mit den Scores je Zielsprache erfasst. Vorschauläufe für einzelne Sprachpaare sind ausgeschlossen – nur vollständige Mehrsprachen-Läufe fließen in die Mediane ein.
  2. Für jede Kombination aus (Ausgangssprache, Zielsprache, Testtyp, Woche) behalten wir den neuesten Lauf und aggregieren anschließend je Monat – so kann eine einzelne Quelle die Mediane nicht verzerren, indem sie ein Sprachpaar innerhalb einer Woche mehrfach ausführt.
  3. Aus dem deduplizierten Datensatz berechnen wir Median, Minimum, Maximum, p10, p90, Durchschnitt und Stichprobengröße.
  4. Wir sichern einzelne Scores als Snapshot, damit die Zahlen nach Abschluss eines Monats stabil bleiben, auch wenn die Rohläufe per TTL gelöscht werden.

Wann ein Sprachpaar im öffentlichen Index erscheint

Eine Zeile (Sprachpaar × Testtyp × Monat) kommt für den öffentlichen Index und die Sitemap in Frage, wenn sie eine Mindeststichprobengröße und eine Untergrenze für den Median-Score erreicht (für Voice gilt eine niedrigere Untergrenze, da hier unvermeidliches ASR-Rauschen auftritt). Da der Datensatz aus einer einzigen automatisierten Quelle statt von vielen unabhängigen Besuchern stammt, wird die Anforderung eindeutiger Quellen für diese synthetischen Daten gelockert – die Untergrenzen für Stichprobengröße und Qualität gelten weiterhin.

Sprachpaare, die diese Schwellen nicht erreichen, bleiben per Direktlink weiterhin abrufbar – die Schwellenwerte steuern nur, was Suchmaschinen sehen. Niedrige Scores verbergen wir vor niemandem, der gezielt danach fragt.

Was wir bewusst NICHT behaupten

  • Ein einzelner Score ist nicht aussagekräftig. Ein gut funktionierendes Sprachpaar kann zwischen zwei Läufen um 30 Punkte schwanken, weil sowohl ASR als auch die LLM-Bewertung verrauscht sind. Deshalb zeigt jede Seite eine Verteilung statt einer einzelnen Zahl.
  • Der LLM-Judge selbst ist nicht perfekt. Wir wechseln ihn künftig möglicherweise oder setzen einen zweiten Judge ein; historische Zeilen tragen dann die Judge-Kennung.
  • Der Benchmark misst weder Latenz, Kosten, Verfügbarkeit noch Nutzerzufriedenheit. Diese Aspekte werden an anderer Stelle behandelt.
  • Der Datensatz ist synthetisch – er wurde von unserer eigenen automatisierten Suite erzeugt, nicht durch unabhängigen Datenverkehr Dritter. Das legen wir ausdrücklich offen, statt ein externes Panel zu suggerieren.

Ehrliche Offenlegung

Wenn die Qualität für ein bestimmtes Sprachpaar in einem Monat sinkt, bleibt das sichtbar. Wenn ein Fehler behoben wird und der Folgemonat sich verbessert, ist die Verbesserung auf derselben Seite sichtbar. Wir schreiben historische Aggregate nie um. Administratoren können einzelne Monate lediglich aus dem öffentlichen Index ausblenden; sie können die bereits veröffentlichten Zahlen nicht verändern.

Bekannte Probleme mit Auswirkung auf historische Daten

  • Chat-Test-Harness, vor dem 23.04.2026: Die automatisierte Chat-Test-Pipeline hatte sprachspezifische Fehler. Chat-Aggregate aus früheren Monaten können niedrigere Scores zeigen, als es der tatsächlichen Übersetzungsqualität dieser Zeiträume entspricht. Betroffene Monate bleiben in der Datenbank erhalten, werden aber aus dem öffentlichen Index ausgeblendet; im Trenddiagramm ist zum Zeitpunkt der Behebung ein Sprung erkennbar.

Fragen

Sie sehen etwas anders? Eröffnen Sie ein Issue oder schreiben Sie uns. Wir aktualisieren diese Seite und vermerken die Änderung.