Ihre eigene Stimme
Ihre eigene Stimme
Wenn InterMIND Ihre Sprache für einen anderen Teilnehmer übersetzt, hört dieser keinen roboterhaften Text-to-Speech-Sprecher. Er hört eine Stimme, die klar als Ihre zu erkennen ist — mit Ihrem Klang und Ihrer Art zu sprechen —, die nun die Wörter in seiner Sprache sagt.
Dies funktioniert in beide Richtungen und für jeden Teilnehmer unabhängig. In einem Meeting, in dem fünf Personen fünf Sprachen sprechen, hört jeder die anderen vier in seiner eigenen Sprache, und jede dieser vier Stimmen klingt weiterhin wie die jeweilige Person selbst.
Wie es klingt
Die meisten Tools für die Live-Übersetzung ersetzen den Sprecher durch eine einzige generische synthetische Stimme. Das Ergebnis ist verständlich, aber flach — Sie verlieren, wer spricht, die Betonung, die Persönlichkeit. InterMIND behält die Stimme des Sprechers bei, sodass ein übersetztes Meeting sich wie eine Konversation zwischen den Personen anfühlt, die tatsächlich daran teilnehmen, und nicht wie eine Reihe von Ansagen, die von einer Maschine vorgelesen werden.
Wie es funktioniert
InterMIND verwendet eine kaskadierte Pipeline, und der Stimmschritt ist die letzte Stufe:
- Spracherkennung — Ihre Wörter werden in Ihrer eigenen Sprache transkribiert, während Sie sprechen.
- Segmentierung — Das Transkript wird in stabile Satzfragmente (Klauseln) gruppiert, sodass die Übersetzung beginnen kann, bevor Sie den Satz beenden.
- Übersetzung — Jedes Fragment wird schrittweise in die Sprache des Zuhörers übersetzt.
- Stimmsynthese — Jedes übersetzte Fragment wird mit einer Probe Ihrer eigenen Stimme gesprochen und an den Zuhörer gesendet.
Während das Meeting noch genügend von Ihrer Sprache sammelt, um Ihre Stimme zu modellieren (etwa die ersten 5–10 Sekunden), verwendet die Synthese das Audiofragment, das dem entspricht, was Sie gerade in Ihrer Quellsprache gesagt haben. Sobald die Probe lang genug ist, wird für alles Folgende auf diese Probe umgeschaltet. In der Praxis bemerken Sie keinen Wechsel — die Übersetzung klingt mit zunehmender Dauer des Meetings immer mehr wie Sie. Es wird keine makellose Nachahmung Ihrer Stimme sein, aber es ist eindeutig Sie und kein generischer Sprecher — und es wird weiterhin besser, je mehr das Modell von Ihnen hört.
Sprachen
Die Übersetzung in die eigene Stimme ist für alle 24 Sprachen verfügbar — dieselbe Auswahl, die unter Sprachen auswählen aufgeführt ist. Es muss nichts separat aktiviert werden: Wenn die Übersetzung aktiv ist, hören die Teilnehmer Sie automatisch in Ihrer eigenen Stimme.
Datenschutz
Die für die Synthese verwendete Stimmprobe ist flüchtig. Sie existiert nur für die Dauer des Live-Meetings und wird nirgendwo gespeichert — die Mind API und das SDK, die die Echtzeit-Sitzung betreiben, behalten keine Daten, sobald die Konferenzsitzung endet. Diese Stimmprobe steht in keinem Zusammenhang mit den Video- und Audio-Aufnahme-Funktionen von InterMIND, bei denen es sich um separate, explizite Aufnahmen handelt, die Sie bewusst starten.
Auf der Roadmap: Lip-Sync
Die Übersetzung in Ihre eigene Stimme zu hören, ist die erste Hälfte eines größeren Ziels. Der nächste Schritt, an dem wir arbeiten, ist Lip-Sync — die zeitliche Anpassung der Mundbewegungen des Sprechers im Kamerabild an das übersetzte Audio, sodass jeder Teilnehmer so erscheint, als spräche er die Sprache des anderen. In Kombination mit der Übersetzung in die eigene Stimme ist das Ziel ein Meeting, in dem Personen, die keine gemeinsame Sprache teilen, sich sehen und hören, als spräche jeder von Natur aus die Sprache des anderen.
Dies ist ein Punkt auf der Roadmap, noch keine veröffentlichte Funktion — die oben genannte Übersetzung in die eigene Stimme ist heute bereits live.