Sprechen Sie mit Ihrer eigenen Stimme — in einer Sprache, die Sie nicht sprechen
Hier ist der Teil der Echtzeit-Übersetzung, den fast alle falsch machen und über den fast niemand spricht: die Stimme, die Sie hören.
Sie können eine exzellente Spracherkennung und eine exzellente Übersetzung haben und am Ende trotzdem ein Meeting haben, das sich anfühlt, als würde eine Maschine eine Liste vorlesen. Denn beim letzten Schritt — der Rückverwandlung des übersetzten Textes in Klang — tauschen die meisten Tools Sie leise gegen eine einzige generische synthetische Erzählstimme aus. Acht Personen im Raum, eine Roboterstimme für alle. Sie verlieren, wer spricht, die Betonung, die Persönlichkeit. Verständlich, aber kein Gespräch.
InterMIND macht den letzten Schritt anders. Wenn Sie sprechen, hören die anderen Teilnehmenden die Übersetzung in einer Stimme, die deutlich Ihre ist — mit Ihrem Timbre und Ihrer Art zu sprechen — die nun die Wörter in ihrer Sprache sagt. Es ist noch keine makellose Imitation; der Punkt ist, dass Sie es sind und kein Standard-Erzähler, und es wird besser. Das funktioniert für alle Teilnehmenden, in beide Richtungen, gleichzeitig.
Dieser Beitrag ist das fehlende Kapitel von Inside the four translation pipelines that run InterMIND: jener Beitrag erklärte, wie Audio zu übersetztem Audio wird. Dieser hier handelt davon, wessen Stimme am anderen Ende herauskommt.
Der Standard, den alle ausliefern, und warum er flach klingt
Wenn Sie die Live-Übersetzung in einer der großen Meeting-Plattformen genutzt haben, kennen Sie den Klang. Eine neutrale, gleichmäßig gesetzte Stimme liest die Übersetzung vor. Es ist dieselbe Stimme, egal ob der Sprecher Ihr CEO ist, der eine Townhall eröffnet, oder ein Kollege, der einen Witz macht. Die Technologie darunter ist Text-to-Speech mit einem einzigen festen Sprachmodell, und die Designannahme ist, dass Verständlichkeit genügt.
In einem echten Meeting genügt sie nicht. Die Hälfte dessen, was ein Meeting vermittelt, ist wer etwas sagt und wie. Entfernen Sie die Stimme, und Sie haben eine Diskussion in ein Transkript verwandelt, das zufällig laut ausgesprochen wird. Die Menschen reagieren nicht mehr aufeinander, sondern warten auf ihren Zug.