Jouw eigen stem
Jouw eigen stem
Wanneer InterMIND je spraak vertaalt voor een andere deelnemer, horen ze geen robotachtige tekst-naar-spraak-verteller. Ze horen een stem die onmiskenbaar van jou is — met jouw klankkleur en manier van spreken — die nu de woorden in hun taal uitspreekt.
Dit werkt in beide richtingen en voor elke deelnemer onafhankelijk. In een meeting waar vijf mensen vijf talen spreken, hoort iedereen de andere vier in zijn of haar eigen taal, en klinken die vier nog steeds als zichzelf.
Hoe het klinkt
De meeste tools voor live-vertaling vervangen de spreker door een enkele generieke synthetische stem. Het resultaat is verstaanbaar maar vlak — je verliest wie er aan het woord is, de nadruk, de persoonlijkheid. InterMIND behoudt de stem van de spreker, waardoor een vertaalde meeting aanvoelt als een gesprek tussen de mensen die er daadwerkelijk in zitten, en niet als een reeks aankondigingen die door een machine worden voorgelezen.
Hoe het werkt
InterMIND maakt gebruik van een getrapte pijplijn, en de stem-stap is de laatste fase:
- Spraakherkenning — je woorden worden in je eigen taal getranscribeerd terwijl je spreekt.
- Segmentatie — het transcript wordt gegroepeerd in stabele zinsfragmenten (zinsdelen) zodat de vertaling kan beginnen voordat je de zin afmaakt.
- Vertaling — elk fragment wordt progressief vertaald naar de taal van de luisteraar.
- Stemsynthese — elk vertaald fragment wordt uitgesproken met behulp van een sample van jouw eigen stem, en naar de luisteraar gestuurd.
Terwijl de meeting nog bezig is met het verzamelen van voldoende spraak om je stem te modelleren (ongeveer de eerste 5–10 seconden), gebruikt de synthese het audiofragment dat overeenkomt met wat je zojuist in je brontaal hebt gezegd. Zodra er een lang genoeg sample is, schakelt het over op het gebruik van dat sample voor alles wat daarna komt. In de praktijk merk je geen omschakeling — de vertaling klinkt meer zoals jij naarmate het gesprek vordert. Het zal geen vlekkeloze imitatie van je stem zijn, maar het is onmiskenbaar jij in plaats van een generieke verteller — en het blijft verbeteren naarmate het model meer van je hoort.
Talen
Jouw-eigen-stem-vertaling is beschikbaar voor alle 24 spraaktalen — dezelfde set die wordt vermeld in Talen kiezen. Er hoeft niets apart te worden ingeschakeld: wanneer vertaling is ingeschakeld, horen deelnemers je automatisch in je eigen stem.
Privacy
De stem-sample die voor synthese wordt gebruikt, is vluchtig. Het bestaat alleen voor de duur van de live meeting en wordt nergens opgeslagen — de Mind API en SDK die de realtime sessie aansturen, bewaren geen gegevens zodra de conferentiesessie is beëindigd. Deze stem-sample is niet gerelateerd aan de video-en-spraak opname functies van InterMIND; dit zijn losse, expliciete opnames die je bewust start.
Op de roadmap: Lip-Sync
Het horen van de vertaling in je eigen stem is de eerste helft van een groter doel. De volgende stap waaraan we werken is lip-sync — het opnieuw timen van de mond van de spreker op de camera zodat deze past bij de vertaalde audio, waardoor het lijkt alsof elke deelnemer de taal van de ander spreekt. Gecombineerd met jouw-eigen-stem-vertaling is het doel een gesprek waarin mensen die geen gemeenschappelijke taal delen, elkaar zien en horen alsof ze elkaars taal als moedertaal spreken.
Dit is een roadmap-item, nog geen uitgebrachte feature — de bovenstaande jouw-eigen-stem-vertaling is vandaag live.