Architectuur

Spreek met je eigen stem — in een taal die je niet spreekt

De meeste tools voor live-vertaling vervangen je door één robotachtige verteller. InterMIND behoudt je stem: elke deelnemer hoort de vertaling in de eigen stem van de oorspronkelijke spreker. Hier zie je hoe de cascade dit doet, wat het optionele opgeslagen stemfragment in Instellingen toevoegt en wat er wordt opgeslagen.

The Mind.com Team

Spreek met je eigen stem — in een taal die je niet spreekt

Spreek met je eigen stem — in een taal die je niet spreekt

Hier is het deel van realtime vertaling dat bijna iedereen verkeerd aanpakt, en waar bijna niemand het over heeft: de stem die je hoort.

Je kunt uitstekende spraakherkenning en uitstekende vertaling hebben, en toch eindigen met een vergadering die aanvoelt als een machine die een lijst voorleest. Omdat in de laatste stap — de vertaalde tekst weer omzetten in geluid — de meeste tools jou stilletjes vervangen door één enkele, generieke synthetische verteller. Acht mensen in de kamer, één robotstem voor hen allemaal. Je verliest wie er spreekt, de nadruk, de persoonlijkheid. Verstaanbaar, maar geen gesprek.

InterMIND doet de laatste stap anders. Als jij spreekt, horen de andere deelnemers de vertaling in een stem die onmiskenbaar van jou is — jouw klankkleur en jouw manier van spreken meedragend — die nu de woorden in hun taal uitspreekt. Het is nog geen vlekkeloze imitatie; het punt is dat het jij bent in plaats van een standaardverteller, en het wordt steeds beter. Dit werkt voor elke deelnemer, in beide richtingen, tegelijkertijd.

Dit bericht is het ontbrekende hoofdstuk van Inside the four translation pipelines that run InterMIND: dat stuk legde uit hoe audio vertaalde audio wordt. Dit gaat over wiens stem er aan de andere kant uitkomt.


De standaard die iedereen levert, en waarom dit vlak klinkt

Als je live vertaling hebt gebruikt in een van de grote vergaderplatforms, dan ken je het geluid. Een neutrale, gelijkmatig geuite stem leest de vertaling voor. Het is dezelfde stem, ongeacht of de spreker je CEO is die een town hall opent, of een collega die een grapje maakt. De onderliggende technologie is tekst-naar-spraak met één vast stemmodel, en de ontwerpaanname is dat verstaanbaarheid voldoende is.

In een echte vergadering is dat niet zo. De helft van wat een vergadering communiceert, is wie het zegt en hoe. Strip de stem eraf en je hebt een discussie veranderd in een transcript dat toevallig hardop wordt uitgesproken. Mensen stoppen met op elkaar reageren en wachten op hun beurt.

Wat InterMIND in plaats daarvan doet

De vertaling draait als een getcascadeerde pijplijn — drie gespecialiseerde fasen in sequentie, in plaats van één model dat probeert alles te doen. De eerste twee fasen worden behandeld in het pijplijn-bericht; de stem-stap is waar dit bericht over gaat:

  1. ASR — spraakherkenning. Je woorden worden getranscribeerd in je eigen taal, terwijl je spreekt, op onze eigen engine — de mediaserver die het gesprek voert (Mind API, OVH France) — zodat de vertaling kan starten voordat de zin is afgelopen.
  2. MT — vertaling. Het transcript wordt gegroepeerd in stabiele zinsfragmenten — clausules — zodat de vertaling kan beginnen voordat je de zin hebt afgemaakt, en elk fragment wordt progressief vertaald naar de taal van de luisteraar.
  3. Zero-shot TTS — stemsynthese. Elk vertaald fragment wordt hardop uitgesproken met behulp van een sample van je eigen stem, en naar de luisteraar gestreamd.

Het is die derde fase — ASR → MT → zero-shot TTS — die het effect produceert. 'Zero-shot' betekent dat het systeem geen vooraf opgenomen inschrijving of trainingssessie nodig heeft voor je stem. Het modelleert je stem aan de hand van de audio van de vergadering waarin je je al bevindt.

De opwarmfase: hoe het zo snel de jouwe begint te klinken

Er schuilt een kip-en-ei-probleem in 'gebruik een sample van je eigen stem.' Helemaal aan het begin van een gesprek heeft het systeem nog niet genoeg van je gehoord om je stem goed te modelleren.

InterMIND handelt dit af met een progressieve opwarmfase:

  • Voor ongeveer de eerste 5–10 seconden, terwijl het nog genoeg van je spraak verzamelt, wordt elk vertaald fragment gesynthetiseerd met behulp van het audiofragment dat overeenkomt met wat je net hebt gezegd in je brontaal. De stemgeving is verankerd in je echte, onmiddellijke spraak.
  • Zodra er een lang genoeg sample is — die markering van 5–10 seconden — sluit het systeem daarop aan en gebruikt het om daarna alles van een stem te voorzien.

In de praktijk hoor je geen schakelaar omslaan. De vertaling klinkt meer als jij naarmate het gesprek op gang komt — geen perfecte dubbelganger van je stem, maar duidelijk de jouwe in plaats van die van een machine, en verbeterend naarmate het model meer hoort. De combinatie van progressieve vertaling (clausule per clausule, niet zin per zin) en progressieve stemgeving is wat het geheel binnen het latentiebudget houdt, terwijl het nog steeds menselijk klinkt.

Neem je stem één keer op, en sla de opwarmfase over

De opwarmfase hierboven is wat er standaard gebeurt, zonder dat er iets hoeft te worden ingesteld. Sinds september 2026 is er een optioneel tweede pad voor ingelogde gebruikers: een opgeslagen stemsample in Instellingen → Jouw stem in vertaling.

Opnemen is één gebaar. Druk op Neem mijn stem op, wacht op Spreek nu, en zeg de getallen één tot tien in willekeurige volgorde. Elk getal licht op op de kaart zodra de spraakengine het hoort; wanneer alle tien zijn opgelicht, wordt het sample gecontroleerd en zelfstandig opgeslagen. Er is niets om terug te luisteren of te bevestigen, en er is geen countdown: de kaart behoudt het stuk van je opname dat de getallen bevat. Een stille kamer en een headset geven het beste resultaat.

Wat het opgeslagen sample verandert: vanaf je volgende vergadering voorziet de synthesizer je vertaling vanaf het eerste fragment van een stem, zodat de andere kant jou vanaf de eerste zin als jezelf hoort, in plaats van na de opwarmfase. Onder de motorkap is het dezelfde zero-shot synthese met een beter startpunt; de live opwarmfase verfijnt de stem nog steeds naarmate het gesprek vordert.

De opname wordt gefilterd voordat deze wordt opgeslagen. Het moet 3 tot 10 seconden heldere spraak zijn (het invoervenster van de synthesizer): te stil, afgekapt, grotendeels stilte of overstemd door achtergrondgeluid, en de kaart vertelt je wat je moet oplossen en vraagt om een nieuwe opname. Getallen zijn om een praktische reden gekozen als frase: ze zijn kort, herkenbaar in elk van de 23 talen, en de engine kan bevestigen dat hij alle tien heeft gehoord, wat 'werkte die opname?' verandert in een zichtbaar ja.

Twee stemsamples, twee levensduren

Dit is het deel waar een beveiligings- of juridisch team direct naar vraagt, dus hier is het helder. Er zijn twee verschillende samples, en ze hebben een verschillende levensduur.

Het live sample dat wordt gebruikt voor de opwarmfase in de vergadering is kortstondig. Het bestaat alleen voor de live conferentiesessie, ten behoeve van het stemmen van de vertaling, en wordt nergens opgeslagen. De Mind API en SDK die de realtime sessie aansturen, behouden geen gegevens; alles wat tijdelijk is verdwijnt wanneer de conferentiesessie eindigt.

Het opgeslagen sample uit Instellingen wordt bij je account opgeslagen, voor één doel: het wordt elke keer dat je deelneemt aan een vergadering naar de vertaalengine gestuurd, zodat je vertaalde spraak hiermee kan worden ingesproken, en voor niets anders. Het blijft staan totdat je op Verwijderen drukt op de kaart, wat je onmiddellijk terugbrengt naar de standaard opwarmfase, en het wordt samen met je account verwijderd. Gasten kunnen er geen opnemen; het is een ontwerpfeature voor ingelogde gebruikers.

Het is de moeite waard om precies te zijn over wat geen van beide samples is: geen van InterMIND's opname-features. Het opnemen van de video en audio van een vergadering is een afzonderlijke, opzettelijke actie die je doelbewust onderneemt, met eigen bedieningselementen. Een stemsample is een invoer voor de spraaksynthesizer: van voorbijgaande aard in het live-geval, van jou om te behouden of verwijderen in het opgeslagen geval.

Waarom niemand anders dit levert

Het is niet zo dat het klonen van stemmen een geheim is. Het punt is dat het live, per deelnemer, in beide richtingen, binnen een budget van één seconde, over 23 talen, zonder iets op te slaan waar je niet om hebt gevraagd doen, een ander probleem is dan het offline klonen van een stem voor een podcast.

De grote platforms optimaliseren hun vertaling voor dekking van ondertiteling en één veilige vertelstem — dat is de goedkope, robuuste standaard op schaal. Elke spreker zijn eigen stem laten behouden, betekent dat de synthesefase elke deelnemer onafhankelijk moet volgen en binnen hetzelfde latentiebudget moet blijven als de rest van de pijplijn. We hebben de stem-engine zelf gebouwd, op onze eigen infrastructuur, wat die afweging van ons maakt. (Meer over waarom de engine onze eigen code is: Waaruit één InterMIND-vergadering bestaat.)

Waar dit naartoe gaat: lip-sync

Je stem behouden is de ene helft van een groter doel. De andere helft is je gezicht.

Op dit moment hoor je de ander in zijn eigen stem, maar als je voor de camera zit, bewegen hun lippen nog steeds op de woorden die ze daadwerkelijk zeiden — in een taal die je niet leest. De volgende stap is lip-sync: de mond van de spreker opnieuw timen op de vertaalde audio, zodat het op jouw scherm lijkt alsof ze jouw taal spreken.

Zet de twee samen en het hele doel van dit werk komt in beeld. Twee mensen die geen gemeenschappelijke taal delen, zitten tegenover elkaar in een videogesprek en zien en horen elkaar alsof elk een moedertaalspreker is van de taal van de ander — dezelfde stem, hetzelfde gezicht, geen tolk ertussen, geen robot die een script voorleest.

Om duidelijk te zijn over de status: de stem is vandaag live; lip-sync staat op de roadmap, nog niet geleverd. We wijzen op de eindbestemming, want dat is de reden waarom het werk aan de stem ertoe doet — eigen-stem-vertaling is niet de feature, het is de eerste helft van 'praat met iedereen, in elke taal, als jezelf'.

Waar je het kunt horen

Eigen-stem-vertaling is vandaag live, in alle 23 spraaktalen — dezelfde talen die in de documentatie staan. Er hoeft niets apart te worden aangezet: wanneer vertaling is ingeschakeld in een vergadering, horen deelnemers elkaar automatisch in hun eigen stemmen. We zijn eerlijk over waar het staat: vandaag is de stem al onmiskenbaar jij, en de gelijkenis is iets dat we actief dichterbij proberen te brengen. Ga luisteren en oordeel zelf.

Een vertaalde vergadering zou moeten aanvoelen alsof de mensen die er daadwerkelijk in zitten met elkaar praten. Je stem behouden is hoe dat wordt bereikt.

Ontvang nieuwe berichten en productupdates via e-mail

Eén e-mail per maand met nieuwe berichten en productupdates. U kunt zich op elk moment afmelden.