[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-nl-\u002Fown-voice-translation":3},{"page":4,"surround":342},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":329,"demo-cta":330,"description":331,"extension":332,"genre":333,"heroOrder":334,"image":335,"meta":336,"navigation":337,"no-translate":330,"path":338,"rank-country":334,"rank-keywords":334,"rank-tag":334,"seo":339,"stem":340,"updated":334,"__hash__":341},"blog_nl\u002Fblog\u002Fown-voice-translation.md","Spreek met je eigen stem — in een taal die je niet spreekt",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":317},"minimark",[14,18,26,34,45,56,59,64,67,78,82,93,123,130,134,141,144,163,173,177,180,195,206,213,217,224,234,238,245,256,259,266,270,285,314],[15,16,6],"h1",{"id":17},"spreek-met-je-eigen-stem-in-een-taal-die-je-niet-spreekt",[19,20,21,22],"p",{},"Hier is het deel van realtime vertaling dat bijna iedereen verkeerd doet, en waar bijna niemand over praat: ",[23,24,25],"strong",{},"de stem die je hoort.",[19,27,28,29,33],{},"Je kunt uitstekende spraakherkenning en uitstekende vertaling hebben, en toch eindigen met een meeting die aanvoelt als een machine die een lijst voorleest. Omdat in de laatste stap — het terugzetten van de vertaalde tekst naar geluid — de meeste tools ",[30,31,32],"em",{},"jou"," stilletjes vervangen door een enkele generieke synthetische verteller. Acht mensen in de kamer, één robotstem voor allemaal. Je verliest wie er spreekt, de nadruk, de persoonlijkheid. Verstaanbaar, maar geen gesprek.",[19,35,36,37,40,41,44],{},"InterMIND doet de laatste stap anders. Wanneer je spreekt, horen de andere deelnemers de vertaling in een stem die ",[23,38,39],{},"herkenbaar de jouwe is"," — met jouw klankkleur en jouw manier van spreken — die nu de woorden in hun taal zegt. Het is nog geen vlekkeloze imitatie; het punt is dat het ",[30,42,43],{},"jij"," bent in plaats van een standaardverteller, en het wordt beter. Dit werkt voor elke deelnemer, in beide richtingen, tegelijkertijd.",[19,46,47,48,55],{},"Dit bericht is het ontbrekende hoofdstuk van ",[49,50,52],"a",{"href":51},"\u002Fblog\u002Finside-the-translation-pipelines",[30,53,54],{},"Binnen de vier vertaalpijplijnen die InterMIND draaien",": dat stuk legde uit hoe audio vertaalde audio wordt. Dit gaat over wiens stem er aan de andere kant uitkomt.",[57,58],"hr",{},[60,61,63],"h2",{"id":62},"de-standaard-die-iedereen-levert-en-waarom-dit-vlak-aanvoelt","De standaard die iedereen levert, en waarom dit vlak aanvoelt",[19,65,66],{},"Als je live vertaling hebt gebruikt in een van de grote meeting-platforms, ken je het geluid. Een neutrale, gelijkmatig gepleisterde stem leest de vertaling voor. Het is dezelfde stem, of de spreker nu jouw CEO is die een town hall opent of een collega die een grapje maakt. De technologie eronder is text-to-speech met één vast stemmodel, en de ontwerpaanname is dat verstaanbaarheid genoeg is.",[19,68,69,70,73,74,77],{},"In een echte meeting is dat niet zo. De helft van wat een meeting communiceert, is ",[30,71,72],{},"wie"," het zegt en ",[30,75,76],{},"hoe",". Haal de stem weg en je hebt een discussie veranderd in een transcript dat toevallig hardop wordt uitgesproken. Mensen stoppen met op elkaar reageren en beginnen op hun beurt te wachten.",[60,79,81],{"id":80},"wat-intermind-in-plaats-daarvan-doet","Wat InterMIND in plaats daarvan doet",[19,83,84,85,88,89,92],{},"De vertaling draait als een ",[23,86,87],{},"getrapte pijplijn"," — drie gespecialiseerde fasen opeenvolgend in plaats van één model dat alles probeert te doen. De eerste twee fasen worden behandeld in het ",[49,90,91],{"href":51},"bericht over pijplijnen","; de stem-stap is waar dit bericht over gaat:",[94,95,96,103,113],"ol",{},[97,98,99,102],"li",{},[23,100,101],{},"ASR — spraakherkenning."," Jouw woorden worden in je eigen taal getranscribeerd, in jouw browser, terwijl je spreekt. (Lokaal draaien bespaart een round-trip en zorgt voor de laagst mogelijke vertraging voordat de vertaling überhaupt kan beginnen.)",[97,104,105,108,109,112],{},[23,106,107],{},"MT — vertaling."," Het transcript wordt gegroepeerd in stabele zinsfragmenten — ",[30,110,111],{},"zinsdelen"," — zodat de vertaling kan beginnen voordat je de zin hebt afgemaakt, en elk fragment wordt progressief vertaald naar de taal van de luisteraar.",[97,114,115,118,119,122],{},[23,116,117],{},"Zero-shot TTS — stemsynthese."," Elk vertaald fragment wordt hardop uitgesproken ",[23,120,121],{},"met behulp van een sample van je eigen stem",", en gestreamd naar de luisteraar.",[19,124,125,126,129],{},"Het is die derde fase — ASR → MT → ",[23,127,128],{},"zero-shot TTS"," — die het effect produceert. \"Zero-shot\" betekent dat het systeem geen vooraf opgenomen registratie of trainingssessie voor je stem nodig heeft. Het modelleert je stem aan de hand van de audio van de meeting waarin je je al bevindt.",[60,131,133],{"id":132},"de-opwarmfase-hoe-het-zo-snel-als-jouw-eigen-stem-begint-te-klinken","De opwarmfase: hoe het zo snel als jouw eigen stem begint te klinken",[19,135,136,137,140],{},"Er schuilt een kip-en-ei-probleem in \"gebruik een sample van je eigen stem.\" Helemaal aan het begin van een call, heeft het systeem nog niet genoeg van je ",[30,138,139],{},"gehoord"," om je stem goed te modelleren.",[19,142,143],{},"InterMIND handelt dit af met een progressieve opwarmfase:",[145,146,147,157],"ul",{},[97,148,149,152,153,156],{},[23,150,151],{},"Voor ongeveer de eerste 5–10 seconden",", terwijl het nog genoeg van je spraak verzamelt, wordt elk vertaald fragment gesynthetiseerd met behulp van het audiofragment dat overeenkomt met wat je ",[30,154,155],{},"net zei"," in je brontaal. De stem is verankerd aan jouw echte, directe spraak.",[97,158,159,162],{},[23,160,161],{},"Zodra er een lang genoeg sample is"," — de 5–10 seconden grens — sluit het systeem hierop aan en gebruikt het dit om alles daarna van een stem te voorzien.",[19,164,165,166,169,170,172],{},"In de praktijk hoor je geen schakelaar omslaan. De vertaling klinkt meer als jij naarmate het gesprek op gang komt — geen perfecte dubbelganger van je stem, maar duidelijk de jouwe in plaats van die van een machine, en verbeterend naarmate het model meer hoort. De combinatie van ",[30,167,168],{},"progressieve"," vertaling (zinsdeel voor zinsdeel, niet zin voor zin) en ",[30,171,168],{}," stemverlening is wat het geheel binnen het latency-budget houdt terwijl het toch menselijk klinkt.",[60,174,176],{"id":175},"de-stem-sample-wordt-nooit-opgeslagen","De stem-sample wordt nooit opgeslagen",[19,178,179],{},"Dit is het deel waar een beveiligings- of juridisch team onmiddellijk naar vraagt, dus hier is het helder uiteengezet.",[19,181,182,183,186,187,190,191,194],{},"De stem-sample die voor de synthese wordt gebruikt, is ",[23,184,185],{},"vluchtig",". Het bestaat alleen voor de live conferentiesessie, ten behoeve van het stemmen van de vertaling, en wordt ",[23,188,189],{},"nergens opgeslagen",". De Mind API en SDK die de realtime sessie aandrijven, behouden ",[23,192,193],{},"geen gegevens"," — alles wat tijdelijk is, verdwijnt wanneer de conferentiesessie eindigt.",[19,196,197,198,201,202,205],{},"Het is de moeite waard om precies te zijn over wat deze sample ",[30,199,200],{},"niet is",": het is niet een van InterMIND's ",[23,203,204],{},"opname","-functies. Het opnemen van de video en audio van een meeting is een aparte, opzettelijke actie die je bewust ondernemt, met zijn eigen bedieningselementen. De eigen-stem-sample is geen opname — het is een vluchtige invoer voor de spraaksynthesizer die de call nooit overleeft.",[19,207,208,209,212],{},"Dit is belangrijk voorbij de privacy-hygiëne. \"Spreek met je eigen stem\" is precies het soort functie dat ",[30,210,211],{},"klinkt"," alsof het het opslaan van een voiceprint ergens zou moeten omvatten. Dat doet het niet. De eerlijke versie is het betere verhaal: je stem wordt op het moment gemodelleerd en verdwijnt wanneer je ophangt.",[60,214,216],{"id":215},"waarom-niemand-anders-dit-levert","Waarom niemand anders dit levert",[19,218,219,220,223],{},"Het is niet zo dat het klonen van stemmen een geheim is. Het is dat het ",[23,221,222],{},"live, per deelnemer, in beide richtingen, onder een budget van één seconde, over 24 talen, zonder iets op te slaan"," doen een ander probleem is dan het offline klonen van een stem voor een podcast.",[19,225,226,227,233],{},"De grote platforms optimaliseren hun vertaling voor ondertiteldekking en een enkele veilige vertellerstem — dat is de goedkope, robuuste standaard op schaal. De eigen stem van elke spreker behouden, betekent dat de synthesefase elke deelnemer onafhankelijk moet volgen en binnen hetzelfde latency-budget moet blijven dat de rest van de pijplijn hanteert. We hebben de stem-engine zelf gebouwd, op onze eigen infrastructuur, waardoor we deze afweging zelf kunnen maken. (Meer over waarom de engine onze eigen code is: ",[49,228,230],{"href":229},"\u002Fblog\u002Fwhat-one-intermind-meeting-is-built-from",[30,231,232],{},"Waaruit één InterMIND meeting bestaat",".)",[60,235,237],{"id":236},"waar-dit-naartoe-gaat-lip-sync","Waar dit naartoe gaat: lip-sync",[19,239,240,241,244],{},"Je stem behouden is de ene helft van een groter doel. De andere helft is je ",[23,242,243],{},"gezicht",".",[19,246,247,248,251,252,255],{},"Nu hoor je de ander in zijn eigen stem, maar als je op camera bent, bewegen hun lippen nog steeds naar de woorden die ze daadwerkelijk zeiden — in een taal die je niet verstaat. De volgende stap is ",[23,249,250],{},"lip-sync",": de mond van de spreker opnieuw timen op de vertaalde audio, zodat het op jouw scherm lijkt alsof ze ",[30,253,254],{},"jouw"," taal spreken.",[19,257,258],{},"Zet de twee samen en het hele doel van dit werk komt in beeld. Twee mensen die geen gemeenschappelijke taal delen, zitten tegenover elkaar in een video-call en zien en horen elkaar alsof elk een native speaker is van de taal van de ander — dezelfde stem, hetzelfde gezicht, geen tolk in het midden, geen robot die een script voorleest.",[19,260,261,262,265],{},"Om duidelijk te zijn over de status: ",[23,263,264],{},"de stem is vandaag live; lip-sync staat op de roadmap en is nog niet geleverd."," We wijzen op de bestemming omdat dat de reden is waarom het werk aan de stem ertoe doet — eigen-stem-vertaling is niet de functie, het is de eerste helft van \"praat met wie dan ook, in elke taal, als jezelf.\"",[60,267,269],{"id":268},"waar-je-het-kunt-horen","Waar je het kunt horen",[19,271,272,273,276,277,281,282,284],{},"Eigen-stem-vertaling is ",[23,274,275],{},"vandaag live, voor alle 21 stemtalen"," — dezelfde talen die vermeld staan in de ",[49,278,280],{"href":279},"\u002Fdocs\u002Ftranslation\u002Flanguages","documentatie",". Er hoeft niets apart te worden aangezet: wanneer vertaling is ingeschakeld in een meeting, horen deelnemers elkaar automatisch in hun eigen stemmen. We zijn eerlijk over waar het staat: vandaag is de stem al herkenbaar ",[30,283,43],{},", en de gelijkenis is iets dat we actief dichterbij brengen. Ga luisteren en oordeel zelf.",[145,286,287,296,305],{},[97,288,289,295],{},[23,290,291],{},[49,292,294],{"href":293},"\u002Fdemo","Probeer de demo"," — draait de live stem-pijplijn tegen jouw audio in elk van de 24 talen.",[97,297,298,304],{},[23,299,300],{},[49,301,303],{"href":302},"\u002Fbenchmark","Bekijk de kwaliteitscijfers"," — dezelfde productie-pijplijn, maandelijks gescoord op FLORES-200, met de volledige verdeling gepubliceerd per taalpaar.",[97,306,307,313],{},[23,308,309],{},[49,310,312],{"href":311},"\u002Fdocs\u002Ftranslation\u002Fown-voice","Hoe het werkt, in de documentatie"," — de korte versie van dit bericht.",[19,315,316],{},"Een vertaalde meeting moet aanvoelen als de mensen die er daadwerkelijk aan deelnemen die met elkaar praten. Je stem behouden is hoe dat bereikt wordt.",{"title":318,"searchDepth":319,"depth":320,"links":321},"",2,3,[322,323,324,325,326,327,328],{"id":62,"depth":319,"text":63},{"id":80,"depth":319,"text":81},{"id":132,"depth":319,"text":133},{"id":175,"depth":319,"text":176},{"id":215,"depth":319,"text":216},{"id":236,"depth":319,"text":237},{"id":268,"depth":319,"text":269},"2026-06-13",false,"De meeste tools voor live vertaling vervangen je door een enkele robotachtige verteller. InterMIND behoudt je stem: elke deelnemer hoort de vertaling in de eigen stem van de oorspronkelijke spreker. Hier lees je hoe de cascade dit doet — en waarom de stem-sample nooit wordt opgeslagen.","md","editorial",null,"\u002Fblog\u002Fown-voice-translation.svg",{},true,"\u002Fblog\u002Fown-voice-translation",{"title":6,"description":331},"blog\u002Fown-voice-translation","yRwpFAj4a1ouAAxBhVbGhltut8jmtWILiQU9DZGwEEY",[343,348],{"title":344,"path":345,"stem":346,"description":347,"children":-1},"We hebben onze GDPR-audit voltooid. Hier is wat we daadwerkelijk hebben afgesloten.","\u002Fblog\u002Fgdpr-audit-what-we-closed","blog\u002Fgdpr-audit-what-we-closed","De 'GDPR-compliant'-badge van een leverancier betekent niets zonder het werk dat erachter staat. We hebben een volledige audit van onze eigen codebase uitgevoerd aan de hand van de GDPR-verplichtingen die op een dataverwerker rusten — verwijdering, retentie, subverwerkers, EU-runtime — en hier is elk item dat we hebben afgesloten, geverifieerd aan de hand van de code.",{"title":349,"path":350,"stem":351,"description":352,"children":-1},"Microsoft Teams live vertaling: hoe het werkt en waar de grenzen liggen","\u002Fblog\u002Fteams-live-translation","blog\u002Fteams-live-translation","Teams kan een live vergadering op drie manieren vertalen — vertaalde ondertiteling, de AI Interpreter-agent en kanalen voor menselijke tolk. Wat elk hiervan vereist, wat het kost, en de beperkingen die bepalen of het geschikt is voor jouw vergadering."]