Parlez de votre propre voix — dans une langue que vous ne parlez pas
Voici l'aspect de la traduction en temps réel que presque tout le monde fait de travers, et dont presque personne ne parle : la voix que vous entendez.
Vous pouvez avoir une excellente reconnaissance vocale et une excellente traduction, et vous retrouver avec une réunion qui donne l'impression d'une machine lisant une liste. Parce que la dernière étape — transformer le texte traduit en son — est l'endroit où la plupart des outils remplacent discrètement vous par un seul narrateur synthétique générique. Huit personnes dans la salle, une seule voix de robot pour tous. Vous perdez qui parle, l'intonation, la personnalité. Intelligible, mais pas une conversation.
InterMIND fait cette dernière étape différemment. Quand vous parlez, les autres participants entendent la traduction dans une voix manifestement la vôtre — portant votre timbre et votre façon de parler — disant désormais les mots dans leur langue. Ce n'est pas encore une imitation parfaite ; l'objectif est que ce soit vous plutôt qu'un narrateur standard, et que cela s'améliore. Cela fonctionne pour chaque participant, dans les deux sens, en même temps.
Cet article est le chapitre manquant de Inside the four translation pipelines that run InterMIND : ce texte expliquait comment l'audio devient de l'audio traduit. Celui-ci porte sur la voix qui ressort à l'autre bout.
Le défaut que tout le monde livre, et pourquoi il est plat
Si vous avez utilisé la traduction en direct dans l'une des grandes plateformes de réunions, vous connaissez ce son. Une voix neutre, au rythme régulier, lit la traduction. C'est la même voix, que le locuteur soit votre CEO ouvrant une réunion générale ou un collègue faisant une blague. La technologie sous-jacente est la synthèse vocale avec un seul modèle de voix fixe, et l'hypothèse de conception est que l'intelligibilité suffit.
Dans une vraie réunion, ce n'est pas le cas. La moitié de ce que communique une réunion, c'est qui le dit et comment. Supprimez la voix et vous avez transformé une discussion en une transcription qui se trouve être prononcée à voix haute. Les gens ne réagissent plus les uns aux autres et commencent à attendre leur tour.