Votre propre voix
Votre propre voix
Lorsqu'InterMIND traduit votre discours pour un autre participant, celui-ci n'entend pas un narrateur de synthèse vocale robotique. Il entend une voix reconnaissable comme étant la vôtre — conservant votre timbre et votre façon de parler — qui prononce désormais les mots dans sa propre langue.
Cela fonctionne dans les deux sens et pour chaque participant de manière indépendante. Dans une réunion où cinq personnes parlent cinq langues, chacune entend les quatre autres dans sa propre langue, et chacune de ces quatre personnes conserve sa propre voix.
À quoi cela ressemble
La plupart des outils de traduction en direct remplacent le locuteur par une voix synthétique générique unique. Le résultat est intelligible mais plat — vous perdez l'identité de la personne qui parle, l'intonation et la personnalité. InterMIND conserve la voix du locuteur, de sorte qu'une réunion traduite ressemble à une conversation entre les personnes qui y participent réellement, et non à une file d'annonces lues par une machine.
Comment cela fonctionne
InterMIND utilise un pipeline en cascade, et l'étape de la voix est la dernière :
- Reconnaissance vocale — vos mots sont transcrits dans votre propre langue, au fur et à mesure que vous parlez.
- Segmentation — la transcription est regroupée en fragments de phrases stables (propositions) afin que la traduction puisse commencer avant que vous ayez terminé votre phrase.
- Traduction — chaque fragment est traduit progressivement dans la langue de l'auditeur.
- Synthèse vocale — chaque fragment traduit est prononcé à l'aide d'un échantillon de votre propre voix, puis envoyé à l'auditeur.
Pendant que la réunion rassemble encore suffisamment de votre discours pour modéliser votre voix (environ les 5 à 10 premières secondes), la synthèse utilise le fragment audio qui correspond à ce que vous venez de dire dans votre langue source. Une fois l'échantillon suffisamment long, le système passe à l'utilisation de cet échantillon pour tout le reste. En pratique, vous ne remarquez pas de transition — la traduction vous ressemble de plus en plus à mesure que l'appel avance. Ce ne sera pas une imitation parfaite de votre voix, mais il s'agit bien de la vôtre de manière reconnaissable plutôt que d'un narrateur générique — et cela continue de s'améliorer au fur et à mesure que le modèle vous écoute.
Langues
La traduction avec votre propre voix est disponible pour les 24 langues vocales — le même ensemble répertorié dans Choisir les langues. Il n'y a rien à activer séparément : lorsque la traduction est activée, les participants entendent automatiquement votre propre voix.
Confidentialité
L'échantillon vocal utilisé pour la synthèse est éphémère. Il n'existe que pendant la durée de la réunion en direct et n'est stocké nulle part — le Mind API et le SDK qui alimentent la session en temps réel ne conservent aucune donnée une fois la session de conférence terminée. Cet échantillon vocal n'a aucun lien avec les fonctionnalités d'enregistrement vidéo et vocal d'InterMIND, qui sont des enregistrements distincts et explicites que vous lancez volontairement.
Sur la feuille de route : Synchronisation labiale
Entendre la traduction dans votre propre voix est la première moitié d'un objectif plus vaste. La prochaine étape sur laquelle nous travaillons est la synchronisation labiale — resynchronisant les mouvements de la bouche du locuteur à la caméra pour les faire correspondre à l'audio traduit, afin que chaque participant semble parler la langue de l'autre. Combinée à la traduction avec votre propre voix, l'objectif est un appel où des personnes qui n'ont aucune langue en commun se voient et s'entendent comme si chacune parlait couramment la langue de l'autre.
Il s'agit d'un élément de la feuille de route, et non d'une fonctionnalité livrée pour le moment — la traduction avec votre propre voix décrite ci-dessus est disponible aujourd'hui.