Architecture

Parlez de votre propre voix — dans une langue que vous ne parlez pas

La plupart des outils de traduction en direct vous remplacent par un seul narrateur robotique. InterMIND conserve votre voix : chaque participant entend la traduction dans la voix du locuteur original. Voici comment la cascade procède, ce que l'échantillon vocal enregistré en option dans les paramètres ajoute, et ce qui est stocké.

The Mind.com Team

Parlez de votre propre voix — dans une langue que vous ne parlez pas

Parlez de votre propre voix — dans une langue que vous ne parlez pas

Voici l'aspect de la traduction en temps réel que presque tout le monde fait de travers, et dont presque personne ne parle : la voix que vous entendez.

Vous pouvez avoir une excellente reconnaissance vocale et une excellente traduction, et vous retrouver avec une réunion qui donne l'impression d'une machine lisant une liste. Parce que la dernière étape — transformer le texte traduit en son — est l'endroit où la plupart des outils remplacent discrètement vous par un seul narrateur synthétique générique. Huit personnes dans la salle, une seule voix de robot pour tous. Vous perdez qui parle, l'intonation, la personnalité. Intelligible, mais pas une conversation.

InterMIND fait cette dernière étape différemment. Quand vous parlez, les autres participants entendent la traduction dans une voix manifestement la vôtre — portant votre timbre et votre façon de parler — disant désormais les mots dans leur langue. Ce n'est pas encore une imitation parfaite ; l'objectif est que ce soit vous plutôt qu'un narrateur standard, et que cela s'améliore. Cela fonctionne pour chaque participant, dans les deux sens, en même temps.

Cet article est le chapitre manquant de Inside the four translation pipelines that run InterMIND : ce texte expliquait comment l'audio devient de l'audio traduit. Celui-ci porte sur la voix qui ressort à l'autre bout.


Le défaut que tout le monde livre, et pourquoi il est plat

Si vous avez utilisé la traduction en direct dans l'une des grandes plateformes de réunions, vous connaissez ce son. Une voix neutre, au rythme régulier, lit la traduction. C'est la même voix, que le locuteur soit votre CEO ouvrant une réunion générale ou un collègue faisant une blague. La technologie sous-jacente est la synthèse vocale avec un seul modèle de voix fixe, et l'hypothèse de conception est que l'intelligibilité suffit.

Dans une vraie réunion, ce n'est pas le cas. La moitié de ce que communique une réunion, c'est qui le dit et comment. Supprimez la voix et vous avez transformé une discussion en une transcription qui se trouve être prononcée à voix haute. Les gens ne réagissent plus les uns aux autres et commencent à attendre leur tour.

Ce qu'InterMIND fait à la place

La traduction fonctionne comme un pipeline en cascade — trois étapes spécialisées en séquence plutôt qu'un seul modèle essayant de tout faire. Les deux premières étapes sont couvertes dans l'article sur les pipelines ; l'étape de la voix est celle dont parle cet article :

  1. ASR — reconnaissance vocale. Vos mots sont transcrits dans votre propre langue, au fur et à mesure que vous parlez, sur notre propre moteur — le serveur média qui porte l'appel (Mind API, OVH France) — afin que la traduction puisse commencer avant la fin de la phrase.
  2. MT — traduction. La transcription est regroupée en fragments de phrases stables — des propositions — afin que la traduction puisse commencer avant que vous n'ayez terminé la phrase, et chaque fragment est traduit progressivement dans la langue de l'auditeur.
  3. Zero-shot TTS — synthèse vocale. Chaque fragment traduit est restitué en utilisant un échantillon de votre propre voix, et diffusé vers l'auditeur.

C'est cette troisième étape — ASR → MT → zero-shot TTS — qui produit l'effet. « Zero-shot » signifie que le système n'a pas besoin d'un enregistrement préalable ou d'une session d'entraînement pour votre voix. Il modélise votre voix à partir de l'audio de la réunion à laquelle vous participez déjà.

La phase d'échauffement : comment cela commence à ressembler à vous si vite

Il y a un problème de l'œuf et de la poule caché dans « utilisez un échantillon de votre propre voix ». Au tout début d'un appel, le système n'a pas encore suffisamment entendu votre voix pour bien la modéliser.

InterMIND gère cela avec une phase d'échauffement progressive :

  • Pendant environ les 5 à 10 premières secondes, pendant qu'il rassemble encore assez de votre parole, chaque fragment traduit est synthétisé en utilisant le fragment audio qui correspond à ce que vous venez de dire dans votre langue source. La voix est ancrée à votre parole réelle et immédiate.
  • Une fois qu'il y a un échantillon suffisamment long — le cap des 5 à 10 secondes — le s'y cala et l'utilise pour vocaliser tout ce qui suit.

En pratique, vous n'entendez pas d'interrupteur qui s'active. La traduction ressemble davantage à vous à mesure que la conversation s'engage — pas un double parfait de votre voix, mais clairement la vôtre plutôt que celle d'une machine, et s'améliorant au fur et à mesure que le modèle entend plus. La combinaison de la traduction progressive (proposition par proposition, pas phrase par phrase) et de la vocalisation progressive est ce qui maintient l'ensemble dans le budget de latence tout en sonnant humain.

Enregistrez votre voix une fois, et sautez l'échauffement

La phase d'échauffement ci-dessus est ce qui se produit par défaut, sans aucune configuration. Depuis septembre 2026, il existe un second chemin facultatif pour les utilisateurs connectés : un échantillon de voix enregistré dans Paramètres → Votre voix dans la traduction.

L'enregistrer tient en un seul geste. Appuyez sur Enregistrer ma voix, attendez Parlez maintenant, et dites les chiffres de un à dix dans n'importe quel ordre. Chaque chiffre s'illumine sur la carte au fur et à mesure que le moteur de reconnaissance vocale l'entend ; lorsque les dix sont allumés, l'échantillon est vérifié et enregistré automatiquement. Il n'y a rien à réécouter ni à confirmer, et aucun compte à rebours : la carte conserve la séquence de votre prise de voix contenant les chiffres. Une pièce silencieuse et un casque donnent le meilleur résultat.

Ce que l'échantillon enregistré change : dès votre prochaine réunion, le synthétiseur vocalise votre traduction avec celui-ci dès le premier fragment, de sorte que l'autre partie vous entend comme vous dès la première phrase, au lieu d'attendre la fin de l'échauffement. Sous le capot, il s'agit de la même synthèse zero-shot avec un meilleur point de départ ; la phase d'échauffement en direct affine toujours la voix à mesure que l'appel avance.

La prise de voix est validée avant d'être stockée. Elle doit durer 3 à 10 secondes de parole claire (la fenêtre d'entrée du synthétiseur) : trop faible, tronquée, majoritairement silencieuse ou noyée dans le bruit de fond, et la carte vous indique quoi corriger et demande une autre prise. Les chiffres ont été choisis comme phrase pour une raison pratique : ils sont courts, reconnaissables dans chacune des 23 langues, et le moteur peut confirmer qu'il a entendu les dix, ce qui transforme « est-ce que l'enregistrement a fonctionné ? » en un oui visible.

Deux échantillons de voix, deux durées de vie

C'est la partie sur laquelle une équipe de sécurité ou juridique pose des questions immédiatement, alors voici les choses clairement. Il y a deux échantillons différents, et ils vivent différemment.

L'échantillon en direct utilisé pour l'échauffement pendant la réunion est éphémère. Il n'existe que pour la session de conférence en direct, au service de la vocalisation de la traduction, et il n'est stocké nulle part. Le Mind API et le SDK qui alimentent la session en temps réel ne conservent aucune donnée ; tout ce qui est temporaire disparaît à la fin de la session de conférence.

L'échantillon enregistré depuis les Paramètres est stocké avec votre compte, à une seule fin : il est envoyé au moteur de traduction à chaque fois que vous rejoignez une réunion afin que votre parole traduite puisse être vocalisée avec, et pour rien d'autre. Il reste jusqu'à ce que vous appuyiez sur Supprimer sur la carte, ce qui vous ramène immédiatement à l'échauffement standard, et il est supprimé en même temps que votre compte. Les invités ne peuvent pas en enregistrer un ; c'est une fonctionnalité réservée aux utilisateurs connectés, par conception.

Il convient d'être précis sur ce que ni l'un ni l'autre des échantillons n'est : il ne s'agit pas de l'une des fonctionnalités d'enregistrement d'InterMIND. L'enregistrement de la vidéo et de l'audio d'une réunion est une action distincte et délibérée que vous entreprenez intentionnellement, avec ses propres contrôles. Un échantillon de voix est une entrée pour le synthétiseur vocal : transitoire dans le cas en direct, à vous de conserver ou de supprimer dans le cas enregistré.

Pourquoi personne d'autre ne livre cela

Ce n'est pas que le clonage vocal soit un secret. C'est que le faire en direct, par participant, dans les deux sens, sous un budget d'une seconde, dans 23 langues, sans rien stocker que vous ne lui ayez demandé de stocker est un problème différent du clonage d'une voix hors ligne pour un podcast.

Les grandes plateformes optimisent leur traduction pour la couverture des sous-titres et une seule voix de narrateur sûre — c'est le défaut bon marché et robuste à grande échelle. Conserver la voix propre de chaque locuteur signifie que l'étape de synthèse doit suivre chaque participant indépendamment et rester dans le même budget de latence que le reste du pipeline. Nous avons construit le moteur de voix nous-mêmes, sur notre propre infrastructure, ce qui rend ce compromis nôtre à décider. (Plus d'informations sur les raisons pour lesquelles le moteur est notre propre code : What one InterMIND meeting is built from.)

Où cela va : le lip-sync

Conserver votre voix est la moitié d'un objectif plus vaste. L'autre moitié, c'est votre visage.

Pour le moment, vous entendez l'autre personne dans sa propre voix, mais si la caméra est activée, ses lèvres bougent encore au rythme des mots qu'elle a réellement prononcés — dans une langue que vous ne lisez pas. L'étape suivante est le lip-sync : recalculer le mouvement des lèvres du locuteur sur l'audio traduit, de sorte que sur votre écran, il semble parler votre langue.

Mettez les deux ensemble et tout l'intérêt de ce travail apparaît clairement. Deux personnes qui ne partagent aucune langue commune se trouvent face à face lors d'un appel vidéo et se voient et s'entendent comme si chacune était un locuteur natif de la langue de l'autre — même voix, même visage, aucun interprète au milieu, aucun robot lisant un script.

Pour être clair sur le statut : la voix est en direct aujourd'hui ; le lip-sync est sur la feuille de route, pas encore livré. Nous indiquons la destination parce que c'est la raison pour laquelle le travail sur la voix compte — la traduction avec voix propre n'est pas la fonctionnalité, c'est la première moitié de « parler à n'importe qui, dans n'importe quelle langue, en tant que vous-même ».

Où l'entendre

La traduction avec voix propre est en direct aujourd'hui, pour les 23 langues vocales — les mêmes langues listées dans la documentation. Il n'y a rien à activer séparément : lorsque la traduction est activée dans une réunion, les participants entendent automatiquement les uns et les autres dans leurs propres voix. Nous serons honnêtes sur son état actuel : aujourd'hui, la voix est déjà manifestement la vôtre, et la ressemblance est quelque chose que nous rapprochons activement. Allez écouter et jugez par vous-même.

Une réunion traduite devrait donner l'impression que les personnes qui y sont réellement parlent entre elles. Conserver votre voix est le moyen d'y parvenir.

Recevez les nouveaux articles et mises à jour du produit par e-mail

Un e-mail par mois avec de nouveaux articles et des mises à jour du produit. Désabonnement à tout moment.