Su propia voz

Cómo InterMIND pronuncia la traducción con la propia voz de cada participante en lugar de con un narrador sintético.

Su propia voz

Cuando InterMIND traduce su discurso para otro participante, este no escucha un narrador de texto a voz robótico. Escucha una voz reconociblemente suya — que conserva su timbre y su forma de hablar — diciendo ahora las palabras en su idioma.

Esto funciona en ambas direcciones y para cada participante de forma independiente. En una reunión donde cinco personas hablan cinco idiomas, cada persona oye a las otras cuatro en su propio idioma, y cada uno de esos cuatro sigue sonando como él mismo.

Cómo suena

La mayoría de las herramientas de traducción en vivo sustituyen al hablante por una única voz sintética genérica. El resultado es inteligible pero plano: se pierde quién está hablando, el énfasis, la personalidad. InterMIND conserva la voz del hablante, por lo que una reunión traducida se siente como una conversación entre las personas que realmente están en ella, no como una cola de anuncios leídos por una máquina.

Cómo funciona

InterMIND utiliza un pipeline en cascada, y el paso de voz es la última etapa:

  1. Reconocimiento de voz — sus palabras se transcriben en su propio idioma mientras habla.
  2. Segmentación — la transcripción se agrupa en fragmentos de oración estables (cláusulas) para que la traducción pueda comenzar antes de que termine la oración.
  3. Traducción — cada fragmento se traduce progresivamente al idioma del oyente.
  4. Síntesis de voz — cada fragmento traducido se reproduce utilizando una muestra de su propia voz y se envía al oyente.

Mientras la reunión aún está recopilando suficiente de su discurso para modelar su voz (aproximadamente los primeros 5–10 segundos), la síntesis utiliza el fragmento de audio que coincide con lo que acaba de decir en su idioma de origen. Una vez que hay una muestra lo suficientemente larga, cambia al uso de esa muestra para todo lo posterior. En la práctica no se nota un cambio — la traducción suena más como usted a medida que avanza la llamada. No será una impecable imitación de su voz, pero es reconociblemente usted en lugar de un narrador genérico — y sigue mejorando a medida que el modelo le escucha más.

Idiomas

La traducción con su propia voz está disponible para los 24 idiomas de voz — el mismo conjunto que se indica en Elegir idiomas. No hay nada que habilitar por separado: cuando la traducción está activada, los participantes le oyen automáticamente con su propia voz.

Privacidad

La muestra de voz utilizada para la síntesis es efímera. Existe únicamente durante la duración de la reunión en vivo y no se almacena en ningún lugar — la API y el SDK de Mind que impulsan la sesión en tiempo real no conservan ningún dato una vez que finaliza la sesión de la conferencia. Esta muestra de voz no está relacionada con las funciones de grabación de video y voz de InterMIND, que son grabaciones explícitas y separadas que usted inicia a propósito.

En la hoja de ruta: Lip-Sync

Escuchar la traducción con su propia voz es la primera mitad de un objetivo mayor. El siguiente paso en el que estamos trabajando es la sincronización labial (lip-sync): reajustar el movimiento de los labios del hablante en la cámara para que coincida con el audio traducido, de modo que cada participante parezca estar hablando en el idioma del otro. Combinado con la traducción con voz propia, el objetivo es una llamada donde las personas que no comparten un idioma común se ven y se escuchan como si cada uno hablara el idioma del otro de forma nativa.

Esto es un elemento de la hoja de ruta, no una función lanzada todavía — la traducción con voz propia descrita anteriormente está disponible hoy.

¿Quiere la imagen técnica completa? Consulte Hable con su propia voz — en un idioma que no habla en el blog.