Hable con su propia voz — en un idioma que usted no habla
Esta es la parte de la traducción en tiempo real que casi todos hacen mal, y de la que casi nadie habla: la voz que usted escucha.
Se puede tener un excelente reconocimiento de voz y una excelente traducción, y aun así acabar con una reunión que parece una máquina leyendo una lista. Porque el último paso — convertir el texto traducido de nuevo en sonido — es donde la mayoría de las herramientas sustituyen discretamente su voz por un único narrador sintético genérico. Ocho personas en la sala, una sola voz robótica para todos. Se pierde quién está hablando, el énfasis, la personalidad. Inteligible, pero no una conversación.
InterMIND hace el último paso de manera distinta. Cuando usted habla, los demás participantes escuchan la traducción en una voz claramente suya — que conserva su timbre y su forma de hablar — ahora diciendo las palabras en su idioma. Todavía no es una imitación perfecta; la cuestión es que es usted y no un narrador prefabricado, y está mejorando. Esto funciona para cada participante, en ambas direcciones, al mismo tiempo.
Esta publicación es el capítulo que faltaba en Dentro de las cuatro pipelines de traducción que ejecutan InterMIND: aquel texto explicaba cómo el audio se convierte en audio traducido. Este trata sobre de quién es la voz que sale al otro lado.
Lo que todos entregan por defecto, y por qué es plano
Si ha usado la traducción en vivo en cualquiera de las grandes plataformas de reuniones, conoce el sonido. Una voz neutra, a ritmo constante, lee la traducción. Es la misma voz tanto si quien habla es su CEO abriendo una asamblea general como un compañero haciendo una broma. La tecnología subyacente es texto a voz con un único modelo de voz fijo, y el supuesto de diseño es que la inteligibilidad es suficiente.
En una reunión real no lo es. La mitad de lo que comunica una reunión es quién lo dice y cómo. Elimine la voz y habrá convertido una discusión en una transcripción que resulta ser hablada en voz alta. La gente deja de reaccionar entre sí y empieza a esperar su turno.
Lo que hace InterMIND en su lugar
La traducción se ejecuta como una pipeline en cascada — tres etapas especializadas en secuencia, en lugar de un único modelo que intenta hacerlo todo. Las dos primeras etapas se tratan en la publicación sobre las pipelines; la etapa de voz es de la que trata esta publicación:
- ASR — reconocimiento de voz. Sus palabras se transcriben en su propio idioma, en su navegador, mientras usted habla. (Ejecutarlo localmente ahorra un viaje de ida y vuelta y proporciona el menor retardo posible antes de que la traducción pueda comenzar.)
- MT — traducción. La transcripción se agrupa en fragmentos estables de oración — cláusulas — de modo que la traducción puede comenzar antes de que usted haya terminado la oración, y cada fragmento se traduce progresivamente al idioma del oyente.
- TTS zero-shot — síntesis de voz. Cada fragmento traducido se reproduce usando una muestra de su propia voz, y se transmite al oyente.
Es esa tercera etapa — ASR → MT → TTS zero-shot — la que produce el efecto. "Zero-shot" significa que el sistema no necesita una inscripción pregrabada ni una sesión de entrenamiento para su voz. Modela su voz a partir del audio de la reunión en la que usted ya está.
El calentamiento: cómo empieza a sonar como usted tan rápido
Hay un problema de huevo y gallina oculto en "usar una muestra de su propia voz". Al inicio de una llamada, el sistema todavía no ha escuchado lo suficiente de usted para modelar bien su voz.
InterMIND maneja esto con un calentamiento progresivo:
- Durante aproximadamente los primeros 5–10 segundos, mientras aún recopila suficiente muestra de su habla, cada fragmento traducido se sintetiza usando el fragmento de audio que coincide con lo que usted acaba de decir en su idioma de origen. La voz se ancla a su habla real e inmediata.
- Una vez hay una muestra lo suficientemente larga — esa marca de 5–10 segundos — el sistema se fija en ella y la usa para dar voz a todo lo que viene después.
En la práctica usted no escucha un cambio brusco. La traducción suena más como usted a medida que avanza la conversación — no un doble perfecto de su voz, pero claramente suya y no la de una máquina, y mejorando a medida que el modelo escucha más. La combinación de traducción progresiva (cláusula a cláusula, no oración a oración) y de voz progresiva es lo que mantiene todo dentro del presupuesto de latencia y aun así suena humano.
La muestra de voz nunca se almacena
Esta es la parte de la que un equipo de seguridad o legal pregunta de inmediato, así aquí está con claridad.
La muestra de voz usada para la síntesis es efímera. Existe solo durante la sesión de la conferencia en vivo, al servicio de dar voz a la traducción, y no se almacena en ningún sitio. La Mind API y el SDK que alimentan la sesión en tiempo real no retienen ningún dato — todo lo temporal se elimina cuando termina la sesión de la conferencia.
Merece la pena ser precisos sobre lo que esta muestra no es: no es una de las funciones de grabación de InterMIND. Grabar el vídeo y el audio de una reunión es una acción separada y deliberada que usted toma a propósito, con sus propios controles. La muestra de voz propia no es una grabación — es una entrada transitoria al sintetizador de voz que nunca sobrevive a la llamada.
Esto importa más allá de la higiene de privacidad. "Hable con su propia voz" es exactamente el tipo de función que suena como si debería implicar almacenar una huella de voz en algún sitio. No es así. La versión honesta es la mejor historia: su voz se modela en el momento y desaparece cuando usted cuelga.
Por qué nadie más entrega esto
No es que la clonación de voz sea un secreto. Es que hacerla en vivo, por participante, en ambas direcciones, dentro de un presupuesto de un segundo, en 24 idiomas, sin almacenar nada es un problema distinto a clonar una voz sin conexión para un podcast.
Las grandes plataformas optimizan su traducción para la cobertura de subtítulos y una única voz narradora segura — ese es el valor por defecto barato y robusto a escala. Conservar la voz propia de cada hablante significa que la etapa de síntesis tiene que rastrear a cada participante de forma independiente y mantenerse dentro del mismo presupuesto de latencia bajo el que opera el resto de la pipeline. Construimos el motor de voz nosotros mismos, en nuestra propia infraestructura, que es lo que hace que esa compensación sea nuestra de decidir. (Más sobre por qué el motor es código propio: De qué está construida una reunión de InterMIND.)
Hacia dónde va esto: sincronización labial
Conservar su voz es la mitad de un objetivo mayor. La otra mitad es su rostro.
Ahora mismo usted escucha a la otra persona con su propia voz, pero si está con la cámara encendida, sus labios siguen moviéndose al compás de las palabras que realmente dijo — en un idioma que usted no lee. El siguiente paso es la sincronización labial: reajustar el movimiento de la boca del hablante al audio traducido, de modo que en su pantalla parezca que está hablando su idioma.
Ponga ambas cosas juntas y el propósito de todo este trabajo se aclara. Dos personas que no comparten ningún idioma común se sientan frente a una videollamada y se ven y se escuchan como si cada uno hablara de forma nativa el idioma del otro — misma voz, mismo rostro, sin intérprete en medio, sin un robot leyendo un guion.
Para ser claros sobre el estado: la voz está disponible hoy; la sincronización labial está en la hoja de ruta, no está entregada. Mencionamos el destino porque es por lo que el trabajo de voz importa — la traducción con voz propia no es la función, es la primera mitad de "hable con cualquiera, en cualquier idioma, como usted mismo".
Dónde escucharlo
La traducción con voz propia está disponible hoy, en los 21 idiomas de voz — los mismos idiomas que figuran en la documentación. No hay nada que activar por separado: cuando la traducción está habilitada en una reunión, los participantes se escuchan mutuamente en sus propias voces automáticamente. Seremos honestos sobre dónde está: hoy la voz ya es reconociblemente suya, y el parecido es algo que seguimos mejorando activamente. Vaya a escucharlo y juzgue usted mismo.
- Pruebe la demo — ejecuta la pipeline de voz en vivo contra su audio en cualquiera de los 24 idiomas.
- Vea las cifras de calidad — la misma pipeline de producción, evaluada mensualmente contra FLORES-200, con la distribución completa publicada por par de idiomas.
- Cómo funciona, en la documentación — la versión breve de esta publicación.
Una reunión traducida debería dar la sensación de que las personas que realmente están en ella hablan entre sí. Conservar su voz es cómo se llega ahí.