Arquitectura

Hable con su propia voz — en un idioma que no habla

La mayoría de las herramientas de traducción en vivo lo sustituyen por un único narrador robótico. InterMIND mantiene su voz: cada participante escucha la traducción en la propia voz del orador original. Aquí se explica cómo lo consigue la cascada, qué aporta la muestra de voz guardada opcional en Configuración y qué se almacena.

The Mind.com Team

Hable con su propia voz — en un idioma que no habla

Hable con su propia voz — en un idioma que no habla

Aquí está la parte de la traducción en tiempo real que casi todos entienden mal, y de la que casi nadie habla: la voz que escucha.

Puede tener un excelente reconocimiento de voz y una excelente traducción, y aun así terminar con una reunión que parece una máquina leyendo una lista. Porque el último paso — convertir el texto traducido de nuevo en sonido — es donde la mayoría de las herramientas sustituyen silenciosamente usted por un único narrador sintético genérico. Ocho personas en la sala, una voz de robot para todos. Pierde quién está hablando, el énfasis, la personalidad. Inteligible, pero no una conversación.

InterMIND hace el último paso de manera diferente. Cuando usted habla, los demás participantes escuchan la traducción en una voz que es reconociblemente suya — con su timbre y su forma de hablar — ahora diciendo las palabras en su idioma. No es una imitación perfecta todavía; la cuestión es que es usted en lugar de un narrador prefabricado, y está mejorando. Esto funciona para cada participante, en ambas direcciones, al mismo tiempo.

Este artículo es el capítulo que falta de Dentro de las cuatro pipelines de traducción que hacen funcionar InterMIND: ese artículo explicaba cómo el audio se convierte en audio traducido. Este trata sobre de quién es la voz que sale al otro lado.


El estándar que todos entregan, y por qué es plano

Si ha usado la traducción en vivo en cualquiera de las grandes plataformas de reuniones, conoce el sonido. Una voz neutral, a un ritmo uniforme, lee la traducción. Es la misma voz tanto si el orador es su CEO abriendo un acto corporativo como un compañero haciendo un chiste. La tecnología subyacente es texto a voz con un único modelo de voz fijo, y el supuesto de diseño es que la inteligibilidad es suficiente.

En una reunión real no lo es. La mitad de lo que comunica una reunión es quién lo dice y cómo. Elimine la voz y habrá convertido una discusión en una transcripción que resulta ser hablada en voz alta. Las personas dejan de reaccionar entre sí y empiezan a esperar su turno.

Lo que InterMIND hace en su lugar

La traducción se ejecuta como una pipeline en cascada — tres etapas especializadas en secuencia en lugar de un único modelo que intenta hacer todo. Las dos primeras etapas se cubren en el artículo de las pipelines; la etapa de voz es de la que trata este artículo:

  1. ASR — reconocimiento de voz. Sus palabras se transcriben en su propio idioma, mientras habla, en nuestro propio motor — el servidor de medios que transporta la llamada (Mind API, OVH France) — para que la traducción pueda comenzar antes de que termine la frase.
  2. MT — traducción. La transcripción se agrupa en fragmentos estables de oración — cláusulas — para que la traducción pueda comenzar antes de que haya terminado la frase, y cada fragmento se traduce progresivamente al idioma del oyente.
  3. Zero-shot TTS — síntesis de voz. Cada fragmento traducido se reproduce usando una muestra de su propia voz, y se transmite al oyente.

Es esa tercera etapa — ASR → MT → zero-shot TTS — la que produce el efecto. "Zero-shot" significa que el sistema no necesita una inscripción pregrabada ni una sesión de entrenamiento para su voz. Modela su voz a partir del audio de la reunión en la que ya está.

El calentamiento: cómo empieza a sonar como usted tan rápido

Hay un problema de huevo y gallina oculto en "usar una muestra de su propia voz". Al principio de una llamada, el sistema aún no ha escuchado suficiente de usted para modelar bien su voz.

InterMIND maneja esto con un calentamiento progresivo:

  • Durante aproximadamente los primeros 5–10 segundos, mientras aún recopila suficiente de su habla, cada fragmento traducido se sintetiza usando el fragmento de audio que coincide con lo que acaba de decir en su idioma de origen. La emisión de voz está anclada a su habla real e inmediata.
  • Una vez que hay una muestra lo suficientemente larga — esa marca de 5–10 segundos — el sistema se fija en ella y la usa para emitir todo lo que viene después.

En la práctica no se escucha un interruptor que cambia. La traducción suena más como usted a medida que avanza la conversación — no un doble perfecto de su voz, pero claramente suya en lugar de la de una máquina, y mejorando a medida que el modelo escucha más. La combinación de traducción progresiva (cláusula por cláusula, no oración por oración) y emisión de voz progresiva es lo que mantiene todo dentro del presupuesto de latencia y aún así suena humano.

Grabe su voz una vez, y omita el calentamiento

El calentamiento anterior es lo que ocurre por defecto, sin nada configurado. Desde septiembre de 2026 existe una segunda ruta opcional para usuarios que han iniciado sesión: una muestra de voz guardada en Settings → Your voice in translation.

Grabarla es un solo gesto. Pulse Record my voice, espere Speak now, y diga los números del uno al diez en cualquier orden. Cada número se ilumina en la tarjeta a medida que el motor de voz los escucha; cuando los diez están iluminados, la muestra se comprueba y se guarda por sí sola. No hay nada que reproducir ni que confirmar, y no hay cuenta atrás: la tarjeta conserva el fragmento de su toma que contiene los números. Una habitación silenciosa y un auricular dan el mejor resultado.

Lo que cambia la muestra guardada: desde su próxima reunión, el sintetizador emite su traducción con ella desde el primer fragmento, para que la otra parte lo escuche a usted desde la primera oración en lugar de después del calentamiento. Internamente es la misma síntesis zero-shot con un mejor punto de partida; el calentamiento en vivo sigue refinando la voz a medida que avanza la llamada.

La toma se valida antes de almacenarse. Tiene que ser de 3 a 10 segundos de habla clara (la ventana de entrada del sintetizador): demasiado baja, recortada, principalmente silencio o sumida en ruido de fondo, y la tarjeta le dice qué corregir y pide otra toma. Los números se eligieron como la frase por una razón práctica: son cortos, reconocibles en cada uno de los 23 idiomas, y el motor puede confirmar que escuchó los diez, lo que convierte "¿funcionó esa grabación?" en un sí visible.

Dos muestras de voz, dos ciclos de vida

Esta es la parte de la que un equipo de seguridad o legal pregunta de inmediato, así que aquí está claramente. Hay dos muestras diferentes, y viven de manera distinta.

La muestra en vivo usada para el calentamiento durante la reunión es efímera. Existe solo para la sesión de conferencia en vivo, al servicio de emitir la traducción, y no se almacena en ningún lugar. La Mind API y el SDK que impulsan la sesión en tiempo real no retienen datos; todo lo temporal desaparece cuando termina la sesión de conferencia.

La muestra guardada de Settings se almacena con su cuenta, para un único propósito: se envía al motor de traducción cada vez que se une a una reunión para que su habla traducida pueda emitirse con ella, y para nada más. Permanece hasta que pulsa Remove en la tarjeta, lo que lo devuelve al calentamiento estándar inmediatamente, y se elimina junto con su cuenta. Los invitados no pueden grabar una; es una función para usuarios con sesión iniciada por diseño.

Vale la pena ser preciso sobre lo que ninguna muestra es: no es una de las funciones de grabación de InterMIND. Grabar el vídeo y el audio de una reunión es una acción separada y deliberada que usted realiza a propósito, con sus propios controles. Una muestra de voz es una entrada para el sintetizador de voz: transitoria en el caso en vivo, suya para conservar o eliminar en el caso guardado.

Por qué nadie más entrega esto

No es que la clonación de voz sea un secreto. Es que hacerla en vivo, por participante, en ambas direcciones, bajo un presupuesto de un segundo, en 23 idiomas, sin almacenar nada que usted no haya pedido es un problema diferente a clonar una voz sin conexión para un pódcast.

Las grandes plataformas optimizan su traducción para la cobertura de subtítulos y una única voz narradora segura — ese es el estándar barato y robusto a escala. Mantener la propia voz de cada orador significa que la etapa de síntesis tiene que rastrear a cada participante de forma independiente y mantenerse dentro del mismo presupuesto de latencia bajo el que opera el resto de la pipeline. Construimos el motor de voz nosotros mismos, en nuestra propia infraestructura, que es lo que hace que esa decisión sea nuestra para tomar. (Más sobre por qué el motor es código nuestro: De qué está hecha una reunión de InterMIND.)

Hacia dónde va esto: lip-sync

Mantener su voz es la mitad de un objetivo más grande. La otra mitad es su rostro.

Ahora mismo escucha a la otra persona con su propia voz, pero si está en cámara, sus labios aún se mueven con las palabras que realmente dijo — en un idioma que no lee. El siguiente paso es el lip-sync: resincronizar la boca del orador con el audio traducido, para que en su pantalla parezca que están hablando su idioma.

Ponga las dos cosas juntas y el punto de todo este trabajo queda enfocado. Dos personas que no comparten ningún idioma común se sientan frente a una videollamada y se ven y se escuchan como si cada uno fuera un hablante nativo del idioma del otro — misma voz, mismo rostro, sin intérprete en medio, sin un robot leyendo un guion.

Para ser claros sobre el estado: la voz está disponible hoy; el lip-sync está en la hoja de ruta, no está disponible. Mencionamos el destino porque es por lo que el trabajo de voz importa — la traducción con voz propia no es la función, es la primera mitad de "hablar con cualquiera, en cualquier idioma, como usted mismo".

Dónde escucharlo

La traducción con voz propia está disponible hoy, en los 23 idiomas de voz — los mismos idiomas que se enumeran en la documentación. No hay nada que activar por separado: cuando se activa la traducción en una reunión, los participantes se escuchan automáticamente en sus propias voces. Seremos honestos sobre dónde se encuentra: hoy la voz ya es reconociblemente suya, y el parecido es algo que estamos impulsando activamente para que sea mayor. Vaya a escucharlo y juzgue por sí mismo.

Una reunión traducida debería sentirse como las personas que realmente están en ella hablando entre sí. Mantener su voz es cómo se llega ahí.

Reciba nuevos artículos y actualizaciones del producto por correo electrónico

Un correo al mes con nuevas publicaciones y actualizaciones del producto. Cancela la suscripción en cualquier momento.