Sua Própria Voz

Como a InterMIND fala a tradução na própria voz de cada participante em vez de um narrador sintético.

Sua Própria Voz

Quando a InterMIND traduz sua fala para outro participante, ele não ouve um narrador robótico de texto para voz. Ele ouve uma voz reconhecivelmente sua — carregando seu timbre e seu jeito de falar — agora dizendo as palavras no idioma dele.

Isso funciona em ambas as direções e para cada participante de forma independente. Em uma reunião onde cinco pessoas falam cinco idiomas, cada pessoa ouve as outras quatro em seu próprio idioma, e cada uma dessas quatro ainda soa como ela mesma.

Como Soa

A maioria das ferramentas de tradução ao vivo substitui o falante por uma única voz sintética genérica. O resultado é inteligível, mas sem vida — você perde quem está falando, a ênfase, a personalidade. A InterMIND mantém a voz do falante, então uma reunião traduzida parece uma conversa entre as pessoas que realmente estão nela, não uma fila de anúncios lidos por uma máquina.

Como Funciona

A InterMIND usa um pipeline em cascata, e a etapa de voz é a última fase:

  1. Reconhecimento de fala — suas palavras são transcritas em seu próprio idioma, conforme você fala.
  2. Segmentação — a transcrição é agrupada em fragmentos de frase estáveis (cláusulas) para que a tradução possa começar antes de você terminar a frase.
  3. Tradução — cada fragmento é traduzido progressivamente para o idioma do ouvinte.
  4. Síntese de voz — cada fragmento traduzido é falado de volta usando uma amostra de sua própria voz, e enviado ao ouvinte.

Enquanto a reunião ainda está reunindo fala suficiente sua para modelar sua voz (aproximadamente os primeiros 5–10 segundos), a síntese usa o fragmento de áudio que corresponde ao que você acabou de dizer em seu idioma de origem. Assim que houver uma amostra longa o suficiente, ela passa a usar essa amostra para todo o restante. Na prática, você não percebe uma mudança — a tradução soa mais como você conforme a chamada avança. Não será uma imitação impecável da sua voz, mas é reconhecivelmente você em vez de um narrador genérico — e continua melhorando à medida que o modelo ouve mais de você.

Idiomas

A tradução em sua própria voz está disponível para todos os 24 idiomas de voz — o mesmo conjunto listado em Escolhendo Idiomas. Não há nada para ativar separadamente: quando a tradução está ativada, os participantes ouvem você automaticamente em sua própria voz.

Privacidade

A amostra de voz usada para a síntese é efêmera. Ela existe apenas durante a reunião ao vivo e não é armazenada em nenhum lugar — a Mind API e o SDK que alimentam a sessão em tempo real não mantêm nenhum dado depois que a sessão da conferência termina. Esta amostra de voz não está relacionada aos recursos de gravação de vídeo e voz da InterMIND, que são gravações separadas e explícitas que você inicia propositalmente.

No Roadmap: Lip-Sync

Ouvir a tradução em sua própria voz é a primeira metade de um objetivo maior. O próximo passo em que estamos trabalhando é o lip-sync — reajustando o tempo da boca do falante na câmera para corresponder ao áudio traduzido, de modo que cada participante pareça estar falando o idioma do outro. Combinado com a tradução em sua própria voz, o objetivo é uma chamada onde pessoas que não compartilham nenhum idioma comum se veem e se ouvem como se cada uma falasse o idioma do outro nativamente.

Isso é um item do roadmap, ainda não é um recurso lançado — a tradução em sua própria voz acima já está disponível hoje.

Quer o quadro técnico completo? Veja Fale com sua própria voz — em um idioma que você não fala no blog.