Sua própria voz

Como a InterMIND fala a tradução na própria voz de cada participante em vez de um narrador sintético.

Sua própria voz

Quando o InterMIND traduz sua fala para outro participante, ele não ouve um narrador robótico de texto para voz. Ele ouve uma voz reconhecidamente sua — carregando seu timbre e seu jeito de falar — agora dizendo as palavras no idioma dele.

Isso funciona em ambas as direções e para cada participante de forma independente. Em uma reunião onde cinco pessoas falam cinco idiomas, cada pessoa ouve as outras quatro em seu próprio idioma, e cada uma dessas quatro ainda soa como ela mesma.

Como soa

A maioria das ferramentas de tradução ao vivo substitui o falante por uma única voz sintética genérica. O resultado é inteligível, mas monótono — você perde quem está falando, a ênfase, a personalidade. O InterMIND mantém a voz do falante, então uma reunião traduzida parece uma conversa entre as pessoas que realmente estão nela, não uma fila de anúncios lidos por uma máquina.

Como funciona

O InterMIND usa um pipeline em cascata, e a etapa de voz é a última fase:

  1. Reconhecimento de fala — suas palavras são transcritas em seu próprio idioma, enquanto você fala.
  2. Segmentação — a transcrição é agrupada em fragmentos de frase estáveis (cláusulas) para que a tradução possa começar antes de você terminar a frase.
  3. Tradução — cada fragmento é traduzido progressivamente para o idioma do ouvinte.
  4. Síntese de voz — cada fragmento traduzido é falado de volta usando uma amostra de sua própria voz, e enviado ao ouvinte.

Enquanto a reunião ainda está coletando fala suficiente para modelar sua voz (aproximadamente nos primeiros 5–10 segundos), a síntese usa o fragmento de áudio que corresponde ao que você acabou de dizer em seu idioma de origem. Assim que houver uma amostra longa o suficiente, ela passa a usar essa amostra para todo o resto. Na prática, você não percebe uma mudança — a tradução soa mais como você conforme a chamada avança. Não será uma imitação perfeita de sua voz, mas é reconhecidamente você em vez de um narrador genérico — e continua melhorando à medida que o modelo ouve mais de você.

Idiomas

A tradução com sua própria voz está disponível para todos os 23 idiomas de voz — o mesmo conjunto listado em Escolhendo idiomas. Não há nada para ativar separadamente: quando a tradução está ativada, os participantes ouvem você com sua própria voz automaticamente.

Sua amostra de voz salva (opcional)

Usuários autenticados podem pular o aquecimento gravando uma amostra de voz uma vez em Configurações → Sua voz na tradução: pressione Gravar minha voz, diga os números de um a dez em qualquer ordem, e a amostra é salva automaticamente quando todos os dez acenderem. A partir da sua próxima reunião, sua fala traduzida é falada com ela desde a primeira frase.

O cartão Sua voz na tradução em Configurações: os números de um a dez e o botão Gravar minha voz

Privacidade

Duas amostras, dois ciclos de vida. A amostra ao vivo usada para o aquecimento na reunião é efêmera: ela existe apenas durante a reunião ao vivo e não é armazenada em nenhum lugar; a Mind API e o SDK que alimentam a sessão em tempo real não mantêm nenhum dado assim que a sessão da conferência termina. A amostra salva das Configurações é armazenada com sua conta para um único propósito: dar voz à sua fala traduzida. Ela é enviada ao mecanismo de tradução toda vez que você entra em uma reunião e é excluída no momento em que você a remove ou exclui sua conta. Nenhuma delas faz parte dos recursos de gravação de vídeo e voz do InterMIND, que são gravações separadas e explícitas que você inicia intencionalmente.

No roadmap: Lip-sync

Ouvir a tradução em sua própria voz é a primeira metade de um objetivo maior. O próximo passo em que estamos trabalhando é o lip-sync — reajustar o tempo da boca do falante na câmera para corresponder ao áudio traduzido, de modo que cada participante pareça estar falando o idioma do outro. Combinada com a tradução de própria voz, o objetivo é uma chamada onde pessoas que não compartilham nenhum idioma comum se veem e se ouvem como se cada um falasse o idioma do outro nativamente.

Isso é um item de roadmap, não um recurso lançado ainda — a tradução de própria voz acima está disponível hoje.

Quer a visão técnica completa? Veja Fale com sua própria voz — em um idioma que você não fala no blog.