Sua Própria Voz
Sua Própria Voz
Quando a InterMIND traduz sua fala para outro participante, ele não ouve um narrador robótico de texto para voz. Ele ouve uma voz reconhecivelmente sua — carregando seu timbre e seu jeito de falar — agora dizendo as palavras no idioma dele.
Isso funciona em ambas as direções e para cada participante de forma independente. Em uma reunião onde cinco pessoas falam cinco idiomas, cada pessoa ouve as outras quatro em seu próprio idioma, e cada uma dessas quatro ainda soa como ela mesma.
Como Soa
A maioria das ferramentas de tradução ao vivo substitui o falante por uma única voz sintética genérica. O resultado é inteligível, mas sem vida — você perde quem está falando, a ênfase, a personalidade. A InterMIND mantém a voz do falante, então uma reunião traduzida parece uma conversa entre as pessoas que realmente estão nela, não uma fila de anúncios lidos por uma máquina.
Como Funciona
A InterMIND usa um pipeline em cascata, e a etapa de voz é a última fase:
- Reconhecimento de fala — suas palavras são transcritas em seu próprio idioma, conforme você fala.
- Segmentação — a transcrição é agrupada em fragmentos de frase estáveis (cláusulas) para que a tradução possa começar antes de você terminar a frase.
- Tradução — cada fragmento é traduzido progressivamente para o idioma do ouvinte.
- Síntese de voz — cada fragmento traduzido é falado de volta usando uma amostra de sua própria voz, e enviado ao ouvinte.
Enquanto a reunião ainda está reunindo fala suficiente sua para modelar sua voz (aproximadamente os primeiros 5–10 segundos), a síntese usa o fragmento de áudio que corresponde ao que você acabou de dizer em seu idioma de origem. Assim que houver uma amostra longa o suficiente, ela passa a usar essa amostra para todo o restante. Na prática, você não percebe uma mudança — a tradução soa mais como você conforme a chamada avança. Não será uma imitação impecável da sua voz, mas é reconhecivelmente você em vez de um narrador genérico — e continua melhorando à medida que o modelo ouve mais de você.
Idiomas
A tradução em sua própria voz está disponível para todos os 24 idiomas de voz — o mesmo conjunto listado em Escolhendo Idiomas. Não há nada para ativar separadamente: quando a tradução está ativada, os participantes ouvem você automaticamente em sua própria voz.
Privacidade
A amostra de voz usada para a síntese é efêmera. Ela existe apenas durante a reunião ao vivo e não é armazenada em nenhum lugar — a Mind API e o SDK que alimentam a sessão em tempo real não mantêm nenhum dado depois que a sessão da conferência termina. Esta amostra de voz não está relacionada aos recursos de gravação de vídeo e voz da InterMIND, que são gravações separadas e explícitas que você inicia propositalmente.
No Roadmap: Lip-Sync
Ouvir a tradução em sua própria voz é a primeira metade de um objetivo maior. O próximo passo em que estamos trabalhando é o lip-sync — reajustando o tempo da boca do falante na câmera para corresponder ao áudio traduzido, de modo que cada participante pareça estar falando o idioma do outro. Combinado com a tradução em sua própria voz, o objetivo é uma chamada onde pessoas que não compartilham nenhum idioma comum se veem e se ouvem como se cada uma falasse o idioma do outro nativamente.
Isso é um item do roadmap, ainda não é um recurso lançado — a tradução em sua própria voz acima já está disponível hoje.