Arquitetura

Fale com a sua própria voz — em um idioma que você não fala

A maioria das ferramentas de tradução ao vivo substitui você por um único narrador robótico. A InterMIND mantém a sua voz: cada participante ouve a tradução na própria voz do falante original. Veja como a cascata faz isso, o que a amostra de voz salva opcional nas Configurações adiciona e o que é armazenado.

The Mind.com Team

Fale com a sua própria voz — em um idioma que você não fala

Fale com a sua própria voz — em um idioma que você não fala

Aqui está a parte da tradução em tempo real que quase todo mundo erra, e sobre a qual quase ninguém fala: a voz que você ouve.

Você pode ter excelente reconhecimento de fala e excelente tradução, e ainda assim acabar com uma reunião que parece uma máquina lendo uma lista. Porque a última etapa — transformar o texto traduzido de volta em som — é onde a maioria das ferramentas substitui discretamente você por um único narrador sintético genérico. Oito pessoas na sala, uma voz de robô para todas elas. Você perde quem está falando, a ênfase, a personalidade. Inteligível, mas não uma conversa.

A InterMIND faz a última etapa de forma diferente. Quando você fala, os outros participantes ouvem a tradução em uma voz reconhecivelmente sua — carregando seu timbre e sua maneira de falar — agora dizendo as palavras no idioma deles. Ainda não é uma imitação perfeita; o ponto é que é você em vez de um narrador padrão, e está melhorando. Isso funciona para todos os participantes, em ambas as direções, ao mesmo tempo.

Este post é o capítulo que faltava em Inside the four translation pipelines that run InterMIND: aquele texto explicou como o áudio se torna áudio traduzido. Este é sobre de quem é a voz que sai do outro lado.


O padrão que todos entregam, e por que é plano

Se você já usou tradução ao vivo em qualquer uma das grandes plataformas de reunião, você conhece o som. Uma voz neutra, em ritmo uniforme, lê a tradução. É a mesma voz se o orador for o seu CEO abrindo um town hall ou um colega fazendo uma piada. A tecnologia por baixo é text-to-speech com um modelo de voz fixo, e a premissa de design é que a inteligibilidade é suficiente.

Em uma reunião real, não é. Metade do que uma reunião comunica é quem está dizendo e como. Retire a voz e você transformou uma discussão em uma transcrição que acontece de ser falada em voz alta. As pessoas param de reagir umas às outras e começam a esperar a sua vez de falar.

O que a InterMIND faz em vez disso

A tradução roda como um pipeline em cascata — três estágios especializados em sequência, em vez de um modelo tentando fazer tudo. Os dois primeiros estágios são cobertos no post sobre os pipelines; o estágio de voz é o tema deste post:

  1. ASR — reconhecimento de fala. Suas palavras são transcritas no seu próprio idioma, enquanto você fala, no nosso próprio motor — o servidor de mídia que carrega a chamada (Mind API, OVH France) — para que a tradução possa começar antes do fim da frase.
  2. MT — tradução. A transcrição é agrupada em fragmentos estáveis de frases — cláusulas — para que a tradução possa começar antes de você terminar a frase, e cada fragmento é traduzido progressivamente para o idioma do ouvinte.
  3. Zero-shot TTS — síntese de voz. Cada fragmento traduzido é falado de volta usando uma amostra da sua própria voz, e transmitido para o ouvinte.

É esse terceiro estágio — ASR → MT → zero-shot TTS — que produz o efeito. "Zero-shot" significa que o sistema não precisa de uma gravação prévia de inscrição ou de uma sessão de treinamento para a sua voz. Ele modela a sua voz a partir do áudio da reunião em que você já está.

O aquecimento: como começa a soar como você tão rápido

Há um problema de ovo e galinha escondido em "use uma amostra da sua própria voz". No início de uma chamada, o sistema ainda não ouviu o suficiente de você para modelar bem a sua voz.

A InterMIND lida com isso com um aquecimento progressivo:

  • Pelos primeiros 5 a 10 segundos aproximadamente, enquanto ainda reúne o suficiente da sua fala, cada fragmento traduzido é sintetizado usando o fragmento de áudio que corresponde ao que você acabou de dizer no seu idioma de origem. A voz é ancorada na sua fala real e imediata.
  • Assim que há uma amostra longa o suficiente — a marca de 5 a 10 segundos — o sistema a fixa e a usa para dar voz a tudo depois.

Na prática, você não ouve uma mudança abrupta. A tradução soa mais como você conforme a conversa engrena — não uma cópia perfeita da sua voz, mas claramente sua em vez de uma de máquina, e melhorando conforme o modelo ouve mais. A combinação de tradução progressiva (cláusula por cláusula, não frase por frase) e voz progressiva é o que mantém tudo dentro do orçamento de latência e ainda soando humano.

Grave sua voz uma vez e pule o aquecimento

O aquecimento acima é o que acontece por padrão, sem nada configurado. Desde setembro de 2026, há um segundo caminho opcional para usuários autenticados: uma amostra de voz salva em Settings → Your voice in translation.

Gravá-la é um único gesto. Pressione Record my voice, aguarde Speak now e diga os números de um a dez em qualquer ordem. Cada número acende no card conforme o motor de fala os ouve; quando todos os dez estiverem acesos, a amostra é verificada e salva por si só. Não há nada para reproduzir ou confirmar, e nenhuma contagem regressiva: o card mantém o trecho da sua tomada que contém os números. Um ambiente silencioso e um headset oferecem o melhor resultado.

O que a amostra salva muda: a partir da sua próxima reunião, o sintetizador dá voz à sua tradução com ela desde o primeiro fragmento, então o outro lado ouve você como você desde a primeira frase, em vez de após o aquecimento. Nos bastidores, é a mesma síntese zero-shot com um ponto de partida melhor; o aquecimento ao vivo ainda refina a voz conforme a chamada prossegue.

A tomada é validada antes de ser armazenada. Ela precisa ter de 3 a 10 segundos de fala clara (a janela de entrada do sintetizador): muito silenciosa, cortada, composta majoritariamente de silêncio ou afogada em ruído de fundo, e o card diz o que corrigir e pede outra tomada. Os números foram escolhidos como a frase por um motivo prático: são curtos, reconhecíveis em cada um dos 23 idiomas, e o motor consegue confirmar que ouviu todos os dez, o que transforma "essa gravação funcionou?" em um sim visível.

Duas amostras de voz, dois ciclos de vida

Esta é a parte sobre a qual uma equipe de segurança ou jurídica pergunta imediatamente, então aqui está de forma direta. Existem duas amostras diferentes, e elas existem de formas diferentes.

A amostra ao vivo usada para o aquecimento durante a reunião é efêmera. Ela existe apenas para a sessão de conferência ao vivo, a serviço de dar voz à tradução, e não é armazenada em nenhum lugar. A Mind API e o SDK que alimentam a sessão em tempo real não retêm nenhum dado; tudo que é temporário morre quando a sessão de conferência termina.

A amostra salva das Settings é armazenada com a sua conta, para um propósito: ela é enviada ao motor de tradução toda vez que você entra em uma reunião, para que sua fala traduzida possa ser falada com ela, e nada mais. Ela permanece até você pressionar Remove no card, o que o retorna imediatamente ao aquecimento padrão, e é excluída junto com a sua conta. Convidados não podem gravar uma; é um recurso para usuários autenticados por design.

Vale ser preciso sobre o que nenhuma das amostras é: não é um dos recursos de gravação da InterMIND. Gravar o áudio e o vídeo de uma reunião é uma ação separada e deliberada que você toma com um propósito, com seus próprios controles. Uma amostra de voz é uma entrada para o sintetizador de fala: transitória no caso ao vivo, sua para manter ou excluir no caso da salva.

Por que ninguém mais entrega isso

Não é que a clonagem de voz seja um segredo. É que fazer isso ao vivo, por participante, em ambas as direções, sob um orçamento de um segundo, em 23 idiomas, sem armazenar nada que você não tenha solicitado é um problema diferente de clonar uma voz offline para um podcast.

As grandes plataformas otimizam sua tradução para a cobertura de legendas e uma única voz de narrador segura — esse é o padrão barato e robusto em escala. Manter a própria voz de cada orador significa que o estágio de síntese precisa rastrear cada participante independentemente e permanecer dentro do mesmo orçamento de latência sob o qual o resto do pipeline opera. Nós construímos o motor de voz nós mesmos, em nossa própria infraestrutura, e é isso que torna essa escolha nossa para fazer. (Mais sobre por que o motor é um código nosso: What one InterMIND meeting is built from.)

Para onde isso caminha: lip-sync

Manter sua voz é metade de um objetivo maior. A outra metade é o seu rosto.

Hoje você ouve a outra pessoa com a própria voz dela, mas se vocês estão com a câmera ligada, os lábios dela ainda se movem de acordo com as palavras que ela realmente disse — em um idioma que você não lê. O próximo passo é o lip-sync: reajustar o tempo da boca do orador para o áudio traduzido, de modo que na sua tela ele pareça estar falando o seu idioma.

Junte os dois e o objetivo de todo este trabalho entra em foco. Duas pessoas que não compartilham nenhum idioma comum sentam-se em uma videochamada e se veem e ouvem como se cada uma fosse um falante nativo do idioma da outra — mesma voz, mesmo rosto, sem intérprete no meio, sem robô lendo um roteiro.

Para ser claro sobre o status: a voz está em produção hoje; o lip-sync está no roadmap, não lançado. Estamos destacando o destino porque é por isso que o trabalho de voz importa — a tradução com a própria voz não é o recurso, é a primeira metade de "fale com qualquer um, em qualquer idioma, como você mesmo".

Onde ouvir

A tradução com a própria voz está disponível hoje, em todos os 23 idiomas de voz — os mesmos idiomas listados na documentação. Não há nada para ativar separadamente: quando a tradução está habilitada em uma reunião, os participantes ouvem automaticamente uns aos outros com suas próprias vozes. Seremos honestos sobre onde isso está: hoje a voz já é reconhecivelmente sua, e a semelhança é algo que estamos ativamente melhorando. Vá ouvir e julgue por si mesmo.

Uma reunião traduzida deve parecer com as pessoas que estão realmente nela conversando entre si. Manter a sua voz é como isso se torna realidade.

Receba novos posts e atualizações do produto por e-mail

Um e-mail por mês com novas publicações e atualizações do produto. Cancele a inscrição a qualquer momento.