Por dentro dos quatro pipelines de tradução que fazem a InterMIND funcionar
A antiga página /product/overview/how-it-works no mind.com está desatualizada em várias versões principais. Ela descreve um único "mecanismo de tradução" da forma como a maioria das páginas de fornecedores faz — uma grande seta de "você fala" para "eles ouvem". Essa imagem já era uma simplificação há dois anos. Hoje ela está errada.
Na verdade, a InterMIND executa quatro pipelines de tradução separados, cada um resolvendo um problema diferente com um mecanismo diferente, um orçamento de latência diferente e um envelope de qualidade diferente. Eles compartilham um seletor de idioma. Eles não compartilham um mecanismo.
Esta é a resposta atualizada para "como funciona".
Um texto complementar: "Quantos idiomas vocês suportam?" aborda o que cada pipeline cobre (23 / 23 / 30 / 17). Este post aborda o que cada pipeline faz — e por que cada um é único.
Por que "um mecanismo para tudo" é uma mentira
Uma plataforma de reuniões em tempo real tem pelo menos quatro tarefas para realizar ao mesmo tempo, e elas puxam em direções incompatíveis:
- Voz em tempo real — áudio entra, áudio traduzido sai, em menos de um segundo, cada espectador no seu próprio idioma. A restrição rígida é a latência.
- Texto de chat em tempo real — mensagens curtas, rápidas, com edições, citações e estrutura HTML preservadas.
- Notas compartilhadas em tempo real — digitação colaborativa caractere por caractere, com hierarquia estrutural (listas, títulos, caixas de seleção) que precisa sobreviver à tradução.
- Arquivos de documentos assíncronos — um PDF de 40 páginas enviado no chat. Sem orçamento de latência. A restrição rígida é a fidelidade — formatação, tabelas, números de página, fonte.
Você pode criar uma única chamada gigante de LLM que tenta fazer as quatro coisas. Tentamos. O resultado é ruim nas quatro. O orçamento de latência da voz significa que o modelo não pode "pensar"; o orçamento de fidelidade dos documentos significa que ele precisa pensar. Uma edição de chat precisa de um diff no idioma do espectador; um PDF de 40 páginas precisa de preservação de formato que nenhum modelo de streaming de tokens oferece.
Por isso, executamos quatro. Aqui está cada um deles.