Por dentro dos quatro pipelines de tradução que executam o InterMIND
A antiga página /product/overview/how-it-works no mind.com está desatualizada por várias versões principais. Ela descreve um único "motor de tradução" da forma que a maioria das páginas de fornecedores faz — uma grande seta de "você fala" para "eles ouvem". Essa imagem já era uma simplificação dois anos atrás. Hoje, ela está errada.
A verdade é que o InterMIND executa quatro pipelines de tradução separados, cada um resolvendo um problema diferente com um motor diferente, um orçamento de latência diferente e um envelope de qualidade diferente. Eles compartilham um seletor de idiomas. Eles não compartilham um motor.
Esta é a resposta atualizada para "como funciona".
Um texto complementar: "Quantos idiomas vocês suportam?" aborda o que cada pipeline abrange (23 / 23 / 30 / 17). Este post aborda o que cada pipeline faz — e por que é algo único.
Por que "um motor para tudo" é uma mentira
Uma plataforma de reuniões ao vivo tem pelo menos quatro tarefas a fazer simultaneamente, e elas puxam em direções incompatíveis:
- Voz em tempo real — áudio entra, áudio traduzido sai, em menos de um segundo, cada visualizador no seu próprio idioma. A restrição difícil é a latência.
- Texto de chat em tempo real — mensagens curtas, rápidas, com edições, citações e estrutura HTML preservadas.
- Notas compartilhadas em tempo real — digitação colaborativa caractere por caractere, com hierarquia estrutural (listas, cabeçalhos, caixas de seleção) que deve sobreviver à tradução.
- Arquivos de documentos assíncronos — um PDF de 40 páginas colocado no chat. Sem orçamento de latência. A restrição difícil é a fidelidade — formatação, tabelas, números de página, fonte.
Você pode fazer uma chamada LLM gigante que tenta fazer as quatro coisas. Nós tentamos. Ela é ruim nas quatro. O orçamento de latência para voz significa que o modelo não pode pensar; o orçamento de fidelidade para documentos significa que o modelo precisa pensar. Uma edição de chat precisa de um diff no idioma do visualizador; um PDF de 40 páginas precisa de preservação de formato que nenhum modelo de streaming de tokens oferece.
Então, nós executamos quatro. Aqui está cada um deles.