Dentro de los cuatro pipelines de traducción que impulsan InterMIND
La antigua página /product/overview/how-it-works en mind.com está obsoleta por varias versiones principales. Describe un único "motor de traducción" como lo hacen la mayoría de páginas de proveedores: una gran flecha de "usted habla" a "ellos escuchan". Esa imagen ya era una simplificación hace dos años. Hoy es incorrecta.
La verdad es que InterMIND ejecuta cuatro pipelines de traducción separados, cada uno resolviendo un problema distinto con un motor diferente, un presupuesto de latencia diferente y un margen de calidad diferente. Comparten un selector de idioma. No comparten un motor.
Esta es la respuesta actualizada a "cómo funciona".
Un artículo complementario: "¿Cuántos idiomas admiten?" cubre lo que cada pipeline cubre (23 / 23 / 30 / 17). Este artículo cubre lo que cada pipeline hace — y por qué tiene entidad propia.
Por qué "un motor para todo" es una mentira
Una plataforma de reuniones en vivo tiene al menos cuatro tareas que hacer a la vez, y tiran en direcciones incompatibles:
- Voz en tiempo real — audio entra, audio traducido sale, en menos de un segundo, cada espectador en su propio idioma. La restricción estricta es la latencia.
- Texto de chat en tiempo real — mensajes cortos, rápidos, con ediciones, citas y estructura HTML preservada.
- Notas compartidas en tiempo real — escritura colaborativa carácter por carácter, con jerarquía estructural (listas, encabezados, casillas de verificación) que debe sobrevivir a la traducción.
- Archivos de documento asíncronos — un PDF de 40 páginas enviado al chat. Sin presupuesto de latencia. La restricción estricta es la fidelidad — formato, tablas, números de página, tipografía.
Se puede construir una llamada LLM gigante que intente hacer las cuatro. Lo intentamos. Es mala en las cuatro. El presupuesto de latencia de la voz significa que el modelo no puede pensar; el presupuesto de fidelidad de los documentos significa que el modelo tiene que hacerlo. Una edición de chat necesita un diff en el idioma del espectador; un PDF de 40 páginas necesita preservación de formato que ningún modelo de streaming de tokens le ofrece.
Así que ejecutamos cuatro. Aquí está cada uno.