Metodología

Por qué el marketing de la calidad de traducción está roto — y qué publicamos en su lugar

Cada proveedor de traducción publica cantidades de idiomas. Ninguno publica calidad verificable por par de idiomas en tráfico real. Por qué esa brecha es importante en su próxima evaluación de adquisiciones — y qué publicamos en su lugar.

The Mind.com Team

Por qué el marketing de la calidad de traducción está roto — y qué publicamos en su lugar

Por qué el marketing de calidad de traducción está roto — y qué publicamos en su lugar

Abra el sitio de cualquier proveedor de traducción en vivo. Verá el mismo tipo de números:

  • "200+ idiomas"
  • "6.000+ pares de idiomas"
  • "El primero del mundo" / "La máxima precisión"
  • "99% de precisión"

Ahora intente encontrar — en cualquiera de esas páginas de proveedores — qué significan esos números para una reunión que está a punto de realizar. Calidad por idioma. Metodología reproducible. Tamaño de muestra. Puntuación a lo largo del tiempo. Divulgación honesta de dónde el modelo es débil.

No lo encontrará. No en los textos de marketing, y rara vez en la documentación.

Este es el equilibrio de la categoría. Existe por tres razones:

  1. La mayoría de los proveedores no son dueños de su motor de traducción. Enrutan a través de OpenAI, Google, DeepL, Microsoft, o alguna combinación. Publicar datos de calidad por par sería hacer benchmarking del modelo de otra persona — no hay valor de marketing en eso.
  2. Los datos honestos de calidad son difíciles de poner en una valla publicitaria. Una sola puntuación es ruidosa. Una distribución es más útil pero más difícil de comprimir. Una tendencia de los últimos seis meses es aún más útil, y aún más difícil.
  3. Los equipos de compras aún no han presionado. Los compradores aceptan los números de marketing al pie de la letra, y así el equilibrio se mantiene.

El equilibrio no se mantendrá. La próxima clase de comprador — farmacéutica, legal, financiera, auditoría, sector público — va a hacer preguntas más difíciles que "cuántos idiomas". Construimos /benchmark porque creemos que no deberían tener que creer en la palabra de un proveedor.


Lo que los números de marketing no le dicen

"200+ idiomas" significa que un proveedor tiene un modelo que emite texto en 200 idiomas. La calidad en esos idiomas varía desde nivel de producción para los pares principales (EN↔DE, EN↔ES, EN↔FR) hasta apenas utilizable para pares de bajos recursos. Sin un desglose por par, no puede saber en qué lado de esa línea caerá su reunión.

"6.000+ pares de idiomas" es combinatoria de N × N sobre 80 idiomas de origen. Decir que se soportan 6.000 pares es la parte fácil. Decir que un par específico es suficientemente bueno para una revisión CAPA, una negociación de contrato, o una llamada de resultados — esa es la parte que no está en el folleto.

"99% de precisión", sin especificar qué se midió, contra qué referencia, en qué muestra, por qué juez — no aporta contenido. La calidad de traducción no tiene un escalar universal. Tiene una distribución que depende del par de idiomas, dominio del contenido, calidad del audio (para voz), presupuesto de latencia, y qué significa "suficientemente bueno" para el caso de uso específico.


Lo que un comprador realmente necesita saber

Las preguntas que aparecen en revisiones reales de DPA y evaluaciones de compras:

  1. Calidad por par — ¿cómo se desempeña en DE↔EN, EN↔AR, JA↔KO, específicamente?
  2. Tamaño de muestra — ¿en cuántas ejecuciones se basa el número reportado? ¿Diez? ¿Diez mil?
  3. Metodología — ¿quién juzga las traducciones, contra qué referencia, con qué rúbrica?
  4. Distribución, no promedio — ¿cómo se ve el 10% del peor caso? ¿El mejor 10%? ¿La mediana?
  5. Deriva a lo largo del tiempo — ¿un par dado ha mejorado o empeorado desde la última vez que publicó un número?
  6. Lo que no se mide — ¿qué no captura explícitamente su benchmark?

Ninguna de estas es imposible de responder. Simplemente no están en la página de marketing de nadie.


Qué publicamos

/benchmark es nuestra respuesta. La metodología está en /benchmark/methodology — escrita antes de que supiéramos que usted estaría leyendo esto.

Tres cosas la separan de las normas de la categoría.

1. Tráfico real, no un conjunto curado

Cada puntuación en el benchmark público proviene de una ejecución de prueba real de /demo. No preseleccionamos pares que funcionen bien. El mismo pipeline que sirve la demo de un comprador es el que se está midiendo.

2. El juez es nombrado

Primario: google/gemini-3.5-flash. Alternativo: anthropic/claude-sonnet-5. Ambos vía Vercel AI Gateway. El juez es parte de la metodología — divulgado por nombre. Cuando cambiamos el juez (lo hemos hecho, a medida que los modelos se retiran), las filas históricas conservan el juez que realmente las puntuó; las puntuaciones antiguas nunca se reevalúan silenciosamente.

3. La distribución son los datos, no el promedio

Cada fila publicada muestra mediana, p10, p90, mínimo, máximo, y tamaño de muestra — no un solo número. Un solo número para un par de traducción es ruido. La forma de la distribución es la señal.


Prácticas que la categoría no ha adoptado

  • Los pares con puntuación baja no se ocultan. El índice público está restringido a ≥ 10 IPs distintas, ≥ 10 ejecuciones, mediana ≥ 60 — pero cualquiera puede enlazar directamente a cualquier par y ver los números reales, incluyendo los pares que están funcionando mal este mes.
  • Los problemas conocidos están documentados. Cuando el harness de pruebas de chat estuvo roto durante unas semanas a principios de 2026, ese período se suprime del índice y se anota por escrito en la página de metodología. La historia no se reescribe silenciosamente.
  • Lo que deliberadamente NO afirmamos es una sección completa en la página de metodología. Decimos dónde el propio juez LLM es imperfecto. Decimos lo que no medimos (latencia, coste, satisfacción del usuario, errores del lado del ASR antes de que la traducción se ejecute). Divulgamos que nuestras propias pruebas de humo automatizadas son parte del tráfico.

Un filtro para la próxima evaluación de proveedores

Si está evaluando cualquier plataforma de reuniones multilingües — la nuestra u otra — la metodología es la página que vale la pena leer. Los números en sí son la parte fácil.

Un filtro práctico para cualquier proveedor en esta categoría:

  • Pida datos de calidad por par de idiomas, por mes, sobre tráfico real. No un benchmark curado. No un agregado.
  • Pregunte cuál es su juez, qué no miden explícitamente, y qué ha cambiado en los últimos seis meses.
  • Pregunte qué pasa cuando la puntuación de un par cae — ¿se lo dicen a alguien, o lo arreglan silenciosamente?

Si el proveedor tiene las tres respuestas por escrito, evalúelo seriamente. Si no las tiene, está comprando marketing — no calidad de traducción.


Pruébelo usted mismo

  • Pruebe la demo en vivo — ejecuta el pipeline de traducción de producción sobre su audio, lo puntúa contra el mismo juez que puntúa el benchmark público, y le muestra el resultado.
  • Vea el benchmark — cada par de idiomas publicado, cada mes, con la distribución completa.
  • Lea la metodología — cómo se calculan los números, qué incluyen, qué no.

No necesitará creer en nuestra palabra para nada de esto. Ese es el punto.


Fuentes: los identificadores de los jueces, los umbrales de inclusión y las reglas de supresión anteriores están verificados contra el código publicado y disponibles en /benchmark/methodology; los jueces se sirven vía Vercel AI Gateway; las afirmaciones de marketing citadas al principio son formulaciones típicas de la categoría, no citas de un proveedor específico; verificado en agosto de 2026.

Recibe nuevas publicaciones por correo

Te enviaremos un correo cuando publiquemos una nueva entrada. Cancela la suscripción cuando quieras.