Metodología
El benchmark de calidad de traducción de InterMIND lo genera automáticamente nuestra propia batería de pruebas: una ejecución sintética semanal activa el mismo pipeline de traducción que da servicio a la /demo pública sobre un conjunto de referencia fijo, de la misma manera para cada par de idiomas. Es sintético y reproducible: nada de lo que se muestra aquí está seleccionado a conveniencia ni cuidadosamente escogido, y no interviene ninguna persona en el proceso de puntuación.
Cómo funciona una prueba individual
Una ejecución de prueba reproduce un archivo de audio de referencia (prueba de voz) o envía un texto de referencia (prueba de chat) desde un idioma de origen a través de nuestro pipeline de traducción en vivo hasta un idioma de destino. La traducción resultante recibe una puntuación de 0 a 100 por parte de un juez LLM, que la compara con una traducción de referencia canónica.
Juez LLM: google/gemini-3.8-flash como principal y anthropic/claude-sonnet-5 como alternativa de respaldo (a través de Vercel AI Gateway). Se utilizan el mismo prompt, la misma rúbrica y los mismos textos de referencia en todos los pares.
Cómo se agrega un mes
- Cada ejecución completa del benchmark finalizada se registra en
demo_test_runscon las puntuaciones por idioma de destino. Las vistas previas de un solo par quedan excluidas: solo las ejecuciones completas multilingüe alimentan las medianas. - Para cada combinación (idioma de origen, idioma de destino, tipo de prueba, semana) conservamos la última ejecución y después agregamos por mes, de modo que una sola fuente no pueda desviar las medianas repitiendo un par dentro de una misma semana.
- A partir del conjunto deduplicado calculamos la mediana, el mínimo, el máximo, el p10, el p90, el promedio y el tamaño de la muestra.
- Guardamos una instantánea de las puntuaciones individuales para que, una vez cerrado un mes, las cifras permanezcan estables incluso después de que las ejecuciones sin procesar se eliminen por TTL.
Cuándo aparece un par en el índice público
Una fila (par × tipo de prueba × mes) es apta para el índice público y el sitemap cuando supera un tamaño mínimo de muestra y un umbral mínimo de mediana (más bajo en el caso de la voz, que arrastra un ruido inevitable del ASR). Dado que el conjunto de datos procede de una única fuente automatizada y no de muchos visitantes independientes, el requisito de fuentes únicas se relaja para estos datos sintéticos; los umbrales de tamaño de muestra y de calidad siguen aplicándose.
Los pares que no alcanzan los umbrales siguen siendo accesibles mediante enlace directo: los umbrales solo regulan lo que ven los motores de búsqueda. No ocultamos las puntuaciones bajas a quien las solicite directamente.
Lo que deliberadamente NO afirmamos
- Una puntuación aislada no es fiable. Un par que funciona bien puede oscilar 30 puntos entre ejecuciones, porque tanto el ASR como la valoración del LLM son ruidosos. Por eso cada página muestra una distribución y no un único número.
- El propio juez LLM es imperfecto. Es posible que en el futuro lo cambiemos o utilicemos un doble juez; cuando eso ocurra, las filas históricas incluirán el identificador del juez.
- El benchmark no mide latencia, coste, disponibilidad ni satisfacción de los usuarios. Esos aspectos se tratan en otro lugar.
- El conjunto de datos es sintético: lo produce nuestra propia batería automatizada, no tráfico independiente de terceros. Lo indicamos de forma explícita en lugar de dar a entender que existe un panel externo.
Transparencia en los resultados
Cuando un mes empeora en calidad para un par concreto, sigue siendo visible. Cuando se corrige un error y el mes siguiente mejora, la mejora se ve en la misma página. Nunca reescribimos los agregados históricos. Los administradores solo pueden ocultar meses individuales del índice público; no pueden alterar las cifras que ya se publicaron.
Problemas conocidos que afectan a los datos históricos
- Arnés de pruebas de chat, antes del 2026-04-23: el pipeline automatizado de pruebas de chat presentaba fallos por idioma. Los agregados de chat de meses anteriores pueden mostrar puntuaciones inferiores a la calidad real de traducción de esos períodos. Los meses afectados se conservan en la base de datos, pero se suprimen del índice público; el gráfico de tendencia mostrará un cambio brusco en el momento de la corrección.
Preguntas
¿No está de acuerdo con algo de lo que aquí se expone? Abra una incidencia o escríbanos. Actualizaremos esta página y dejaremos constancia del cambio.