Metodologia

O benchmark de qualidade de tradução da InterMIND é produzido automaticamente pela nossa própria suíte de testes: uma execução sintética semanal aciona o mesmo pipeline de tradução que alimenta a /demo pública sobre um conjunto de referência fixo, da mesma forma para cada par de idiomas. Ele é sintético e reproduzível — nada aqui é selecionado a dedo ou escolhido a conveniência, e não há nenhum humano no processo de pontuação.

Como funciona um teste individual

Uma execução de teste reproduz um arquivo de áudio de referência (teste de voz) ou envia um texto de referência (teste de chat) de um idioma de origem, passando pelo nosso pipeline de tradução ao vivo, até um idioma de destino. A tradução resultante é pontuada de 0 a 100 por um juiz LLM, com base em uma tradução de referência canônica.

Juiz LLM: google/gemini-3.8-flash como principal e anthropic/claude-sonnet-5 como fallback (via Vercel AI Gateway). O mesmo prompt, a mesma rubrica e os mesmos textos de referência são usados em todos os pares.

Como um mês é agregado

  1. Toda execução completa do benchmark é registrada em demo_test_runs com as pontuações por idioma de destino. Prévias de um único par são excluídas — somente execuções completas com vários idiomas alimentam as medianas.
  2. Para cada (idioma de origem, idioma de destino, tipo de teste, semana), mantemos a execução mais recente e depois agregamos por mês — assim, uma única fonte não consegue distorcer as medianas repetindo um par dentro de uma semana.
  3. A partir do conjunto deduplicado, calculamos mediana, mínimo, máximo, p10, p90, média e tamanho da amostra.
  4. Registramos um snapshot das pontuações individuais para que, depois que um mês é encerrado, os números permaneçam estáveis mesmo após a exclusão das execuções brutas por TTL.

Quando um par aparece no índice público

Uma linha (par × tipo de teste × mês) é elegível para o índice público e o sitemap quando atinge um tamanho mínimo de amostra e um piso de mediana (um piso mais baixo para voz, que carrega um ruído inevitável de ASR). Como o conjunto de dados vem de uma única fonte automatizada, e não de muitos visitantes independentes, o requisito de fontes únicas é flexibilizado para estes dados sintéticos — os pisos de tamanho de amostra e de qualidade continuam valendo.

Os pares que ficam abaixo desses critérios continuam acessíveis por link direto — os limites controlam apenas o que os mecanismos de busca veem. Não escondemos pontuações baixas de ninguém que as solicite diretamente.

O que deliberadamente NÃO afirmamos

  • Uma única pontuação não é confiável. Um par que costuma ir bem pode oscilar 30 pontos entre execuções, porque tanto o ASR quanto o julgamento do LLM são ruidosos. É por isso que cada página mostra uma distribuição, e não um único número.
  • O próprio juiz LLM é imperfeito. Podemos trocá-lo ou adotar um juiz duplo no futuro; as linhas históricas carregarão o identificador do juiz quando isso acontecer.
  • O benchmark não mede latência, custo, disponibilidade ou satisfação do usuário. Isso fica em outros lugares.
  • O conjunto de dados é sintético — produzido pela nossa própria suíte automatizada, e não por tráfego independente de terceiros. Divulgamos isso explicitamente, em vez de sugerir um painel externo.

Transparência nos resultados

Quando a qualidade de um mês cai para um par específico, isso continua visível. Quando um bug é corrigido e o mês seguinte sobe, a melhoria fica visível na mesma página. Nunca reescrevemos agregados históricos. Os administradores só podem ocultar meses individuais do índice público; eles não podem alterar os números que já foram publicados.

Problemas conhecidos que afetam dados históricos

  • Harness de testes de chat, antes de 2026-04-23: o pipeline automatizado de testes de chat apresentava falhas por idioma. Os agregados de chat de meses anteriores podem mostrar pontuações inferiores à qualidade real da tradução desses períodos. Os meses afetados são mantidos no banco de dados, mas suprimidos do índice público; o gráfico de tendência mostrará uma mudança abrupta no ponto da correção.

Perguntas

Discorda de algo aqui? Abra uma issue ou escreva para nós. Atualizaremos esta página e registraremos a alteração.