Por que o marketing de qualidade de tradução está quebrado — e o que publicamos em vez disso
Abra o site de qualquer fornecedor de tradução ao vivo. Você verá os mesmos tipos de números:
- "200+ idiomas"
- "6.000+ pares de idiomas"
- "O primeiro do mundo" / "Maior precisão"
- "99% de precisão"
Agora tente encontrar — em qualquer uma dessas páginas de fornecedores — o que esses números significam para uma reunião que você está prestes a realizar. Qualidade por idioma. Metodologia reprodutível. Tamanho da amostra. Pontuação ao longo do tempo. Divulgação honesta de onde o modelo é fraco.
Você não vai encontrar. Não no material de marketing e raramente na documentação.
Esse é o equilíbrio da categoria. Ele existe por três razões:
- A maioria dos fornecedores não possui seu próprio motor de tradução. Eles roteiam através da OpenAI, Google, DeepL, Microsoft ou alguma combinação. Publicar dados de qualidade por par seria avaliar o modelo de outra pessoa — não há valor de marketing nisso.
- Dados de qualidade honestos são difíceis de colocar em um outdoor. Uma única pontuação é ruidosa. Uma distribuição é mais útil, mas mais difícil de comprimir. Uma
tendência dos últimos seis mesesé ainda mais útil e ainda mais difícil. - O processo de aquisição ainda não questionou isso. Os compradores aceitam os números de marketing pelo valor de face, e assim o equilíbrio se mantém.
O equilíbrio não vai durar. A próxima classe de compradores — farmacêutica, jurídico, financeiro, auditoria, setor público — fará perguntas mais difíceis do que "quantos idiomas". Construímos o /benchmark porque achamos que eles não deveriam ter que acreditar na palavra de um fornecedor.
O que os números de marketing não dizem
"200+ idiomas" significa que um fornecedor tem um modelo que emite texto em 200 idiomas. A qualidade nesses idiomas varia de nível de produção para os principais pares (EN↔DE, EN↔ES, EN↔FR) para quase inutilizável em pares de baixos recursos. Sem uma divisão por par, você não consegue dizer em qual lado dessa linha sua reunião vai pousar.
"6.000+ pares de idiomas" é combinatória de N × N em 80 idiomas de origem. Dizer que você suporta 6.000 pares é a parte fácil. Dizer que um par específico é bom o suficiente para uma revisão de CAPA, uma negociação de contrato ou uma teleconferência de resultados — essa é a parte que não está no folheto.
"99% de precisão", sem especificar o que foi medido, contra qual referência, em qual amostra, por qual juiz — é sem conteúdo. A qualidade da tradução não tem um escalar universal. Ela tem uma distribuição que depende do par de idiomas, do domínio do conteúdo, da qualidade do áudio (para voz), do orçamento de latência e do que "bom o suficiente" significa para o caso de uso específico.
O que um comprador realmente precisa saber
As perguntas que aparecem em revisões reais de DPA e avaliações de aquisição:
- Qualidade por par — como isso funciona em DE↔EN, EN↔AR, JA↔KO, especificamente?
- Tamanho da amostra — em quantas execuções o número relatado por você se baseia? Dez? Dez mil?
- Metodologia — quem está julgando as traduções, contra qual referência, com qual rubrica?
- Distribuição, não média — como são os 10% do pior caso? Os melhores 10%? A mediana?
- Desvio ao longo do tempo — um determinado par melhorou ou piorou desde a última vez que você publicou um número?
- O que você não mede — o que o seu benchmark não captura explicitamente?
Nenhuma delas é sem resposta. Elas apenas não estão na página de marketing de ninguém.
O que publicamos
O /benchmark é a nossa resposta. A metodologia está em /benchmark/methodology — escrita antes de sabermos que você estaria lendo isso.
Três coisas o separam das normas da categoria.
1. Tráfego real, não um conjunto selecionado
Cada pontuação no benchmark público vem de uma execução de teste real do /demo. Nós não pré-selecionamos pares que tenham um bom desempenho. O mesmo pipeline que atende ao demo de um comprador é o que está sendo medido.
2. O juiz é nomeado
Primário: google/gemini-3.5-flash. Alternativo: anthropic/claude-sonnet-5. Ambos via Vercel AI Gateway. O juiz faz parte da metodologia — divulgado por nome. Quando mudamos o juiz (já mudamos, à medida que os modelos são aposentados), as linhas históricas mantêm o juiz que realmente as pontuou; pontuações antigas nunca são recalculadas silenciosamente.
3. A distribuição é o dado, não a média
Cada linha publicada mostra mediana, p10, p90, mínimo, máximo e tamanho da amostra — não um único número. Um único número para um par de tradução é ruído. A forma da distribuição é o sinal.
Práticas que a categoria não adotou
- Pares com pontuação baixa não estão ocultos. O índice público é controlado por
≥ 10 IPs distintos, ≥ 10 execuções, mediana ≥ 60— mas qualquer um pode criar um link direto para qualquer par e ver os números reais, incluindo os pares que estão tendo um desempenho ruim este mês. - Problemas conhecidos são documentados. Quando o harness de testes de chat esteve quebrado por algumas semanas no início de 2026, esse período foi suprimido do índice e anotado por escrito na página de metodologia. A história não é reescrita silenciosamente.
- O que nós deliberadamente NÃO afirmamos é uma seção completa na página de metodologia. Dizemos onde o juiz LLM em si é imperfeito. Dizemos o que não medimos (latência, custo, satisfação do usuário, erros do lado do ASR antes mesmo de a tradução ser executada). Divulgamos que nossos próprios testes de fumaça automatizados fazem parte do tráfego.
Um filtro para a próxima avaliação de fornecedor
Se você está avaliando qualquer plataforma de reunião multilíngue — a nossa ou outra — a metodologia é a página que vale a pena ler. Os números em si são a parte fácil.
Um filtro prático para qualquer fornecedor nesta categoria:
- Peça dados de qualidade por par de idiomas, por mês, em tráfego real. Não um benchmark selecionado. Não um agregado.
- Pergunte qual é o juiz deles, o que eles não medem explicitamente e o que mudou nos últimos seis meses.
- Pergunte o que acontece quando a pontuação de um par cai — eles contam a alguém ou corrigem silenciosamente?
Se o fornecedor tiver as três respostas por escrito, avalie-o seriamente. Se não tiver, você está comprando marketing — não qualidade de tradução.
Experimente você mesmo
- Experimente o demo ao vivo — executa o pipeline de tradução de produção no seu áudio, pontua-o contra o mesmo juiz que pontua o benchmark público e mostra a saída para você.
- Veja o benchmark — cada par de idiomas publicado, todos os meses, com a distribuição completa.
- Leia a metodologia — como os números são calculados, o que eles incluem, o que não incluem.
Você não precisará acreditar na nossa palavra para nada disso. Esse é o ponto.
Fontes: os identificadores do juiz, limites de controle e regras de supressão acima são verificados em relação ao código enviado e publicados em /benchmark/methodology; os juízes são servidos via Vercel AI Gateway; as afirmações de marketing citadas no topo são formulações típicas da categoria, não citações de um fornecedor nomeado; verificado em agosto de 2026.