为什么翻译质量营销已经失灵——以及我们转而发布了什么
打开任何实时翻译厂商的网站。您会看到类似的一组数字:
- "200+ 种语言"
- "6,000+ 语言对"
- "全球首创" / "最高准确度"
- "99% 准确率"
现在试着在任何一家厂商的页面上找到——这些数字对您即将召开的会议意味着什么。按语言的质量。可复现的方法论。样本量。随时间变化的评分。对模型薄弱环节的诚实披露。
您找不到这些信息。营销文案里没有,文档里也很少出现。
这是该品类的均衡状态。它之所以存在,有三个原因:
- 大多数厂商不拥有自己的翻译引擎。 他们的请求经由 OpenAI、Google、DeepL、Microsoft 或其组合处理。发布按语言对的质量数据等于在为别人的模型做基准测试——这没有任何营销价值。
- 诚实的质量数据很难放在广告牌上。 单一评分噪声太大。分布数据更有用,但更难压缩。
过去六个月的趋势更有用,也更难呈现。 - 采购方还没有提出质疑。 买方照单全收营销数字,因此均衡得以维持。
这种均衡不会持续。下一类买方——制药、法律、金融、审计、公共部门——会提出比"支持多少种语言"更尖锐的问题。我们打造了 /benchmark,因为我们认为他们不应该只能听信厂商的一面之词。
营销数字没有告诉您的事
"200+ 种语言" 意味着厂商有一个能在 200 种语言中输出文本的模型。这些语言之间的质量从主要语言对(EN↔DE、EN↔ES、EN↔FR)的生产级水平,到低资源语言对的勉强可用,跨度极大。没有按语言对的细分数据,您无法判断您的会议会落在分界线的哪一侧。
"6,000+ 语言对" 是 80 种源语言的 N × N 组合。说支持 6,000 个语言对是容易的部分。说某个特定语言对的质量足以支撑 CAPA 审查、合同谈判或财报电话会议——这才是手册里不会写到的部分。
"99% 准确率"——如果不说明测量了什么、对照什么参考、基于什么样本、由谁评判——就是毫无信息量的空话。翻译质量没有通用的标量。它有一个分布,取决于语言对、内容领域、音频质量(针对语音)、延迟预算,以及"足够好"对特定用例意味着什么。