方法论

翻译质量营销为何失效——以及我们转而发布的内容

每个翻译供应商都会公布支持的语言数量,但没有一家会发布真实流量下可验证的每语言对质量。为什么这一差距在您下一次的采购评估中至关重要——以及我们转而发布的内容。

The Mind.com Team

翻译质量营销为何失效——以及我们转而发布的内容

为什么翻译质量营销已经失灵——以及我们转而发布了什么

打开任何实时翻译厂商的网站。您会看到类似的一组数字:

  • "200+ 种语言"
  • "6,000+ 语言对"
  • "全球首创" / "最高准确度"
  • "99% 准确率"

现在试着在任何一家厂商的页面上找到——这些数字对您即将召开的会议意味着什么。按语言的质量。可复现的方法论。样本量。随时间变化的评分。对模型薄弱环节的诚实披露。

您找不到这些信息。营销文案里没有,文档里也很少出现。

这是该品类的均衡状态。它之所以存在,有三个原因:

  1. 大多数厂商不拥有自己的翻译引擎。 他们的请求经由 OpenAI、Google、DeepL、Microsoft 或其组合处理。发布按语言对的质量数据等于在为别人的模型做基准测试——这没有任何营销价值。
  2. 诚实的质量数据很难放在广告牌上。 单一评分噪声太大。分布数据更有用,但更难压缩。过去六个月的趋势更有用,也更难呈现。
  3. 采购方还没有提出质疑。 买方照单全收营销数字,因此均衡得以维持。

这种均衡不会持续。下一类买方——制药、法律、金融、审计、公共部门——会提出比"支持多少种语言"更尖锐的问题。我们打造了 /benchmark,因为我们认为他们不应该只能听信厂商的一面之词。


营销数字没有告诉您的事

"200+ 种语言" 意味着厂商有一个能在 200 种语言中输出文本的模型。这些语言之间的质量从主要语言对(EN↔DE、EN↔ES、EN↔FR)的生产级水平,到低资源语言对的勉强可用,跨度极大。没有按语言对的细分数据,您无法判断您的会议会落在分界线的哪一侧。

"6,000+ 语言对" 是 80 种源语言的 N × N 组合。说支持 6,000 个语言对是容易的部分。说某个特定语言对的质量足以支撑 CAPA 审查、合同谈判或财报电话会议——这才是手册里不会写到的部分。

"99% 准确率"——如果不说明测量了什么、对照什么参考、基于什么样本、由谁评判——就是毫无信息量的空话。翻译质量没有通用的标量。它有一个分布,取决于语言对、内容领域、音频质量(针对语音)、延迟预算,以及"足够好"对特定用例意味着什么。


买方真正需要知道的事

在实际的 DPA 审查和采购评估中出现的这些问题:

  1. 按语言对的质量——在 DE↔EN、EN↔AR、JA↔KO 上具体表现如何?
  2. 样本量——您报告的数字基于多少次运行?十次?一万次?
  3. 方法论——谁在评判翻译,对照什么参考,使用什么评分标准?
  4. 看分布,不是看平均——最差的 10% 是什么情况?最好的 10% 呢?中位数呢?
  5. 随时间的漂移——自上次发布数据以来,某个语言对是变好了还是变差了?
  6. 您没有测量什么——您的基准测试明确不覆盖哪些方面?

这些问题没有哪个是无法回答的。只是没有厂商把它们放在营销页面上。


我们发布了什么

/benchmark 是我们的回答。方法论在 /benchmark/methodology——在我们知道您会读到这些之前就已写好。

三点使其不同于品类惯例。

1. 真实流量,非精选测试集

公开基准测试中的每一个评分都来自一次真实的 /demo 测试运行。我们不预先挑选表现好的语言对。服务买方演示的同一套流水线,就是被测量的那套流水线。

2. 评判者具名公开

主力:google/gemini-3.5-flash。备用:anthropic/claude-sonnet-5。两者均经由 Vercel AI Gateway。评判者是方法论的一部分——按名称披露。当我们更换评判者时(随着模型退役,我们已经换过),历史数据行保留实际评分时使用的评判者;旧评分绝不会被静默重新评分。

3. 分布即数据,而非平均值

每一行发布的数据都显示中位数、p10、p90、最小值、最大值和样本量——而不是单一数字。语言对的单一数字只是噪声。分布的形状才是信号。


品类尚未采纳的做法

  • 低分语言对不会被隐藏。 公开索引的准入门槛是 ≥ 10 distinct IPs, ≥ 10 runs, median ≥ 60——但任何人都可以直接深链到任何语言对并查看真实数字,包括本月表现不佳的语言对。
  • 已知问题有记录。 当聊天测试工具在 2026 年初的几周内出现故障时,该时间段从索引中被排除,并在方法论页面上以文字注明。历史不会被静默改写。
  • 我们刻意不声称的内容 是方法论页面上的一个完整章节。我们说明 LLM 评判者本身在哪些地方不完善。我们说明我们没有测量什么(延迟、成本、用户满意度、翻译运行前的 ASR 端错误)。我们披露我们自己的自动化冒烟测试也是流量的一部分。

下一次厂商评估的筛选标准

如果您正在评估任何多语言会议平台——我们的或他人的——方法论是值得阅读的页面。数字本身是容易的部分。

适用于该品类任何厂商的实用筛选标准:

  • 要求提供基于真实流量的按语言对、按月的质量数据。 不是精选的基准测试。不是聚合数据。
  • 询问他们的评判者是什么,明确不测量什么,以及过去六个月有什么变化。
  • 询问当某个语言对的评分下降时会发生什么——他们会告知任何人吗,还是静默修复?

如果厂商能以书面形式回答全部三个问题,认真评估他们。如果不能,您买到的是营销——而不是翻译质量。


亲自体验

  • 试用实时演示——在生产翻译流水线上处理您的音频,使用与公开基准测试相同的评判者进行评分,并展示输出结果。
  • 查看基准测试——每个发布的语言对,每个月,附带完整分布数据。
  • 阅读方法论——数字如何计算,包含什么,不包含什么。

您不需要在任何一点上听信我们的一面之词。这才是关键。


来源:上述评判者标识符、准入门槛和排除规则均经核实与已发布代码一致,并公布在 /benchmark/methodology;评判者经由 Vercel AI Gateway 提供;开头引用的营销用语是品类典型措辞,并非对特定厂商的引用;于 2026 年 8 月核实。

通过电子邮件接收新文章

我们将在发布新文章时通过电子邮件通知您。可随时取消订阅。