方法论
InterMIND 翻译质量基准由我们自有的测试套件自动生成:每周一次的合成测试运行,会针对一组固定的参考集,驱动为公开的 /demo 提供支持的同一条翻译流水线,且对每一个语言对采用完全相同的方式。该基准是合成的、可复现的——这里的内容没有经过任何筛选或挑选,评分环节中也没有人工参与。
单次测试的工作方式
一次测试运行会播放一段参考音频文件(语音测试)或发送一段参考文本(聊天测试),使其从源语言经由我们的线上实时翻译流水线翻译为目标语言。所得译文由一个 LLM 评审依据标准参考译文打分,分值为 0–100。
LLM 评审:主评审为 google/gemini-3.8-flash,备用评审为 anthropic/claude-sonnet-5(通过 Vercel AI Gateway 调用)。所有语言对使用相同的提示词、评分标准和参考文本。
月度数据的聚合方式
- 每一次完整的基准测试运行都会连同各目标语言的分数记录在
demo_test_runs中。单个语言对的预览运行不计入——只有完整的多语言运行才会参与中位数的计算。 - 对于每一个(源语言、目标语言、测试类型、周)组合,我们只保留_最新_的一次运行,然后按月聚合——这样,单一来源就无法通过在一周内重复运行某个语言对来左右中位数。
- 基于去重后的数据集,我们计算中位数、最小值、最大值、p10、p90、平均值以及样本量。
- 我们会对各项分数做快照,这样一个月结束后,即使原始运行记录因 TTL 被删除,这些数字依然保持稳定。
语言对何时出现在公开索引中
当某一行(语言对 × 测试类型 × 月份)达到最低样本量和中位分数下限(语音测试的下限较低,因为 ASR 噪声不可避免)时,便有资格进入公开索引和站点地图。由于数据集来自单一的自动化来源,而非众多独立访问者,因此对这类合成数据放宽了独立来源的要求——但样本量和质量下限仍然适用。
未达标的语言对仍可通过直接链接访问——这些阈值只决定搜索引擎能看到什么。对于任何直接询问的人,我们都不会隐藏低分结果。
我们刻意不作的声明
- 单一分数不可信。表现良好的语言对在不同运行之间也可能出现 30 分的波动,因为 ASR 和 LLM 的判断都存在噪声。这正是每个页面展示的是分布而非单一数字的原因。
- LLM 评审本身并不完美。我们未来可能更换评审或采用双评审;届时历史数据行将带有评审标识。
- 该基准不衡量延迟、成本、可用性或用户满意度。这些内容另有来源。
- 数据集是合成的——由我们自己的自动化套件生成,而非来自独立第三方流量。我们明确披露这一点,而不是暗示存在外部评审小组。
如实呈现
当某个语言对在某个月份的质量下降时——该结果依然保持可见。当某个缺陷被修复、下个月分数上升时——这一改进会在同一页面上可见。我们从不改写历史聚合数据。管理员只能将个别月份从公开索引中隐藏,而无法更改已发布的数字。
影响历史数据的已知问题
- 聊天测试框架,2026-04-23 之前: 自动化聊天测试流水线在个别语言上存在故障。更早月份的聊天聚合数据可能低于当时实际的翻译质量。受影响的月份保留在数据库中,但不在公开索引中显示;趋势图会在修复时间点呈现一个阶跃变化。
问题反馈
对此处内容有异议?欢迎提交 issue 或直接联系我们。我们会更新本页面并注明所作变更。