得分 = 与参考译文的语义忠实度(0–100)。分数越高越好。
优秀 90+ 良好 70–89 一般 50–69 较弱 <50
文本聊天翻译
输入的消息在发送时即时内联翻译。
本季度 23 种语言中有 23 种平均水平达到良好及以上(70 分以上) · 较 Q3 2026 提升 14 项
各语言平均质量 · Q4 2026较 Q3 2026
每根柱条汇总了本季度所有翻译至该语言或从该语言翻译的测试。虚线刻度标示上一季度的水平。
Q4 2026 (avg) Q3 2026 中位数 91 · Q4 2026
100
75
50
25
0
100
100
100
97
96
94
94
92
92
91
91
91
91
91
89
89
88
88
88
88
87
87
71
▲2es
▲4it
▲1pt
▲1ro
▲3fr
▲7ko
▲3pl
▼1sv
▲5zh
▲6fi
▼4de
▲2en
▼4ja
▲30tr
▲9is
▼2nl
▼4da
▲3ru
▼1uk
▼3no
▼4cs
▲26hi
▼13hu
Faded bars have a thin sample (<3 runs) — read them as provisional.
语音翻译
实时语音转写并翻译——难度更高的端到端问题。
本季度 23 种语言中有 23 种平均水平达到良好及以上(70 分以上) · 较 Q3 2026 提升 19 项
各语言平均质量 · Q4 2026较 Q3 2026
每根柱条汇总了本季度所有翻译至该语言或从该语言翻译的测试。虚线刻度标示上一季度的水平。
Q4 2026 (avg) Q3 2026 中位数 93 · Q4 2026
100
75
50
25
0
100
98
97
97
97
96
96
96
95
94
93
92
92
91
90
89
89
89
88
87
85
83
76
▲8ko
▲3es
▲2zh
▲3ja
▲1it
▲4uk
▲3pt
▲3ro
▲10ru
▲3pl
▲1fr
•nl
▲4en
▲1cs
▲1no
▲2sv
▲9hu
▲4de
•da
▼4hi
•fi
▲5is
▲8tr
Faded bars have a thin sample (<3 runs) — read them as provisional.
质量变化趋势
自开始发布以来,各模态的月度中位数。
聊天 语音
100
75
50
25
0
98
68
99
77
92
94
84
92
91
93
2026年3月
2026年4月
2026年5月
2026年7月
2026年8月
2026年9月
2026年10月
完整数据表
每个已发布的语言对和月份——中位数、范围和样本量。可按任意列排序。
常见问题
因为支持的语言在不断增加。我们每为产品新增一种语言,它就会加入每周的基准测试,并在达到发布门槛后立即纳入指数——而新语言的起点,很少能与我们已调优一年的语言对相当。头条数字是该季度所有已发布语言对的中位数,因此即使所有既有语言对保持不变或有所提升,一批新加入的语言对也会拉低这一数字。随后,这些新语言对会随着我们的调优而提升,指数也随之回升。若要查看某一种语言的进展,请打开下方对应的语言对页面:该趋势不会被其他任何因素稀释。
每次测试都会将参考文本(聊天)发送、或将参考音频文件(语音)播放,经过产品所使用的同一条实时流水线,再由 LLM 评审依据标准参考译文对输出结果给出 0 到 100 的评分。分数分为几个等级:90 分及以上为优秀,70–89 分为良好,50–69 分为一般,50 分以下为较弱。由于语音识别和评审本身都存在噪声,单次测试的结果可能相差数十分,因此请根据一个月内的中位数和范围来判断某个语言对,而不是依据单一数字。
语音是一个端到端的综合得分:语音识别加翻译。聊天仅是对输入文本的翻译。识别错误会计入语音得分,因此语音语言对的平均得分偏低,发布门槛也更低——语音为 45,聊天为 60。如果您的团队以打字为主,请参考聊天得分;如果以口头交流为主,请参考语音得分。
不属于。该基准是合成的:我们的自动化测试套件每周将一组固定的 FLORES-200 参考集送入处理流程,这是这些数据的唯一来源。用户在演示中进行的会话既不会被评分,也不会保存到基准中,您的会议也绝不会用于基准。
请从上方表格打开该语言对的专属页面:页面会按月显示中位数、范围和样本量,以及各月的趋势。若要用您自己的材料测试,请打开测试平台——与基准运行时相同的双窗格设置——然后用您的语言说话或输入;不会自动启动任何内容,也不会保存任何内容。如果某个语言对未列出,说明它尚未达到发布门槛,或尚未上线产品。低分结果仍可通过直接链接访问;我们不会隐藏它们。