翻訳品質を、オープンに

AI翻訳 品質 ベンチマーク

InterMINDが実際にどれだけ正確に翻訳できるかを、固定されたFLORES-200ベンチマークセットを用いた自動テストスイートで、言語ペアごとに毎月測定しています。都合のよい平均値の抜粋ではなく、合成データによる再現可能な測定です。

チャット翻訳
91/100
中央値 · 22 ペア · 22 回実行 · Q4 2026

入力したメッセージをその場で翻訳

音声翻訳
93/100
+3(対 Q3 2026)中央値 · 22 ペア · 22 回実行 · Q4 2026

音声認識と翻訳をエンドツーエンドで評価した単一スコア

44 言語ペア·45 採点済みの実行回数·23 言語·毎月更新 · 2026年10月

スコア = 参照翻訳に対する意味的忠実度(0〜100)。数値が高いほど良好です。

優秀 90+ 良好 70–89 可 50–69 要改善 <50

テキストチャット翻訳

入力したメッセージを、送信と同時にその場で翻訳します。

今四半期は23言語中23言語の平均が「良好」以上(70以上)です · Q3 2026より14件が向上

言語別の平均品質 · Q4 2026Q3 2026比

各バーは、今四半期にその言語への翻訳またはその言語からの翻訳を行ったすべての実行を集計したものです。破線の目印は前四半期を示します。

Q4 2026 (avg) Q3 2026 中央値 91 · Q4 2026
100
75
50
25
0
100
100
100
97
96
94
94
92
92
91
91
91
91
91
89
89
88
88
88
88
87
87
71
▲2es
▲4it
▲1pt
▲1ro
▲3fr
▲7ko
▲3pl
▼1sv
▲5zh
▲6fi
▼4de
▲2en
▼4ja
▲30tr
▲9is
▼2nl
▼4da
▲3ru
▼1uk
▼3no
▼4cs
▲26hi
▼13hu

Faded bars have a thin sample (<3 runs) — read them as provisional.

音声翻訳

ライブの音声を文字起こしし、リアルタイムで翻訳します。エンドツーエンドで見ると、より難しい課題です。

今四半期は23言語中23言語の平均が「良好」以上(70以上)です · Q3 2026より19件が向上

言語別の平均品質 · Q4 2026Q3 2026比

各バーは、今四半期にその言語への翻訳またはその言語からの翻訳を行ったすべての実行を集計したものです。破線の目印は前四半期を示します。

Q4 2026 (avg) Q3 2026 中央値 93 · Q4 2026
100
75
50
25
0
100
98
97
97
97
96
96
96
95
94
93
92
92
91
90
89
89
89
88
87
85
83
76
▲8ko
▲3es
▲2zh
▲3ja
▲1it
▲4uk
▲3pt
▲3ro
▲10ru
▲3pl
▲1fr
•nl
▲4en
▲1cs
▲1no
▲2sv
▲9hu
▲4de
•da
▼4hi
•fi
▲5is
▲8tr

Faded bars have a thin sample (<3 runs) — read them as provisional.

品質の推移

公開を開始して以降の、モダリティ別の月次中央値です。

チャット 音声
100
75
50
25
0
98
68
99
77
92
94
84
92
91
93
2026年3月
2026年4月
2026年5月
2026年7月
2026年8月
2026年9月
2026年10月

これらの数値は実際のセッションに基づいています

ライブデモで行われたすべての実行は自動的に採点され、翌月のベンチマークに反映されます。セッションは次のようになります。

ライブ翻訳ミーティング
→ EN

全データ表

公開済みのすべてのペアと月について、中央値、範囲、サンプル数を掲載しています。どの列でも並べ替えできます。

よくある質問