翻訳品質を、オープンに
AI翻訳 品質 ベンチマーク
InterMINDが実際にどれだけ正確に翻訳できるかを、固定されたFLORES-200ベンチマークセットを用いた自動テストスイートで、言語ペアごとに毎月測定しています。都合のよい平均値の抜粋ではなく、合成データによる再現可能な測定です。
チャット翻訳
91/100
中央値 · 22 ペア · 22 回実行 · Q4 2026
入力したメッセージをその場で翻訳
音声翻訳
93/100
+3(対 Q3 2026)中央値 · 22 ペア · 22 回実行 · Q4 2026
音声認識と翻訳をエンドツーエンドで評価した単一スコア
44 言語ペア·45 採点済みの実行回数·23 言語·毎月更新 · 2026年10月
スコア = 参照翻訳に対する意味的忠実度(0〜100)。数値が高いほど良好です。
優秀 90+ 良好 70–89 可 50–69 要改善 <50
テキストチャット翻訳
入力したメッセージを、送信と同時にその場で翻訳します。
今四半期は23言語中23言語の平均が「良好」以上(70以上)です · Q3 2026より14件が向上
言語別の平均品質 · Q4 2026Q3 2026比
各バーは、今四半期にその言語への翻訳またはその言語からの翻訳を行ったすべての実行を集計したものです。破線の目印は前四半期を示します。
Q4 2026 (avg) Q3 2026 中央値 91 · Q4 2026
100
75
50
25
0
100
100
100
97
96
94
94
92
92
91
91
91
91
91
89
89
88
88
88
88
87
87
71
▲2es
▲4it
▲1pt
▲1ro
▲3fr
▲7ko
▲3pl
▼1sv
▲5zh
▲6fi
▼4de
▲2en
▼4ja
▲30tr
▲9is
▼2nl
▼4da
▲3ru
▼1uk
▼3no
▼4cs
▲26hi
▼13hu
Faded bars have a thin sample (<3 runs) — read them as provisional.
音声翻訳
ライブの音声を文字起こしし、リアルタイムで翻訳します。エンドツーエンドで見ると、より難しい課題です。
今四半期は23言語中23言語の平均が「良好」以上(70以上)です · Q3 2026より19件が向上
言語別の平均品質 · Q4 2026Q3 2026比
各バーは、今四半期にその言語への翻訳またはその言語からの翻訳を行ったすべての実行を集計したものです。破線の目印は前四半期を示します。
Q4 2026 (avg) Q3 2026 中央値 93 · Q4 2026
100
75
50
25
0
100
98
97
97
97
96
96
96
95
94
93
92
92
91
90
89
89
89
88
87
85
83
76
▲8ko
▲3es
▲2zh
▲3ja
▲1it
▲4uk
▲3pt
▲3ro
▲10ru
▲3pl
▲1fr
•nl
▲4en
▲1cs
▲1no
▲2sv
▲9hu
▲4de
•da
▼4hi
•fi
▲5is
▲8tr
Faded bars have a thin sample (<3 runs) — read them as provisional.
品質の推移
公開を開始して以降の、モダリティ別の月次中央値です。
チャット 音声
100
75
50
25
0
98
68
99
77
92
94
84
92
91
93
2026年3月
2026年4月
2026年5月
2026年7月
2026年8月
2026年9月
2026年10月
全データ表
公開済みのすべてのペアと月について、中央値、範囲、サンプル数を掲載しています。どの列でも並べ替えできます。
よくある質問
対応言語が増え続けているためです。製品に追加した言語は、すべて週次のベンチマーク実行の対象となり、公開基準を満たした時点で指数に加わります。そして、新しい言語が、1年かけて調整してきたペアと同じ水準から始まることはほとんどありません。見出しの数値は、その四半期に公開された全ペアの中央値であるため、既存のペアがすべて維持または向上していても、新たに加わった言語が数値を押し下げます。その後、調整を重ねるにつれて新しいペアも向上し、指数は回復します。特定の言語の進捗を確認するには、下のペアページをご覧ください。その推移は、他の要素に左右されることはありません。
各テストでは、製品が使用しているものと同じライブパイプラインに参照テキスト(チャット)または参照音声ファイル(音声)を通し、LLMジャッジが出力を正準の参照翻訳と比較して0〜100で採点します。スコアは次の区分に分かれます。90以上は優秀、70〜89は良好、50〜69は可、50未満は不十分です。音声認識とジャッジの双方にばらつきがあるため、1回の実行で数十ポイントも変動することがあります。そのため、ペアの評価は単一の数値ではなく、1か月間の中央値と範囲で判断してください。
音声は、音声認識と翻訳を合わせたエンドツーエンドの単一スコアです。チャットは、入力したテキストのみの翻訳です。認識の誤りは音声スコアに反映されるため、音声の言語ペアは平均的に低めになり、公開基準も低く設定されています(チャットの60に対して45)。チームが主に文字を入力する場合はチャットの数値を、主に話す場合は音声の数値を参考にしてください。
いいえ。このベンチマークは合成データによるものです。当社の自動テストスイートが、固定のFLORES-200リファレンスセットを毎週パイプラインに通しており、これらの数値の唯一の出典です。デモで実行されたセッションは、スコア化されることも、ベンチマークに保存されることもありません。お客様のミーティングがベンチマークに使われることも一切ありません。
上の表から該当ペアのページを開くと、月ごとの中央値・範囲・サンプル数と、月をまたいだ推移を確認できます。お手持ちの素材で確認するには、テストリグ(ベンチマークと同じ2ペイン構成)を開き、ご自身の言語で話すか入力してください。自動的に開始されることはなく、何も保存されません。一覧にないペアは、まだ公開基準を満たしていないか、製品にまだ搭載されていません。スコアが低いペアも直接リンクから確認できます。非表示にはしていません。