評価方法

InterMIND の翻訳品質ベンチマークは、自社のテストスイートによって自動的に作成されます。毎週の合成テストが、公開されている /demo を支えるものと同じ翻訳パイプラインを、固定の参照セットに対して実行します。この手順はすべての言語ペアで同一です。このベンチマークは合成データに基づく再現可能なものであり、ここに掲載している内容に選別や恣意的な抽出はなく、スコアリングの過程に人手は介在しません。

1回のテストの流れ

テストでは、ソース言語の参照音声ファイルを再生する(音声テスト)か、参照テキストを送信し(チャットテスト)、自社のライブ翻訳パイプラインを通してターゲット言語に翻訳します。得られた翻訳は、LLM ジャッジが正解となる参照翻訳と照らし合わせて 0〜100 でスコアリングします。

LLM ジャッジ:プライマリは google/gemini-3.8-flash、フォールバックは anthropic/claude-sonnet-5 です(Vercel AI Gateway 経由)。すべてのペアで、同じプロンプト、評価基準、参照テキストを使用します。

月次集計の方法

  1. 完了したフルベンチマークの実行はすべて demo_test_runs に記録され、ターゲット言語ごとのスコアが保存されます。単一ペアのプレビューは除外され、複数言語にわたるフル実行のみが中央値の算出に使われます。
  2. (ソース言語、ターゲット言語、テスト種別、週)ごとに_最新_の実行のみを残し、その後に月単位で集計します。これにより、同じペアを1週間に繰り返し実行しても、単一のソースが中央値を左右することはありません。
  3. 重複を除いたデータセットから、中央値、最小値、最大値、p10、p90、平均値、サンプルサイズを算出します。
  4. 個々のスコアはスナップショットとして保存します。月が締まった後は、生の実行データが TTL によって削除されても、数値は変わりません。

公開インデックスに掲載される条件

(ペア × テスト種別 × 月)の行は、最小サンプルサイズと中央値スコアの下限を満たした場合に、公開インデックスとサイトマップの対象になります(音声は ASR のノイズが避けられないため、下限をより低く設定しています)。このデータセットは、多数の独立した訪問者ではなく単一の自動化されたソースから得られるため、この合成データについてはユニークソースの要件を緩和しています。ただし、サンプルサイズと品質の下限は引き続き適用されます。

基準を満たさないペアも、直接リンクからはアクセスできます。しきい値が制限するのは、検索エンジンに表示される範囲だけです。低いスコアであっても、直接ご覧になりたい方に対して隠すことはありません。

私たちが主張しないこと

  • 単一のスコアは信頼できません。ASR と LLM の判定はどちらもノイズを含むため、問題なく動作しているペアでも、実行ごとに 30 ポイント変動することがあります。そのため、各ページには単一の数値ではなく分布を表示しています。
  • LLM ジャッジ自体も完全ではありません。今後、ジャッジの切り替えやデュアルジャッジの導入を行う可能性があります。その場合、過去の行にはジャッジの識別子を付与します。
  • このベンチマークは、レイテンシ、コスト、可用性、ユーザー満足度を測定するものではありません。それらについては別の場所で扱っています。
  • このデータセットは合成データであり、自社の自動化スイートによって生成されたものです。独立した第三者のトラフィックによるものではありません。外部のパネルがあるかのように装うことなく、この点を明示します。

正直な開示

特定のペアで月ごとの品質が低下した場合も、その結果は表示されたままです。バグが修正されて翌月にスコアが上昇した場合も、その改善は同じページで確認できます。過去の集計値を書き換えることはありません。管理者ができるのは、個々の月を公開インデックスから非表示にすることだけで、すでに公開された数値を変更することはできません。

過去データに影響する既知の問題

  • 2026-04-23 より前のチャットテストハーネス: 自動化されたチャットテストのパイプラインで、言語ごとに失敗が発生していました。それ以前の月のチャット集計は、当時の実際の翻訳品質よりも低いスコアを示している可能性があります。影響を受けた月はデータベースに保持されていますが、公開インデックスには表示されません。トレンドチャートには、修正時点で段差が現れます。

ご質問

ここに書かれている内容に異論がありますか?Issue を作成するか、私たちまでご連絡ください。このページを更新し、変更内容を明記します。