翻訳品質のマーケティングが壊れている理由 — そして私たちが代わりに公開しているもの
ライブ翻訳ベンダーのサイトを開いてみてください。どのサイトでも同じような数字を目にするでしょう:
- 「200以上の言語」
- 「6,000以上の言語ペア」
- 「世界初」 / 「最高精度」
- 「99%の精度」
次に、これから開催するミーティングにおいて、それらの数字が何を意味するのかを、ベンダーのページで探してみてください。言語ごとの品質。再現可能な手法。サンプルサイズ。経時的なスコア。モデルの弱点に関する正直な開示。
それは見つかりません。マーケティングコピーにもなく、ドキュメントにもめったにありません。
これがこのカテゴリーの均衡状態です。これが存在する理由は3つあります:
- ほとんどのベンダーは自社の翻訳エンジンを所有していない。 彼らは OpenAI、Google、DeepL、Microsoft、またはその組み合わせを経由してルーティングしています。ペアごとの品質データを公開することは、他人のモデルをベンチマークすることを意味し、そこにはマーケティング価値がありません。
- 正直な品質データはビルボードに掲載するのが難しい。 単一のスコアはノイズが多いです。分布はより有用ですが、圧縮するのは難しいです。
過去6ヶ月のトレンドはさらに有用ですが、さらに難しいです。 - 調達担当者がまだ反撃していない。 買い手はマーケティングの数字を額面通りに受け入れており、そのため均衡が保たれています。
この均衡は長くは続かないでしょう。次世代の買い手 — 製薬、法務、金融、監査、公共部門 — は、「言語数はいくつか」以上に厳しい質問をするようになります。私たちが /benchmark を構築したのは、彼らがベンダーの言葉を鵜呑みにする必要がないべきだと考えているからです。
マーケティングの数字が教えてくれないこと
「200以上の言語」 は、ベンダーが200の言語でテキストを出力するモデルを持っていることを意味します。これらの言語間の品質は、主要なペア (EN↔DE, EN↔ES, EN↔FR) の本番環境レベルの品質から、低リソースのペアではかろうじて使用できるレベルまで幅があります。ペアごとの内訳がなければ、あなたのミーティングがその境界線のどちら側に位置するかを知ることはできません。
「6,000以上の言語ペア」 は、80のソース言語に対する N × N の組み合わせです。6,000のペアをサポートしていると言うのは簡単な部分です。特定のペアが CAPA レビュー、契約交渉、決算説明会に十分な品質であると言うこと — それこそがパンフレットには書かれていない部分です。
「99%の精度」 は、何が測定され、何と比較され、どのようなサンプルで、誰が判定したのかが指定されていない場合、無意味です。翻訳品質には普遍的なスカラー値はありません。言語ペア、コンテンツのドメイン、音声の品質 (音声の場合)、レイテンシの予算、そして特定のユースケースにおいて「十分な品質」とは何を意味するかに依存する分布が存在するだけです。
買い手が実際に知る必要があること
実際の DPA レビューや調達評価で現れる質問:
- ペアごとの品質 — 具体的に DE↔EN、EN↔AR、JA↔KO でどのようなパフォーマンスが出ますか?
- サンプルサイズ — 報告された数字は何回の実行に基づいていますか? 10回ですか? 1万回ですか?
- 手法 — 誰が翻訳を判定し、何を基準とし、どのような評価基準を用いていますか?
- 平均ではなく分布 — 最悪の10%はどのような結果ですか? 最高の10%は? 中央値は?
- 経時的なドリフト — 前回数字を公開してから、特定のペアは良くなりましたか、それとも悪くなりましたか?
- 測定していないこと — あなたのベンチマークは明示的に何を捉えていませんか?
これらはどれも答えられないものではありません。ただ、どのベンダーのマーケティングページにも載っていないだけです。
私たちが公開しているもの
/benchmark が私たちの回答です。手法については /benchmark/methodology に記載されています — あなたがこれを読んでいることを知る前に書かれたものです。
これをカテゴリーの常識と分ける3つの要素があります。
1. キュレーションされたスイートではなく、実際のトラフィック
公開ベンチマークのすべてのスコアは、実際の /demo テスト実行から得られたものです。パフォーマンスの良いペアを事前に選別していません。買い手のデモを提供するのと同じパイプラインが測定対象となっています。
2. 判定モデルが明示されている
プライマリ: google/gemini-3.5-flash。フォールバック: anthropic/claude-sonnet-5。どちらも Vercel AI Gateway 経由です。判定モデルは手法の一部であり — 名前が明示されています。判定モデルを変更する場合 (モデルが廃止された際に変更しましたが)、過去の行には実際にスコアを付けた判定モデルが引き継がれます。過去のスコアが密かに再採点されることはありません。
3. データは平均ではなく分布
公開されているすべての行には、中央値、p10、p90、最小値、最大値、およびサンプルサイズが表示され — 単一の数字ではありません。翻訳ペアの単一の数字はノイズです。分布の形状こそがシグナルです。
業界がまだ採用していないプラクティス
- 低スコアのペアは隠されない。 公開インデックスは
≥ 10 distinct IPs, ≥ 10 runs, median ≥ 60でゲートされていますが — 誰でも任意のペアに直接ディープリンクして、今月調子が悪いペアを含む実際の数字を見ることができます。 - 既知の問題は文書化されている。 2026年前半にチャットテストハーネスが数週間壊れていた際、その期間はインデックスから抑制され、手法ページに書面で注記されています。履歴が密かに書き換えられることはありません。
- 意図的に主張しないこと は、手法ページ上に完全なセクションとして設けられています。LLM 判定モデル自体が不完全な箇所を明記しています。測定していないこと (レイテンシ、コスト、ユーザー満足度、翻訳が実行される前の ASR 側のエラー) を明記しています。自社の自動スモークテストがトラフィックの一部であることを開示しています。
次回のベンダー評価のためのフィルター
多言語ミーティングプラットフォーム (当社のものでも他社のものでも) を評価しているなら、手法こそが読む価値のあるページです。数字自体は簡単な部分です。
このカテゴリーの任意のベンダーに対する実用的なフィルター:
- 実際のトラフィックにおける言語ペアごと、月ごとの品質データを求める。 キュレーションされたベンチマークではなく。集計データではなく。
- 判定モデルが何か、明示的に測定していないことは何か、過去6ヶ月間で何が変更されたかを尋ねる。
- ペアのスコアが低下した場合に何が起こるかを尋ねる — 彼らは誰かに伝えるのか、それとも黙って修正するのか?
ベンダーがこれら3つの回答をすべて文書で提示するなら、真剣に評価してください。提示しないなら、あなたはマーケティングを買っているのであって — 翻訳品質を買っているのではありません。
自分で試してみる
- ライブデモを試す — あなたの音声に対して本番環境の翻訳パイプラインを実行し、公開ベンチマークのスコア付けと同じ判定モデルで採点し、出力を表示します。
- ベンチマークを見る — 公開されているすべての言語ペア、毎月、完全な分布とともに。
- 手法を読む — 数字がどのように計算され、何が含まれ、何が含まれないのか。
いずれについても、私たちの言葉を鵜呑みにする必要はありません。それがポイントです。
情報源: 上記の判定モデルの識別子、ゲーティングのしきい値、抑制ルールは、出荷されたコードに対して検証されており、/benchmark/methodology で公開されています。判定モデルは Vercel AI Gateway 経由で提供されます。冒頭で引用されたマーケティングの主張は、特定のベンダーの引用ではなく、カテゴリーで典型的な表現です。2026年8月に確認済み。