翻訳品質のマーケティングが壊れている理由 — そして私たちが代わりに公開しているもの
ライブ翻訳ベンダーのサイトを開いてみてください。どのサイトでも同じような数字を目にするでしょう:
- 「200以上の言語」
- 「6,000以上の言語ペア」
- 「世界初」 / 「最高精度」
- 「99%の精度」
次に、これから開催するミーティングにおいて、それらの数字が何を意味するのかを、ベンダーのページで探してみてください。言語ごとの品質。再現可能な手法。サンプルサイズ。経時的なスコア。モデルの弱点に関する正直な開示。
それは見つかりません。マーケティングコピーにもなく、ドキュメントにもめったにありません。
これがこのカテゴリーの均衡状態です。これが存在する理由は3つあります:
- ほとんどのベンダーは自社の翻訳エンジンを所有していない。 彼らは OpenAI、Google、DeepL、Microsoft、またはその組み合わせを経由してルーティングしています。ペアごとの品質データを公開することは、他人のモデルをベンチマークすることを意味し、そこにはマーケティング価値がありません。
- 正直な品質データはビルボードに掲載するのが難しい。 単一のスコアはノイズが多いです。分布はより有用ですが、圧縮するのは難しいです。
過去6ヶ月のトレンドはさらに有用ですが、さらに難しいです。 - 調達担当者がまだ反撃していない。 買い手はマーケティングの数字を額面通りに受け入れており、そのため均衡が保たれています。
この均衡は長くは続かないでしょう。次世代の買い手 — 製薬、法務、金融、監査、公共部門 — は、「言語数はいくつか」以上に厳しい質問をするようになります。私たちが /benchmark を構築したのは、彼らがベンダーの言葉を鵜呑みにする必要がないべきだと考えているからです。
マーケティングの数字が教えてくれないこと
「200以上の言語」 は、ベンダーが200の言語でテキストを出力するモデルを持っていることを意味します。これらの言語間の品質は、主要なペア (EN↔DE, EN↔ES, EN↔FR) の本番環境レベルの品質から、低リソースのペアではかろうじて使用できるレベルまで幅があります。ペアごとの内訳がなければ、あなたのミーティングがその境界線のどちら側に位置するかを知ることはできません。
「6,000以上の言語ペア」 は、80のソース言語に対する N × N の組み合わせです。6,000のペアをサポートしていると言うのは簡単な部分です。特定のペアが CAPA レビュー、契約交渉、決算説明会に十分な品質であると言うこと — それこそがパンフレットには書かれていない部分です。
「99%の精度」 は、何が測定され、何と比較され、どのようなサンプルで、誰が判定したのかが指定されていない場合、無意味です。翻訳品質には普遍的なスカラー値はありません。言語ペア、コンテンツのドメイン、音声の品質 (音声の場合)、レイテンシの予算、そして特定のユースケースにおいて「十分な品質」とは何を意味するかに依存する分布が存在するだけです。