InterMINDを駆動する4つの翻訳パイプラインの内部
mind.comの古い/product/overview/how-it-worksページは、すでに何回かのメジャーリリース分も時代遅れになっています。多くのベンダーのページと同じように、単一の「翻訳エンジン」を説明しており、「あなたが話す」から「彼らが聞く」への大きな矢印が1本引かれています。その図は2年前にはすでに単純化されすぎていました。今日ではそれは間違っています。
実際のところ、InterMINDは4つの個別の翻訳パイプラインを実行しており、それぞれが異なるエンジン、異なるレイテンシ予算、異なる品質エンベロープによって異なる問題を解決しています。それらは言語ピッカーを共有していますが、エンジンは共有していません。
これが、「どのように機能するのか」という問いに対する最新の回答です。
関連記事: 「何言語サポートしていますか?」 は、各パイプラインがカバーする範囲(23 / 23 / 30 / 17)について解説しています。本記事では、各パイプラインが何をするのか、そしてなぜそれぞれが独立した存在なのかについて解説します。
「すべてを1つのエンジンで」というアプローチが嘘である理由
リアルタイムのミーティングプラットフォームには、少なくとも同時にこなさなければならない4つのジョブがあり、それらは互いに矛盾する方向に引っ張り合います:
- リアルタイムの音声 — 音声を入力し、翻訳された音声を出力します。1秒未満で、すべての視聴者がそれぞれの言語で聞けます。厳しい制約となるのはレイテンシです。
- リアルタイムのチャットテキスト — 短いメッセージを高速に処理し、編集、引用、HTML構造を保持します。
- リアルタイムの共有ノート — 文字ごとの共同タイピングであり、翻訳後も維持されなければならない構造的階層(リスト、見出し、チェックボックス)が含まれます。
- 非同期のドキュメントファイル — チャットにドロップされた40ページのPDFなど。レイテンシの予算はありません。厳しい制約は忠実度です — フォーマット、表、ページ番号、フォントがこれにあたります。
この4つすべてをこなそうとする巨大な1つのLLM呼び出しを構築することもできます。私たちも試みました。しかしそれは、4つすべてにおいて下手でした。音声のレイテンシ予算は、モデルが「考える」ことを許しません。ドキュメントの忠実度予算は、モデルが「考えなければならない」ことを意味します。チャットの編集には視聴者の言語での差分(diff)が必要ですが、40ページのPDFにはトークンストリーミングモデルでは提供できないフォーマット保持が必要です。
そこで私たちは4つを実行しています。それぞれのパイプラインを紹介します。