1つのInterMINDミーティングにおけるリアルタイム翻訳、キャプション、検索可能なトランスクリプトの連携
4つのタイムゾーンにまたがるチームは、カレンダーの招待状の段階では言語の問題を抱えていません。問題が生じるのは、誰かが話し始めた瞬間です。リアルタイム翻訳、リアルタイムキャプション、そして後から見返せるトランスクリプトは、この摩擦を実際に取り除く3つの要素であり、近年では3つの別々のアドオンとしてではなく、1つのバンドルとして1つのプロダクトページにまとめて記載されることが増えています。
最近の例として、職場プラットフォームであるNexGen Virtual Workplaceの2026年9月の投稿があります。そこには「ライブ音声翻訳、ミーティングキャプション、検索可能なトランスクリプトは、ミーティングに後付けするのではなく、勤務日に組み込まれたものです」という言葉で始まり、「これらの機能はNexGen Virtual Workplaceプラットフォーム内で加入者が利用できる機能です」と述べられています。これが提供されている仕様の全貌です。この投稿では、サポートされている言語の数には触れられておらず、どのサブスクリプション階層でこれら3つの機能がアンロックされるのかも明記されていません。そして、「検索可能」とは「ユーザーが過去のトランスクリプションを参考として調べることもできる」という以上の意味を持たないと説明されています(2026年9月確認、ソースは末尾にリンク)。これはベンダーに対する批判ではありません。読者は、そのバンドルが自分のチームに適合するかどうかを知る前に、他の場所で調べるか、単に信じるしかないということを示しています。
「翻訳」「キャプション」「トランスクリプト」という同じ3つの単語が、プロダクトごとに意味的に異なる仕組みを指すために使われることがあるため、ここでは、現在のInterMINDにおけるそれぞれの具体的かつ検証可能な仕組みを説明します。
翻訳:自分でオンにし、話者自身の声で話す
翻訳は常にバックグラウンドで行われるものではありません。ルーム内に少なくとも2つの言語が存在すると利用可能になり、ミーティングごとにコントロールバーの More メニュー(または Alt+T ショートカット)から意図的に有効にします。そこから各参加者は独自の翻訳言語を個別に設定します。5つの言語を話す5名の通話の場合、全員が他の全員の発言を自分の言語に同時に翻訳されて聞くことができます。
出力は汎用のナレーターの声ではありません。音声認識、文のセグメンテーション、翻訳、音声合成がパイプラインとして実行され、最後の段階で、翻訳された文が元の話者自身の声のバリエーションで再合成されます。平坦なテキスト読み上げではなく、話者と認識できる声になります。このパイプラインの技術的な詳細については 別の投稿 で解説していますが、ここでの要点は、翻訳をオンにすると「何が話されたか」だけでなく「誰が話したか」も翻訳を通じて保持されるということです。対応範囲は、音声、チャット、共有ノートで23言語、ドキュメント全体のファイル翻訳で30言語です。この区分とその理由については、対応言語の内訳 で解説しています。