アーキテクチャ

自分の声で話す — 話せない言語で

多くのリアルタイム翻訳ツールは、あなたを単一の機械的な音声に置き換えてしまいます。InterMINDはあなたの声を保持します。すべての参加者は、元の話者自身の声で翻訳を聞くことができます。カスケードがどのようにこれを実現するか、設定のオプションである保存済み音声サンプルが何を追加するか、そして何が保存されるかをご紹介します。

The Mind.com Team

自分の声で話す — 話せない言語で

あなた自身の声で話す — あなたが話せない言語で

リアルタイム翻訳において、ほぼすべての人が誤解し、ほとんど誰も語らない部分があります。それが**「あなたが聞く声」**です。

優秀な音声認識と優秀な翻訳があっても、最終的には機械がリストを読み上げているようなミーティングにしかなりません。なぜなら、最後のステップ(翻訳されたテキストを再び音声に変換する段階)で、ほとんどのツールは静かにあなた自身を単一の汎用的な合成ナレーターに置き換えてしまうからです。部屋に8人がいても、全員に対して1つのロボット音声です。誰が話しているのか、強調点、個性といったものが失われます。理解はできても、会話にはなりません。

InterMINDは、この最後のステップを変えています。あなたが話すと、他の参加者は明らかにあなた自身のものとわかる声で翻訳を聞きます。その声はあなたの音色や話し方を保ったまま、今度は彼らの言語で言葉を発します。まだ完璧な模倣ではありませんが、重要なのは、汎用のナレーターではなくあなた自身の声になるという点であり、そしてこれは改善されていくものです。この機能は、すべての参加者に対して、双方向かつ同時に機能します。

この記事は、Inside the four translation pipelines that run InterMINDの欠けていた章です。前回の記事ではオーディオがどのように翻訳されたオーディオになるかを説明しました。今回は、その先からどの声が出てくるのかについてです。


誰もが提供しているデフォルトと、それが平坦になる理由

大手ミーティングプラットフォームのいずれかでライブ翻訳を使ったことがあるなら、その音声をご存知でしょう。中立的で一定のペースの声が翻訳を読み上げます。話者がタウンホールミーティングを開くCEOであれ、冗談を言う同僚であれ、同じ声です。その裏にある技術は、1つの固定された音声モデルを使用したテキスト読み上げであり、インテリジェブル(理解可能)で十分であるという設計上の想定に基づいています。

しかし、実際のミーティングではそうはいきません。ミーティングが伝える情報の半分は、誰がどのように言っているかです。声を剥ぎ取れば、ディスカッションはたまたま声に出して読まれるトランスクリプトになってしまいます。人々はお互いに反応するのをやめ、自分の順番を待ち始めます。

InterMINDが代わりに行っていること

翻訳はカスケードパイプラインとして実行されます。つまり、1つのモデルですべてを行おうとするのではなく、3つの特殊なステージが順番に実行されます。最初の2つのステージについてはパイプラインの記事で解説済みです。音声のステージが、この記事のテーマです:

  1. ASR — 音声認識。 あなたの言葉は、あなたが話すと同時に、あなた自身の言語で、私たち独自のエンジン(通話を担うメディアサーバーであるMind API、OVH France)上で文字起こしされます。これにより、文が終わる前から翻訳を開始できます。
  2. MT — 翻訳。 文字起こしされたテキストは、安定した文の断片(節)にまとめられます。これにより、文を言い終わる前に翻訳を開始でき、各断片がリスナーの言語へと段階的に翻訳されます。
  3. Zero-shot TTS — 音声合成。 翻訳された各断片は、あなた自身の声のサンプルを使用して音声化され、リスナーへストリーミングされます。

効果を生み出しているのは、ASR → MT → zero-shot TTS という第3のステージです。「ゼロショット」とは、事前に録音された登録音声や、声のトレーニングセッションがシステムに不要であることを意味します。システムは、あなたが現在参加しているミーティングのオーディオから、あなたの声をモデル化します。

ウォームアップ:なぜそんなに早くあなたの声のように聞こえ始めるのか

「あなた自身の声のサンプルを使用する」という言葉には、鶏と卵の問題が潜んでいます。通話の開始直後は、システムがあなたの声を適切にモデル化するのに十分なほどあなたの声を聞いていません。

InterMINDはこれを、段階的なウォームアップで処理します:

  • 最初の5〜10秒間ほどは、あなたの音声を十分に集めている間、各翻訳された断片は、あなたが元の言語でまさに今発した内容に一致するオーディオ断片を使用して合成されます。音声化は、あなたの実際の、即時の発話に固定されます。
  • 十分に長いサンプルが得られたら — その5〜10秒の地点で — システムはそれを捕捉し、以降のすべての音声化にそれを使用します。

実際には、スイッチが切り替わる音は聞こえません。会話が進むにつれて、翻訳音声はよりあなたに近いものに聞こえます。あなたの声の完全なコピーではなく、機械の声ではなく明らかにあなたの声であり、モデルが聞くにつれて改善されていきます。段階的翻訳(文単位ではなく節単位)と段階的音声化の組み合わせが、全体を人間らしく聞こえさせながらレイテンシ予算内に収めているのです。

声を一度録音して、ウォームアップをスキップする

上記のウォームアップは、何も設定せずにデフォルトで起こる動作です。2026年9月以降、サインイン済みユーザー向けのオプションとして2つ目のパスが用意されました。Settings → Your voice in translation での保存済み音声サンプルです。

録音は1アクションです。音声を録音 を押し、今すぐ話す と表示されるのを待って、1から10までの数字を好きな順序で言ってください。各数字は、音声エンジンが聞き取るたびにカード上で点灯します。10個すべてが点灯すると、サンプルはチェックされ、単独で保存されます。再生や確認するものはなく、カウントダウンもありません。カードは、数字が含まれるあなたの録音区間を保持します。静かな部屋とヘッドセットが最良の結果をもたらします。

保存済みサンプルがもたらす変化は、次のミーティングから、シンセサイザーがあなたの翻訳を最初の断片からそのサンプルで音声化するという点です。これにより、相手はウォームアップ後ではなく、最初の文からあなたをあなたとして聞くことになります。内部では、これはより良い開始点を持つ同じゼロショット合成です。通話が進むにつれて、ライブウォームアップがさらに声を洗練させていきます。

録音は保存前に精査されます。3〜10秒のクリアな音声(シンセサイザーの入力ウィンドウ)である必要があります。小さすぎる、途切れる、ほとんど無音、または背景ノイズに埋もれている場合、カードは修正すべき点を伝え、もう一度録音を求めます。フレーズとして数字が選ばれたのには実用的な理由があります。数字は短く、23言語のどれでも認識可能であり、エンジンは10個すべてを聞き取ったことを確認できるため、「あの録音は成功したか?」という問いが目に見える「はい」に変わります。

2つの音声サンプル、2つのライフタイム

これはセキュリティや法務チームがすぐに尋ねる部分なので、率直に説明します。サンプルは2種類あり、それぞれの存続期間が異なります。

ミーティング中のウォームアップに使われるライブサンプルは一時的なものです。それはライブの会議セッションの間だけ、翻訳の音声化のために存在し、どこにも保存されません。リアルタイムセッションを支えるMind APIとSDKはデータを保持しません。会議セッションが終了すると、すべての一時的なものは消滅します。

Settingsからの保存済みサンプルは、あなたのアカウントに1つの目的で保存されます。それは、あなたがミーティングに参加するたびに翻訳エンジンに送信され、翻訳された音声をそれで音声化するためであり、それ以外の目的では使われません。カード上で削除を押すまで保持され、押すとすぐに標準のウォームアップに戻ります。また、アカウントと共に削除されます。ゲストは録音できません。これはサインイン済み機能として設計されています。

どちらのサンプルでもないことを正確にしておく価値があります。これらはInterMINDの録音機能の1つではありません。ミーティングのビデオと音声を録音することは、それ自体の制御を持つ、意図的な別個のアクションです。音声サンプルは音声シンセサイザーへの入力です。ライブの場合は一時的であり、保存済みの場合はあなたが保持または削除するものです。

なぜ他の誰もこれを提供しないのか

声のクローニングが秘密なわけではありません。問題は、ライブで、参加者ごとに、双方向で、1秒未満の予算内で、23言語にわたり、あなたが求めなかったものを何も保存せずにそれを行うことが、ポッドキャスト用にオフラインで声をクローニングするのとは異なる問題だからです。

大手プラットフォームは、字幕の網羅性と単一の安全なナレーター音声のために翻訳を最適化しています。これはスケール時において安価で堅牢なデフォルトです。各話者自身の声を維持することは、合成ステージがすべての参加者を独立して追跡し、パイプラインの残りが従うのと同じレイテンシ予算内に収まる必要があることを意味します。私たちは独自のインフラ上に独自の音声エンジンを構築しました。これにより、そのトレードオフを私たちが決定できるようになっています。(なぜエンジンが独自のコードなのかについては、What one InterMIND meeting is built fromを参照してください。)

これが向かう先:リップシンク

あなたの声を保つことは、より大きな目標の半分です。もう半分はあなたの顔です。

現在、あなたは相手を相手自身の声で聞くことができますが、カメラを使用している場合、相手の唇は依然として実際に話した言葉(あなたが読めない言語)に合わせて動きます。次のステップはリップシンクです。話者の口の動きを翻訳された音声に再タイミングし、画面上で彼らがあなたの言語を話しているように見えるようにします。

この2つを組み合わせると、この作業の全体像が明確になります。共通の言語を持たない2人がビデオ通話越しに座り、お互いが相手の言語のネイティブスピーカーであるかのように見聞きします。同じ声、同じ顔、間に通訳者はおらず、台本を読み上げるロボットもいません。

ステータスについて明確にしておきます。音声は今日ライブで利用可能ですが、リップシンクはロードマップにあり、まだ提供されていません。 私たちが目的地を明示するのは、それが音声に関する作業が重要な理由だからです。自分自身の声での翻訳は機能そのものではなく、「誰とでも、どんな言語でも、自分自身として話す」という目標の前半部分なのです。

どこで聞けるか

自分自身の声での翻訳は、今日、すべての23の音声言語でライブで利用可能です。これらはドキュメントに記載されている言語と同じです。個別に有効にするものはありません。ミーティングで翻訳が有効になると、参加者は自動的にお互いを自身の声で聞くことができます。現在の状況について正直に言えば、今日の音声はすでに明らかにあなたであり、私たちはその類似性をさらに高めるための作業を積極的に進めています。ぜひ自分の耳で聞いてみて判断してください。

翻訳されたミーティングは、実際にそこにいる人々がお互いに話しているように感じられるべきです。あなたの声を保つことは、それを実現するための手段です。

メールで新しい投稿とプロダクトアップデートを受け取る

月1回、新しい投稿とプロダクトのアップデートをお届けするメールをお送りします。いつでも解除できます。