あなた自身の声で話す — あなたが話せない言語で
リアルタイム翻訳において、ほぼすべての人が誤解し、ほとんど誰も語らない部分があります。それが**「あなたが聞く声」**です。
優秀な音声認識と優秀な翻訳があっても、最終的には機械がリストを読み上げているようなミーティングにしかなりません。なぜなら、最後のステップ(翻訳されたテキストを再び音声に変換する段階)で、ほとんどのツールは静かにあなた自身を単一の汎用的な合成ナレーターに置き換えてしまうからです。部屋に8人がいても、全員に対して1つのロボット音声です。誰が話しているのか、強調点、個性といったものが失われます。理解はできても、会話にはなりません。
InterMINDは、この最後のステップを変えています。あなたが話すと、他の参加者は明らかにあなた自身のものとわかる声で翻訳を聞きます。その声はあなたの音色や話し方を保ったまま、今度は彼らの言語で言葉を発します。まだ完璧な模倣ではありませんが、重要なのは、汎用のナレーターではなくあなた自身の声になるという点であり、そしてこれは改善されていくものです。この機能は、すべての参加者に対して、双方向かつ同時に機能します。
この記事は、Inside the four translation pipelines that run InterMINDの欠けていた章です。前回の記事ではオーディオがどのように翻訳されたオーディオになるかを説明しました。今回は、その先からどの声が出てくるのかについてです。
誰もが提供しているデフォルトと、それが平坦になる理由
大手ミーティングプラットフォームのいずれかでライブ翻訳を使ったことがあるなら、その音声をご存知でしょう。中立的で一定のペースの声が翻訳を読み上げます。話者がタウンホールミーティングを開くCEOであれ、冗談を言う同僚であれ、同じ声です。その裏にある技術は、1つの固定された音声モデルを使用したテキスト読み上げであり、インテリジェブル(理解可能)で十分であるという設計上の想定に基づいています。
しかし、実際のミーティングではそうはいきません。ミーティングが伝える情報の半分は、誰がどのように言っているかです。声を剥ぎ取れば、ディスカッションはたまたま声に出して読まれるトランスクリプトになってしまいます。人々はお互いに反応するのをやめ、自分の順番を待ち始めます。