架构

用您自己的声音说话——用一种您不会说的语言

大多数实时翻译工具会用一个单一的机械合成音来代替您。InterMIND 保留了您的声音:每位参与者都能听到带有原说话者本人声音的翻译。以下是级联流水线如何实现这一点——以及为什么语音样本绝不存储。

The Mind.com Team

用您自己的声音说话——用一种您不会说的语言

用您自己的声音说话——用一种您不会说的语言

这里是实时翻译中几乎所有人都会弄错、而且几乎没有人谈论的部分:您听到的声音。

即使您拥有出色的语音识别和出色的翻译,最终可能仍是一场感觉像机器在朗读清单的会议。因为最后一步——将翻译好的文本重新转换为声音——正是大多数工具悄悄用单一的通用合成音代替的地方。房间里有八个人,却全用同一个机械音。您失去了说话人的身份、语气和个性。听得懂,但这不是对话。

InterMIND 在最后一步的做法不同。当您说话时,其他参与者听到的翻译声音明显是您的——带着您的音色和说话方式——只不过现在说的是他们语言的词汇。目前它还不是完美的模仿;关键在于这是的声音,而不是千篇一律的旁白,而且它还在不断改进。这适用于每一位参与者,双向同时进行。

这篇文章是《运行 InterMIND 的四大翻译流水线探秘》的缺失章节:那篇文章解释了音频如何变成翻译后的音频。这篇则关于另一端传出的究竟是谁的声音。


所有人都在发布的默认方案,以及为什么它很平淡

如果您曾在任何大型会议平台上使用过实时翻译,您就会熟悉那种声音。一个中性、节奏平稳的声音朗读着翻译内容。无论说话人是正在开启全员大会的 CEO,还是在讲笑话的同事,声音都是一样的。其底层技术是采用单一固定语音模型的文本转语音(TTS),而设计假设是“听得懂就够了”。

在真实的会议中,这并不够。会议传达的信息中,有一半在于是谁在说以及怎么说。剥离了声音,您就把一场讨论变成了一份碰巧被大声朗读出来的文字记录。人们不再相互交流反应,而是开始等待轮到自己发言。

InterMIND 的不同做法

翻译作为一个级联流水线运行——三个按顺序执行的专业阶段,而不是由一个模型试图完成所有事情。前两个阶段在流水线文章中已有介绍;语音步骤正是本文的主题:

  1. ASR — 语音识别。 您的言语在您说话时,直接在您的浏览器中以您的母语被转录。(在本地运行节省了一次往返,并在翻译开始前提供了尽可能低的延迟。)
  2. MT — 翻译。 转录的文本被分组为稳定的句子片段——从句——因此翻译可以在您说完整个句子之前就开始,并且每个片段会渐进地翻译成听众的语言。
  3. Zero-shot TTS — 语音合成。 每个翻译后的片段都会使用您自己声音的样本进行合成回放,并流式传输给听众。

正是这第三个阶段——ASR → MT → zero-shot TTS——产生了这种效果。“Zero-shot”意味着系统不需要为您的声音预先录制注册或进行训练。它直接根据您正在参加的会议音频来构建您的声音模型。

预热:它如何这么快就开始听起来像您

“使用您自己声音的样本”中隐藏着一个鸡生蛋还是蛋生鸡的问题。在通话最开始的阶段,系统还没有够您的声音,无法很好地建立您的声音模型。

InterMIND 通过渐进式预热来处理这个问题:

  • 大约在最初的 5 到 10 秒内,在系统仍在收集足够的语音片段时,每个翻译片段都是使用与您刚才在源语言中所说内容相匹配的音频片段来合成的。发音锚定在您真实、即时的语音上。
  • 一旦有了足够长的样本——即达到 5 到 10 秒的标记后——系统就会锁定它,并用它为之后的所有内容发音。

在实践中,您不会听到某种生硬的切换。随着对话的进行,翻译听起来越来越像您——虽然不是对您声音的完美复刻,但明显是您的声音而不是机器的,并且随着模型听到更多内容而不断改进。渐进式翻译(逐个从句而非逐句)与渐进式发音的结合,使得整个流程在保持低于延迟预算的同时,听起来依然具有人情味。

语音样本绝不存储

这正是安全或法务团队会立即询问的部分,所以这里直白地说明。

用于合成的语音样本是短暂存留的。它仅在实时会议期间存在,用于为翻译发音,并且绝不存储在任何地方。支持实时会议的 Mind API 和 SDK 不会保留任何数据——会议结束时,所有临时数据都会销毁。

有必要明确这个样本不是什么:它不是 InterMIND 的录制功能之一。录制会议的视频和音频是一项独立的、需要您刻意采取的专门操作,有其自身的控制选项。原音样本不是录制内容——它是语音合成器的临时输入,绝不会在通话结束后继续存在。

这不仅仅是隐私保护的问题。“用您自己的声音说话”正是那种听起来像是要在某个地方存储声纹的功能。但它并没有。如实讲述反而是更好的故事:您的声音在当下被建模,并在您挂断时消失。

为什么没有其他人提供这个功能

声音克隆并不是什么秘密。问题在于,实时、针对每个参与者、双向、在一秒的预算内、跨越 24 种语言、且不存储任何内容地完成这项工作,这与离线为播客克隆声音是完全不同的问题。

大型平台针对字幕覆盖率和单一安全的旁白声音优化了它们的翻译——这是大规模应用下廉价且稳健的默认选择。保留每位说话者自己的声音意味着合成阶段必须独立跟踪每位参与者,并保持在流水线其他部分所遵循的相同延迟预算内。我们在我们自己的基础设施上自行构建了语音引擎,这使得我们能够自主做出这种权衡。(关于为什么该引擎是我们自己的代码的更多信息:《一场 InterMIND 会议是由什么构成的》。)

未来的发展方向:唇形同步

保留您的声音只是更大目标的一半。另一半是您的

现在您可以听到对方用自己的声音说话,但如果开启了摄像头,他们的嘴唇仍然会配合他们实际说的话——即一种您看不懂的语言——在运动。下一步是唇形同步:将说话者的嘴部动作与翻译后的音频重新同步,这样在您的屏幕上,他们看起来就像是在说您的语言。

把这两者结合起来,这项工作的全部意义就清晰可见了。两个没有共同语言的人坐在视频通话的两端,看到和听到对方时,就好像每个人都是对方语言的母语者——同样的声音,同样的面孔,中间没有传译员,也没有机器人在念剧本。

明确一下当前状态:声音功能今天已上线;唇形同步在路线图中,尚未发布。 我们指出这个最终目标,是因为这正是声音功能如此重要的原因——原音翻译不是最终特性,它是“作为您自己,用任何语言与任何人交谈”的第一步。

在哪里体验它

原音翻译今天已上线,覆盖所有 21 种语音语言——与文档中列出的语言相同。无需单独开启:在会议中启用翻译后,参与者会自动听到对方用自己的声音说话。我们会如实告知其当前水平:今天的声音已经能明显听出是,而我们正在积极努力让相似度更高。去听听并亲自评判吧。

  • 尝试演示 — 在 24 种语言中的任意一种下,针对您的音频运行实时语音流水线。
  • 查看质量数据 — 相同的生产流水线,每月根据 FLORES-200 进行评分,并发布每个语言对的完整分布情况。
  • 文档中的工作原理 — 本文的精简版本。

一场经过翻译的会议,应该让人感觉是真正参与其中的人在相互交谈。保留您的声音正是实现这一目标的方式。

通过电子邮件接收新文章

我们将在发布新文章时通过电子邮件通知您。可随时取消订阅。