架构

用您自己的声音发言——使用一种您不会说的语言

大多数实时翻译工具会用单一机械的旁白声音替代您。InterMIND 保留了您的声音:每位参与者听到的翻译都是原始发言者本人的声音。以下是级联系统的工作原理、设置中可选的已保存声音样本的作用,以及存储了哪些内容。

The Mind.com Team

用您自己的声音发言——使用一种您不会说的语言

用您自己的声音——说出您不会说的语言

实时翻译中有一个几乎所有人都搞错、却几乎没人谈论的环节:您听到的声音

即使语音识别和翻译都很出色,会议仍可能让人感觉像是一台机器在朗读清单。因为最后一步——将翻译后的文本重新转换为声音——正是大多数工具悄悄用单一通用合成声音替代的地方。八个人在会议室里,却只有同一个机器人的声音代表所有人。您失去了说话者的身份、语气和个性。听得懂,但不是对话。

InterMIND 在最后一步上与众不同。当您说话时,其他参与者听到的翻译声音明显是您的——带着您的音色和说话方式——用他们的语言说出这些话。目前它还不是完美的模仿;关键在于那是,而不是一个千篇一律的旁白,而且它还在不断改进。这适用于每位参与者,双向同时生效。

这篇文章是 Inside the four translation pipelines that run InterMIND 的补充章节:那篇文章解释了音频如何变成翻译后的音频。这一篇讲的是另一端传出来的是谁的声音。


大家都在用的默认方案,以及它为何平淡无味

如果您在大型会议平台上用过实时翻译,您一定熟悉那种声音。一个中性、节奏均匀的声音朗读着翻译内容。无论说话者是开场致辞的 CEO,还是开玩笑的同事,声音都一模一样。底层技术是采用单一固定语音模型的文本转语音(TTS),其设计假设是只要能听懂就够了。

在真实的会议中,光听懂是不够的。会议传达的信息有一半在于在说以及怎么说。剥离了声音,您就把讨论变成了一份碰巧被大声朗读出来的转录稿。人们不再相互回应,而是开始等待轮到自己发言。

InterMIND 的不同做法

翻译以级联流水线方式运行——三个专门的阶段依次进行,而不是用一个模型试图完成所有事情。前两个阶段在 pipelines post 中已有介绍;本文要讲的是语音阶段:

  1. ASR — 语音识别。 您的话语在您说话的同时被转录为您的母语,运行在我们自己的引擎上——承载通话的媒体服务器(Mind API,OVH France)——因此翻译可以在句子结束前就开始。
  2. MT — 翻译。 转录文本被分组为稳定的句子片段——子句——这样翻译可以在您说完整个句子之前就开始,每个片段逐步翻译成听众的语言。
  3. Zero-shot TTS — 语音合成。 每个翻译后的片段被使用您自己的声音样本合成并传输给听众。

正是第三个阶段——ASR → MT → zero-shot TTS——产生了这种效果。“Zero-shot”意味着系统不需要预先录制的注册音频或针对您声音的训练环节。它直接从您正在参与的会议音频中建模您的声音。

预热:为什么它能这么快听起来像您

“使用您自己的声音样本”背后隐藏着一个鸡生蛋蛋生鸡的问题。在通话刚开始时,系统还没有听到足够的您的声音来很好地建模。

InterMIND 通过渐进式预热来解决这个问题:

  • 大约在前 5–10 秒,当系统还在收集足够的语音时,每个翻译片段的合成使用的是与您在源语言中刚刚说过的内容相匹配的音频片段。发音锚定在您真实的即时语音上。
  • 一旦样本足够长——达到 5–10 秒的节点——系统锁定该样本,并用它来为之后的所有内容发音。

在实际体验中,您听不到开关切换的痕迹。随着对话的进行,翻译听起来越来越像您——不是对您声音的完美复刻,但明显是您的声音而不是机器的,并且随着模型听到更多内容而不断改进。渐进式翻译(按子句而非按整句)和渐进式发音相结合,使整个过程在保持低延迟的同时依然听起来像真人。

录制一次您的声音,跳过预热

上面的预热是默认行为,无需任何设置。自 2026 年 9 月起,已登录用户有一个可选的第二路径:在 Settings → Your voice in translation 中保存声音样本

录制只需一个动作。按下 Record my voice,等待 Speak now 提示,然后以任意顺序说出一到十的数字。当语音引擎听到每个数字时,卡片上对应的数字会亮起;当十个数字全部亮起后,样本会自动检查并保存。无需回放或确认,也没有倒计时:卡片会保留您录制中包含数字的那段音频。安静的房间和头戴式耳机能带来最佳效果。

保存样本带来的改变:从您的下一次会议开始,合成器会从第一个片段起使用该样本为您的翻译发音,因此对方听到的您从一开始就是真实的您,而无需经过预热。其底层原理是相同的 zero-shot 合成,只是起点更好;实时预热仍会在通话过程中继续优化声音。

录制内容在存储前会经过检测。它必须是 3 到 10 秒的清晰语音(合成器的输入窗口):如果太安静、被截断、大部分是静音或被背景噪音淹没,卡片会告诉您需要修正什么,并要求重新录制。选择数字作为录制内容有一个实际原因:它们简短,在 23 种语言中都能被识别,并且引擎可以确认它听到了全部十个数字,这将“刚才录制成功了吗?”变成了一个可见的确认。

两种声音样本,两种生命周期

这是安全或法务团队会立即询问的部分,所以这里直接说明。有两种不同的样本,它们的存在方式不同。

用于会议预热的实时样本临时的。它仅存在于实时会议会话中,用于为翻译发音,不进行任何存储。支持实时会话的 Mind API 和 SDK 不保留任何数据;所有临时数据在会议会话结束后即被销毁。

来自 Settings 的保存样本存储在您的账户中,仅用于一个目的:每次您加入会议时,它会被发送到翻译引擎,以便您的翻译语音可以用它来发音,仅此而已。它会一直保留,直到您在卡片上按下 Remove,这会立即让您回到标准预热流程;当您删除账户时,它也会一并被删除。访客无法录制样本;这是设计上仅限已登录用户使用的功能。

有必要明确这两个样本不是什么:它们不是 InterMIND 的录制功能。录制会议的视频和音频是一项独立的、您有意采取的明确操作,有其独立的控制选项。声音样本是语音合成器的输入:在实时场景中是转瞬即逝的,在保存场景中则由您决定保留或删除。

为什么没有其他人提供这个功能

并不是说语音克隆是什么秘密。而是要实时、按参与者、双向、在一秒延迟预算内、跨 23 种语言、且不存储任何您未要求存储的内容,这与离线为播客克隆声音是完全不同的问题。

大型平台将翻译优化为字幕覆盖和单一安全的旁白声音——这是规模化下廉价且稳健的默认选择。保留每位说话者自己的声音意味着合成阶段必须独立跟踪每位参与者,并保持在流水线其余部分相同的延迟预算内。我们自主构建了语音引擎,运行在自己的基础设施上,这使得我们可以自己做这项权衡。(关于为什么引擎使用我们自己的代码的更多信息:What one InterMIND meeting is built from。)

下一步:唇形同步

保留您的声音只是一个更大目标的一半。另一半是您的面部

现在您可以听到对方用自己的声音说话,但如果开启摄像头,他们的嘴唇仍然会根据他们实际说的话——用一种您看不懂的语言——来开合。下一步是唇形同步:将说话者的嘴部动作与翻译后的音频重新同步,使他们在您的屏幕上看起来像是在说您的语言。

将两者结合,这项工作的整体目标就清晰了。两个没有共同语言的人坐在视频通话两端,看到和听到对方就像每个人都是对方语言的母语者——同样的声音,同样的面孔,中间没有传译员,也没有朗读脚本的机器人。

关于当前状态需要说明:声音功能现已上线;唇形同步在路线图上,尚未发布。 我们指出这个目标是因为它是声音工作的意义所在——保留原声翻译不是最终功能,它是“以您本来的样子,用任何语言与任何人交谈”的第一步。

在哪里体验

保留原声翻译今天已在所有 23 种语音语言中上线——与 docs 中列出的语言相同。无需单独开启:当会议中启用翻译时,参与者会自动听到彼此用自己的声音说话。我们会坦诚说明现状:今天的声音已经明显是的,我们也在积极推动相似度更近一步。去听听,自行判断。

一场翻译后的会议应该感觉像是真正参与其中的人在互相交谈。保留您的声音,正是实现这一目标的方式。

通过电子邮件获取新文章和产品更新

每月一封电子邮件,包含新文章和产品更新。随时可取消订阅。