您自己的声音
您自己的声音
当 InterMIND 为另一位参与者翻译您的语音时,他们听到的不是机械的文本转语音旁白。他们听到的声音具有您的辨识度——承载着您的音色和说话方式——此刻正用他们的语言说出这些词汇。
这在双向交流中均有效,且对每位参与者独立起作用。在一场有五个人使用五种语言的会议中,每个人都能以自己的语言听到另外四个人的发言,且那四个人听上去依然保持他们各自的嗓音。
听感如何
大多数实时翻译工具都会用单一且通用的合成声音替代发言者。其结果虽然清晰可懂,但却平淡无奇——您会分不清是谁在说话,也感受不到语气强调和个性特征。InterMIND 保留了发言者的声音,因此一场被翻译的会议感觉就像是实际参与会议的人们之间的对话,而不是由机器朗读的一连串播报。
工作原理
InterMIND 使用级联流水线,而语音步骤是最后一个阶段:
- 语音识别 — 在您说话时,您的言辞会被转录为您自己的语言。
- 分段 — 转录文本被分组为稳定的句子片段(从句),以便在您说完话之前就能开始翻译。
- 翻译 — 每个片段会被逐步翻译为听众的语言。
- 语音合成 — 每个翻译后的片段都会使用您自己声音的样本进行播报,并发送给听众。
当会议仍在收集您足够的语音以建立您的声音模型时(大约在最初的 5–10 秒内),合成功能会使用与您刚才所说的源语言相匹配的音频片段。一旦样本足够长,它就会切换为使用该样本来处理之后的所有内容。在实际操作中,您不会察觉到切换的痕迹——随着通话的进行,翻译听起来会越来越像您。这不会是对您声音完美无缺的模仿,但听起来就是您,而不是通用的旁白——并且随着模型听到更多您的声音,它还会不断改进。
语言
您专属声音的翻译适用于所有 24 种语音语言——与选择语言中列出的集合相同。无需单独开启:当开启翻译时,参与者会自动听到用您自己的声音说出的内容。
隐私
用于合成的声音样本是临时性的。它仅在实时会议期间存在,且不会存储在任何地方——支持实时会话的 Mind API 和 SDK 在会议会话结束后不会保留任何数据。此声音样本与 InterMIND 的视频与语音录制功能无关,这些功能是您有意开启的独立且明确的录制。
路线图:唇形同步
用您自己的声音听到翻译只是更大目标的前半部分。我们正在努力的下一步是唇形同步——重新调整摄像头中发言者的口型,使其与翻译后的音频相匹配,从而让每位参与者看起来就像在说对方的语言。结合专属声音翻译,我们的目标是实现这样一通通话:没有共同语言的人们在视觉和听觉上感受到彼此,就像每个人都在用对方的母语交流一样。
这是路线图中的项目,尚未成为已发布的功能——上方的专属声音翻译目前已上线。