用您自己的声音——说出您不会说的语言
实时翻译中有一个几乎所有人都搞错、却几乎没人谈论的环节:您听到的声音。
即使语音识别和翻译都很出色,会议仍可能让人感觉像是一台机器在朗读清单。因为最后一步——将翻译后的文本重新转换为声音——正是大多数工具悄悄用单一通用合成声音替代您的地方。八个人在会议室里,却只有同一个机器人的声音代表所有人。您失去了说话者的身份、语气和个性。听得懂,但不是对话。
InterMIND 在最后一步上与众不同。当您说话时,其他参与者听到的翻译声音明显是您的——带着您的音色和说话方式——用他们的语言说出这些话。目前它还不是完美的模仿;关键在于那是您,而不是一个千篇一律的旁白,而且它还在不断改进。这适用于每位参与者,双向同时生效。
这篇文章是 Inside the four translation pipelines that run InterMIND 的补充章节:那篇文章解释了音频如何变成翻译后的音频。这一篇讲的是另一端传出来的是谁的声音。
大家都在用的默认方案,以及它为何平淡无味
如果您在大型会议平台上用过实时翻译,您一定熟悉那种声音。一个中性、节奏均匀的声音朗读着翻译内容。无论说话者是开场致辞的 CEO,还是开玩笑的同事,声音都一模一样。底层技术是采用单一固定语音模型的文本转语音(TTS),其设计假设是只要能听懂就够了。
在真实的会议中,光听懂是不够的。会议传达的信息有一半在于谁在说以及怎么说。剥离了声音,您就把讨论变成了一份碰巧被大声朗读出来的转录稿。人们不再相互回应,而是开始等待轮到自己发言。