당신의 목소리로 — 당신이 구사하지 못하는 언어로
실시간 번역에서 거의 모든 사람이 잘못 이해하고, 거의 아무도 말하지 않는 부분이 있습니다. 바로 당신이 듣는 목소리입니다.
뛰어난 음성 인식과 뛰어난 번역을 갖추더라도, 여전히 기계가 목록을 읽어주는 듯한 회의가 될 수 있습니다. 마지막 단계 — 번역된 텍스트를 다시 소리로 바꾸는 단계 — 에서 대부분의 도구는 조용히 당신을 하나의 평범한 합성 내레이터로 대체하기 때문입니다. 회의실에 여덟 명이 있어도 모두에게 하나의 로봇 목소리가 쓰입니다. 누가 말하고 있는지, 강조점, 개성을 잃게 됩니다. 알아들을 수는 있지만, 대화가 아닙니다.
InterMIND은 마지막 단계를 다르게 처리합니다. 당신이 말할 때, 다른 참가자들은 분명히 당신 것으로 식별되는 목소리로 번역을 듣습니다 — 당신의 음색과 당신의 말투를 담은, 이제 그들의 언어로 말해지는 목소리로. 아직 완벽한 모방은 아닙니다; 핵심은 평범한 내레이터가 아닌 당신이라는 점이며, 계속 나아지고 있습니다. 이는 모든 참가자에게, 양방향으로, 동시에 작동합니다.
이 글은 InterMIND을 구동하는 네 개의 번역 파이프라인 내부의 빠진 챕터입니다: 그 글은 오디오가 번역된 오디오가 되는 과정을 설명했고, 이 글은 그 반대편에서 누구의 목소리가 나오는지에 관한 것입니다.
모두가 출시하는 기본값, 그리고 왜 그것이 단조로운지
대형 회의 플랫폼 어디서든 실시간 번역을 사용해 보았다면 그 소리를 아실 것입니다. 중립적이고 균일한 속도의 목소리가 번역을 읽어줍니다. 발표자가 전사 회의를 여는 당신의 CEO이든, 농담을 건네는 동료이든 같은 목소리입니다. 그 아래의 기술은 하나의 고정된 음성 모델을 사용하는 텍스트-투-스피치이며, 설계 가정은 "알아들을 수 있으면 충분하다"는 것입니다.
실제 회의에서는 그렇지 않습니다. 회의가 전달하는 것의 절반은 누가 말하는지, 어떻게 말하는지입니다. 목소리를 벗겨내면 토론은 소리 내어 읽히는 전사본이 되어 버립니다. 사람들은 서로에게 반응하는 대신 자신의 차례를 기다리기 시작합니다.