당신의 목소리로 말하세요 — 당신이 구사하지 못하는 언어로
실시간 번역에서 거의 모든 사람이 잘못 이해하고, 거의 아무도 이야기하지 않는 부분이 있습니다: 당신이 듣는 목소리입니다.
우수한 음성 인식과 우수한 번역을 갖추고도, 여전히 기계가 목록을 읽는 듯한 회의가 될 수 있습니다. 마지막 단계 — 번역된 텍스트를 다시 소리로 바꾸는 과정 — 에서 대부분의 도구가 조용히 당신을 단일 범용 합성 내레이터로 대체하기 때문입니다. 회의실에 여덟 명이 있어도, 모두를 위한 로봇 목소리 하나입니다. 누가 말하고 있는지, 억양, 개성을 잃게 됩니다. 알아들을 수는 있지만, 대화가 아닙니다.
InterMIND는 마지막 단계를 다르게 처리합니다. 당신이 말할 때, 다른 참가자들은 분명히 당신 것인 목소리로 번역을 듣습니다 — 당신의 음색과 말하는 방식을 담은 채, 이제 그들의 언어로 말합니다. 아직 완벽한 모방은 아닙니다; 핵심은 재고용된 내레이터가 아닌 당신이라는 점이며, 계속 개선되고 있다는 것입니다. 이 기능은 모든 참가자에게, 양방향으로, 동시에 작동합니다.
이 글은 InterMIND를 구동하는 네 가지 번역 파이프라인 내부의 누락된 챕터입니다: 해당 글은 오디오가 어떻게 번역된 오디오가 되는지를 설명했습니다. 이 글은 반대편에서 나오는 목소리가 누구의 것인지에 관한 것입니다.
모두가 출시하는 기본값, 그리고 그것이 평탄한 이유
대형 회의 플랫폼 중 어느 곳에서든 실시간 번역을 사용해 보셨다면, 그 소리를 아실 것입니다. 중립적이고 균일한 속도의 목소리가 번역을 읽어줍니다. 발화자가 타운홀을 여는 CEO든, 농담을 던지는 동료든 같은 목소리입니다. 그 아래의 기술은 하나의 고정된 음성 모델을 사용하는 텍스트-음성 변환이며, 설계 전제는 이해 가능성만으로 충분하다는 것입니다.
실제 회의에서는 그렇지 않습니다. 회의가 전달하는 것의 절반은 누가 말하는지, 그리고 어떻게 말하는지입니다. 목소리를 제거하면 토론을 우연히 소리 내어 읽는 대본으로 바꾸는 셈입니다. 사람들은 서로 반응하는 것을 멈추고 자신의 차례를 기다리기 시작합니다.
InterMIND가 대신 하는 것
번역은 캐스케이드 파이프라인으로 실행됩니다 — 하나의 모델이 모든 것을 처리하는 대신, 세 개의 전문화된 단계가 순차적으로 실행됩니다. 처음 두 단계는 파이프라인 글에서 다뤘습니다; 이 글의 주제인 목소리 단계는:
- ASR — 음성 인식. 당신의 말은 당신이 말하는 대로, 브라우저에서, 당신의 언어로 전사됩니다. (로컬에서 실행하면 왕복을 절약하고 번역이 시작되기 전의 지연을 최소화합니다.)
- MT — 번역. 전사본은 안정적인 문장 단위 — 절(clause) — 로 그룹화되어, 문장을 끝내기 전에 번역이 시작될 수 있으며, 각 단위는 점진적으로 청취자의 언어로 번역됩니다.
- Zero-shot TTS — 음성 합성. 각 번역된 단위는 당신의 목소리 샘플을 사용하여 다시 음성으로 합성되고 청취자에게 스트리밍됩니다.
이 세 번째 단계 — ASR → MT → zero-shot TTS — 가 이 효과를 만들어냅니다. "Zero-shot"은 시스템이 사전 녹음된 등록이나 음성 훈련 세션이 필요 없다는 의미입니다. 시스템은 당신이 현재 참여한 회의의 오디오에서 당신의 목소리를 모델링합니다.
워밍업: 어떻게 이렇게 빨리 당신처럼 들리기 시작하는가
"당신의 목소리 샘플을 사용한다"에는 달걀-닭 문제가 숨어 있습니다. 통화 시작 시점에는 시스템이 아직 당신의 목소리를 제대로 모델링할 만큼 충분히 듣지 못했습니다.
InterMIND는 점진적 워밍업으로 이를 처리합니다:
- 대략 처음 5–10초 동안, 충분한 음성을 수집하는 동안, 각 번역된 단위는 당신이 원래 언어에서 방금 말한 것과 일치하는 오디오 단위를 사용하여 합성됩니다. 음성은 당신의 실제, 즉각적인 말에 기반합니다.
- 충분히 긴 샘플이 확보되면 — 그 5–10초 시점 — 시스템은 그에 고정하고 이후 모든 것을 해당 샘플로 합성합니다.
실제로 스위치가 전환되는 것을 듣지 못합니다. 대화가 진행됨에 따라 번역이 점점 더 당신처럼 들립니다 — 당신 목소리의 완벽한 복제는 아니지만, 기계의 것이 아닌 분명히 당신의 것이며, 모델이 더 많이 들을수록 개선됩니다. 점진적 번역(문장이 아닌 절 단위로)과 점진적 음성 합성의 조합이 전체를 지연 예산 내에 유지하면서도 인간적으로 들리게 만드는 것입니다.
음성 샘플은 절대 저장되지 않습니다
이는 보안 또는 법무 팀이 즉시 묻는 부분이므로, 명확히 설명하겠습니다.
합성에 사용되는 음성 샘플은 **일시적(ephemeral)**입니다. 실시간 회의 세션 동안만, 번역 음성 합성을 위해 존재하며, 어디에도 저장되지 않습니다. 실시간 세션을 구동하는 Mind API와 SDK는 어떤 데이터도 보존하지 않습니다 — 모든 임시 데이터는 회의 세션이 종료되면 사라집니다.
이 샘플이 아닌 것에 대해 정확히 짚을 필요가 있습니다: 이것은 InterMIND의 녹음 기능 중 하나가 아닙니다. 회의의 비디오와 오디오를 녹음하는 것은 별도의, 의도적인 행위이며 고유한 컨트롤이 있습니다. 본인 목소리 샘플은 녹음이 아닙니다 — 통화보다 오래 존재하지 않는, 음성 합성기로의 일시적 입력입니다.
이는 단순한 프라이버시 관행을 넘어 중요합니다. "당신의 목소리로 말하세요"는 어딘가에 음성 지문(voiceprint)을 저장해야 할 것처럼 들리는 바로 그런 기능입니다. 그렇지 않습니다. 정직한 버전이 더 나은 스토리입니다: 당신의 목소리는 순간에 모델링되고 전화를 끊으면 사라집니다.
다른 누구도 이것을 출시하지 않는 이유
음성 복제가 비밀어서가 아닙니다. 실시간으로, 참가자별로, 양방향으로, 1초 예산 하에서, 24개 언어에 걸쳐, 아무것도 저장하지 않고 수행하는 것은 팟캐스트를 위해 오프라인으로 음성을 복제하는 것과는 다른 문제입니다.
대형 플랫폼들은 자막 커버리지와 단일 안전한 내레이터 목소리에 맞춰 번역을 최적화합니다 — 대규모에서 저렴하고 견고한 기본값입니다. 각 발화자의 본래 목소리를 유지하려면 합성 단계가 모든 참가자를 독립적으로 추적하고 파이프라인의 나머지가 따르는 것과 동일한 지연 예산 내에 머물러야 합니다. 우리는 자체 인프라에서 음성 엔진을 직접 구축했으며, 그것이 이 트레이드오프를 우리가 결정할 수 있게 하는 이유입니다. (엔진이 자체 코드인 이유에 대해서는 하나의 InterMIND 회의는 무엇으로 구성되는가를 참조하세요.)
이것이 나아가는 방향: 립싱크
목소리를 유지하는 것은 더 큰 목표의 절반입니다. 나머지 절반은 당신의 얼굴입니다.
지금은 상대방의 본래 목소리로 듣지만, 카메라를 켜고 있다면 그들의 입술은 여전히 실제로 말한 단어 — 당신이 읽을 수 없는 언어 — 에 맞춰 움직입니다. 다음 단계는 립싱크입니다: 발화자의 입술을 번역된 오디오에 맞춰 재타이밍하여, 당신의 화면에서 그들이 당신의 언어를 말하는 것처럼 보이게 하는 것입니다.
둘을 합치면 이 작업의 전체 목적이 명확해집니다. 공통 언어가 없는 두 사람이 화상 통화 양쪽에 앉아, 마치 각자가 상대방 언어의 원어민인 것처럼 서로를 보고 듣습니다 — 같은 목소리, 같은 얼굴, 중간에 통역사 없이, 대본을 읽는 로봇 없이.
상태에 대해 명확히 하자면: 음성은 현재 실시간으로 제공됩니다; 립싱크는 로드맵에 있으며, 아직 출시되지 않았습니다. 우리가 목적지를 언급하는 이유는 그것이 음성 작업이 중요한 이유이기 때문입니다 — 본인 목소리 번역은 기능 자체가 아니라 "누구든지, 어떤 언어든, 당신 자신으로 대화하기"의 전반부입니다.
어디서 들을 수 있는지
본인 목소리 번역은 현재 실시간으로, 모든 21개 음성 언어에서 제공됩니다 — 문서에 나열된 것과 동일한 언어입니다. 별도로 켤 것은 없습니다: 회의에서 번역이 활성화되면, 참가자들은 자동으로 서로의 본래 목소리로 듣습니다. 현재 상태에 대해 솔직히 말씀드리면: 오늘날 목소리는 이미 분명히 당신이며, 닮음 정도는 우리가 적극적으로 개선하고 있는 부분입니다. 직접 들어보고 판단해 보세요.
- 데모 체험하기 — 24개 언어 중 어느 것으로든 당신의 오디오에 대해 실시간 음성 파이프라인을 실행합니다.
- 품질 수치 확인하기 — 동일한 프로덕션 파이프라인을 FLORES-200에 대해 월간 측정하며, 언어 쌍별 전체 분포가 공개됩니다.
- 작동 방식, 문서에서 — 이 글의 요약 버전입니다.
번역된 회의는 실제로 참여한 사람들이 서로 대화하는 것처럼 느껴져야 합니다. 당신의 목소리를 유지하는 것이 그것을 달성하는 방법입니다.