본인만의 목소리
본인만의 목소리
InterMIND이 다른 참가자를 위해 귀하의 발언을 번역할 때, 참가자는 기계적인 텍스트 음성 변환 내레이터를 듣는 것이 아닙니다. 대신 음색과 말하는 방식을 그대로 유지한 채 그들의 언어로 말하는, 분명히 본인의 것임을 알 수 있는 목소리를 듣게 됩니다.
이 기능은 양방향으로 작동하며 각 참가자별로 독립적으로 적용됩니다. 5명이 5개의 다른 언어를 사용하는 회의에서 각 참가자는 다른 4명의 말을 자신의 언어로 듣게 되며, 말하는 4명의 목소리도 각자 본래의 목소리로 전달됩니다.
어떻게 들리나요
대부분의 실시간 번역 도구는 화자를 단일하고 일반적인 합성 음성으로 대체합니다. 그 결과 의미는 전달되지만 단조로우며, 누가 말하고 있는지, 억양이나 개인의 특성을 파악하기 어렵습니다. InterMIND은 화자의 목소리를 유지합니다. 따라서 번역된 회의는 기계가 읽어주는 안내 방송의 나열이 아니라, 실제 참석한 사람들 사이의 자연스러운 대화처럼 느껴집니다.
작동 방식
InterMIND은 캐스케이드 파이프라인을 사용하며, 목소리 생성은 그 마지막 단계입니다:
- 음성 인식 — 말하는 즉시 귀하의 언어로 발언이 전사됩니다.
- 세그먼테이션 — 문장을 끝맺기 전에 번역을 시작할 수 있도록, 전사된 텍스트를 안정적인 문장 조각(절) 단위로 그룹화합니다.
- 번역 — 각 조각은 청취자의 언어로 점진적으로 번역됩니다.
- 음성 합성 — 번역된 각 조각은 귀하 자신의 목소리 샘플을 사용하여 발화되고 청취자에게 전송됩니다.
회의 중 귀하의 목소리를 모델링할 만큼 충분한 음성 데이터가 수집되는 동안(대략 처음 5~10초), 음성 합성은 원본 언어로 방금 말한 내용과 일치하는 오디오 조각을 사용합니다. 충분히 긴 샘플이 확보되면 이후의 모든 음성에 해당 샘플을 사용하도록 전환됩니다. 실제로는 이러한 전환이 일어나는지 느끼지 못할 정도로 자연스럽습니다. 통화가 진행될수록 번역은 점점 더 귀하의 목소리처럼 들립니다. 완벽하게 모방한 목소리는 아니지만, 일반적인 합성 내레이터가 아닌 분명한 '귀하'의 목소리로 들리며, 모델이 더 많은 음성을 들을수록 계속해서 개선됩니다.
지원 언어
본인 목소리 번역은 모든 24개 음성 언어에서 사용 가능합니다 — 언어 선택에 나열된 언어 세트와 동일합니다. 별도로 켜야 할 설정은 없습니다. 번역 기능이 켜져 있으면 참가자들은 자동으로 귀하의 본래 목소리로 귀하의 말을 듣게 됩니다.
프라이버시
합성에 사용되는 음성 샘플은 일시적입니다. 이 샘플은 실시간 회의가 진행되는 동안에만 존재하며 어디에도 저장되지 않습니다. 실시간 세션을 구동하는 Mind API와 SDK는 회의 세션이 종료되면 데이터를 보관하지 않습니다. 이 음성 샘플은 InterMIND의 비디오 및 음성 녹화 기능과는 무관합니다. 해당 기능은 사용자가 의도적으로 시작하는 별도의 명시적인 기록입니다.
로드맵: 립싱크
번역을 본인의 목소리로 듣는 것은 더 큰 목표를 향한 첫 번째 단계입니다. 우리가 작업 중인 다음 단계는 립싱크입니다. 이는 번역된 오디오에 맞춰 화자의 입술 움직임을 카메라 상에서 재조정하여, 각 참가자가 상대방의 언어를 말하는 것처럼 보이게 하는 기능입니다. 본인 목소리 번역과 결합하여, 공통 언어가 없는 사람들도 서로가 상대방의 언어를 모어로 구사하는 것처럼 보이고 들리는 통화 환경을 목표로 하고 있습니다.
이 기능은 로드맵 항목으로 아직 출시되지 않았습니다 — 위에서 설명한 본인 목소리 번역은 현재 사용 가능합니다.