아키텍처

자신만의 목소리로 — 할 줄 모르는 언어로

대부분의 실시간 번역 도구는 당신을 단일한 로봇 내레이터로 대체합니다. InterMIND는 당신의 목소리를 유지합니다. 모든 참가자는 원래 발언자 본연의 목소리로 번역을 듣게 됩니다. 캐스케이드 방식이 이를 어떻게 수행하는지, 설정의 선택적 저장 음성 샘플이 어떤 효과를 더하는지, 그리고 어떤 데이터가 저장되는지 확인해 보세요.

The Mind.com Team

자신만의 목소리로 — 할 줄 모르는 언어로

당신의 목소리로 — 당신이 구사하지 못하는 언어로

실시간 번역에서 거의 모든 사람이 잘못 이해하고, 거의 아무도 말하지 않는 부분이 있습니다. 바로 당신이 듣는 목소리입니다.

뛰어난 음성 인식과 뛰어난 번역을 갖추더라도, 여전히 기계가 목록을 읽어주는 듯한 회의가 될 수 있습니다. 마지막 단계 — 번역된 텍스트를 다시 소리로 바꾸는 단계 — 에서 대부분의 도구는 조용히 당신을 하나의 평범한 합성 내레이터로 대체하기 때문입니다. 회의실에 여덟 명이 있어도 모두에게 하나의 로봇 목소리가 쓰입니다. 누가 말하고 있는지, 강조점, 개성을 잃게 됩니다. 알아들을 수는 있지만, 대화가 아닙니다.

InterMIND은 마지막 단계를 다르게 처리합니다. 당신이 말할 때, 다른 참가자들은 분명히 당신 것으로 식별되는 목소리로 번역을 듣습니다 — 당신의 음색과 당신의 말투를 담은, 이제 그들의 언어로 말해지는 목소리로. 아직 완벽한 모방은 아닙니다; 핵심은 평범한 내레이터가 아닌 당신이라는 점이며, 계속 나아지고 있습니다. 이는 모든 참가자에게, 양방향으로, 동시에 작동합니다.

이 글은 InterMIND을 구동하는 네 개의 번역 파이프라인 내부의 빠진 챕터입니다: 그 글은 오디오가 번역된 오디오가 되는 과정을 설명했고, 이 글은 그 반대편에서 누구의 목소리가 나오는지에 관한 것입니다.


모두가 출시하는 기본값, 그리고 왜 그것이 단조로운지

대형 회의 플랫폼 어디서든 실시간 번역을 사용해 보았다면 그 소리를 아실 것입니다. 중립적이고 균일한 속도의 목소리가 번역을 읽어줍니다. 발표자가 전사 회의를 여는 당신의 CEO이든, 농담을 건네는 동료이든 같은 목소리입니다. 그 아래의 기술은 하나의 고정된 음성 모델을 사용하는 텍스트-투-스피치이며, 설계 가정은 "알아들을 수 있으면 충분하다"는 것입니다.

실제 회의에서는 그렇지 않습니다. 회의가 전달하는 것의 절반은 누가 말하는지, 어떻게 말하는지입니다. 목소리를 벗겨내면 토론은 소리 내어 읽히는 전사본이 되어 버립니다. 사람들은 서로에게 반응하는 대신 자신의 차례를 기다리기 시작합니다.

InterMIND이 대신 하는 것

번역은 계단식 파이프라인으로 실행됩니다 — 모든 것을 하나의 모델이 처리하려 하는 대신, 세 개의 특화된 단계가 순차적으로 이어집니다. 처음 두 단계는 파이프라인 글에서 다루었습니다; 목소리 단계가 바로 이 글의 주제입니다:

  1. ASR — 음성 인식. 당신의 말은 당신이 말하는 즉시, 당신의 언어로, 당사 자체 엔진 — 통화를 전달하는 미디어 서버(Mind API, OVH France) — 에서 전사되어, 문장이 끝나기도 전에 번역이 시작될 수 있습니다.
  2. MT — 번역. 전사본은 안정적인 문장 단위인 *절(clause)*로 묶여, 문장을 끝마치기 전에 번역이 시작될 수 있으며, 각 조각은 점진적으로 청자의 언어로 번역됩니다.
  3. Zero-shot TTS — 음성 합성. 각 번역된 조각은 당신 자신의 목소리 샘플을 사용하여 다시 말해지며, 청자에게 스트리밍됩니다.

이 효과를 만들어내는 것은 세 번째 단계 — ASR → MT → zero-shot TTS — 입니다. "Zero-shot"은 시스템이 당신의 목소리를 위해 사전 녹음된 등록 데이터나 학습 세션을 필요로 하지 않는다는 뜻입니다. 이미 진행 중인 회의의 오디오로부터 당신의 목소리를 모델링합니다.

워밍업: 어떻게 이렇게 빨리 당신처럼 들리기 시작하는지

"당신 자신의 목소리 샘플을 사용한다"에는 닭과 달걀의 문제가 숨어 있습니다. 통화의 맨 처음에는 시스템이 당신의 목소리를 제대로 모델링할 만큼 충분히 당신을 듣지 못했습니다.

InterMIND은 이를 점진적 워밍업으로 처리합니다:

  • 대략 처음 5–10초 동안, 아직 당신의 발화를 충분히 모으는 동안, 각 번역 조각은 원어에서 당신이 방금 말한 것과 일치하는 오디오 조각을 사용하여 합성됩니다. 발화는 당신의 실제이자 즉각적인 말에 고정됩니다.
  • 충분히 긴 샘플이 잡히면 — 5–10초 지점 — 시스템은 그것에 고정하고 이후 모든 것을 목소리로 내는 데 사용합니다.

실제로는 스위치가 넘어가는 소리를 듣지 못합니다. 대화가 진행될수록 번역은 점점 더 당신처럼 들립니다 — 당신 목소리의 완벽한 복제는 아니지만, 기계의 것보다 분명히 당신의 것이며, 모델이 더 많이 들을수록 개선됩니다. 점진적 번역(문장이 아닌 절 단위로)과 점진적 발화의 조합이 전체를 지연 예산 안에 유지하면서도 사람처럼 들리게 만드는 것입니다.

목소리를 한 번 녹음하고, 워밍업을 건너뛰세요

위의 워밍업은 아무것도 설정하지 않았을 때 기본적으로 일어나는 일입니다. 2026년 9월부터 로그인한 사용자에게 선택적 두 번째 경로가 있습니다: 설정 → 번역에서 당신의 목소리에 있는 저장된 목소리 샘플입니다.

녹음은 한 번의 동작입니다. 내 목소리 녹음을 누르고, 지금 말하세요가 표시되기를 기다린 뒤, 1부터 10까지의 숫자를 아무 순서로나 말하세요. 각 숫자는 음성 엔진이 들으면서 카드에서 켜지며, 열 개 모두 켜지면 샘플이 점검되어 자동으로 저장됩니다. 재생하거나 확인할 것은 없고, 카운트다운도 없습니다: 카드가 숫자를 담은 녹음 구간을 보관합니다. 조용한 방과 헤드셋이 최상의 결과를 줍니다.

저장된 샘플이 바꾸는 것: 다음 회의부터, 합성기는 첫 번째 조각부터 그것으로 당신의 번역을 발화하므로, 상대방은 워밍업 이후가 아닌 첫 문장부터 당신을 당신으로 듣습니다. 내부적으로는 더 나은 시작점을 가진 동일한 zero-shot 합성입니다; 통화가 진행되는 동안 라이브 워밍업은 여전히 목소리를 다듬습니다.

녹음은 저장되기 전에 검사됩니다. 3~10초의 선명한 발화(합성기의 입력 윈도우)여야 합니다: 너무 조용하거나, 잘리거나, 대부분 침묵이거나 배경 소음에 묻히면, 카드가 무엇을 고쳐야 할지 알려주며 다시 녹음을 요청합니다. 숫자를 문구로 선택한 것은 실용적인 이유가 있습니다: 짧고, 23개 언어 모두에서 인식 가능하며, 엔진이 10개를 모두 들었음을 확인할 수 있어 "녹음이 잘 되었나요?"를 눈에 보이는 '예'로 바꿉니다.

두 개의 목소리 샘플, 두 가지 보존 기한

이 부분은 보안 또는 법무 팀이 즉시 묻는 부분이며, 그래서 분명히 적겠습니다. 두 개의 다른 샘플이 있으며, 보관 방식이 다릅니다.

라이브 샘플은 회의 중 워밍업에 사용되며 일시적입니다. 라이브 회의 세션 동안에만, 번역의 발화를 위해 존재하며, 어디에도 저장되지 않습니다. 실시간 세션을 구동하는 Mind API와 SDK는 어떤 데이터도 보관하지 않습니다; 모든 일시적 데이터는 회의 세션이 종료되면 사라집니다.

저장된 샘플은 설정에서 보관되며, 당신의 계정과 함께, 단일 목적을 위해 보관됩니다: 회의에 참여할 때마다 번역 엔진에 전송되어 당신의 번역된 발화를 이 목소리로 낼 수 있게 하며, 그 외의 용도로는 쓰이지 않습니다. 카드에서 제거를 누르기 전까지 유지되며(누르면 표준 워밍업으로 즉시 돌아갑니다), 그리고 계정과 함께 삭제됩니다. 게스트는 이를 녹음할 수 없습니다; 설계상 로그인한 사용자의 기능입니다.

두 샘플 모두 무엇이 아닌지를 정확히 짚어둘 가치가 있습니다: InterMIND의 녹음 기능 중 하나가 아닙니다. 회의의 비디오와 오디오를 녹음하는 것은 별도의, 의도적인 행동이며 자체 제어가 있습니다. 목소리 샘플은 음성 합성기의 입력입니다: 라이브의 경우 일시적이며, 저장된 샘플의 경우 당신이 보관하거나 삭제할 수 있는 것입니다.

왜 다른 누구도 이것을 출시하지 않는지

음성 복제가 비밀이어서가 아닙니다. 그것을 라이브로, 참가자별로, 양방향으로, 1초 예산 안에서, 23개 언어에 걸쳐, 당신이 요청하지 않은 것은 아무것도 저장하지 않고 실행하는 것이, 팟캐스트를 위해 오프라인으로 목소리를 복제하는 것과는 다른 문제이기 때문입니다.

대형 플랫폼들은 번역을 자막 커버리지와 안전한 단일 내레이터 목소리에 맞춰 최적화합니다 — 이것이 대규모에서 저렴하고 견고한 기본값입니다. 각 발표자 자신의 목소리를 유지한다는 것은 합성 단계가 모든 참가자를 독립적으로 추적해야 하며, 파이프라인의 나머지가 작동하는 동일한 지연 예산 내에 머물러야 함을 의미합니다. 당사는 목소리 엔진을 당사 자체 인프라에서 자체 구축했으며, 바로 이것이 그 트레이드오프를 당사가 결정할 수 있게 만듭니다. (엔진이 자체 코드인 이유에 대한 더 많은 내용: 하나의 InterMIND 회의가 무엇으로 구성되는지.)

앞으로의 방향: 립싱크

당신의 목소리를 유지하는 것은 더 큰 목표의 절반입니다. 나머지 절반은 당신의 얼굴입니다.

지금은 상대방의 목소리를 그들 자신의 목소리로 듣지만, 카메라를 켜면 그들의 입술은 여전히 그들이 실제로 말한 단어 — 당신이 이해할 수 없는 언어로 — 에 맞춰 움직입니다. 다음 단계는 립싱크입니다: 발표자의 입 모양을 번역된 오디오에 맞게 다시 타이밍하여, 당신의 화면에서 그들이 당신의 언어를 말하는 것처럼 보이게 하는 것입니다.

둘을 합치면 이 작업의 전체 목적이 분명해집니다. 공유 언어가 없는 두 사람이 영상 통화 양편에 앉아, 서로가 상대방 언어의 원어민인 것처럼 서로를 보고 듣습니다 — 같은 목소리, 같은 얼굴, 중간에 통역사 없이, 대본을 읽는 로봇 없이.

상태를 분명히 하자면: 목소리는 오늘 라이브입니다; 립싱크는 로드맵에 있으며, 출시되지 않았습니다. 당사가 도착점을 강조하는 것은 그것이 목소리 작업이 중요한 이유이기 때문입니다 — 자기 목소리 번역은 기능이 아니라, "모두와, 어떤 언어로든, 당신 자신으로 대화하세요"의 절반입니다.

어디서 들을 수 있는지

자기 목소리 번역은 오늘, 모든 23개 음성 언어에서 라이브입니다 — 문서에 나열된 것과 동일한 언어입니다. 따로 켤 것은 없습니다: 회의에서 번역이 켜지면, 참가자들은 자동으로 서로를 자신의 목소리로 듣습니다. 어디까지 왔는지 솔직히 말씀드리면: 오늘 목소리는 이미 분명히 당신이며, 닮음은 당사가 적극적으로 더 가까이 밀어붙이고 있는 부분입니다. 가서 직접 듣고 판단해 보세요.

번역된 회의는 실제로 그 안에 있는 사람들이 서로 대화하는 것처럼 느껴져야 합니다. 당신의 목소리를 유지하는 것이 그곳에 도달하는 방법입니다.

이메일로 새 게시물 및 제품 업데이트 받기

새 글 및 제품 업데이트가 포함된 이메일을 매월 한 번 발송합니다. 언제든지 구독을 취소할 수 있습니다.