InterMIND를 구동하는 4개의 번역 파이프라인 내부
mind.com의 이전 /product/overview/how-it-works 페이지는 여러 주요 릴리스가 뒤처져 있습니다. 이 페이지는 대부분의 벤더 페이지가 그렇듯 단일 "번역 엔진"을 설명하며, "당신이 말하면"에서 "그들이 듣는다"로 향하는 하나의 큰 화살표로 표현합니다. 그 그림은 2년 전에 이미 단순화된 것이었습니다. 오늘날에는 틀린 그림입니다.
실제로 InterMIND는 4개의 개별 번역 파이프라인을 실행하며, 각 파이프라인은 각기 다른 엔진, 다른 지연 시간 예산, 다른 품질 한계로 다른 문제를 해결합니다. 이들은 언어 선택기를 공유하지만, 엔진은 공유하지 않습니다.
이것이 "어떻게 작동하나요?"라는 질문에 대한 업데이트된 답변입니다.
관련 글: "지원하는 언어는 몇 개인가요?"는 각 파이프라인이 지원하는 범위(23 / 23 / 30 / 17)를 다룹니다. 이 글은 각 파이프라인이 수행하는 작업과 각 파이프라인이 독립적인 이유를 다룹니다.
"모든 것을 위한 하나의 엔진"이 거짓인 이유
실시간 미팅 플랫폼은 한 번에 적어도 4가지 작업을 수행해야 하며, 이들은 서로 양립할 수 없는 방향으로 당깁니다:
- 실시간 음성 — 1초 미만으로 오디오를 입력받아 번역된 오디오를 출력하며, 모든 시청자는 자신의 언어로 듣습니다. 가장 엄격한 제약은 지연 시간입니다.
- 실시간 채팅 텍스트 — 빠르고 짧은 메시지, 편집 및 인용, HTML 구조가 유지됩니다.
- 실시간 공유 노트 — 문자 단위의 협업 타이핑, 번역 후에도 유지되어야 하는 구조적 계층(목록, 제목, 체크박스)을 포함합니다.
- 비동기 문서 파일 — 채팅에 드롭된 40페이지짜리 PDF. 지연 시간 예산이 없습니다. 가장 엄격한 제약은 충실도(fidelity) — 서식, 표, 페이지 번호, 글꼴입니다.
이 네 가지를 모두 처리하려는 거대한 LLM 호출 하나를 만들 수 있습니다. 우리는 시도해봤습니다. 네 가지 모두에 대해 서툴렀습니다. 음성의 지연 시간 예산은 모델이 '생각'할 수 없음을 의미하고, 문서의 충실도 예산은 모델이 생각해야 함을 의미합니다. 채팅 편집은 시청자 언어로 diff가 필요하지만, 40페이지 PDF는 어떤 토큰 스트리밍 모델도 제공하지 않는 서식 보존이 필요합니다.
그래서 우리는 4개를 실행합니다. 각각에 대한 설명은 다음과 같습니다.