음성 메모 153건으로 비교한 Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe: InterMIND가 조직의 자체 클라우드 게이트웨이에서 음성-텍스트 변환을 실행하는 이유 (2026)
InterMIND 채널의 음성 메모는 모든 팀원이 각자의 언어로 읽는 텍스트 메시지가 됩니다. 그 첫 단계가 음성-텍스트 변환(STT)이며, IT 및 컴플라이언스 검토자들이 저희에게 묻는 질문은 "정확도가 얼마나 되는가"가 아니라 "누구의 서비스이며, 오디오가 어디로 가는가"입니다.
짧게 답하자면: 기본 AI 게이트웨이의 음성 서비스인 Azure AI Speech가 InterMIND 자체 Azure 테넌트(스웨덴 중부)에서 실행되며, 조직이 선택할 수 있는 나머지 두 게이트웨이의 음성 서비스도 동일한 클립으로 측정하여 선택이 취향이 아닌 숫자에 근거하도록 했습니다. 이 글은 그 선택의 근거가 된 수치를 보여줍니다 — 같은 날 동일한 153개 클립을 Azure AI Speech, Google Cloud Speech-to-Text, Amazon Transcribe에 각각 통과시킨 결과와, 정확도의 소수점 이하 수치보다 더 중요한 각 API에 관한 두 가지 사실입니다.
원칙이 먼저다: 조직당 게이트웨이 하나
InterMIND의 모든 AI 기능 — 회의 요약, 문서 요약, 작성 도우미, Ask AI, 회의 중 Mia — 는 조직이 선택한 하나의 언어 모델 게이트웨이에서 실행됩니다: 기본값은 EU 데이터 존의 Azure OpenAI이며, 선택에 따라 EU 멀티 리전 엔드포인트의 Google Vertex AI 또는 프랑크푸르트의 Amazon Bedrock을 사용할 수 있고, 각각 InterMIND 자체 테넌트에서 실행됩니다. 그 이유는 자체 클라우드 게이트웨이에서 실행되는 회의 AI에서 설명했습니다: 대부분의 조직에서는 해당 게이트웨이가 이미 승인된 서브프로세서 목록에 있으므로, AI 기능이 추가되어도 목록에 새로운 업체가 추가되지 않습니다.
음성 메모의 음성-텍스트 변환은 현재 기본 게이트웨이에서 동일한 원칙을 따르며, 세 게이트웨이 각각에는 언어 모델과 함께 음성 서비스가 있습니다 — 이 글이 측정하는 것이 바로 이것입니다:
| 게이트웨이 | 음성 서비스 | 이번 테스트에서 사용한 리전 | API가 녹음을 처리하는 방식 |
|---|---|---|---|
| Azure OpenAI(Microsoft) | Azure AI Speech, 고속 전사(fast transcription) API | 스웨덴 중부 | 최대 5시간, 500MB 파일을 단일 요청으로 처리 (고속 전사 문서, 2026년 9월 확인) |
| Google Vertex AI(Google Cloud) | Cloud Speech-to-Text v2, Chirp 3 모델 | eu 멀티 리전 | 동기식 인식은 60초, 10MB로 제한되며, 더 긴 오디오는 배치 또는 스트리밍 인식을 거침 (동기식 제한, Chirp 3, 2026년 9월 확인) |
| Amazon Bedrock(AWS) | Amazon Transcribe, 스트리밍 | eu-central-1(프랑크푸르트) | HTTP/2 또는 WebSocket을 통한 스트리밍 세션; 입력은 PCM, FLAC 또는 Ogg-Opus (스트리밍 문서, 2026년 9월 확인) |
인식기에는 항상 화자 본인의 언어 — 멤버가 프로필에 설정한 언어 — 가 지정됩니다. 저희 테스트에서 자동 언어 식별이 짧은 클립에서는 신뢰할 수 없는 것으로 나타났기 때문입니다: 4초짜리 러시아어 메모가 영어로 인식된 사례도 있었습니다. 이는 현재 제품이 Azure를 호출하는 방식이며, 이번 테스트에서도 나머지 두 서비스를 동일한 방식으로 호출했습니다.