[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-ko-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":824},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":808,"demo-cta":809,"description":810,"extension":811,"genre":812,"heroOrder":813,"icp":814,"image":817,"meta":818,"navigation":819,"no-translate":809,"path":820,"rank-country":813,"rank-keywords":813,"rank-tag":813,"seo":821,"stem":822,"updated":813,"video":819,"__hash__":823},"blog_ko\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","153개의 음성 메모에 대한 Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe: InterMIND가 조직 자체 클라우드 게이트웨이에서 음성-텍스트 변환을 실행하는 이유 (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":795},"minimark",[14,19,23,26,31,40,43,148,151,155,171,177,183,189,193,196,526,529,533,566,570,573,585,596,602,606,609,613,618,625,630,633,638,641,646,662,667,670,675,678,683,686,691,694,699,708,713,716,719,723,750,752],[15,16,18],"h1",{"id":17},"음성-메모-153건으로-비교한-azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-intermind가-조직의-자체-클라우드-게이트웨이에서-음성-텍스트-변환을-실행하는-이유-2026","음성 메모 153건으로 비교한 Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe: InterMIND가 조직의 자체 클라우드 게이트웨이에서 음성-텍스트 변환을 실행하는 이유 (2026)",[20,21,22],"p",{},"InterMIND 채널의 음성 메모는 모든 팀원이 각자의 언어로 읽는 텍스트 메시지가 됩니다. 그 첫 단계가 음성-텍스트 변환(STT)이며, IT 및 컴플라이언스 검토자들이 저희에게 묻는 질문은 \"정확도가 얼마나 되는가\"가 아니라 \"누구의 서비스이며, 오디오가 어디로 가는가\"입니다.",[20,24,25],{},"짧게 답하자면: 기본 AI 게이트웨이의 음성 서비스인 Azure AI Speech가 InterMIND 자체 Azure 테넌트(스웨덴 중부)에서 실행되며, 조직이 선택할 수 있는 나머지 두 게이트웨이의 음성 서비스도 동일한 클립으로 측정하여 선택이 취향이 아닌 숫자에 근거하도록 했습니다. 이 글은 그 선택의 근거가 된 수치를 보여줍니다 — 같은 날 동일한 153개 클립을 Azure AI Speech, Google Cloud Speech-to-Text, Amazon Transcribe에 각각 통과시킨 결과와, 정확도의 소수점 이하 수치보다 더 중요한 각 API에 관한 두 가지 사실입니다.",[27,28,30],"h2",{"id":29},"원칙이-먼저다-조직당-게이트웨이-하나","원칙이 먼저다: 조직당 게이트웨이 하나",[20,32,33,34,39],{},"InterMIND의 모든 AI 기능 — 회의 요약, 문서 요약, 작성 도우미, Ask AI, 회의 중 Mia — 는 조직이 선택한 하나의 언어 모델 게이트웨이에서 실행됩니다: 기본값은 EU 데이터 존의 Azure OpenAI이며, 선택에 따라 EU 멀티 리전 엔드포인트의 Google Vertex AI 또는 프랑크푸르트의 Amazon Bedrock을 사용할 수 있고, 각각 InterMIND 자체 테넌트에서 실행됩니다. 그 이유는 ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","자체 클라우드 게이트웨이에서 실행되는 회의 AI","에서 설명했습니다: 대부분의 조직에서는 해당 게이트웨이가 이미 승인된 서브프로세서 목록에 있으므로, AI 기능이 추가되어도 목록에 새로운 업체가 추가되지 않습니다.",[20,41,42],{},"음성 메모의 음성-텍스트 변환은 현재 기본 게이트웨이에서 동일한 원칙을 따르며, 세 게이트웨이 각각에는 언어 모델과 함께 음성 서비스가 있습니다 — 이 글이 측정하는 것이 바로 이것입니다:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"게이트웨이",[53,57,58],{},"음성 서비스",[53,60,61],{},"이번 테스트에서 사용한 리전",[53,63,64],{},"API가 녹음을 처리하는 방식",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI","(Microsoft)",[71,79,80],{},"Azure AI Speech, 고속 전사(fast transcription) API",[71,82,83],{},"스웨덴 중부",[71,85,86,87,93],{},"최대 5시간, 500MB 파일을 단일 요청으로 처리 (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","고속 전사 문서",", 2026년 9월 확인)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI","(Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, Chirp 3 모델",[71,106,107,111],{},[108,109,110],"code",{},"eu"," 멀티 리전",[71,113,114,115,120,121,93],{},"동기식 인식은 60초, 10MB로 제한되며, 더 긴 오디오는 배치 또는 스트리밍 인식을 거침 (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"동기식 제한",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock","(AWS)",[71,135,136],{},"Amazon Transcribe, 스트리밍",[71,138,139],{},"eu-central-1(프랑크푸르트)",[71,141,142,143,93],{},"HTTP\u002F2 또는 WebSocket을 통한 스트리밍 세션; 입력은 PCM, FLAC 또는 Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"스트리밍 문서",[20,149,150],{},"인식기에는 항상 화자 본인의 언어 — 멤버가 프로필에 설정한 언어 — 가 지정됩니다. 저희 테스트에서 자동 언어 식별이 짧은 클립에서는 신뢰할 수 없는 것으로 나타났기 때문입니다: 4초짜리 러시아어 메모가 영어로 인식된 사례도 있었습니다. 이는 현재 제품이 Azure를 호출하는 방식이며, 이번 테스트에서도 나머지 두 서비스를 동일한 방식으로 호출했습니다.",[27,152,154],{"id":153},"측정-방법","측정 방법",[20,156,157,160,161,165,166,170],{},[74,158,159],{},"클립 구성."," 17개 언어로 된 153개 클립: 제품의 합성 음성 2개가 10개 언어로 발화한 두 개의 비즈니스 대화(계약 협상, 데일리 스탠드업)로 이루어진 136개 대화 턴에, ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","공개 번역 벤치마크","의 FLORES-200 비즈니스 문장을 합성 음성으로 읽은 언어당 1개씩, 71",[167,168,169],"del",{},"109초 길이의 정식 문단 17개를 더한 것입니다. 대화 턴의 길이는 실제 음성 메모와 같은 3","30초입니다.",[20,172,173,176],{},[74,174,175],{},"측정 지표."," 대소문자, 구두점, 공백을 정규화한 뒤 기준 텍스트 대비 단어 오류율(WER) — 치환, 삽입, 삭제된 단어의 비율 — 을 측정했으며, 중국어와 일본어는 글자 단위로 비교했습니다. 문자 오류율도 함께 기록했으며 결과는 동일한 경향을 보였습니다.",[20,178,179,182],{},[74,180,181],{},"측정 도구."," 2026년 9월 16일, 하나의 스크립트와 하나의 머신으로 한 시간 동안 각 엔진에 153개 클립 전체를 통과시켰습니다. Azure와 Amazon Transcribe는 각 클립을 그대로 전송했습니다. Google의 동기식 인식기는 최대 60초까지만 처리할 수 있어, 정식 문단 17개는 무음 구간에서 55초 미만 조각으로 잘라 전사 결과를 이어 붙였고, 대화 클립 136개는 그대로 전송했습니다. Amazon Transcribe는 실시간 속도의 오디오를 요구하므로, 측정 도구는 실시간보다 4배 빠르게 데이터를 공급했습니다. 따라서 아래의 지연 시간 수치는 서비스 자체가 아니라 데이터 공급 속도에 의해 정해진 하한값입니다.",[20,184,185,188],{},[74,186,187],{},"이것이 아닌 것."," 이 테스트는 차 안에서 휴대폰으로 녹음한 현장 녹음이 아니라 조용한 환경의 합성 음성입니다. 하루, 클립당 1회 실행입니다. 이는 순위표가 아니라, 저희 번역 파이프라인이 테스트되는 오디오와 사용자가 실제로 쓰는 언어를 기준으로 한 비교입니다.",[27,190,192],{"id":191},"결과-언어별-단어-오류율","결과: 언어별 단어 오류율",[20,194,195],{},"각 언어의 클립에 대한 평균 WER입니다. 모든 엔진이 153개 클립 전체에 대해 전사 결과를 반환했습니다.",[44,197,198,217],{},[47,199,200],{},[50,201,202,205,208,211,214],{},[53,203,204],{},"언어",[53,206,207],{},"클립 수",[53,209,210],{},"Azure AI Speech",[53,212,213],{},"Google Chirp 3",[53,215,216],{},"Amazon Transcribe",[66,218,219,236,251,267,280,295,310,326,340,353,366,380,393,406,420,434,447,460,482,496,510],{},[50,220,221,224,227,230,233],{},[71,222,223],{},"아랍어",[71,225,226],{},"13",[71,228,229],{},"32%",[71,231,232],{},"46%",[71,234,235],{},"26%",[50,237,238,241,243,246,248],{},[71,239,240],{},"중국어",[71,242,226],{},[71,244,245],{},"3%",[71,247,245],{},[71,249,250],{},"8%",[50,252,253,256,259,262,265],{},[71,254,255],{},"체코어",[71,257,258],{},"1",[71,260,261],{},"1%",[71,263,264],{},"2%",[71,266,245],{},[50,268,269,272,274,276,278],{},[71,270,271],{},"네덜란드어",[71,273,258],{},[71,275,264],{},[71,277,264],{},[71,279,245],{},[50,281,282,285,288,290,293],{},[71,283,284],{},"영어",[71,286,287],{},"21",[71,289,264],{},[71,291,292],{},"5%",[71,294,264],{},[50,296,297,300,302,304,307],{},[71,298,299],{},"프랑스어",[71,301,226],{},[71,303,292],{},[71,305,306],{},"11%",[71,308,309],{},"12%",[50,311,312,315,317,320,323],{},[71,313,314],{},"독일어",[71,316,226],{},[71,318,319],{},"7%",[71,321,322],{},"9%",[71,324,325],{},"13%",[50,327,328,331,333,336,338],{},[71,329,330],{},"힌디어",[71,332,226],{},[71,334,335],{},"10%",[71,337,335],{},[71,339,309],{},[50,341,342,345,347,349,351],{},[71,343,344],{},"헝가리어",[71,346,258],{},[71,348,322],{},[71,350,319],{},[71,352,250],{},[50,354,355,358,360,362,364],{},[71,356,357],{},"이탈리아어",[71,359,258],{},[71,361,261],{},[71,363,261],{},[71,365,245],{},[50,367,368,371,373,376,378],{},[71,369,370],{},"일본어",[71,372,226],{},[71,374,375],{},"6%",[71,377,292],{},[71,379,292],{},[50,381,382,385,387,389,391],{},[71,383,384],{},"한국어",[71,386,258],{},[71,388,322],{},[71,390,306],{},[71,392,306],{},[50,394,395,398,400,402,404],{},[71,396,397],{},"폴란드어",[71,399,258],{},[71,401,261],{},[71,403,261],{},[71,405,264],{},[50,407,408,411,413,415,418],{},[71,409,410],{},"포르투갈어(브라질)",[71,412,226],{},[71,414,292],{},[71,416,417],{},"4%",[71,419,375],{},[50,421,422,425,427,430,432],{},[71,423,424],{},"러시아어",[71,426,287],{},[71,428,429],{},"14%",[71,431,335],{},[71,433,429],{},[50,435,436,439,441,443,445],{},[71,437,438],{},"스페인어",[71,440,226],{},[71,442,375],{},[71,444,292],{},[71,446,375],{},[50,448,449,452,454,456,458],{},[71,450,451],{},"터키어",[71,453,258],{},[71,455,417],{},[71,457,245],{},[71,459,417],{},[50,461,462,467,470,474,478],{},[71,463,464],{},[74,465,466],{},"전체 153개 클립",[71,468,469],{},"153",[71,471,472],{},[74,473,322],{},[71,475,476],{},[74,477,335],{},[71,479,480],{},[74,481,335],{},[50,483,484,487,490,492,494],{},[71,485,486],{},"대화 턴만",[71,488,489],{},"136",[71,491,322],{},[71,493,306],{},[71,495,335],{},[50,497,498,501,504,506,508],{},[71,499,500],{},"정식 문단만",[71,502,503],{},"17",[71,505,417],{},[71,507,292],{},[71,509,292],{},[50,511,512,515,517,520,523],{},[71,513,514],{},"처리 시간 ÷ 오디오 길이",[71,516],{},[71,518,519],{},"0.10",[71,521,522],{},"0.22",[71,524,525],{},"0.41(데이터 공급 속도에 좌우)",[20,527,528],{},"클립이 하나뿐인 언어(정식 문단만 있는 경우)는 완전성을 위해 표시했습니다. 클립 1개로 산출된 수치는 비율이 아니라 하나의 데이터 포인트입니다.",[27,530,532],{"id":531},"수치가-말해주는-것","수치가 말해주는 것",[534,535,536,543,549,560],"ul",{},[537,538,539,542],"li",{},[74,540,541],{},"전체 세트에서 세 서비스는 1%p 이내로 차이가 납니다:"," 9%, 10%, 10%. 153개 클립 모두 모든 엔진에서 전사 결과를 반환했으며 — 세 서비스 모두 17개 언어를 빠짐없이 커버합니다.",[537,544,545,548],{},[74,546,547],{},"차이는 언어별로 나타나며, 방향은 일정하지 않습니다."," Azure는 프랑스어(5% 대 11%, 12%)와 독일어(7% 대 9%, 13%)에서 오류율이 가장 낮았고, 영어(2%, Amazon Transcribe와 공동)와 중국어(3%, Google과 공동)에서는 공동 최저였습니다. Amazon Transcribe는 아랍어(26% 대 32%, 46%)에서 가장 낮았습니다. Google은 러시아어(10% 대 14%, 14%), 포르투갈어, 헝가리어, 터키어에서 가장 낮았습니다.",[537,550,551,554,555,559],{},[74,552,553],{},"아랍어는 세 서비스 모두에게 어렵습니다."," 아랍어 대화 클립에서 가장 좋은 결과도 단어 네 개 중 하나가 틀립니다. 이는 번역 쪽에서 저희가 관찰한 것과 일치하며, 2026년 8월 품질이 기준을 충족할 때까지 아랍어를 회의 언어 선택 목록에서 제외한 이유이기도 합니다 (",[35,556,558],{"href":557},"\u002Fblog\u002Fhow-many-languages-do-you-support","지원하는 언어 수",").",[537,561,562,565],{},[74,563,564],{},"세 서비스 모두 처리 시간이 실시간보다 훨씬 짧습니다."," 이 측정 도구 기준으로 30초짜리 메모는 Azure에서 약 3초, Google에서 약 7초가 걸립니다. Amazon의 수치는 데이터 공급 속도에 좌우됩니다.",[27,567,569],{"id":568},"azure-ai-speech가-기본값으로-유지되는-이유","Azure AI Speech가 기본값으로 유지되는 이유",[20,571,572],{},"결정에 반영된 순서대로 세 가지 이유가 있습니다.",[20,574,575,578,579,584],{},[74,576,577],{},"1. 기본 게이트웨이가 Azure입니다."," 게이트웨이를 별도로 선택하지 않은 조직은 EU 데이터 존의 Azure OpenAI에서 AI 기능을 실행하므로, 음성 메모 역시 같은 테넌트의 Azure AI Speech로 전사됩니다. 추가 서브프로세서도, 추가 리전도 필요하지 않습니다. Microsoft는 Azure Speech가 음성 리소스가 위치한 리전 밖에서는 데이터를 저장하거나 처리하지 않는다고 명시하고 있으며 (",[35,580,583],{"href":581,"rel":582},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"리전 페이지",", 2026년 9월 확인), 저희 리소스는 고속 전사가 지원되는 스웨덴 중부에 있습니다.",[20,586,587,590,591,595],{},[74,588,589],{},"2. API 구조가 음성 메모에 적합합니다."," InterMIND의 음성 메모는 최대 10분까지 가능합니다 (",[35,592,594],{"href":593},"\u002Fdocs\u002Fchat\u002Fvoice-notes","음성 메모","). Azure의 고속 전사는 녹음 전체를 한 번의 요청으로 처리합니다. Google의 동기식 인식은 60초에서 멈추기 때문에 10분짜리 메모는 스토리지 버킷을 통한 배치 인식이나 스트리밍 세션이 필요합니다. Amazon Transcribe는 스트리밍 방식이지만 휴대폰과 브라우저가 녹음하는 형식이 아닌 PCM, FLAC 또는 Ogg-Opus를 요구하므로 오디오를 먼저 트랜스코딩해야 합니다. 둘 다 해결 가능한 문제이며 — 측정 도구에서도 실제로 해결했습니다 — 다만 모든 메모 경로에 더 많은 구성 요소가 개입하게 됩니다.",[20,597,598,601],{},[74,599,600],{},"3. 수치가 이를 반박하지 않습니다."," 9% 대 10%, 10%라는 결과에서, 이 세트 기준으로 기본 게이트웨이에서 음성 메모를 옮길 만큼 확실히 더 나은 엔진은 없습니다. 만약 Google이나 Amazon이 절반의 오류율을 기록했다면, 이 글에서 그렇게 밝혔을 것입니다.",[27,603,605],{"id":604},"vertex-ai-또는-bedrock을-사용하는-조직에-의미하는-바","Vertex AI 또는 Bedrock을 사용하는 조직에 의미하는 바",[20,607,608],{},"조직이 게이트웨이로 Google Vertex AI 또는 Amazon Bedrock을 선택한 경우, AI 기능은 해당 게이트웨이에서 실행됩니다. 이러한 조직에서 음성 메모는 현재 전사 없이 녹음만 전달됩니다: 이 글에서 보여드린 것처럼 저희는 Google Cloud Speech-to-Text와 Amazon Transcribe를 측정했지만, 아직 제품에 연결하지는 않았습니다. 권한과 통합 코드는 이미 마련되어 있으며, 모든 메모 경로에 반영되면 이 글도 업데이트하겠습니다. 그때까지 Vertex AI 또는 Bedrock 조직의 음성 메모는 재생 가능한 녹음으로 남으며, 게이트웨이를 Azure로 전환한 조직은 이후 전송되는 메모부터 전사 결과를 받게 됩니다.",[27,610,612],{"id":611},"자주-묻는-질문","자주 묻는 질문",[20,614,615],{},[74,616,617],{},"InterMIND는 어떤 음성-텍스트 변환 서비스를 사용하나요?",[20,619,620,621,559],{},"채팅의 음성 메모는 InterMIND 자체 Azure 테넌트(스웨덴 중부)의 Azure AI Speech(고속 전사 API)를 사용하며, 이는 기본 AI 게이트웨이의 음성 서비스입니다. 회의 중 실시간 음성은 경로가 다릅니다: 프랑스 OVH에서 호스팅되는 InterMIND 자체 미디어 엔진인 Mind API에서 처리되며, 클라우드 음성 서비스와는 전혀 접촉하지 않습니다 (",[35,622,624],{"href":623},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","회의가 실제로 실행되는 곳",[20,626,627],{},[74,628,629],{},"Azure AI Speech가 Google Speech-to-Text나 Amazon Transcribe보다 정확한가요?",[20,631,632],{},"17개 언어로 된 153개 음성 메모 클립 세트를 같은 날 동일한 측정 도구로 측정한 결과, Azure AI Speech의 평균 단어 오류율은 9%, Google Cloud Speech-to-Text(Chirp 3)는 10%, Amazon Transcribe는 10%였습니다. 언어별로는 순위가 달라집니다: 프랑스어, 영어, 중국어에서는 Azure가 가장 낮았고, 아랍어에서는 Amazon Transcribe가, 러시아어에서는 Google이 가장 낮았습니다. 다른 녹음 세트라면 순위가 달라질 수 있으며, 위 표는 저희 세트에 대한 근거입니다.",[20,634,635],{},[74,636,637],{},"단어 오류율이란 무엇이며, 여기서는 어떻게 계산했나요?",[20,639,640],{},"단어 오류율은 치환, 삽입, 삭제된 단어 수를 기준 텍스트의 단어 수로 나눈 값입니다. 비교 전에 대소문자, 구두점, 공백을 정규화하며, 중국어와 일본어는 단어를 공백으로 구분하지 않는 문자 체계이므로 글자 단위로 비교합니다. 9%라는 수치는 대략 단어 11개 중 1개가 기준 텍스트와 다르다는 의미입니다.",[20,642,643],{},[74,644,645],{},"음성 메모의 오디오가 EU 밖으로 나가나요?",[20,647,648,649,651,652,656,657,661],{},"아니요. 녹음은 EU 내 InterMIND의 객체 스토리지에 저장되며, 이를 전사하는 음성 서비스도 EU 리전에서 실행됩니다: Azure의 스웨덴 중부, Google Cloud의 ",[108,650,110],{}," 멀티 리전, AWS의 프랑크푸르트입니다. 전체 처리 업체와 리전 목록은 ",[35,653,655],{"href":654},"\u002Flegal\u002Fsubprocessors","서브프로세서 페이지","와 ",[35,658,660],{"href":659},"\u002Ftrust","신뢰 페이지","에서 확인할 수 있습니다.",[20,663,664],{},[74,665,666],{},"오디오가 휴대폰을 벗어나지 않도록 앱 내에서 클라이언트 측으로 음성을 인식하지 않는 이유는 무엇인가요?",[20,668,669],{},"저희도 2026년 9월에 이를 측정했습니다. 로컬 처리 방식의 Chrome 내장 인식기는 제품 언어 전체에서 정식 문단 클립 17개 중 단 하나도 인식하지 못했으며, 클라이언트 측 인식기의 언어 커버리지는 위 표의 17개 언어보다 훨씬 좁습니다. 클라이언트 측 인식은 플랫폼이 개선됨에 따라 저희가 계속 재측정할 방향이지만, 현재는 게이트웨이 경로만이 모든 멤버, 모든 언어에서 작동합니다.",[20,671,672],{},[74,673,674],{},"우리 조직이 음성 메모를 전사할 음성 서비스를 직접 선택할 수 있나요?",[20,676,677],{},"별도로는 선택할 수 없습니다. 조직 관리자가 통합(Integrations) 페이지에서 선택하는 것은 AI 게이트웨이입니다. 기본 게이트웨이에서는 음성 메모가 Azure AI Speech로 전사됩니다. Vertex AI와 Amazon Bedrock에서는 아직 음성 메모가 전사되지 않습니다 — 위 섹션을 참고하세요.",[20,679,680],{},[74,681,682],{},"음성 메모는 최대 몇 분까지 가능하며, API가 이를 제한하나요?",[20,684,685],{},"최대 10분까지 가능합니다. Azure의 고속 전사는 한 번의 요청으로 최대 5시간, 500MB까지 파일을 받아들이므로 메모는 단일 호출로 전사됩니다. Google의 동기식 인식은 60초, 10MB까지만 받아들이므로, 측정 도구는 긴 클립을 무음 구간에서 잘라 처리했습니다.",[20,687,688],{},[74,689,690],{},"인식기가 화자의 언어를 자동으로 감지하는 대신 미리 지정받는 이유는 무엇인가요?",[20,692,693],{},"음성 메모가 짧기 때문입니다. 4초짜리 클립에서는 자동 언어 식별이 잘못된 언어를 반환할 수 있습니다 — 실제로 러시아어 테스트 메모가 영어로 인식된 사례가 있었습니다. 멤버의 프로필 언어는 거의 항상 정확합니다. 인식기는 이 언어를 전달받으며, 이 언어가 알려지지 않은 경우에만 채팅방의 언어들을 후보로 전달받습니다.",[20,695,696],{},[74,697,698],{},"회의 오디오도 같은 서비스로 전사되나요?",[20,700,701,702,704,705,559],{},"아니요. 회의 중 실시간 음성은 통화를 처리하는 미디어 서버(프랑스 OVH에서 호스팅)에서 InterMIND 자체 엔진(Mind API)으로 인식 및 번역됩니다 — ",[35,703,624],{"href":623},"을 참고하세요. 클라우드 게이트웨이는 텍스트만 보며, 통화의 오디오는 전혀 접하지 않습니다 (",[35,706,707],{"href":37},"자체 게이트웨이에서 실행되는 회의 AI",[20,709,710],{},[74,711,712],{},"결과를 다시 공개할 예정인가요?",[20,714,715],{},"측정 도구는 명령어 하나로 실행되며, 모든 엔진의 권한이 이미 설정되어 있으므로 벤더가 새 모델을 출시하면 표를 다시 측정할 수 있습니다. 결과가 달라지면 이 글도 날짜와 함께 업데이트됩니다.",[717,718],"hr",{},[27,720,722],{"id":721},"직접-확인해-보세요","직접 확인해 보세요",[534,724,725,733,741],{},[537,726,727,732],{},[74,728,729],{},[35,730,731],{"href":593},"음성 메모 작동 방식 알아보기"," — 녹음, 10분 제한, 오디오가 향하는 곳.",[537,734,735,740],{},[74,736,737],{},[35,738,739],{"href":654},"서브프로세서 목록 확인하기"," — 데이터를 처리하는 모든 업체의 이름, 국가, 목적, 리전.",[537,742,743,749],{},[74,744,745],{},[35,746,748],{"href":747},"\u002Fdemo","라이브 데모 체험하기"," — 회원가입 없이 여러분의 오디오로 프로덕션 번역 파이프라인을 직접 테스트해 보세요.",[717,751],{},[20,753,754],{},[755,756,757,758,762,763,766,767,771,772,775,776,780,781,785,786,775,790,794],"em",{},"출처: Microsoft — Azure AI Speech 고속 전사 (",[35,759,761],{"href":89,"rel":760},[91],"learn.microsoft.com",") 및 Speech 리전 표 (",[35,764,761],{"href":581,"rel":765},[91],"); Google Cloud — Chirp 3 모델 (",[35,768,770],{"href":123,"rel":769},[91],"docs.cloud.google.com","), 동기식 인식 제한 (",[35,773,770],{"href":117,"rel":774},[91],") 및 지원 언어 (",[35,777,770],{"href":778,"rel":779},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — Amazon Transcribe 스트리밍 (",[35,782,784],{"href":145,"rel":783},[91],"docs.aws.amazon.com","), 엔드포인트 및 할당량 (",[35,787,784],{"href":788,"rel":789},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,791,784],{"href":792,"rel":793},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); 모두 2026년 9월 확인. 측정: InterMIND 음성 벤치마크, 2026-09-16, 153개 클립, 17개 언어.",{"title":796,"searchDepth":797,"depth":798,"links":799},"",2,3,[800,801,802,803,804,805,806,807],{"id":29,"depth":797,"text":30},{"id":153,"depth":797,"text":154},{"id":191,"depth":797,"text":192},{"id":531,"depth":797,"text":532},{"id":568,"depth":797,"text":569},{"id":604,"depth":797,"text":605},{"id":611,"depth":797,"text":612},{"id":721,"depth":797,"text":722},"2026-09-16",false,"InterMIND 조직이 선택할 수 있는 세 가지 클라우드 게이트웨이(Azure AI Speech, Google Cloud Speech-to-Text(Chirp 3), Amazon Transcribe)의 음성-텍스트 변환 서비스를 17개 언어로 된 동일한 153개의 음성 메모 클립에 대해 단일 테스트 하네스로 하루 만에 측정했습니다. 언어별 단어 오류율, 방법론, 각 API의 한계, 그리고 인식기가 리더보드가 아닌 게이트웨이를 따르는 이유를 다룹니다.","md","editorial",null,{"role":815,"spend":816},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":810},"blog\u002Fspeech-to-text-on-your-own-gateway","QKrizxr-MXzAOn6jVszxPhtB7dO4Z2DeDVWoZTcBrQw",[825,830],{"title":826,"path":827,"stem":828,"description":829,"children":-1},"사용하는 사람만큼만 결제하세요: InterMIND, 활성 멤버 기반 결제로 전환","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Pro 및 Business에서 수동으로 할당하는 좌석 판매가 중단됩니다. 전체 팀을 초대하세요. 갱신 시 이전 28일 동안 활성 상태였던 멤버 수를 계산하여 해당 멤버에 대해서만 청구됩니다. 활동이 멈춘 멤버도 액세스 권한을 유지하며 비용이 발생하지 않습니다. 회의 게스트 및 외부 채널 참가자는 계속 무료로 유지됩니다. 활성으로 간주되는 기준, 결제 주기 내에서 숫자가 어떻게 변동하는지, 갱신 전에 발송되는 알림 이메일의 내용, 그리고 결제 페이지에서 변경되는 사항을 확인하세요.",{"title":831,"path":832,"stem":833,"description":834,"children":-1},"전체 청중을 위한 실시간 번역 자막: Zoom, Teams 및 Google Meet의 요구 사항과 각 참석자가 자신의 언어로 읽는 방법 (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","한 명의 발표자, 10개 언어의 청중. 번역 자막 기능은 Zoom, Microsoft Teams 및 Google Meet에 존재하지만, 각각 다른 라이선스가 필요하며 청중이 어떤 언어로 읽을 수 있는지를 누가 결정하는지에 대한 동일한 질문에 각기 다르게 답합니다. Teams를 사용하면 타운홀 주최자가 6개 언어(Teams Premium의 경우 10개 언어)를 미리 선택할 수 있습니다. Zoom의 언어 쌍은 호스트의 계정 설정에 따라 결정되며, Google Meet는 번역 자막을 유료 Workspace 에디션으로 제한합니다. 문서화된 지도와 함께, 자막 언어가 참석자 측의 설정이며 회의실이 음성으로도 번역되는 InterMIND에서의 작동 방식도 소개합니다."]