[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-ru-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_ru\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech, Google Chirp 3 и Amazon Transcribe на 153 голосовых заметках: почему InterMIND выполняет распознавание речи в облачном шлюзе вашей организации (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-на-153-голосовых-сообщениях-почему-intermind-запускает-распознавание-речи-на-собственном-облачном-шлюзе-вашей-организации-2026","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe на 153 голосовых сообщениях: почему InterMIND запускает распознавание речи на собственном облачном шлюзе вашей организации (2026)",[20,21,22],"p",{},"Голосовое сообщение в канале InterMIND становится текстовым сообщением, которое каждый участник команды читает на своём языке. Первый шаг этого процесса — распознавание речи (speech-to-text), и вопрос, который нам задают специалисты по ИТ и комплаенсу, не «насколько это точно», а «чей это сервис и куда уходит аудио».",[20,24,25],{},"Короткий ответ: Azure AI Speech — сервис распознавания речи AI-шлюза по умолчанию — работает в собственном Azure-тенанте InterMIND в регионе Sweden Central, а сервисы распознавания речи двух других шлюзов, которые может выбрать организация, измерены на тех же аудиофрагментах, чтобы выбор был числом, а не предпочтением. В этом материале показаны цифры, стоящие за этим выбором, — одни и те же 153 фрагмента, прогнанные через Azure AI Speech, Google Cloud Speech-to-Text и Amazon Transcribe в один и тот же день, — а также два факта о каждом API, которые важнее процентного пункта точности.",[27,28,30],"h2",{"id":29},"сначала-правило-один-шлюз-на-организацию","Сначала правило: один шлюз на организацию",[20,32,33,34,39],{},"Каждая функция ИИ в InterMIND — резюме встреч, сводки документов, помощник для написания текста, Ask AI и Mia во время встречи — работает на одном шлюзе языковых моделей, который выбирает организация: Azure OpenAI в EU Data Zone по умолчанию, Google Vertex AI на мультирегиональном эндпоинте EU или Amazon Bedrock во Франкфурте — по выбору, каждый в собственном тенанте InterMIND. Мы объяснили логику этого решения в статье ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","ИИ для встреч на вашем собственном облачном шлюзе",": для большинства организаций этот шлюз уже входит в список утверждённых субпроцессоров, поэтому функция ИИ не добавляет в этот список ни одной новой компании.",[20,41,42],{},"Распознавание речи для голосовых сообщений сегодня следует тому же правилу на шлюзе по умолчанию, и у каждого из трёх шлюзов есть сервис распознавания речи рядом со своими языковыми моделями — именно это измеряется в данном материале:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Шлюз",[53,57,58],{},"Сервис распознавания речи",[53,60,61],{},"Регион, использованный в этом тесте",[53,63,64],{},"Как API принимает запись",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, fast transcription API",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Один запрос для файла размером до 5 часов и 500 МБ (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","документация по fast transcription",", проверено в сентябре 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, модель Chirp 3",[71,106,107,108],{},"мультирегион ",[109,110,111],"code",{},"eu",[71,113,114,115,120,121,93],{},"Синхронное распознавание ограничено 60 секундами и 10 МБ; более длинное аудио обрабатывается через batch- или потоковое распознавание (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"ограничения синхронного режима",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, потоковый режим",[71,138,139],{},"eu-central-1 (Франкфурт)",[71,141,142,143,93],{},"Потоковая сессия по HTTP\u002F2 или WebSocket; на входе — PCM, FLAC или Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"документация по потоковому режиму",[20,149,150],{},"В каждом случае распознавателю сообщается собственный язык говорящего — язык, который участник указал в своём профиле, — потому что автоматическое определение языка оказалось ненадёжным на коротких фрагментах в наших тестах: четырёхсекундное сообщение на русском языке было распознано как английское. Именно так продукт сегодня обращается к Azure, и тест обращается к двум другим сервисам таким же образом.",[27,152,154],{"id":153},"что-мы-измеряли","Что мы измеряли",[20,156,157,160,161,165],{},[74,158,159],{},"Набор данных."," 153 фрагмента на 17 языках: 136 диалоговых реплик — два деловых диалога (переговоры по контракту и ежедневный стендап), озвученных двумя синтетическими голосами продукта на десяти языках, — плюс 17 формальных отрывков, деловых предложений FLORES-200 из нашего ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","публичного бенчмарка перевода",", озвученных синтетическим голосом, по одному на язык, длительностью от 71 до 109 секунд. Диалоговые реплики длятся от 3 до 30 секунд — столько же, сколько обычное голосовое сообщение.",[20,167,168,171],{},[74,169,170],{},"Метрика."," Word error rate (WER, доля ошибочных слов) относительно эталонного текста — доля слов, замененных, добавленных или удалённых — после нормализации регистра, пунктуации и пробелов; китайский и японский языки сравниваются посимвольно. Character error rate фиксировался параллельно и показывает ту же картину.",[20,173,174,177],{},[74,175,176],{},"Тестовый стенд."," Один скрипт, одна машина, один час 16 сентября 2026 года — каждый движок обрабатывал все 153 фрагмента. Azure и Amazon Transcribe принимали каждый фрагмент целиком. Синхронный распознаватель Google принимает не более 60 секунд, поэтому 17 формальных фрагментов были разрезаны по паузам на части короче 55 секунд, а расшифровки затем объединялись; 136 диалоговых фрагментов передавались целиком. Amazon Transcribe рассчитан на подачу аудио в реальном темпе, поэтому стенд подавал ему аудио в четыре раза быстрее реального времени; указанная ниже цифра задержки для этого сервиса — это нижняя граница, заданная скоростью подачи, а не самим сервисом.",[20,179,180,183],{},[74,181,182],{},"Чем это не является."," Синтетические голоса в тихом аудио, а не полевые записи с телефона в машине. Один день, один прогон на фрагмент. Это сравнение на том же аудио, на котором тестируется наш собственный конвейер перевода, на языках, на которых пишут наши пользователи, — а не рейтинговая таблица.",[27,185,187],{"id":186},"результаты-word-error-rate-по-языкам","Результаты: word error rate по языкам",[20,189,190],{},"Средний WER по фрагментам каждого языка; каждый движок вернул расшифровку для всех 153 фрагментов.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Язык",[53,201,202],{},"Фрагменты",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"Арабский",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"Китайский",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"Чешский",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"Нидерландский",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"Английский",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"Французский",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"Немецкий",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"Хинди",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"Венгерский",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"Итальянский",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"Японский",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"Корейский",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"Польский",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"Португальский (Бразилия)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"Русский",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"Испанский",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"Турецкий",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Все 153 фрагмента",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Только диалоговые реплики",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Только формальные отрывки",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Время обработки ÷ длительность аудио",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (ограничено скоростью подачи)",[20,522,523],{},"Языки, представленные одним фрагментом (только формальный отрывок), показаны для полноты картины; показатель по одному фрагменту — это отдельная точка данных, а не статистическая частота.",[27,525,527],{"id":526},"что-говорят-цифры","Что говорят цифры",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"На всём наборе три сервиса отличаются друг от друга не более чем на один процентный пункт:"," 9%, 10% и 10%. Каждый из 153 фрагментов вернулся с расшифровкой от каждого движка — покрытие всех 17 языков полное у всех трёх.",[532,539,540,543],{},[74,541,542],{},"Различия проявляются на уровне языков, и в обе стороны."," У Azure самая низкая частота ошибок на французском (5% против 11% и 12%) и немецком (7% против 9% и 13%), а также самая низкая наравне с другими на английском (2%, вместе с Amazon Transcribe) и китайском (3%, вместе с Google). У Amazon Transcribe самая низкая частота ошибок на арабском (26% против 32% и 46%). У Google — на русском (10% против 14% и 14%), португальском, венгерском и турецком.",[532,545,546,549,550,554],{},[74,547,548],{},"Арабский язык сложен для всех трёх сервисов."," Лучший результат на арабских диалоговых фрагментах — ошибка в каждом четвёртом слове. Это согласуется с тем, что мы наблюдали на стороне перевода, где в августе 2026 года мы убрали арабский язык из списка языков встреч, пока его качество не достигнет нашей планки (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","сколько языков мы поддерживаем",").",[532,556,557,560],{},[74,558,559],{},"Время обработки у всех трёх сервисов заметно меньше реального времени."," В нашем тестовом стенде 30-секундное сообщение обрабатывается примерно за три секунды на Azure и примерно за семь на Google; на показатель Amazon в основном влияет заданный темп подачи аудио.",[27,562,564],{"id":563},"почему-azure-ai-speech-остаётся-сервисом-по-умолчанию","Почему Azure AI Speech остаётся сервисом по умолчанию",[20,566,567],{},"Три причины, в том порядке, в котором они и определили это решение.",[20,569,570,573,574,579],{},[74,571,572],{},"1. Шлюз по умолчанию — Azure."," Организация, которая не выбрала шлюз, запускает свои функции ИИ на Azure OpenAI в EU Data Zone, поэтому её голосовые сообщения распознаются сервисом Azure AI Speech в том же тенанте. Никакого дополнительного субпроцессора, никакого дополнительного региона. Microsoft заявляет, что Azure Speech не хранит и не обрабатывает данные за пределами региона ресурса Speech (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"страница регионов",", проверено в сентябре 2026); наш ресурс размещён в регионе Sweden Central, который указан в списке доступных для fast transcription.",[20,581,582,585,586,590],{},[74,583,584],{},"2. Формат API подходит для голосового сообщения."," Голосовое сообщение в InterMIND может длиться до десяти минут (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","голосовые сообщения","). Fast transcription в Azure принимает всю запись одним запросом. Синхронное распознавание Google ограничено 60 секундами, поэтому десятиминутное сообщение требует batch-распознавания через хранилище или потоковой сессии; Amazon Transcribe работает в потоковом режиме, но принимает PCM, FLAC или Ogg-Opus, а не форматы, в которых записывают телефоны и браузеры, поэтому аудио сначала перекодируется. Обе проблемы решаемы — наш тестовый стенд их решает, — но это дополнительные звенья на пути каждого сообщения.",[20,592,593,596],{},[74,594,595],{},"3. Цифры не говорят против этого решения."," При 9% против 10% и 10% ни один из движков в этом наборе не показывает настолько лучший результат, чтобы это оправдывало перенос голосовых сообщений с шлюза по умолчанию. Если бы Google или Amazon показали ошибку вдвое ниже, в этом материале так и было бы написано.",[27,598,600],{"id":599},"что-это-значит-для-организаций-на-vertex-ai-или-bedrock","Что это значит для организаций на Vertex AI или Bedrock",[20,602,603],{},"Если ваша организация выбрала в качестве шлюза Google Vertex AI или Amazon Bedrock, ваши функции ИИ работают там же. Голосовые сообщения в таких организациях сейчас приходят как запись без расшифровки: мы измерили Google Cloud Speech-to-Text и Amazon Transcribe, как показано в этом материале, но пока не подключили их к продукту. Права доступа и интеграционный код уже существуют; этот материал будет обновлён, когда они окажутся на пути каждого сообщения. До этого момента голосовое сообщение в организации на Vertex AI или Bedrock — это воспроизводимая запись; организация, которая переключит свой шлюз на Azure, начнёт получать расшифровки сообщений, отправленных с этого момента.",[27,605,607],{"id":606},"faq","FAQ",[20,609,610],{},[74,611,612],{},"Какой сервис распознавания речи использует InterMIND?",[20,614,615,616,554],{},"Для голосовых сообщений в чате — Azure AI Speech (fast transcription API) в собственном Azure-тенанте InterMIND в регионе Sweden Central: это сервис распознавания речи AI-шлюза по умолчанию. Живая речь на встречах идёт по другому пути: она обрабатывается собственным медиадвигателем InterMIND, Mind API, размещённым в OVH во Франции, и никогда не попадает в облачный сервис распознавания речи (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","где проходит одна встреча",[20,621,622],{},[74,623,624],{},"Точнее ли Azure AI Speech, чем Google Speech-to-Text или Amazon Transcribe?",[20,626,627],{},"На нашем наборе из 153 фрагментов голосовых сообщений на 17 языках, измеренном в один день с использованием одного и того же тестового стенда, средний word error rate у Azure AI Speech составил 9%, у Google Cloud Speech-to-Text (Chirp 3) — 10%, у Amazon Transcribe — 10%. По отдельным языкам порядок меняется: у Azure самый низкий показатель на французском, английском и китайском, у Amazon Transcribe — на арабском, у Google — на русском. На другом наборе записей соотношение может быть другим; таблица выше — это доказательство для нашего набора.",[20,629,630],{},[74,631,632],{},"Что такое word error rate и как он был рассчитан здесь?",[20,634,635],{},"Word error rate — это количество заменённых, добавленных и удалённых слов, поделённое на количество слов в эталонном тексте. Перед сравнением мы нормализуем регистр, пунктуацию и пробелы, а китайский и японский языки сравниваем посимвольно, поскольку в этих системах письма слова не разделяются пробелами. Показатель 9% означает, что примерно каждое одиннадцатое слово отличается от эталона.",[20,637,638],{},[74,639,640],{},"Выходит ли аудио голосового сообщения за пределы ЕС?",[20,642,643,644,646,647,651,652,656],{},"Нет. Запись хранится в объектном хранилище InterMIND в ЕС, а сервис распознавания речи, который её обрабатывает, работает в регионе ЕС: Sweden Central в Azure, мультирегион ",[109,645,111],{}," в Google Cloud, Франкфурт в AWS. Полный список сторон и регионов приведён на ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","странице субпроцессоров"," и на ",[35,653,655],{"href":654},"\u002Ftrust","странице о доверии",".",[20,658,659],{},[74,660,661],{},"Почему не распознавать речь на стороне клиента, в приложении, чтобы аудио никогда не покидало телефон?",[20,663,664],{},"Мы измерили и это, в сентябре 2026 года. Встроенный распознаватель Chrome с локальной обработкой правильно распознал 0 из 17 формальных фрагментов на языках продукта, а языковое покрытие клиентских распознавателей значительно уже, чем 17 языков в таблице выше. Клиентское распознавание — это направление, которое мы будем переизмерять по мере развития платформ; сегодня именно путь через шлюз работает для каждого участника на каждом языке.",[20,666,667],{},[74,668,669],{},"Может ли наша организация выбрать, какой сервис распознавания речи расшифровывает её голосовые сообщения?",[20,671,672],{},"Отдельно — нет: администратор организации выбирает AI-шлюз на странице интеграций. На шлюзе по умолчанию голосовые сообщения расшифровывает Azure AI Speech. На Vertex AI и Amazon Bedrock голосовые сообщения пока не расшифровываются — см. раздел выше.",[20,674,675],{},[74,676,677],{},"Какой может быть длина голосового сообщения и ограничивает ли это API?",[20,679,680],{},"До десяти минут. Fast transcription в Azure принимает файлы размером до 5 часов и 500 МБ в одном запросе, поэтому сообщение расшифровывается за один вызов. Синхронное распознавание Google принимает не более 60 секунд и 10 МБ, поэтому тестовый стенд разрезал длинные фрагменты по паузам на части.",[20,682,683],{},[74,684,685],{},"Почему распознавателю сообщают язык говорящего, а не определяют его автоматически?",[20,687,688],{},"Потому что голосовое сообщение короткое. На четырёхсекундном фрагменте автоматическое определение языка может вернуть неверный язык — тестовое сообщение на русском было распознано как английское; язык, указанный в профиле участника, почти всегда верен. Распознавателю передаётся именно этот язык, и только если он неизвестен, ему передаются в качестве кандидатов языки, используемые в комнате.",[20,690,691],{},[74,692,693],{},"Расшифровывается ли аудио встречи тем же сервисом?",[20,695,696,697,699,700,554],{},"Нет. Живая речь на встрече распознаётся и переводится на собственном движке InterMIND (Mind API) на медиасервере, который обслуживает звонок и размещён в OVH во Франции, — см. ",[35,698,619],{"href":618},". Облачный шлюз видит текст, но никогда не получает аудио звонка (",[35,701,702],{"href":37},"ИИ для встреч на вашем собственном шлюзе",[20,704,705],{},[74,706,707],{},"Будете ли вы публиковать результаты снова?",[20,709,710],{},"Тестовый стенд запускается одной командой, и права доступа для каждого движка уже настроены, так что таблицу можно пересчитать, когда поставщик выпустит новую модель. Если это изменит картину, материал будет обновлён с указанием даты.",[712,713],"hr",{},[27,715,717],{"id":716},"убедитесь-сами","Убедитесь сами",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Узнайте, как работают голосовые сообщения"," — запись, ограничение в десять минут и куда уходит аудио.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Посмотрите список субпроцессоров"," — поставщик, страна, назначение и регион для каждой стороны, обрабатывающей ваши данные.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Попробуйте живую демонстрацию"," — продакшен-конвейер перевода на вашем собственном аудио, без регистрации.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Источники: Microsoft — Azure AI Speech fast transcription (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") и таблица регионов Speech (",[35,759,756],{"href":576,"rel":760},[91],"); Google Cloud — модель Chirp 3 (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), ограничения синхронного распознавания (",[35,768,765],{"href":117,"rel":769},[91],") и поддерживаемые языки (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — потоковый режим Amazon Transcribe (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), эндпоинты и квоты (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); все проверено в сентябре 2026 года. Измерение: InterMIND speech bench, 2026-09-16, 153 фрагмента, 17 языков.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Мы измерили сервисы распознавания речи трёх облачных шлюзов, которые может выбрать организация InterMIND, — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) и Amazon Transcribe — на одних и тех же 153 голосовых заметках на 17 языках, с помощью одного инструмента, за один день. Коэффициенты ошибок в словах по каждому языку, методика, ограничения каждого API и почему распознаватель следует за шлюзом, а не за лидербордом.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","KpQnroPtO-_B9Im0hhwWh_7ICc4TctPw4MYaGiy_gJw",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Платите только за тех, кто пользуется: InterMIND переходит на оплату за активных участников","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Pro и Business прекращают продажу мест, которые вы назначаете вручную. Пригласите всю команду; при каждом продлении учитываются участники, активные за предыдущие 28 дней, и оплата списывается только за них. Участник, который перестает быть активным, сохраняет доступ и не требует затрат; гости встреч и участники внешних каналов остаются бесплатными. Что считается активностью, как меняется число в рамках биллингового цикла, что говорится в письме перед продлением и что меняется на вашей странице биллинга.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Субтитры с живым переводом для всей аудитории: что требуют Zoom, Teams и Google Meet и как каждый участник читает на своём языке (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Один спикер, аудитория на десяти языках. Переведённые субтитры доступны в Zoom, Microsoft Teams и Google Meet — каждый по разной лицензии, и каждый по-разному отвечает на один и тот же вопрос: кто решает, на каких языках аудитория может читать. Teams позволяет организатору общей встречи предварительно выбирать шесть языков (десять с Teams Premium); пары в Zoom задаются настройками аккаунта организатора; Google Meet ограничивает переведённые субтитры платными редакциями Workspace. Документированная карта наряду с тем, как это работает в InterMIND, где язык субтитров — это настройка на стороне самого участника, а комната переводится также и голосом."]