Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe на 153 голосовых сообщениях: почему InterMIND запускает распознавание речи на собственном облачном шлюзе вашей организации (2026)
Голосовое сообщение в канале InterMIND становится текстовым сообщением, которое каждый участник команды читает на своём языке. Первый шаг этого процесса — распознавание речи (speech-to-text), и вопрос, который нам задают специалисты по ИТ и комплаенсу, не «насколько это точно», а «чей это сервис и куда уходит аудио».
Короткий ответ: Azure AI Speech — сервис распознавания речи AI-шлюза по умолчанию — работает в собственном Azure-тенанте InterMIND в регионе Sweden Central, а сервисы распознавания речи двух других шлюзов, которые может выбрать организация, измерены на тех же аудиофрагментах, чтобы выбор был числом, а не предпочтением. В этом материале показаны цифры, стоящие за этим выбором, — одни и те же 153 фрагмента, прогнанные через Azure AI Speech, Google Cloud Speech-to-Text и Amazon Transcribe в один и тот же день, — а также два факта о каждом API, которые важнее процентного пункта точности.
Сначала правило: один шлюз на организацию
Каждая функция ИИ в InterMIND — резюме встреч, сводки документов, помощник для написания текста, Ask AI и Mia во время встречи — работает на одном шлюзе языковых моделей, который выбирает организация: Azure OpenAI в EU Data Zone по умолчанию, Google Vertex AI на мультирегиональном эндпоинте EU или Amazon Bedrock во Франкфурте — по выбору, каждый в собственном тенанте InterMIND. Мы объяснили логику этого решения в статье ИИ для встреч на вашем собственном облачном шлюзе: для большинства организаций этот шлюз уже входит в список утверждённых субпроцессоров, поэтому функция ИИ не добавляет в этот список ни одной новой компании.
Распознавание речи для голосовых сообщений сегодня следует тому же правилу на шлюзе по умолчанию, и у каждого из трёх шлюзов есть сервис распознавания речи рядом со своими языковыми моделями — именно это измеряется в данном материале:
| Шлюз | Сервис распознавания речи | Регион, использованный в этом тесте | Как API принимает запись |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | Sweden Central | Один запрос для файла размером до 5 часов и 500 МБ (документация по fast transcription, проверено в сентябре 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, модель Chirp 3 | мультирегион eu | Синхронное распознавание ограничено 60 секундами и 10 МБ; более длинное аудио обрабатывается через batch- или потоковое распознавание (ограничения синхронного режима, Chirp 3, проверено в сентябре 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, потоковый режим | eu-central-1 (Франкфурт) | Потоковая сессия по HTTP/2 или WebSocket; на входе — PCM, FLAC или Ogg-Opus (документация по потоковому режиму, проверено в сентябре 2026) |
В каждом случае распознавателю сообщается собственный язык говорящего — язык, который участник указал в своём профиле, — потому что автоматическое определение языка оказалось ненадёжным на коротких фрагментах в наших тестах: четырёхсекундное сообщение на русском языке было распознано как английское. Именно так продукт сегодня обращается к Azure, и тест обращается к двум другим сервисам таким же образом.