Архитектура

Azure AI Speech, Google Chirp 3 и Amazon Transcribe на 153 голосовых заметках: почему InterMIND выполняет распознавание речи в облачном шлюзе вашей организации (2026)

Мы измерили сервисы распознавания речи трёх облачных шлюзов, которые может выбрать организация InterMIND, — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) и Amazon Transcribe — на одних и тех же 153 голосовых заметках на 17 языках, с помощью одного инструмента, за один день. Коэффициенты ошибок в словах по каждому языку, методика, ограничения каждого API и почему распознаватель следует за шлюзом, а не за лидербордом.

The Mind.com Team

Azure AI Speech, Google Chirp 3 и Amazon Transcribe на 153 голосовых заметках: почему InterMIND выполняет распознавание речи в облачном шлюзе вашей организации (2026)

Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe на 153 голосовых сообщениях: почему InterMIND запускает распознавание речи на собственном облачном шлюзе вашей организации (2026)

Голосовое сообщение в канале InterMIND становится текстовым сообщением, которое каждый участник команды читает на своём языке. Первый шаг этого процесса — распознавание речи (speech-to-text), и вопрос, который нам задают специалисты по ИТ и комплаенсу, не «насколько это точно», а «чей это сервис и куда уходит аудио».

Короткий ответ: Azure AI Speech — сервис распознавания речи AI-шлюза по умолчанию — работает в собственном Azure-тенанте InterMIND в регионе Sweden Central, а сервисы распознавания речи двух других шлюзов, которые может выбрать организация, измерены на тех же аудиофрагментах, чтобы выбор был числом, а не предпочтением. В этом материале показаны цифры, стоящие за этим выбором, — одни и те же 153 фрагмента, прогнанные через Azure AI Speech, Google Cloud Speech-to-Text и Amazon Transcribe в один и тот же день, — а также два факта о каждом API, которые важнее процентного пункта точности.

Сначала правило: один шлюз на организацию

Каждая функция ИИ в InterMIND — резюме встреч, сводки документов, помощник для написания текста, Ask AI и Mia во время встречи — работает на одном шлюзе языковых моделей, который выбирает организация: Azure OpenAI в EU Data Zone по умолчанию, Google Vertex AI на мультирегиональном эндпоинте EU или Amazon Bedrock во Франкфурте — по выбору, каждый в собственном тенанте InterMIND. Мы объяснили логику этого решения в статье ИИ для встреч на вашем собственном облачном шлюзе: для большинства организаций этот шлюз уже входит в список утверждённых субпроцессоров, поэтому функция ИИ не добавляет в этот список ни одной новой компании.

Распознавание речи для голосовых сообщений сегодня следует тому же правилу на шлюзе по умолчанию, и у каждого из трёх шлюзов есть сервис распознавания речи рядом со своими языковыми моделями — именно это измеряется в данном материале:

ШлюзСервис распознавания речиРегион, использованный в этом тестеКак API принимает запись
Azure OpenAI (Microsoft)Azure AI Speech, fast transcription APISweden CentralОдин запрос для файла размером до 5 часов и 500 МБ (документация по fast transcription, проверено в сентябре 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, модель Chirp 3мультирегион euСинхронное распознавание ограничено 60 секундами и 10 МБ; более длинное аудио обрабатывается через batch- или потоковое распознавание (ограничения синхронного режима, Chirp 3, проверено в сентябре 2026)
Amazon Bedrock (AWS)Amazon Transcribe, потоковый режимeu-central-1 (Франкфурт)Потоковая сессия по HTTP/2 или WebSocket; на входе — PCM, FLAC или Ogg-Opus (документация по потоковому режиму, проверено в сентябре 2026)

В каждом случае распознавателю сообщается собственный язык говорящего — язык, который участник указал в своём профиле, — потому что автоматическое определение языка оказалось ненадёжным на коротких фрагментах в наших тестах: четырёхсекундное сообщение на русском языке было распознано как английское. Именно так продукт сегодня обращается к Azure, и тест обращается к двум другим сервисам таким же образом.

Что мы измеряли

Набор данных. 153 фрагмента на 17 языках: 136 диалоговых реплик — два деловых диалога (переговоры по контракту и ежедневный стендап), озвученных двумя синтетическими голосами продукта на десяти языках, — плюс 17 формальных отрывков, деловых предложений FLORES-200 из нашего публичного бенчмарка перевода, озвученных синтетическим голосом, по одному на язык, длительностью от 71 до 109 секунд. Диалоговые реплики длятся от 3 до 30 секунд — столько же, сколько обычное голосовое сообщение.

Метрика. Word error rate (WER, доля ошибочных слов) относительно эталонного текста — доля слов, замененных, добавленных или удалённых — после нормализации регистра, пунктуации и пробелов; китайский и японский языки сравниваются посимвольно. Character error rate фиксировался параллельно и показывает ту же картину.

Тестовый стенд. Один скрипт, одна машина, один час 16 сентября 2026 года — каждый движок обрабатывал все 153 фрагмента. Azure и Amazon Transcribe принимали каждый фрагмент целиком. Синхронный распознаватель Google принимает не более 60 секунд, поэтому 17 формальных фрагментов были разрезаны по паузам на части короче 55 секунд, а расшифровки затем объединялись; 136 диалоговых фрагментов передавались целиком. Amazon Transcribe рассчитан на подачу аудио в реальном темпе, поэтому стенд подавал ему аудио в четыре раза быстрее реального времени; указанная ниже цифра задержки для этого сервиса — это нижняя граница, заданная скоростью подачи, а не самим сервисом.

Чем это не является. Синтетические голоса в тихом аудио, а не полевые записи с телефона в машине. Один день, один прогон на фрагмент. Это сравнение на том же аудио, на котором тестируется наш собственный конвейер перевода, на языках, на которых пишут наши пользователи, — а не рейтинговая таблица.

Результаты: word error rate по языкам

Средний WER по фрагментам каждого языка; каждый движок вернул расшифровку для всех 153 фрагментов.

ЯзыкФрагментыAzure AI SpeechGoogle Chirp 3Amazon Transcribe
Арабский1332%46%26%
Китайский133%3%8%
Чешский11%2%3%
Нидерландский12%2%3%
Английский212%5%2%
Французский135%11%12%
Немецкий137%9%13%
Хинди1310%10%12%
Венгерский19%7%8%
Итальянский11%1%3%
Японский136%5%5%
Корейский19%11%11%
Польский11%1%2%
Португальский (Бразилия)135%4%6%
Русский2114%10%14%
Испанский136%5%6%
Турецкий14%3%4%
Все 153 фрагмента1539%10%10%
Только диалоговые реплики1369%11%10%
Только формальные отрывки174%5%5%
Время обработки ÷ длительность аудио0.100.220.41 (ограничено скоростью подачи)

Языки, представленные одним фрагментом (только формальный отрывок), показаны для полноты картины; показатель по одному фрагменту — это отдельная точка данных, а не статистическая частота.

Что говорят цифры

  • На всём наборе три сервиса отличаются друг от друга не более чем на один процентный пункт: 9%, 10% и 10%. Каждый из 153 фрагментов вернулся с расшифровкой от каждого движка — покрытие всех 17 языков полное у всех трёх.
  • Различия проявляются на уровне языков, и в обе стороны. У Azure самая низкая частота ошибок на французском (5% против 11% и 12%) и немецком (7% против 9% и 13%), а также самая низкая наравне с другими на английском (2%, вместе с Amazon Transcribe) и китайском (3%, вместе с Google). У Amazon Transcribe самая низкая частота ошибок на арабском (26% против 32% и 46%). У Google — на русском (10% против 14% и 14%), португальском, венгерском и турецком.
  • Арабский язык сложен для всех трёх сервисов. Лучший результат на арабских диалоговых фрагментах — ошибка в каждом четвёртом слове. Это согласуется с тем, что мы наблюдали на стороне перевода, где в августе 2026 года мы убрали арабский язык из списка языков встреч, пока его качество не достигнет нашей планки (сколько языков мы поддерживаем).
  • Время обработки у всех трёх сервисов заметно меньше реального времени. В нашем тестовом стенде 30-секундное сообщение обрабатывается примерно за три секунды на Azure и примерно за семь на Google; на показатель Amazon в основном влияет заданный темп подачи аудио.

Почему Azure AI Speech остаётся сервисом по умолчанию

Три причины, в том порядке, в котором они и определили это решение.

1. Шлюз по умолчанию — Azure. Организация, которая не выбрала шлюз, запускает свои функции ИИ на Azure OpenAI в EU Data Zone, поэтому её голосовые сообщения распознаются сервисом Azure AI Speech в том же тенанте. Никакого дополнительного субпроцессора, никакого дополнительного региона. Microsoft заявляет, что Azure Speech не хранит и не обрабатывает данные за пределами региона ресурса Speech (страница регионов, проверено в сентябре 2026); наш ресурс размещён в регионе Sweden Central, который указан в списке доступных для fast transcription.

2. Формат API подходит для голосового сообщения. Голосовое сообщение в InterMIND может длиться до десяти минут (голосовые сообщения). Fast transcription в Azure принимает всю запись одним запросом. Синхронное распознавание Google ограничено 60 секундами, поэтому десятиминутное сообщение требует batch-распознавания через хранилище или потоковой сессии; Amazon Transcribe работает в потоковом режиме, но принимает PCM, FLAC или Ogg-Opus, а не форматы, в которых записывают телефоны и браузеры, поэтому аудио сначала перекодируется. Обе проблемы решаемы — наш тестовый стенд их решает, — но это дополнительные звенья на пути каждого сообщения.

3. Цифры не говорят против этого решения. При 9% против 10% и 10% ни один из движков в этом наборе не показывает настолько лучший результат, чтобы это оправдывало перенос голосовых сообщений с шлюза по умолчанию. Если бы Google или Amazon показали ошибку вдвое ниже, в этом материале так и было бы написано.

Что это значит для организаций на Vertex AI или Bedrock

Если ваша организация выбрала в качестве шлюза Google Vertex AI или Amazon Bedrock, ваши функции ИИ работают там же. Голосовые сообщения в таких организациях сейчас приходят как запись без расшифровки: мы измерили Google Cloud Speech-to-Text и Amazon Transcribe, как показано в этом материале, но пока не подключили их к продукту. Права доступа и интеграционный код уже существуют; этот материал будет обновлён, когда они окажутся на пути каждого сообщения. До этого момента голосовое сообщение в организации на Vertex AI или Bedrock — это воспроизводимая запись; организация, которая переключит свой шлюз на Azure, начнёт получать расшифровки сообщений, отправленных с этого момента.

FAQ

Какой сервис распознавания речи использует InterMIND?

Для голосовых сообщений в чате — Azure AI Speech (fast transcription API) в собственном Azure-тенанте InterMIND в регионе Sweden Central: это сервис распознавания речи AI-шлюза по умолчанию. Живая речь на встречах идёт по другому пути: она обрабатывается собственным медиадвигателем InterMIND, Mind API, размещённым в OVH во Франции, и никогда не попадает в облачный сервис распознавания речи (где проходит одна встреча).

Точнее ли Azure AI Speech, чем Google Speech-to-Text или Amazon Transcribe?

На нашем наборе из 153 фрагментов голосовых сообщений на 17 языках, измеренном в один день с использованием одного и того же тестового стенда, средний word error rate у Azure AI Speech составил 9%, у Google Cloud Speech-to-Text (Chirp 3) — 10%, у Amazon Transcribe — 10%. По отдельным языкам порядок меняется: у Azure самый низкий показатель на французском, английском и китайском, у Amazon Transcribe — на арабском, у Google — на русском. На другом наборе записей соотношение может быть другим; таблица выше — это доказательство для нашего набора.

Что такое word error rate и как он был рассчитан здесь?

Word error rate — это количество заменённых, добавленных и удалённых слов, поделённое на количество слов в эталонном тексте. Перед сравнением мы нормализуем регистр, пунктуацию и пробелы, а китайский и японский языки сравниваем посимвольно, поскольку в этих системах письма слова не разделяются пробелами. Показатель 9% означает, что примерно каждое одиннадцатое слово отличается от эталона.

Выходит ли аудио голосового сообщения за пределы ЕС?

Нет. Запись хранится в объектном хранилище InterMIND в ЕС, а сервис распознавания речи, который её обрабатывает, работает в регионе ЕС: Sweden Central в Azure, мультирегион eu в Google Cloud, Франкфурт в AWS. Полный список сторон и регионов приведён на странице субпроцессоров и на странице о доверии.

Почему не распознавать речь на стороне клиента, в приложении, чтобы аудио никогда не покидало телефон?

Мы измерили и это, в сентябре 2026 года. Встроенный распознаватель Chrome с локальной обработкой правильно распознал 0 из 17 формальных фрагментов на языках продукта, а языковое покрытие клиентских распознавателей значительно уже, чем 17 языков в таблице выше. Клиентское распознавание — это направление, которое мы будем переизмерять по мере развития платформ; сегодня именно путь через шлюз работает для каждого участника на каждом языке.

Может ли наша организация выбрать, какой сервис распознавания речи расшифровывает её голосовые сообщения?

Отдельно — нет: администратор организации выбирает AI-шлюз на странице интеграций. На шлюзе по умолчанию голосовые сообщения расшифровывает Azure AI Speech. На Vertex AI и Amazon Bedrock голосовые сообщения пока не расшифровываются — см. раздел выше.

Какой может быть длина голосового сообщения и ограничивает ли это API?

До десяти минут. Fast transcription в Azure принимает файлы размером до 5 часов и 500 МБ в одном запросе, поэтому сообщение расшифровывается за один вызов. Синхронное распознавание Google принимает не более 60 секунд и 10 МБ, поэтому тестовый стенд разрезал длинные фрагменты по паузам на части.

Почему распознавателю сообщают язык говорящего, а не определяют его автоматически?

Потому что голосовое сообщение короткое. На четырёхсекундном фрагменте автоматическое определение языка может вернуть неверный язык — тестовое сообщение на русском было распознано как английское; язык, указанный в профиле участника, почти всегда верен. Распознавателю передаётся именно этот язык, и только если он неизвестен, ему передаются в качестве кандидатов языки, используемые в комнате.

Расшифровывается ли аудио встречи тем же сервисом?

Нет. Живая речь на встрече распознаётся и переводится на собственном движке InterMIND (Mind API) на медиасервере, который обслуживает звонок и размещён в OVH во Франции, — см. где проходит одна встреча. Облачный шлюз видит текст, но никогда не получает аудио звонка (ИИ для встреч на вашем собственном шлюзе).

Будете ли вы публиковать результаты снова?

Тестовый стенд запускается одной командой, и права доступа для каждого движка уже настроены, так что таблицу можно пересчитать, когда поставщик выпустит новую модель. Если это изменит картину, материал будет обновлён с указанием даты.


Убедитесь сами


Источники: Microsoft — Azure AI Speech fast transcription (learn.microsoft.com) и таблица регионов Speech (learn.microsoft.com); Google Cloud — модель Chirp 3 (docs.cloud.google.com), ограничения синхронного распознавания (docs.cloud.google.com) и поддерживаемые языки (docs.cloud.google.com); AWS — потоковый режим Amazon Transcribe (docs.aws.amazon.com), эндпоинты и квоты (docs.aws.amazon.com) и поддерживаемые языки (docs.aws.amazon.com); все проверено в сентябре 2026 года. Измерение: InterMIND speech bench, 2026-09-16, 153 фрагмента, 17 языков.

Получайте новые публикации и обновления продукта по email

Одно письмо в месяц с новыми публикациями и обновлениями продукта. Отписаться можно в любой момент.


Платите только за тех, кто пользуется: InterMIND переходит на оплату за активных участников

Pro и Business прекращают продажу мест, которые вы назначаете вручную. Пригласите всю команду; при каждом продлении учитываются участники, активные за предыдущие 28 дней, и оплата списывается только за них. Участник, который перестает быть активным, сохраняет доступ и не требует затрат; гости встреч и участники внешних каналов остаются бесплатными. Что считается активностью, как меняется число в рамках биллингового цикла, что говорится в письме перед продлением и что меняется на вашей странице биллинга.

Субтитры с живым переводом для всей аудитории: что требуют Zoom, Teams и Google Meet и как каждый участник читает на своём языке (2026)

Один спикер, аудитория на десяти языках. Переведённые субтитры доступны в Zoom, Microsoft Teams и Google Meet — каждый по разной лицензии, и каждый по-разному отвечает на один и тот же вопрос: кто решает, на каких языках аудитория может читать. Teams позволяет организатору общей встречи предварительно выбирать шесть языков (десять с Teams Premium); пары в Zoom задаются настройками аккаунта организатора; Google Meet ограничивает переведённые субтитры платными редакциями Workspace. Документированная карта наряду с тем, как это работает в InterMIND, где язык субтитров — это настройка на стороне самого участника, а комната переводится также и голосом.