Голосове повідомлення в каналі InterMIND перетворюється на текстове повідомлення, яке кожен учасник команди читає своєю мовою. Перший крок цього процесу — розпізнавання мовлення в текст, і питання, яке ми чуємо від фахівців з ІТ та комплаєнсу, — не «наскільки це точно», а «чий це сервіс і куди йде аудіо».
Коротка відповідь: Azure AI Speech — мовленнєвий сервіс шлюзу ШІ за замовчуванням — у власному тенанті Azure компанії InterMIND у регіоні Sweden Central, а також мовленнєві сервіси двох інших шлюзів, які може обрати організація, виміряні на тих самих аудіозаписах, щоб вибір ґрунтувався на цифрах, а не на уподобаннях. У цій статті наведено цифри, що стоять за цим вибором, — ті самі 153 фрагменти, прогнані через Azure AI Speech, Google Cloud Speech-to-Text та Amazon Transcribe в один день, — а також два факти про кожен API, які важать більше, ніж один відсотковий пункт точності.
Спочатку правило: один шлюз на організацію
Кожна функція ШІ в InterMIND — стислі підсумки зустрічей, резюме документів, помічник з написання текстів, Ask AI та Mia під час зустрічі — працює на одному шлюзі мовної моделі, який обирає організація: Azure OpenAI в EU Data Zone за замовчуванням, Google Vertex AI на мультирегіональній кінцевій точці ЄС або Amazon Bedrock у Франкфурті — за бажанням, кожен у власному тенанті InterMIND. Ми пояснили цю логіку в статті ШІ для зустрічей на вашому власному хмарному шлюзі: для більшості організацій цей шлюз уже є у списку затверджених субпроцесорів, тож функція ШІ не додає до списку жодної нової компанії.
Сьогодні розпізнавання мовлення для голосових повідомлень підпорядковується тому самому правилу на шлюзі за замовчуванням, і кожен із трьох шлюзів має мовленнєвий сервіс поряд зі своїми мовними моделями — саме це й вимірює ця стаття:
| Шлюз | Мовленнєвий сервіс | Регіон, використаний у цьому тесті | Як API приймає запис |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, API швидкої транскрипції | Sweden Central | Один запит для файлу розміром до 5 годин і 500 МБ (документація fast transcription, перевірено у вересні 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, модель Chirp 3 | Мультирегіон eu | Синхронне розпізнавання обмежене 60 секундами та 10 МБ; довше аудіо обробляється через пакетне або потокове розпізнавання (обмеження синхронного розпізнавання, Chirp 3, перевірено у вересні 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, потокове передавання | eu-central-1 (Франкфурт) | Потокова сесія через HTTP/2 або WebSocket; вхідні дані у форматі PCM, FLAC або Ogg-Opus (документація streaming, перевірено у вересні 2026) |
У кожному випадку розпізнавачу повідомляється власна мова мовця — мова, яку учасник встановив у своєму профілі, — оскільки автоматичне визначення мови виявилося ненадійним на коротких фрагментах у наших тестах: чотирисекундне повідомлення російською мовою було розпізнане як англійське. Саме так продукт сьогодні звертається до Azure, і саме так тест звертається до двох інших сервісів.