Архітектура

Azure AI Speech проти Google Chirp 3 проти Amazon Transcribe на 153 голосових нотатках: чому InterMIND виконує розпізнавання мовлення на власному хмарному шлюзі вашої організації (2026)

Ми виміряли сервіси розпізнавання мовлення трьох хмарних шлюзів, які може обрати організація InterMIND — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) та Amazon Transcribe — на одних і тих самих 153 кліпах голосових нотаток 17 мовами, в одному середовищі, за один день. Коефіцієнти помилок у словах для кожної мови, методологія, обмеження кожного API та причини, чому розпізнавач слідує за шлюзом, а не за лідербордом.

The Mind.com Team

Azure AI Speech проти Google Chirp 3 проти Amazon Transcribe на 153 голосових нотатках: чому InterMIND виконує розпізнавання мовлення на власному хмарному шлюзі вашої організації (2026)

Голосове повідомлення в каналі InterMIND перетворюється на текстове повідомлення, яке кожен учасник команди читає своєю мовою. Перший крок цього процесу — розпізнавання мовлення в текст, і питання, яке ми чуємо від фахівців з ІТ та комплаєнсу, — не «наскільки це точно», а «чий це сервіс і куди йде аудіо».

Коротка відповідь: Azure AI Speech — мовленнєвий сервіс шлюзу ШІ за замовчуванням — у власному тенанті Azure компанії InterMIND у регіоні Sweden Central, а також мовленнєві сервіси двох інших шлюзів, які може обрати організація, виміряні на тих самих аудіозаписах, щоб вибір ґрунтувався на цифрах, а не на уподобаннях. У цій статті наведено цифри, що стоять за цим вибором, — ті самі 153 фрагменти, прогнані через Azure AI Speech, Google Cloud Speech-to-Text та Amazon Transcribe в один день, — а також два факти про кожен API, які важать більше, ніж один відсотковий пункт точності.

Спочатку правило: один шлюз на організацію

Кожна функція ШІ в InterMIND — стислі підсумки зустрічей, резюме документів, помічник з написання текстів, Ask AI та Mia під час зустрічі — працює на одному шлюзі мовної моделі, який обирає організація: Azure OpenAI в EU Data Zone за замовчуванням, Google Vertex AI на мультирегіональній кінцевій точці ЄС або Amazon Bedrock у Франкфурті — за бажанням, кожен у власному тенанті InterMIND. Ми пояснили цю логіку в статті ШІ для зустрічей на вашому власному хмарному шлюзі: для більшості організацій цей шлюз уже є у списку затверджених субпроцесорів, тож функція ШІ не додає до списку жодної нової компанії.

Сьогодні розпізнавання мовлення для голосових повідомлень підпорядковується тому самому правилу на шлюзі за замовчуванням, і кожен із трьох шлюзів має мовленнєвий сервіс поряд зі своїми мовними моделями — саме це й вимірює ця стаття:

ШлюзМовленнєвий сервісРегіон, використаний у цьому тестіЯк API приймає запис
Azure OpenAI (Microsoft)Azure AI Speech, API швидкої транскрипціїSweden CentralОдин запит для файлу розміром до 5 годин і 500 МБ (документація fast transcription, перевірено у вересні 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, модель Chirp 3Мультирегіон euСинхронне розпізнавання обмежене 60 секундами та 10 МБ; довше аудіо обробляється через пакетне або потокове розпізнавання (обмеження синхронного розпізнавання, Chirp 3, перевірено у вересні 2026)
Amazon Bedrock (AWS)Amazon Transcribe, потокове передаванняeu-central-1 (Франкфурт)Потокова сесія через HTTP/2 або WebSocket; вхідні дані у форматі PCM, FLAC або Ogg-Opus (документація streaming, перевірено у вересні 2026)

У кожному випадку розпізнавачу повідомляється власна мова мовця — мова, яку учасник встановив у своєму профілі, — оскільки автоматичне визначення мови виявилося ненадійним на коротких фрагментах у наших тестах: чотирисекундне повідомлення російською мовою було розпізнане як англійське. Саме так продукт сьогодні звертається до Azure, і саме так тест звертається до двох інших сервісів.

Що ми вимірювали

Набір. 153 фрагменти 17 мовами: 136 реплік діалогів — два ділові діалоги (переговори щодо контракту та щоденний стендап), озвучені двома синтетичними голосами продукту десятьма мовами, — плюс 17 формальних уривків, ділові речення FLORES-200 з нашого публічного бенчмарку перекладу, прочитані синтетичним голосом, по одному на мову, тривалістю від 71 до 109 секунд. Репліки діалогів тривають від 3 до 30 секунд — стільки ж, скільки й реальне голосове повідомлення.

Метрика. Частка помилкових слів (WER) відносно еталонного тексту — частка слів, які були замінені, вставлені або видалені, — після нормалізації регістру, пунктуації та пробілів; для китайської та японської мов порівняння виконується посимвольно. Паралельно фіксувалася частка помилкових символів, і вона показує ту саму картину.

Тестовий стенд. Один скрипт, одна машина, одна година 16.09.2026, кожен рушій обробив усі 153 фрагменти. Azure та Amazon Transcribe приймали кожен фрагмент цілком. Синхронний розпізнавач Google приймає щонайбільше 60 секунд, тож 17 формальних фрагментів були розрізані на паузах на частини менше 55 секунд, а транскрипти потім об'єднані; 136 фрагментів діалогів оброблялися цілком. Amazon Transcribe очікує аудіо в темпі реального часу, тож стенд подавав його вчетверо швидше за реальний час; тому наведена нижче цифра затримки для нього — це нижня межа, задана способом подачі, а не самим сервісом.

Чим це не є. Це синтетичні голоси в тихому аудіо, а не польові записи з телефону в машині. Один день, один прогін на фрагмент. Це порівняння на аудіо, на якому тестується наш власний конвеєр перекладу, мовами, якими пишуть наші користувачі, — а не рейтингова таблиця.

Результати: частка помилкових слів за мовами

Середня частка помилкових слів (WER) для фрагментів кожної мови; кожен рушій повернув транскрипт для всіх 153 фрагментів.

МоваФрагментиAzure AI SpeechGoogle Chirp 3Amazon Transcribe
Арабська1332%46%26%
Китайська133%3%8%
Чеська11%2%3%
Нідерландська12%2%3%
Англійська212%5%2%
Французька135%11%12%
Німецька137%9%13%
Гінді1310%10%12%
Угорська19%7%8%
Італійська11%1%3%
Японська136%5%5%
Корейська19%11%11%
Польська11%1%2%
Португальська (Бразилія)135%4%6%
Російська2114%10%14%
Іспанська136%5%6%
Турецька14%3%4%
Усі 153 фрагменти1539%10%10%
Лише репліки діалогів1369%11%10%
Лише формальні уривки174%5%5%
Час обробки ÷ тривалість аудіо0.100.220.41 (обмежено темпом подачі)

Мови з лише одним фрагментом (тільки формальний уривок) наведено для повноти; показник з одного фрагмента — це окрема точка даних, а не статистична частка.

Що показують ці цифри

  • На всьому наборі три сервіси відрізняються не більше ніж на один пункт: 9%, 10% і 10%. Кожен із 153 фрагментів повернувся з транскриптом від кожного рушія — покриття всіх 17 мов повне для всіх трьох.
  • Відмінності проявляються по мовах, і в обидва боки. Azure мав найнижчу частку помилок для французької (5% проти 11% і 12%) та німецької (7% проти 9% і 13%) мов, а також розділив перше місце з англійською (2%, разом з Amazon Transcribe) та китайською (3%, разом з Google). Amazon Transcribe мав найнижчий показник для арабської (26% проти 32% і 46%). Google мав найнижчий показник для російської (10% проти 14% і 14%), португальської, угорської та турецької мов.
  • Арабська складна для всіх трьох. Найкращий результат на арабських діалогових фрагментах — це помилка в кожному четвертому слові. Це узгоджується з тим, що ми спостерігали на боці перекладу, де ми прибрали арабську мову з вибору мов зустрічі у серпні 2026 року, доки якість не досягне нашої планки (скільки мов ми підтримуємо).
  • Час обробки в усіх трьох значно менший за реальний час. 30-секундне повідомлення в цьому стенді обробляється приблизно за три секунди на Azure та приблизно за сім на Google; показник Amazon визначається переважно темпом подачі даних.

Чому Azure AI Speech залишається варіантом за замовчуванням

Три причини, у тому порядку, в якому вони й визначили це рішення.

1. Шлюз за замовчуванням — це Azure. Організація, яка не обрала шлюз, використовує свої функції ШІ на Azure OpenAI в EU Data Zone, тож її голосові повідомлення транскрибуються сервісом Azure AI Speech у тому самому тенанті. Жодного додаткового субпроцесора, жодного додаткового регіону. Microsoft стверджує, що Azure Speech не зберігає й не обробляє дані за межами регіону ресурсу Speech (сторінка регіонів, перевірено у вересні 2026); наш ресурс знаходиться в Sweden Central, який зазначений як доступний для швидкої транскрипції.

2. Форма API підходить для голосового повідомлення. Голосове повідомлення в InterMIND може тривати до десяти хвилин (голосові повідомлення). Швидка транскрипція Azure приймає весь запис в одному запиті. Синхронне розпізнавання Google обмежене 60 секундами, тож десятихвилинне повідомлення потребує пакетного розпізнавання через сховище або потокової сесії; Amazon Transcribe працює потоково, але приймає PCM, FLAC або Ogg-Opus, а не формати, у яких записують телефони та браузери, тож аудіо спочатку потрібно перекодувати. Обидві проблеми вирішувані — стенд їх вирішує, — але це додаткові рухомі частини на шляху кожного повідомлення.

3. Цифри не суперечать цьому рішенню. При 9% проти 10% і 10% жоден рушій у цьому наборі не є настільки кращим, щоб виправдати перенесення голосових повідомлень з шлюзу за замовчуванням. Якби Google чи Amazon показали вдвічі меншу частку помилок, ця стаття про це б і повідомила.

Що це означає для організацій на Vertex AI або Bedrock

Якщо ваша організація обрала Google Vertex AI або Amazon Bedrock як свій шлюз, ваші функції ШІ працюють саме там. Голосові повідомлення в таких організаціях наразі надходять як запис без транскрипту: ми виміряли Google Cloud Speech-to-Text та Amazon Transcribe, як показано в цій статті, але ще не інтегрували їх у продукт. Дозволи та код інтеграції вже існують; ця стаття буде оновлена, коли вони з'являться на шляху кожного повідомлення. До того часу голосове повідомлення в організації на Vertex AI або Bedrock — це запис, який можна відтворити; організація, яка перемикає свій шлюз на Azure, отримує транскрипти для повідомлень, надісланих з цього моменту.

Поширені запитання

Який сервіс розпізнавання мовлення використовує InterMIND?

Для голосових повідомлень у чаті — Azure AI Speech (API швидкої транскрипції) у власному тенанті Azure компанії InterMIND у Sweden Central — мовленнєвий сервіс шлюзу ШІ за замовчуванням. Мовлення наживо на зустрічах — це інший шлях: воно обробляється власним медіарушієм InterMIND, Mind API, розміщеним в OVH у Франції, і ніколи не звертається до хмарного мовленнєвого сервісу (де насправді відбувається зустріч).

Чи є Azure AI Speech точнішим за Google Speech-to-Text або Amazon Transcribe?

На нашому наборі зі 153 фрагментів голосових повідомлень 17 мовами, виміряному в один день на одному й тому самому стенді, Azure AI Speech мав середню частку помилкових слів 9%, Google Cloud Speech-to-Text (Chirp 3) — 10%, а Amazon Transcribe — 10%. За мовами порядок змінюється: Azure був найкращим для французької, англійської та китайської, Amazon Transcribe — для арабської, Google — для російської. На іншому наборі записів рейтинг може відрізнятися; наведена вище таблиця — це докази для нашого набору.

Що таке частка помилкових слів і як вона тут обчислювалася?

Частка помилкових слів — це кількість замінених, вставлених і видалених слів, поділена на кількість слів в еталонному тексті. Перед порівнянням ми нормалізуємо регістр, пунктуацію та пробіли, а китайську й японську мови порівнюємо посимвольно, оскільки в цих системах письма слова не розділені пробілами. Показник 9% означає, що приблизно кожне одинадцяте слово відрізняється від еталону.

Чи виходить аудіо голосового повідомлення за межі ЄС?

Ні. Запис зберігається в об'єктному сховищі InterMIND у ЄС, а мовленнєвий сервіс, який його транскрибує, працює в регіоні ЄС: Sweden Central на Azure, мультирегіон eu на Google Cloud, Франкфурт на AWS. Повний перелік сторін і регіонів наведено на сторінці субпроцесорів та сторінці довіри.

Чому не розпізнавати мовлення на боці клієнта, у застосунку, щоб аудіо ніколи не залишало телефон?

Ми виміряли й це, у вересні 2026 року. Вбудований розпізнавач Chrome з локальною обробкою правильно розпізнав 0 із 17 формальних фрагментів мовами продукту, а покриття мов клієнтськими розпізнавачами набагато вужче за 17 мов у таблиці вище. Клієнтське розпізнавання — це напрямок, який ми переоцінюємо в міру вдосконалення платформ; сьогодні саме шлях через шлюз працює для кожного учасника кожною мовою.

Чи може наша організація обрати, який мовленнєвий сервіс транскрибує її голосові повідомлення?

Не окремо: адміністратор організації обирає шлюз ШІ на сторінці інтеграцій. На шлюзі за замовчуванням голосові повідомлення транскрибує Azure AI Speech. На Vertex AI та Amazon Bedrock голосові повідомлення поки що не транскрибуються — див. розділ вище.

Якою може бути тривалість голосового повідомлення та чи обмежує її API?

До десяти хвилин. Швидка транскрипція Azure приймає файли розміром до 5 годин і 500 МБ в одному запиті, тож повідомлення транскрибується одним викликом. Синхронне розпізнавання Google приймає до 60 секунд і 10 МБ, саме тому стенд розрізав довгі фрагменти на частини на паузах.

Чому розпізнавачу повідомляють мову мовця, замість того щоб визначати її автоматично?

Тому що голосове повідомлення коротке. На чотирисекундному фрагменті автоматичне визначення мови може повернути неправильну мову — тестове повідомлення російською було розпізнане як англійське; мова, вказана в профілі учасника, правильна майже завжди. Розпізнавачу передається саме ця мова, і лише коли вона невідома, йому передаються мови кімнати як кандидати.

Чи транскрибується аудіо зустрічі тим самим сервісом?

Ні. Мовлення наживо на зустрічі розпізнається й перекладається власним рушієм InterMIND (Mind API) на медіасервері, який обслуговує дзвінок, розміщеному в OVH у Франції — див. де насправді відбувається зустріч. Хмарний шлюз бачить лише текст і ніколи не бачить аудіо дзвінка (ШІ для зустрічей на вашому власному шлюзі).

Чи будете ви публікувати результати знову?

Стенд запускається однією командою, а дозволи для кожного рушія вже налаштовані, тож таблицю можна перевимірювати щоразу, коли постачальник випускає нову модель. Коли це змінює картину, стаття оновлюється разом із датою.


Переконайтеся самі


Джерела: Microsoft — швидка транскрипція Azure AI Speech (learn.microsoft.com) та таблиця регіонів Speech (learn.microsoft.com); Google Cloud — модель Chirp 3 (docs.cloud.google.com), обмеження синхронного розпізнавання (docs.cloud.google.com) та підтримувані мови (docs.cloud.google.com); AWS — потокове передавання Amazon Transcribe (docs.aws.amazon.com), кінцеві точки та квоти (docs.aws.amazon.com) та підтримувані мови (docs.aws.amazon.com); усе перевірено у вересні 2026 року. Вимірювання: тестовий стенд InterMIND для розпізнавання мовлення, 16.09.2026, 153 фрагменти, 17 мов.

Отримуйте нові публікації та оновлення продукту на email

Один лист на місяць із новими публікаціями та оновленнями продукту. Скасувати підписку можна будь-коли.


Платіть лише за тих, хто користується: InterMIND переходить на тарифікацію за активних учасників

Pro та Business припиняють продаж місць, які ви призначаєте вручну. Запросіть всю свою команду; під час кожного поновлення рахуються учасники, які були активними протягом попередніх 28 днів, і рахунок виставляється лише за них. Учасник, який стає неактивним, зберігає свій доступ і не потребує оплати; гості зустрічей та учасники зовнішніх каналів залишаються безкоштовними. Що вважається активністю, як змінюється число протягом циклу оплати, що написано в листі перед поновленням і що змінюється на вашій сторінці оплати.

Субтитри з перекладом у реальному часі для всієї аудиторії: що вимагають Zoom, Teams та Google Meet, і як кожен учасник читає своєю мовою (2026)

Один спікер, аудиторія десяма мовами. Субтитри з перекладом існують у Zoom, Microsoft Teams та Google Meet — кожен за різною ліцензією, і кожен по-різному відповідає на одне й те саме запитання: хто вирішує, якими мовами може читати аудиторія. Teams дозволяє організатору загальної зустрічі попередньо обрати шість мов (десять із Teams Premium); пари Zoom визначаються налаштуваннями облікового запису ведучого; Google Meet обмежує субтитри з перекладом платними редакціями Workspace. Задокументована карта поряд із тим, як це працює в InterMIND, де мова субтитрів є налаштуванням на боці самого учасника, а кімната також перекладається голосом.