Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe pada 153 catatan suara: mengapa InterMIND menjalankan speech-to-text di cloud gateway milik organisasi Anda sendiri (2026)
Catatan suara di sebuah channel InterMIND menjadi pesan teks yang dibaca setiap rekan tim dalam bahasa mereka sendiri. Langkah pertama dari proses itu adalah speech-to-text, dan pertanyaan yang kami terima dari peninjau TI dan kepatuhan bukanlah "seberapa akurat ini" melainkan "layanan siapa ini, dan ke mana audionya pergi".
Jawaban singkatnya: Azure AI Speech, layanan ucapan dari AI gateway default, di tenant Azure milik InterMIND sendiri di Sweden Central — serta layanan ucapan dari dua gateway lain yang dapat dipilih organisasi, diukur pada klip yang sama sehingga pilihannya menjadi angka, bukan preferensi. Tulisan ini menunjukkan angka-angka di balik pilihan tersebut — 153 klip yang sama melalui Azure AI Speech, Google Cloud Speech-to-Text, dan Amazon Transcribe pada hari yang sama — serta dua fakta tentang setiap API yang lebih penting daripada satu poin persentase akurasi.
Aturannya lebih dulu: satu gateway per organisasi
Setiap fitur AI di InterMIND — rekap meeting, ringkasan dokumen, writing assistant, Ask AI, dan Mia dalam meeting — berjalan di satu gateway model bahasa yang dipilih organisasi: Azure OpenAI di EU Data Zone secara default, Google Vertex AI di endpoint multi-region UE, atau Amazon Bedrock di Frankfurt sesuai pilihan, masing-masing di tenant milik InterMIND sendiri. Kami menjelaskan alasannya di AI meeting di cloud gateway Anda sendiri: bagi kebanyakan organisasi, gateway tersebut sudah ada dalam daftar sub-processor yang disetujui, sehingga fitur AI tidak menambahkan perusahaan baru ke daftar tersebut.
Speech-to-text untuk catatan suara mengikuti aturan yang sama pada gateway default saat ini, dan masing-masing dari ketiga gateway memiliki layanan ucapan sendiri di samping model bahasanya — inilah yang diukur dalam tulisan ini:
| Gateway | Layanan ucapan | Wilayah yang digunakan dalam pengujian ini | Bagaimana API menerima rekaman |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | Sweden Central | Satu permintaan untuk file hingga 5 jam dan 500 MB (dokumentasi fast transcription, diperiksa September 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, model Chirp 3 | multi-region eu | Pengenalan sinkron dibatasi hingga 60 detik dan 10 MB; audio yang lebih panjang diproses melalui pengenalan batch atau streaming (batasan sinkron, Chirp 3, diperiksa September 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | Sesi streaming melalui HTTP/2 atau WebSocket; input berupa PCM, FLAC, atau Ogg-Opus (dokumentasi streaming, diperiksa September 2026) |
Pengenal ucapan selalu diberi tahu bahasa penutur itu sendiri — bahasa yang diatur anggota di profilnya — karena identifikasi bahasa otomatis terbukti tidak andal pada klip pendek dalam pengujian kami: catatan berbahasa Rusia berdurasi empat detik justru dikenali sebagai bahasa Inggris. Begitulah cara produk memanggil Azure saat ini, dan pengujian ini memanggil dua layanan lainnya dengan cara yang sama.