[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-id-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_id\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe pada 153 catatan suara: mengapa InterMIND menjalankan speech-to-text di cloud gateway organisasi Anda sendiri (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-vs-google-chirp-3-vs-amazon-transcribe-pada-153-catatan-suara-mengapa-intermind-menjalankan-speech-to-text-di-cloud-gateway-milik-organisasi-anda-sendiri-2026","Azure AI Speech vs Google Chirp 3 vs Amazon Transcribe pada 153 catatan suara: mengapa InterMIND menjalankan speech-to-text di cloud gateway milik organisasi Anda sendiri (2026)",[20,21,22],"p",{},"Catatan suara di sebuah channel InterMIND menjadi pesan teks yang dibaca setiap rekan tim dalam bahasa mereka sendiri. Langkah pertama dari proses itu adalah speech-to-text, dan pertanyaan yang kami terima dari peninjau TI dan kepatuhan bukanlah \"seberapa akurat ini\" melainkan \"layanan siapa ini, dan ke mana audionya pergi\".",[20,24,25],{},"Jawaban singkatnya: Azure AI Speech, layanan ucapan dari AI gateway default, di tenant Azure milik InterMIND sendiri di Sweden Central — serta layanan ucapan dari dua gateway lain yang dapat dipilih organisasi, diukur pada klip yang sama sehingga pilihannya menjadi angka, bukan preferensi. Tulisan ini menunjukkan angka-angka di balik pilihan tersebut — 153 klip yang sama melalui Azure AI Speech, Google Cloud Speech-to-Text, dan Amazon Transcribe pada hari yang sama — serta dua fakta tentang setiap API yang lebih penting daripada satu poin persentase akurasi.",[27,28,30],"h2",{"id":29},"aturannya-lebih-dulu-satu-gateway-per-organisasi","Aturannya lebih dulu: satu gateway per organisasi",[20,32,33,34,39],{},"Setiap fitur AI di InterMIND — rekap meeting, ringkasan dokumen, writing assistant, Ask AI, dan Mia dalam meeting — berjalan di satu gateway model bahasa yang dipilih organisasi: Azure OpenAI di EU Data Zone secara default, Google Vertex AI di endpoint multi-region UE, atau Amazon Bedrock di Frankfurt sesuai pilihan, masing-masing di tenant milik InterMIND sendiri. Kami menjelaskan alasannya di ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","AI meeting di cloud gateway Anda sendiri",": bagi kebanyakan organisasi, gateway tersebut sudah ada dalam daftar sub-processor yang disetujui, sehingga fitur AI tidak menambahkan perusahaan baru ke daftar tersebut.",[20,41,42],{},"Speech-to-text untuk catatan suara mengikuti aturan yang sama pada gateway default saat ini, dan masing-masing dari ketiga gateway memiliki layanan ucapan sendiri di samping model bahasanya — inilah yang diukur dalam tulisan ini:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Gateway",[53,57,58],{},"Layanan ucapan",[53,60,61],{},"Wilayah yang digunakan dalam pengujian ini",[53,63,64],{},"Bagaimana API menerima rekaman",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, fast transcription API",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Satu permintaan untuk file hingga 5 jam dan 500 MB (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","dokumentasi fast transcription",", diperiksa September 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, model Chirp 3",[71,106,107,108],{},"multi-region ",[109,110,111],"code",{},"eu",[71,113,114,115,120,121,93],{},"Pengenalan sinkron dibatasi hingga 60 detik dan 10 MB; audio yang lebih panjang diproses melalui pengenalan batch atau streaming (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"batasan sinkron",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, streaming",[71,138,139],{},"eu-central-1 (Frankfurt)",[71,141,142,143,93],{},"Sesi streaming melalui HTTP\u002F2 atau WebSocket; input berupa PCM, FLAC, atau Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"dokumentasi streaming",[20,149,150],{},"Pengenal ucapan selalu diberi tahu bahasa penutur itu sendiri — bahasa yang diatur anggota di profilnya — karena identifikasi bahasa otomatis terbukti tidak andal pada klip pendek dalam pengujian kami: catatan berbahasa Rusia berdurasi empat detik justru dikenali sebagai bahasa Inggris. Begitulah cara produk memanggil Azure saat ini, dan pengujian ini memanggil dua layanan lainnya dengan cara yang sama.",[27,152,154],{"id":153},"apa-yang-kami-ukur","Apa yang kami ukur",[20,156,157,160,161,165],{},[74,158,159],{},"Kumpulan data."," 153 klip dalam 17 bahasa: 136 giliran dialog — dua dialog bisnis (negosiasi kontrak dan stand-up harian) yang diucapkan oleh dua suara sintetis produk dalam sepuluh bahasa — ditambah 17 bagian formal, kalimat bisnis FLORES-200 dari ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","tolok ukur terjemahan publik"," kami yang dibacakan oleh suara sintetis, satu per bahasa dan berdurasi 71 hingga 109 detik. Giliran dialog berdurasi 3 hingga 30 detik, sepanjang catatan suara sungguhan.",[20,167,168,171],{},[74,169,170],{},"Metrik."," Word error rate (WER) terhadap teks referensi — proporsi kata yang disubstitusi, disisipkan, atau dihapus — setelah menormalkan huruf besar\u002Fkecil, tanda baca, dan spasi; bahasa Mandarin dan Jepang dibandingkan per karakter. Character error rate juga dicatat dan menunjukkan hasil yang sama.",[20,173,174,177],{},[74,175,176],{},"Harness pengujian."," Satu skrip, satu mesin, satu jam pada 2026-09-16, setiap mesin memproses seluruh 153 klip. Azure dan Amazon Transcribe menerima setiap klip secara utuh. Pengenal sinkron Google hanya menerima maksimal 60 detik, sehingga 17 klip formal dipotong pada jeda hening menjadi bagian-bagian di bawah 55 detik lalu transkripnya digabungkan; 136 klip dialog diproses utuh. Amazon Transcribe membutuhkan audio dengan kecepatan real-time, sehingga harness ini mengumpankannya empat kali lebih cepat dari real-time; angka latensi di bawah karenanya merupakan batas bawah yang ditentukan oleh cara pengumpanan, bukan oleh layanannya.",[20,179,180,183],{},[74,181,182],{},"Apa yang bukan ini."," Suara sintetis dalam audio yang tenang, bukan rekaman lapangan dari ponsel di dalam mobil. Satu hari, satu kali proses per klip. Ini adalah perbandingan pada audio yang sama dengan yang digunakan untuk menguji pipeline terjemahan kami sendiri, dalam bahasa-bahasa yang digunakan pengguna kami menulis — bukan papan peringkat.",[27,185,187],{"id":186},"hasil-word-error-rate-per-bahasa","Hasil: word error rate per bahasa",[20,189,190],{},"WER rata-rata pada klip tiap bahasa; setiap mesin mengembalikan transkrip untuk seluruh 153 klip.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Bahasa",[53,201,202],{},"Klip",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"Arab",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"Mandarin",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"Ceko",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"Belanda",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"Inggris",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"Prancis",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"Jerman",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"Hindi",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"Hungaria",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"Italia",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"Jepang",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"Korea",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"Polandia",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"Portugis (Brasil)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"Rusia",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"Spanyol",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"Turki",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Seluruh 153 klip",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Hanya giliran dialog",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Hanya bagian formal",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Waktu pemrosesan ÷ panjang audio",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (dibatasi oleh pengumpanan)",[20,522,523],{},"Bahasa dengan hanya satu klip (bagian formal saja) ditampilkan demi kelengkapan; angka dari satu klip adalah titik data, bukan tingkat kesalahan.",[27,525,527],{"id":526},"apa-yang-ditunjukkan-angka-angka-ini","Apa yang ditunjukkan angka-angka ini",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"Pada keseluruhan kumpulan data, ketiga layanan berada dalam selisih satu poin satu sama lain:"," 9%, 10%, dan 10%. Setiap satu dari 153 klip menghasilkan transkrip dari setiap mesin — cakupan 17 bahasa lengkap pada ketiganya.",[532,539,540,543],{},[74,541,542],{},"Perbedaannya ada per bahasa, dan arahnya tidak selalu sama."," Azure memiliki tingkat kesalahan terendah pada bahasa Prancis (5% dibanding 11% dan 12%) dan Jerman (7% dibanding 9% dan 13%), serta seri di posisi terendah untuk bahasa Inggris (2%, bersama Amazon Transcribe) dan Mandarin (3%, bersama Google). Amazon Transcribe memiliki tingkat kesalahan terendah pada bahasa Arab (26% dibanding 32% dan 46%). Google memiliki tingkat kesalahan terendah pada bahasa Rusia (10% dibanding 14% dan 14%), Portugis, Hungaria, dan Turki.",[532,545,546,549,550,554],{},[74,547,548],{},"Bahasa Arab sulit bagi ketiganya."," Hasil terbaik pada klip dialog berbahasa Arab adalah satu dari empat kata salah. Ini konsisten dengan yang kami lihat pada sisi terjemahan, di mana kami menarik bahasa Arab dari pemilih bahasa meeting pada Agustus 2026 hingga kualitasnya melewati ambang batas kami (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","berapa banyak bahasa yang kami dukung",").",[532,556,557,560],{},[74,558,559],{},"Waktu pemrosesan jauh di bawah real-time pada ketiganya."," Catatan berdurasi 30 detik membutuhkan sekitar tiga detik pada Azure dan sekitar tujuh detik pada Google dalam harness ini; angka Amazon didominasi oleh pengumpanan yang diatur kecepatannya.",[27,562,564],{"id":563},"mengapa-azure-ai-speech-tetap-menjadi-default","Mengapa Azure AI Speech tetap menjadi default",[20,566,567],{},"Tiga alasan, dalam urutan yang menentukan pilihan ini.",[20,569,570,573,574,579],{},[74,571,572],{},"1. Gateway default adalah Azure."," Organisasi yang belum memilih gateway menjalankan fitur AI-nya pada Azure OpenAI di EU Data Zone, sehingga catatan suaranya ditranskripsi oleh Azure AI Speech di tenant yang sama. Tidak ada sub-processor tambahan, tidak ada wilayah tambahan. Microsoft menyatakan bahwa Azure Speech tidak menyimpan atau memproses data di luar wilayah resource Speech tersebut (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"halaman regions",", diperiksa September 2026); resource kami berada di Sweden Central, yang terdaftar untuk fast transcription.",[20,581,582,585,586,590],{},[74,583,584],{},"2. Bentuk API ini cocok untuk catatan suara."," Catatan suara di InterMIND dapat berdurasi hingga sepuluh menit (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","catatan suara","). Fast transcription Azure menerima seluruh rekaman dalam satu permintaan. Pengenalan sinkron Google berhenti pada 60 detik, sehingga catatan sepuluh menit memerlukan pengenalan batch melalui storage bucket atau sesi streaming; Amazon Transcribe melakukan streaming, tetapi menerima PCM, FLAC, atau Ogg-Opus, bukan format yang direkam oleh ponsel dan browser, sehingga audionya harus di-transcode terlebih dahulu. Keduanya dapat diatasi — harness ini mengatasinya — tetapi keduanya menambah lebih banyak bagian yang bergerak di jalur setiap catatan.",[20,592,593,596],{},[74,594,595],{},"3. Angka-angkanya tidak menentang pilihan ini."," Dengan 9% berbanding 10% dan 10%, tidak ada mesin dalam kumpulan data ini yang cukup lebih baik untuk membenarkan pemindahan catatan suara dari gateway default. Jika Google atau Amazon mencapai setengah dari tingkat kesalahan ini, tulisan ini akan mengatakannya.",[27,598,600],{"id":599},"apa-artinya-ini-bagi-organisasi-yang-menggunakan-vertex-ai-atau-bedrock","Apa artinya ini bagi organisasi yang menggunakan Vertex AI atau Bedrock",[20,602,603],{},"Jika organisasi Anda memilih Google Vertex AI atau Amazon Bedrock sebagai gateway-nya, fitur AI Anda berjalan di sana. Catatan suara di organisasi tersebut saat ini muncul sebagai rekaman tanpa transkrip: kami telah mengukur Google Cloud Speech-to-Text dan Amazon Transcribe, seperti yang ditunjukkan tulisan ini, tetapi belum menghubungkannya ke dalam produk. Izin akses dan kode integrasinya sudah ada; tulisan ini akan diperbarui saat keduanya sudah berada di jalur setiap catatan. Sampai saat itu, catatan suara di organisasi Vertex AI atau Bedrock adalah rekaman yang dapat diputar; organisasi yang beralih gateway-nya ke Azure akan mendapatkan transkrip pada catatan yang dikirim sejak saat itu.",[27,605,607],{"id":606},"faq","FAQ",[20,609,610],{},[74,611,612],{},"Layanan speech-to-text apa yang digunakan InterMIND?",[20,614,615,616,554],{},"Untuk catatan suara di chat, Azure AI Speech (fast transcription API) di tenant Azure milik InterMIND sendiri di Sweden Central — layanan ucapan dari AI gateway default. Ucapan langsung dalam meeting menempuh jalur yang berbeda: berjalan pada media engine milik InterMIND sendiri, Mind API, yang dihosting di OVH di Prancis, dan tidak pernah menyentuh layanan ucapan cloud (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","di mana satu meeting berjalan",[20,621,622],{},[74,623,624],{},"Apakah Azure AI Speech lebih akurat daripada Google Speech-to-Text atau Amazon Transcribe?",[20,626,627],{},"Pada kumpulan 153 klip catatan suara kami dalam 17 bahasa, diukur pada hari yang sama dengan harness yang sama, Azure AI Speech memiliki word error rate rata-rata 9%, Google Cloud Speech-to-Text (Chirp 3) 10%, dan Amazon Transcribe 10%. Per bahasa urutannya berubah: Azure terendah pada bahasa Prancis, Inggris, dan Mandarin, Amazon Transcribe pada bahasa Arab, Google pada bahasa Rusia. Pada kumpulan rekaman yang berbeda, peringkatnya bisa berbeda; tabel di atas adalah bukti untuk kumpulan data kami.",[20,629,630],{},[74,631,632],{},"Apa itu word error rate, dan bagaimana cara menghitungnya di sini?",[20,634,635],{},"Word error rate adalah jumlah kata yang disubstitusi, disisipkan, dan dihapus dibagi jumlah kata dalam teks referensi. Kami menormalkan huruf besar\u002Fkecil, tanda baca, dan spasi sebelum membandingkan, dan membandingkan bahasa Mandarin serta Jepang per karakter karena kedua skrip tersebut tidak memisahkan kata dengan spasi. Tingkat 9% berarti kira-kira satu dari sebelas kata berbeda dari referensi.",[20,637,638],{},[74,639,640],{},"Apakah audio catatan suara keluar dari UE?",[20,642,643,644,646,647,651,652,656],{},"Tidak. Rekaman disimpan di object storage milik InterMIND di UE, dan layanan ucapan yang mentranskripsinya berjalan di wilayah UE: Sweden Central di Azure, multi-region ",[109,645,111],{}," di Google Cloud, Frankfurt di AWS. Daftar lengkap pihak dan wilayah tersedia di ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","halaman subprocessors"," dan ",[35,653,655],{"href":654},"\u002Ftrust","halaman trust",".",[20,658,659],{},[74,660,661],{},"Mengapa tidak mengenali ucapan di sisi klien, dalam aplikasi, sehingga audio tidak pernah meninggalkan ponsel?",[20,663,664],{},"Kami juga sudah mengukur hal ini, pada September 2026. Pengenal bawaan Chrome dengan pemrosesan lokal berhasil mengenali 0 dari 17 klip formal di seluruh bahasa produk, dan cakupan bahasa pengenal sisi klien jauh lebih sempit dibanding 17 bahasa pada tabel di atas. Pengenalan sisi klien adalah arah yang akan kami ukur ulang seiring perkembangan platform; saat ini jalur gateway adalah satu-satunya yang berfungsi untuk setiap anggota dalam setiap bahasa.",[20,666,667],{},[74,668,669],{},"Bisakah organisasi kami memilih layanan ucapan mana yang mentranskripsi catatan suaranya?",[20,671,672],{},"Tidak secara terpisah: AI gateway adalah yang dipilih admin organisasi di halaman Integrations. Pada gateway default, catatan suara ditranskripsi oleh Azure AI Speech. Pada Vertex AI dan Amazon Bedrock, catatan suara belum ditranskripsi — lihat bagian di atas.",[20,674,675],{},[74,676,677],{},"Berapa lama durasi catatan suara, dan apakah API membatasinya?",[20,679,680],{},"Hingga sepuluh menit. Fast transcription Azure menerima file hingga 5 jam dan 500 MB dalam satu permintaan, sehingga catatan ditranskripsi dalam satu panggilan. Pengenalan sinkron Google menerima 60 detik dan 10 MB, itulah sebabnya harness memotong klip panjang menjadi bagian-bagian pada jeda hening.",[20,682,683],{},[74,684,685],{},"Mengapa pengenal diberi tahu bahasa penutur alih-alih mendeteksinya sendiri?",[20,687,688],{},"Karena catatan suara berdurasi singkat. Pada klip berdurasi empat detik, identifikasi bahasa otomatis dapat memberikan bahasa yang salah — sebuah catatan uji berbahasa Rusia justru dikenali sebagai bahasa Inggris; bahasa profil anggota hampir selalu tepat. Pengenal menerima bahasa tersebut, dan hanya ketika bahasa itu tidak diketahui, ia menerima bahasa-bahasa ruangan sebagai kandidat.",[20,690,691],{},[74,692,693],{},"Apakah audio meeting ditranskripsi oleh layanan yang sama?",[20,695,696,697,699,700,554],{},"Tidak. Ucapan langsung dalam meeting dikenali dan diterjemahkan pada engine milik InterMIND sendiri (Mind API) di media server yang membawa panggilan tersebut, dihosting di OVH di Prancis — lihat ",[35,698,619],{"href":618},". Cloud gateway hanya melihat teks, tidak pernah audio dari panggilan tersebut (",[35,701,702],{"href":37},"AI meeting di gateway Anda sendiri",[20,704,705],{},[74,706,707],{},"Apakah hasil ini akan dipublikasikan lagi?",[20,709,710],{},"Harness ini berjalan dengan satu perintah, dan izin akses setiap mesin sudah tersedia, sehingga tabel ini dapat diukur ulang saat vendor merilis model baru. Ketika hasilnya berubah, tulisan ini akan diperbarui beserta tanggalnya.",[712,713],"hr",{},[27,715,717],{"id":716},"lihat-sendiri","Lihat sendiri",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Baca cara kerja catatan suara"," — perekaman, batas sepuluh menit, dan ke mana audionya pergi.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Lihat daftar subprocessors"," — vendor, negara, tujuan, dan wilayah untuk setiap pihak yang memproses data Anda.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Coba demo langsung"," — pipeline terjemahan produksi pada audio Anda sendiri, tanpa perlu mendaftar.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Sumber: Microsoft — Azure AI Speech fast transcription (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") dan tabel Speech regions (",[35,759,756],{"href":576,"rel":760},[91],"); Google Cloud — model Chirp 3 (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), batasan pengenalan sinkron (",[35,768,765],{"href":117,"rel":769},[91],") dan bahasa yang didukung (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — Amazon Transcribe streaming (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), endpoint dan kuota (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); semua diperiksa September 2026. Pengukuran: InterMIND speech bench, 2026-09-16, 153 klip, 17 bahasa.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Kami mengukur layanan speech-to-text dari tiga cloud gateway yang dapat dipilih oleh organisasi InterMIND — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3), dan Amazon Transcribe — pada cuplikan 153 cataman suara yang sama dalam 17 bahasa, satu harness, satu hari. Tingkat kesalahan kata per bahasa, metode, batasan setiap API, dan mengapa pengenal mengikuti gateway, bukan papan peringkat.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","yxR-krcvWd29EePhmb-SdVxPgK7mEs92ANgG2F7NbQo",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Bayar hanya untuk orang yang menggunakannya: InterMIND beralih ke penagihan per anggota aktif","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Pro dan Business berhenti menjual kursi yang Anda tetapkan secara manual. Undang seluruh tim Anda; setiap perpanjangan menghitung anggota yang aktif dalam 28 hari sebelumnya dan menagih hanya untuk mereka. Anggota yang menjadi tidak aktif tetap memiliki akses mereka tanpa biaya; tamu rapat dan peserta channel eksternal tetap gratis. Apa yang dihitung sebagai aktif, bagaimana angka bergerak di dalam siklus penagihan, apa isi surat sebelum perpanjangan, dan apa yang berubah di halaman penagihan Anda.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Takarir terjemahan langsung untuk seluruh audiens: apa yang Zoom, Teams, dan Google Meet butuhkan, serta bagaimana setiap peserta membaca dalam bahasa mereka sendiri (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Satu pembicara, audiens dalam sepuluh bahasa. Takarir terjemahan tersedia di Zoom, Microsoft Teams, dan Google Meet — masing-masing di balik lisensi yang berbeda, dan masing-masing menjawab pertanyaan yang sama secara berbeda: siapa yang menentukan bahasa apa yang dapat dibaca oleh audiens. Teams memungkinkan penyelenggara rapat umum memilih enam bahasa sebelumnya (sepuluh dengan Teams Premium); pasangan Zoom ditentukan oleh pengaturan akun host; Google Meet membatasi takarir terjemahan pada edisi Workspace berbayar. Peta yang didokumentasikan, berdampingan dengan cara kerjanya di InterMIND, di mana bahasa takarir merupakan pengaturan di sisi peserta itu sendiri dan ruangan juga diterjemahkan dengan suara."]