Azure AI Speech เทียบกับ Google Chirp 3 และ Amazon Transcribe บนข้อความเสียง 153 รายการ: เหตุผลที่ InterMIND ใช้การแปลงเสียงเป็นข้อความผ่านเกตเวย์คลาวด์ขององค์กรคุณเอง (2026)
ข้อความเสียงในช่องของ InterMIND จะกลายเป็นข้อความตัวอักษรที่เพื่อนร่วมทีมทุกคนอ่านได้ในภาษาของตนเอง ขั้นตอนแรกคือการแปลงเสียงเป็นข้อความ (speech-to-text) คำถามที่ทีม IT และผู้ตรวจสอบด้านคอมไพลแอนซ์ถามเรามักไม่ใช่ "แม่นยำแค่ไหน" แต่เป็น "บริการนี้เป็นของใคร และเสียงถูกส่งไปที่ใด"
คำตอบสั้น ๆ คือ Azure AI Speech ซึ่งเป็นบริการเสียงของเกตเวย์ AI เริ่มต้น ทำงานใน Azure tenant ของ InterMIND เองที่ Sweden Central ส่วนอีกสองเกตเวย์ที่องค์กรเลือกใช้ได้ก็มีบริการเสียงของตนเอง เราวัดทั้งหมดบนคลิปชุดเดียวกัน เพื่อให้การเลือกเป็นตัวเลข ไม่ใช่ความชอบส่วนตัว บทความนี้นำเสนอตัวเลขเบื้องหลังการตัดสินใจนั้น โดยนำคลิปเดิม 153 รายการผ่าน Azure AI Speech, Google Cloud Speech-to-Text และ Amazon Transcribe ในวันเดียวกัน พร้อมข้อเท็จจริงสองข้อเกี่ยวกับแต่ละ API ที่สำคัญกว่าความแม่นยำที่ต่างกันเพียงหนึ่งจุดเปอร์เซ็นต์
กฎมาก่อน: หนึ่งองค์กร หนึ่งเกตเวย์
ฟีเจอร์ AI ทุกอย่างใน InterMIND ทั้งสรุปการประชุม สรุปเอกสาร ผู้ช่วยเขียน Ask AI และ Mia ในการประชุม ทำงานบนเกตเวย์โมเดลภาษาเดียวที่องค์กรเป็นผู้เลือก ค่าเริ่มต้นคือ Azure OpenAI ใน EU Data Zone ส่วนตัวเลือกอื่นคือ Google Vertex AI บน endpoint แบบ EU multi-region หรือ Amazon Bedrock ที่ Frankfurt โดยแต่ละตัวทำงานใน tenant ของ InterMIND เอง เราอธิบายเหตุผลไว้ใน Meeting AI on your own cloud gateway สำหรับองค์กรส่วนใหญ่ เกตเวย์นั้นอยู่ในรายชื่อ sub-processor ที่อนุมัติไว้แล้ว ฟีเจอร์ AI จึงไม่ทำให้มีบริษัทใหม่เพิ่มในรายชื่อ
ปัจจุบันการแปลงเสียงเป็นข้อความสำหรับข้อความเสียงเป็นไปตามกฎเดียวกันบนเกตเวย์เริ่มต้น และทั้งสามเกตเวย์ต่างมีบริการเสียงควบคู่กับโมเดลภาษาของตน ซึ่งเป็นสิ่งที่บทความนี้วัด:
| เกตเวย์ | บริการเสียง | ภูมิภาคที่ใช้ในการทดสอบนี้ | วิธีที่ API รับไฟล์บันทึกเสียง |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | Sweden Central | ส่งคำขอเดียวได้สำหรับไฟล์ยาวถึง 5 ชั่วโมงและขนาด 500 MB (เอกสาร fast transcription, ตรวจสอบเมื่อกันยายน 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, โมเดล Chirp 3 | eu multi-region | การรู้จำเสียงแบบซิงโครนัสจำกัดที่ 60 วินาทีและ 10 MB ส่วนเสียงที่ยาวกว่านั้นต้องใช้การรู้จำแบบ batch หรือ streaming (ข้อจำกัดแบบซิงโครนัส, Chirp 3, ตรวจสอบเมื่อกันยายน 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | เซสชันสตรีมมิงผ่าน HTTP/2 หรือ WebSocket โดยอินพุตเป็น PCM, FLAC หรือ Ogg-Opus (เอกสาร streaming, ตรวจสอบเมื่อกันยายน 2026) |
ในทุกกรณี ตัวรู้จำเสียงจะได้รับแจ้งภาษาของผู้พูดเอง ซึ่งคือภาษาที่สมาชิกตั้งไว้ในโปรไฟล์ เพราะในการทดสอบของเรา การระบุภาษาอัตโนมัติไม่น่าเชื่อถือกับคลิปสั้น ข้อความภาษารัสเซียความยาวสี่วินาทีถูกถอดออกมาเป็นภาษาอังกฤษ นี่คือวิธีที่ผลิตภัณฑ์เรียกใช้ Azure ในปัจจุบัน และการทดสอบก็เรียกอีกสองบริการด้วยวิธีเดียวกัน