Azure AI Speech, Google Chirp 3 và Amazon Transcribe trên 153 tin nhắn thoại: tại sao InterMIND chạy chuyển giọng nói thành văn bản trên cổng cloud riêng của tổ chức bạn (2026)
Một tin nhắn thoại trong một kênh InterMIND trở thành một tin nhắn văn bản mà mọi thành viên trong nhóm đọc bằng ngôn ngữ của riêng họ. Bước đầu tiên của quá trình đó là chuyển giọng nói thành văn bản, và câu hỏi mà chúng tôi nhận được từ các bên rà soát về CNTT và tuân thủ không phải là "độ chính xác thế nào" mà là "đây là dịch vụ của ai, và âm thanh đi đâu".
Câu trả lời ngắn gọn: Azure AI Speech, dịch vụ giọng nói của cổng AI mặc định, trong tenant Azure riêng của InterMIND tại Sweden Central — cùng với các dịch vụ giọng nói của hai cổng khác mà một tổ chức có thể chọn, được đo trên cùng các đoạn ghi âm để lựa chọn là một con số, không phải một sở thích. Bài viết này cho thấy các con số đằng sau lựa chọn đó — cùng 153 đoạn ghi âm chạy qua Azure AI Speech, Google Cloud Speech-to-Text và Amazon Transcribe trong cùng một ngày — và hai sự thật về mỗi API quan trọng hơn một điểm phần trăm độ chính xác.
Quy tắc đặt lên trước: mỗi tổ chức một cổng
Mọi tính năng AI trong InterMIND — tóm tắt cuộc họp, tóm tắt tài liệu, trợ lý viết, Ask AI và Mia trong cuộc họp — đều chạy trên một cổng mô hình ngôn ngữ mà tổ chức lựa chọn: Azure OpenAI trong EU Data Zone theo mặc định, Google Vertex AI trên endpoint đa vùng EU hoặc Amazon Bedrock tại Frankfurt theo lựa chọn, mỗi cổng đều nằm trong tenant riêng của InterMIND. Chúng tôi đã giải thích lý do trong AI cuộc họp trên cổng cloud riêng của bạn: với hầu hết tổ chức, cổng đó đã có sẵn trong danh sách nhà xử lý phụ được phê duyệt, nên một tính năng AI không thêm công ty mới nào vào danh sách.
Chuyển giọng nói thành văn bản cho tin nhắn thoại hiện tuân theo cùng quy tắc này trên cổng mặc định, và mỗi cổng trong ba cổng đều có một dịch vụ giọng nói đi kèm với các mô hình ngôn ngữ của mình — đây chính là điều bài viết này đo lường:
| Cổng | Dịch vụ giọng nói | Vùng dùng trong bài kiểm tra này | Cách API nhận một đoạn ghi âm |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | Sweden Central | Một yêu cầu cho một tệp lên đến 5 giờ và 500 MB (tài liệu fast transcription, kiểm tra tháng 9 năm 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, mô hình Chirp 3 | đa vùng eu | Nhận dạng đồng bộ bị giới hạn ở 60 giây và 10 MB; âm thanh dài hơn phải qua nhận dạng theo lô hoặc streaming (giới hạn đồng bộ, Chirp 3, kiểm tra tháng 9 năm 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (Frankfurt) | Một phiên streaming qua HTTP/2 hoặc WebSocket; đầu vào là PCM, FLAC hoặc Ogg-Opus (tài liệu streaming, kiểm tra tháng 9 năm 2026) |
Trong mọi trường hợp, bộ nhận dạng đều được cho biết trước ngôn ngữ của người nói — ngôn ngữ mà thành viên đã đặt trong hồ sơ của họ — vì nhận dạng ngôn ngữ tự động chứng minh là không đáng tin cậy trên các đoạn ghi âm ngắn trong quá trình kiểm tra của chúng tôi: một tin nhắn tiếng Nga dài bốn giây được trả về là tiếng Anh. Đó là cách sản phẩm gọi Azure hiện nay, và bài kiểm tra gọi hai dịch vụ còn lại theo cách tương tự.