[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-vi-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":819},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":803,"demo-cta":804,"description":805,"extension":806,"genre":807,"heroOrder":808,"icp":809,"image":812,"meta":813,"navigation":814,"no-translate":804,"path":815,"rank-country":808,"rank-keywords":808,"rank-tag":808,"seo":816,"stem":817,"updated":808,"video":814,"__hash__":818},"blog_vi\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech so với Google Chirp 3 so với Amazon Transcribe trên 153 ghi âm giọng nói: lý do InterMIND chạy speech-to-text trên cloud gateway riêng của tổ chức bạn (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":790},"minimark",[14,19,23,26,31,40,43,148,151,155,166,172,178,184,188,191,521,524,528,561,565,568,580,591,597,601,604,608,613,620,625,628,633,636,641,657,662,665,670,673,678,681,686,689,694,703,708,711,714,718,745,747],[15,16,18],"h1",{"id":17},"azure-ai-speech-google-chirp-3-và-amazon-transcribe-trên-153-tin-nhắn-thoại-tại-sao-intermind-chạy-chuyển-giọng-nói-thành-văn-bản-trên-cổng-cloud-riêng-của-tổ-chức-bạn-2026","Azure AI Speech, Google Chirp 3 và Amazon Transcribe trên 153 tin nhắn thoại: tại sao InterMIND chạy chuyển giọng nói thành văn bản trên cổng cloud riêng của tổ chức bạn (2026)",[20,21,22],"p",{},"Một tin nhắn thoại trong một kênh InterMIND trở thành một tin nhắn văn bản mà mọi thành viên trong nhóm đọc bằng ngôn ngữ của riêng họ. Bước đầu tiên của quá trình đó là chuyển giọng nói thành văn bản, và câu hỏi mà chúng tôi nhận được từ các bên rà soát về CNTT và tuân thủ không phải là \"độ chính xác thế nào\" mà là \"đây là dịch vụ của ai, và âm thanh đi đâu\".",[20,24,25],{},"Câu trả lời ngắn gọn: Azure AI Speech, dịch vụ giọng nói của cổng AI mặc định, trong tenant Azure riêng của InterMIND tại Sweden Central — cùng với các dịch vụ giọng nói của hai cổng khác mà một tổ chức có thể chọn, được đo trên cùng các đoạn ghi âm để lựa chọn là một con số, không phải một sở thích. Bài viết này cho thấy các con số đằng sau lựa chọn đó — cùng 153 đoạn ghi âm chạy qua Azure AI Speech, Google Cloud Speech-to-Text và Amazon Transcribe trong cùng một ngày — và hai sự thật về mỗi API quan trọng hơn một điểm phần trăm độ chính xác.",[27,28,30],"h2",{"id":29},"quy-tắc-đặt-lên-trước-mỗi-tổ-chức-một-cổng","Quy tắc đặt lên trước: mỗi tổ chức một cổng",[20,32,33,34,39],{},"Mọi tính năng AI trong InterMIND — tóm tắt cuộc họp, tóm tắt tài liệu, trợ lý viết, Ask AI và Mia trong cuộc họp — đều chạy trên một cổng mô hình ngôn ngữ mà tổ chức lựa chọn: Azure OpenAI trong EU Data Zone theo mặc định, Google Vertex AI trên endpoint đa vùng EU hoặc Amazon Bedrock tại Frankfurt theo lựa chọn, mỗi cổng đều nằm trong tenant riêng của InterMIND. Chúng tôi đã giải thích lý do trong ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","AI cuộc họp trên cổng cloud riêng của bạn",": với hầu hết tổ chức, cổng đó đã có sẵn trong danh sách nhà xử lý phụ được phê duyệt, nên một tính năng AI không thêm công ty mới nào vào danh sách.",[20,41,42],{},"Chuyển giọng nói thành văn bản cho tin nhắn thoại hiện tuân theo cùng quy tắc này trên cổng mặc định, và mỗi cổng trong ba cổng đều có một dịch vụ giọng nói đi kèm với các mô hình ngôn ngữ của mình — đây chính là điều bài viết này đo lường:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"Cổng",[53,57,58],{},"Dịch vụ giọng nói",[53,60,61],{},"Vùng dùng trong bài kiểm tra này",[53,63,64],{},"Cách API nhận một đoạn ghi âm",[66,67,68,94,126],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (Microsoft)",[71,79,80],{},"Azure AI Speech, fast transcription API",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"Một yêu cầu cho một tệp lên đến 5 giờ và 500 MB (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","tài liệu fast transcription",", kiểm tra tháng 9 năm 2026)",[50,95,96,102,105,112],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (Google Cloud)",[71,103,104],{},"Cloud Speech-to-Text v2, mô hình Chirp 3",[71,106,107,108],{},"đa vùng ",[109,110,111],"code",{},"eu",[71,113,114,115,120,121,93],{},"Nhận dạng đồng bộ bị giới hạn ở 60 giây và 10 MB; âm thanh dài hơn phải qua nhận dạng theo lô hoặc streaming (",[35,116,119],{"href":117,"rel":118},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"giới hạn đồng bộ",", ",[35,122,125],{"href":123,"rel":124},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,127,128,134,137,140],{},[71,129,130,133],{},[74,131,132],{},"Amazon Bedrock"," (AWS)",[71,135,136],{},"Amazon Transcribe, streaming",[71,138,139],{},"eu-central-1 (Frankfurt)",[71,141,142,143,93],{},"Một phiên streaming qua HTTP\u002F2 hoặc WebSocket; đầu vào là PCM, FLAC hoặc Ogg-Opus (",[35,144,147],{"href":145,"rel":146},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"tài liệu streaming",[20,149,150],{},"Trong mọi trường hợp, bộ nhận dạng đều được cho biết trước ngôn ngữ của người nói — ngôn ngữ mà thành viên đã đặt trong hồ sơ của họ — vì nhận dạng ngôn ngữ tự động chứng minh là không đáng tin cậy trên các đoạn ghi âm ngắn trong quá trình kiểm tra của chúng tôi: một tin nhắn tiếng Nga dài bốn giây được trả về là tiếng Anh. Đó là cách sản phẩm gọi Azure hiện nay, và bài kiểm tra gọi hai dịch vụ còn lại theo cách tương tự.",[27,152,154],{"id":153},"chúng-tôi-đã-đo-lường-điều-gì","Chúng tôi đã đo lường điều gì",[20,156,157,160,161,165],{},[74,158,159],{},"Bộ dữ liệu."," 153 đoạn ghi âm trong 17 ngôn ngữ: 136 lượt hội thoại — hai đoạn hội thoại kinh doanh (một cuộc đàm phán hợp đồng và một buổi stand-up hàng ngày) được hai giọng nói tổng hợp của sản phẩm thể hiện bằng mười ngôn ngữ — cộng với 17 đoạn văn bản trang trọng, là các câu kinh doanh FLORES-200 trong ",[35,162,164],{"href":163},"\u002Fbenchmark\u002Fmethodology","benchmark dịch thuật công khai"," của chúng tôi được một giọng nói tổng hợp đọc, một đoạn cho mỗi ngôn ngữ và dài từ 71 đến 109 giây. Các lượt hội thoại dài từ 3 đến 30 giây, đúng độ dài của một tin nhắn thoại thực tế.",[20,167,168,171],{},[74,169,170],{},"Chỉ số đo."," Tỷ lệ lỗi từ (WER — word error rate) so với văn bản tham chiếu — tỷ lệ số từ bị thay thế, chèn thêm hoặc xóa bỏ — sau khi chuẩn hóa chữ hoa\u002Fthường, dấu câu và khoảng trắng; tiếng Trung và tiếng Nhật được so sánh theo từng ký tự. Tỷ lệ lỗi ký tự cũng được ghi nhận song song và cho thấy kết quả tương tự.",[20,173,174,177],{},[74,175,176],{},"Bộ khung kiểm tra."," Một script, một máy, một giờ vào ngày 2026-09-16, mỗi engine chạy qua toàn bộ 153 đoạn ghi âm. Azure và Amazon Transcribe nhận toàn bộ mỗi đoạn ghi âm nguyên vẹn. Bộ nhận dạng đồng bộ của Google chỉ nhận tối đa 60 giây, nên 17 đoạn văn bản trang trọng được cắt tại các khoảng lặng thành các phần dưới 55 giây và ghép lại các bản chuyển văn bản; 136 đoạn hội thoại được xử lý nguyên vẹn. Amazon Transcribe yêu cầu âm thanh theo tốc độ thời gian thực, nên bộ khung kiểm tra đưa vào với tốc độ nhanh gấp bốn lần thời gian thực; do đó số liệu độ trễ dưới đây là mức sàn do tốc độ đưa vào quyết định, không phải do dịch vụ.",[20,179,180,183],{},[74,181,182],{},"Đây không phải là gì."," Đây là giọng nói tổng hợp trong âm thanh yên tĩnh, không phải bản ghi thực tế từ điện thoại trong ô tô. Một ngày, một lần chạy cho mỗi đoạn ghi âm. Đây là một phép so sánh trên loại âm thanh mà pipeline dịch thuật của chúng tôi được kiểm tra, bằng các ngôn ngữ mà người dùng của chúng tôi viết — không phải một bảng xếp hạng.",[27,185,187],{"id":186},"kết-quả-tỷ-lệ-lỗi-từ-theo-ngôn-ngữ","Kết quả: tỷ lệ lỗi từ theo ngôn ngữ",[20,189,190],{},"WER trung bình trên các đoạn ghi âm của mỗi ngôn ngữ; mọi engine đều trả về bản chuyển văn bản cho toàn bộ 153 đoạn ghi âm.",[44,192,193,212],{},[47,194,195],{},[50,196,197,200,203,206,209],{},[53,198,199],{},"Ngôn ngữ",[53,201,202],{},"Số đoạn",[53,204,205],{},"Azure AI Speech",[53,207,208],{},"Google Chirp 3",[53,210,211],{},"Amazon Transcribe",[66,213,214,231,246,262,275,290,305,321,335,348,361,375,388,401,415,429,442,455,477,491,505],{},[50,215,216,219,222,225,228],{},[71,217,218],{},"Tiếng Ả Rập",[71,220,221],{},"13",[71,223,224],{},"32%",[71,226,227],{},"46%",[71,229,230],{},"26%",[50,232,233,236,238,241,243],{},[71,234,235],{},"Tiếng Trung",[71,237,221],{},[71,239,240],{},"3%",[71,242,240],{},[71,244,245],{},"8%",[50,247,248,251,254,257,260],{},[71,249,250],{},"Tiếng Séc",[71,252,253],{},"1",[71,255,256],{},"1%",[71,258,259],{},"2%",[71,261,240],{},[50,263,264,267,269,271,273],{},[71,265,266],{},"Tiếng Hà Lan",[71,268,253],{},[71,270,259],{},[71,272,259],{},[71,274,240],{},[50,276,277,280,283,285,288],{},[71,278,279],{},"Tiếng Anh",[71,281,282],{},"21",[71,284,259],{},[71,286,287],{},"5%",[71,289,259],{},[50,291,292,295,297,299,302],{},[71,293,294],{},"Tiếng Pháp",[71,296,221],{},[71,298,287],{},[71,300,301],{},"11%",[71,303,304],{},"12%",[50,306,307,310,312,315,318],{},[71,308,309],{},"Tiếng Đức",[71,311,221],{},[71,313,314],{},"7%",[71,316,317],{},"9%",[71,319,320],{},"13%",[50,322,323,326,328,331,333],{},[71,324,325],{},"Tiếng Hindi",[71,327,221],{},[71,329,330],{},"10%",[71,332,330],{},[71,334,304],{},[50,336,337,340,342,344,346],{},[71,338,339],{},"Tiếng Hungary",[71,341,253],{},[71,343,317],{},[71,345,314],{},[71,347,245],{},[50,349,350,353,355,357,359],{},[71,351,352],{},"Tiếng Ý",[71,354,253],{},[71,356,256],{},[71,358,256],{},[71,360,240],{},[50,362,363,366,368,371,373],{},[71,364,365],{},"Tiếng Nhật",[71,367,221],{},[71,369,370],{},"6%",[71,372,287],{},[71,374,287],{},[50,376,377,380,382,384,386],{},[71,378,379],{},"Tiếng Hàn",[71,381,253],{},[71,383,317],{},[71,385,301],{},[71,387,301],{},[50,389,390,393,395,397,399],{},[71,391,392],{},"Tiếng Ba Lan",[71,394,253],{},[71,396,256],{},[71,398,256],{},[71,400,259],{},[50,402,403,406,408,410,413],{},[71,404,405],{},"Tiếng Bồ Đào Nha (Brazil)",[71,407,221],{},[71,409,287],{},[71,411,412],{},"4%",[71,414,370],{},[50,416,417,420,422,425,427],{},[71,418,419],{},"Tiếng Nga",[71,421,282],{},[71,423,424],{},"14%",[71,426,330],{},[71,428,424],{},[50,430,431,434,436,438,440],{},[71,432,433],{},"Tiếng Tây Ban Nha",[71,435,221],{},[71,437,370],{},[71,439,287],{},[71,441,370],{},[50,443,444,447,449,451,453],{},[71,445,446],{},"Tiếng Thổ Nhĩ Kỳ",[71,448,253],{},[71,450,412],{},[71,452,240],{},[71,454,412],{},[50,456,457,462,465,469,473],{},[71,458,459],{},[74,460,461],{},"Toàn bộ 153 đoạn",[71,463,464],{},"153",[71,466,467],{},[74,468,317],{},[71,470,471],{},[74,472,330],{},[71,474,475],{},[74,476,330],{},[50,478,479,482,485,487,489],{},[71,480,481],{},"Chỉ các lượt hội thoại",[71,483,484],{},"136",[71,486,317],{},[71,488,301],{},[71,490,330],{},[50,492,493,496,499,501,503],{},[71,494,495],{},"Chỉ các đoạn văn bản trang trọng",[71,497,498],{},"17",[71,500,412],{},[71,502,287],{},[71,504,287],{},[50,506,507,510,512,515,518],{},[71,508,509],{},"Thời gian xử lý ÷ độ dài âm thanh",[71,511],{},[71,513,514],{},"0.10",[71,516,517],{},"0.22",[71,519,520],{},"0.41 (bị giới hạn bởi tốc độ đưa vào)",[20,522,523],{},"Các ngôn ngữ chỉ có một đoạn ghi âm (chỉ đoạn văn bản trang trọng) được hiển thị để đầy đủ; một con số từ một đoạn ghi âm duy nhất là một điểm dữ liệu, không phải một tỷ lệ.",[27,525,527],{"id":526},"các-con-số-nói-lên-điều-gì","Các con số nói lên điều gì",[529,530,531,538,544,555],"ul",{},[532,533,534,537],"li",{},[74,535,536],{},"Trên toàn bộ bộ dữ liệu, ba dịch vụ chỉ chênh nhau trong vòng một điểm phần trăm:"," 9%, 10% và 10%. Cả 153 đoạn ghi âm đều có bản chuyển văn bản trả về từ mọi engine — mức độ bao phủ 17 ngôn ngữ là đầy đủ trên cả ba dịch vụ.",[532,539,540,543],{},[74,541,542],{},"Sự khác biệt nằm ở từng ngôn ngữ, và không có xu hướng cố định."," Azure có tỷ lệ lỗi thấp nhất ở tiếng Pháp (5% so với 11% và 12%) và tiếng Đức (7% so với 9% và 13%), và đồng thấp nhất ở tiếng Anh (2%, cùng với Amazon Transcribe) và tiếng Trung (3%, cùng với Google). Amazon Transcribe có tỷ lệ thấp nhất ở tiếng Ả Rập (26% so với 32% và 46%). Google có tỷ lệ thấp nhất ở tiếng Nga (10% so với 14% và 14%), tiếng Bồ Đào Nha, tiếng Hungary và tiếng Thổ Nhĩ Kỳ.",[532,545,546,549,550,554],{},[74,547,548],{},"Tiếng Ả Rập là ngôn ngữ khó đối với cả ba dịch vụ."," Kết quả tốt nhất trên các đoạn hội thoại tiếng Ả Rập là sai một từ trong bốn từ. Điều này khớp với những gì chúng tôi thấy ở phía dịch thuật, nơi chúng tôi đã tạm rút tiếng Ả Rập khỏi bộ chọn ngôn ngữ cuộc họp vào tháng 8 năm 2026 cho đến khi chất lượng đạt mức tiêu chuẩn của chúng tôi (",[35,551,553],{"href":552},"\u002Fblog\u002Fhow-many-languages-do-you-support","chúng tôi hỗ trợ bao nhiêu ngôn ngữ",").",[532,556,557,560],{},[74,558,559],{},"Thời gian xử lý ở cả ba dịch vụ đều thấp hơn nhiều so với thời gian thực."," Một tin nhắn dài 30 giây tốn khoảng ba giây trên Azure và khoảng bảy giây trên Google trong bộ khung kiểm tra này; con số của Amazon bị chi phối bởi tốc độ đưa vào có kiểm soát.",[27,562,564],{"id":563},"vì-sao-azure-ai-speech-vẫn-là-lựa-chọn-mặc-định","Vì sao Azure AI Speech vẫn là lựa chọn mặc định",[20,566,567],{},"Ba lý do, theo đúng thứ tự đã quyết định việc này.",[20,569,570,573,574,579],{},[74,571,572],{},"1. Cổng mặc định là Azure."," Một tổ chức chưa chọn cổng nào sẽ chạy các tính năng AI của mình trên Azure OpenAI trong EU Data Zone, vì vậy tin nhắn thoại của tổ chức đó được chuyển văn bản bởi Azure AI Speech trong cùng một tenant. Không có nhà xử lý phụ mới, không có vùng mới. Microsoft khẳng định Azure Speech không lưu trữ hoặc xử lý dữ liệu ngoài vùng của tài nguyên Speech (",[35,575,578],{"href":576,"rel":577},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"trang các vùng",", kiểm tra tháng 9 năm 2026); tài nguyên của chúng tôi nằm ở Sweden Central, vùng được liệt kê hỗ trợ fast transcription.",[20,581,582,585,586,590],{},[74,583,584],{},"2. Hình thức API phù hợp với tin nhắn thoại."," Một tin nhắn thoại trong InterMIND có thể dài đến mười phút (",[35,587,589],{"href":588},"\u002Fdocs\u002Fchat\u002Fvoice-notes","tin nhắn thoại","). Fast transcription của Azure nhận toàn bộ bản ghi âm trong một yêu cầu duy nhất. Nhận dạng đồng bộ của Google dừng ở 60 giây, nên một tin nhắn dài mười phút cần nhận dạng theo lô qua một storage bucket hoặc một phiên streaming; Amazon Transcribe dùng streaming, nhưng chỉ nhận PCM, FLAC hoặc Ogg-Opus thay vì các định dạng mà điện thoại và trình duyệt ghi âm, nên âm thanh phải được chuyển mã trước. Cả hai vấn đề đều giải quyết được — bộ khung kiểm tra của chúng tôi đã giải quyết chúng — nhưng chúng là thêm nhiều bộ phận chuyển động trên đường đi của mỗi tin nhắn.",[20,592,593,596],{},[74,594,595],{},"3. Các con số không phản đối lựa chọn này."," Ở mức 9% so với 10% và 10%, không có engine nào trong bộ dữ liệu này vượt trội đủ để biện minh cho việc chuyển tin nhắn thoại khỏi cổng mặc định. Nếu Google hoặc Amazon đạt tỷ lệ lỗi chỉ bằng một nửa, bài viết này sẽ nói rõ điều đó.",[27,598,600],{"id":599},"điều-này-có-ý-nghĩa-gì-đối-với-các-tổ-chức-dùng-vertex-ai-hoặc-bedrock","Điều này có ý nghĩa gì đối với các tổ chức dùng Vertex AI hoặc Bedrock",[20,602,603],{},"Nếu tổ chức của bạn đã chọn Google Vertex AI hoặc Amazon Bedrock làm cổng, các tính năng AI của bạn sẽ chạy trên đó. Tin nhắn thoại trong các tổ chức này hiện đến dưới dạng bản ghi âm không có bản chuyển văn bản: chúng tôi đã đo lường Google Cloud Speech-to-Text và Amazon Transcribe, như bài viết này cho thấy, nhưng chưa tích hợp chúng vào sản phẩm. Các quyền truy cập và mã tích hợp đã có sẵn; bài viết này sẽ được cập nhật khi chúng nằm trên đường đi của mỗi tin nhắn. Cho đến lúc đó, một tin nhắn thoại trong tổ chức dùng Vertex AI hoặc Bedrock là một bản ghi âm có thể phát lại; một tổ chức chuyển cổng của mình sang Azure sẽ nhận được bản chuyển văn bản cho các tin nhắn được gửi từ thời điểm đó.",[27,605,607],{"id":606},"câu-hỏi-thường-gặp","Câu hỏi thường gặp",[20,609,610],{},[74,611,612],{},"InterMIND sử dụng dịch vụ chuyển giọng nói thành văn bản nào?",[20,614,615,616,554],{},"Đối với tin nhắn thoại trong chat, đó là Azure AI Speech (fast transcription API) trong tenant Azure riêng của InterMIND tại Sweden Central — dịch vụ giọng nói của cổng AI mặc định. Giọng nói trực tiếp trong cuộc họp đi theo một đường khác: nó chạy trên engine media riêng của InterMIND, Mind API, được host tại OVH ở Pháp, và không bao giờ chạm đến bất kỳ dịch vụ giọng nói trên cloud nào (",[35,617,619],{"href":618},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","một cuộc họp thực sự chạy ở đâu",[20,621,622],{},[74,623,624],{},"Azure AI Speech có chính xác hơn Google Speech-to-Text hoặc Amazon Transcribe không?",[20,626,627],{},"Trên bộ dữ liệu 153 đoạn tin nhắn thoại bằng 17 ngôn ngữ của chúng tôi, được đo trong cùng một ngày với cùng một bộ khung kiểm tra, Azure AI Speech có tỷ lệ lỗi từ trung bình là 9%, Google Cloud Speech-to-Text (Chirp 3) là 10% và Amazon Transcribe là 10%. Thứ tự thay đổi theo từng ngôn ngữ: Azure thấp nhất ở tiếng Pháp, tiếng Anh và tiếng Trung, Amazon Transcribe thấp nhất ở tiếng Ả Rập, Google thấp nhất ở tiếng Nga. Trên một bộ bản ghi âm khác, thứ hạng có thể khác đi; bảng trên là chứng cứ cho bộ dữ liệu của chúng tôi.",[20,629,630],{},[74,631,632],{},"Tỷ lệ lỗi từ là gì, và nó được tính như thế nào ở đây?",[20,634,635],{},"Tỷ lệ lỗi từ là số từ bị thay thế, chèn thêm và xóa bỏ chia cho số từ trong văn bản tham chiếu. Chúng tôi chuẩn hóa chữ hoa\u002Fthường, dấu câu và khoảng trắng trước khi so sánh, và so sánh tiếng Trung và tiếng Nhật theo từng ký tự vì các hệ chữ này không dùng khoảng trắng để phân tách từ. Tỷ lệ 9% nghĩa là khoảng một từ trong mười một từ khác với văn bản tham chiếu.",[20,637,638],{},[74,639,640],{},"Âm thanh của một tin nhắn thoại có ra khỏi EU không?",[20,642,643,644,646,647,651,652,656],{},"Không. Bản ghi âm được lưu trữ trong object storage của InterMIND tại EU, và dịch vụ giọng nói chuyển văn bản nó chạy trong một vùng thuộc EU: Sweden Central trên Azure, đa vùng ",[109,645,111],{}," trên Google Cloud, Frankfurt trên AWS. Danh sách đầy đủ các bên và các vùng có trên ",[35,648,650],{"href":649},"\u002Flegal\u002Fsubprocessors","trang subprocessors"," và ",[35,653,655],{"href":654},"\u002Ftrust","trang trust",".",[20,658,659],{},[74,660,661],{},"Vì sao không nhận dạng giọng nói ngay trên thiết bị (client-side), trong ứng dụng, để âm thanh không bao giờ ra khỏi điện thoại?",[20,663,664],{},"Chúng tôi đã đo lường cả điều này, vào tháng 9 năm 2026. Bộ nhận dạng tích hợp sẵn của Chrome với xử lý cục bộ chỉ nhận dạng đúng 0 trong 17 đoạn văn bản trang trọng trên các ngôn ngữ của sản phẩm, và mức độ bao phủ ngôn ngữ của các bộ nhận dạng client-side hẹp hơn rất nhiều so với 17 ngôn ngữ trong bảng trên. Nhận dạng client-side là một hướng chúng tôi sẽ đo lại khi các nền tảng cải thiện; hiện nay đường đi qua cổng là cách hoạt động được cho mọi thành viên bằng mọi ngôn ngữ.",[20,666,667],{},[74,668,669],{},"Tổ chức chúng tôi có thể chọn dịch vụ giọng nói nào chuyển văn bản tin nhắn thoại của mình không?",[20,671,672],{},"Không thể chọn riêng: cổng AI là thứ mà quản trị viên tổ chức lựa chọn trên trang Integrations. Trên cổng mặc định, tin nhắn thoại được chuyển văn bản bởi Azure AI Speech. Trên Vertex AI và Amazon Bedrock, tin nhắn thoại chưa được chuyển văn bản — xem phần ở trên.",[20,674,675],{},[74,676,677],{},"Một tin nhắn thoại có thể dài bao lâu, và API có giới hạn điều đó không?",[20,679,680],{},"Tối đa mười phút. Fast transcription của Azure chấp nhận tệp lên đến 5 giờ và 500 MB trong một yêu cầu, nên một tin nhắn được chuyển văn bản trong một lần gọi duy nhất. Nhận dạng đồng bộ của Google chỉ chấp nhận 60 giây và 10 MB, đó là lý do bộ khung kiểm tra cắt các đoạn ghi âm dài thành từng phần tại các khoảng lặng.",[20,682,683],{},[74,684,685],{},"Vì sao bộ nhận dạng được cho biết trước ngôn ngữ của người nói thay vì tự phát hiện?",[20,687,688],{},"Vì một tin nhắn thoại rất ngắn. Trên một đoạn ghi âm bốn giây, nhận dạng ngôn ngữ tự động có thể trả về sai ngôn ngữ — một tin nhắn kiểm tra bằng tiếng Nga được trả về là tiếng Anh; ngôn ngữ trong hồ sơ của thành viên đúng gần như mọi lần. Bộ nhận dạng nhận được ngôn ngữ đó, và chỉ khi nó không xác định được thì nó mới nhận các ngôn ngữ của phòng làm các ứng viên.",[20,690,691],{},[74,692,693],{},"Âm thanh cuộc họp có được chuyển văn bản bởi cùng một dịch vụ không?",[20,695,696,697,699,700,554],{},"Không. Giọng nói trực tiếp trong cuộc họp được nhận dạng và dịch trên engine riêng của InterMIND (Mind API) trên máy chủ media mang cuộc gọi, được host tại OVH ở Pháp — xem ",[35,698,619],{"href":618},". Cổng cloud chỉ thấy văn bản, không bao giờ thấy âm thanh của cuộc gọi (",[35,701,702],{"href":37},"AI cuộc họp trên cổng riêng của bạn",[20,704,705],{},[74,706,707],{},"Bạn có công bố lại kết quả không?",[20,709,710],{},"Bộ khung kiểm tra chạy chỉ với một lệnh, và các quyền truy cập của mọi engine đã sẵn sàng, nên bảng số liệu có thể được đo lại khi một nhà cung cấp phát hành mô hình mới. Khi kết quả thay đổi bức tranh chung, bài viết này sẽ được cập nhật cùng ngày cập nhật.",[712,713],"hr",{},[27,715,717],{"id":716},"tự-mình-kiểm-chứng","Tự mình kiểm chứng",[529,719,720,728,736],{},[532,721,722,727],{},[74,723,724],{},[35,725,726],{"href":588},"Đọc cách tin nhắn thoại hoạt động"," — ghi âm, giới hạn mười phút, và âm thanh đi đâu.",[532,729,730,735],{},[74,731,732],{},[35,733,734],{"href":649},"Xem danh sách subprocessors"," — nhà cung cấp, quốc gia, mục đích và vùng cho mọi bên xử lý dữ liệu của bạn.",[532,737,738,744],{},[74,739,740],{},[35,741,743],{"href":742},"\u002Fdemo","Thử bản demo trực tiếp"," — pipeline dịch thuật thực tế trên âm thanh của riêng bạn, không cần đăng ký.",[712,746],{},[20,748,749],{},[750,751,752,753,757,758,761,762,766,767,770,771,775,776,780,781,770,785,789],"em",{},"Nguồn: Microsoft — Azure AI Speech fast transcription (",[35,754,756],{"href":89,"rel":755},[91],"learn.microsoft.com",") và bảng vùng Speech (",[35,759,756],{"href":576,"rel":760},[91],"); Google Cloud — mô hình Chirp 3 (",[35,763,765],{"href":123,"rel":764},[91],"docs.cloud.google.com","), giới hạn nhận dạng đồng bộ (",[35,768,765],{"href":117,"rel":769},[91],") và các ngôn ngữ được hỗ trợ (",[35,772,765],{"href":773,"rel":774},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],"); AWS — Amazon Transcribe streaming (",[35,777,779],{"href":145,"rel":778},[91],"docs.aws.amazon.com","), endpoint và quota (",[35,782,779],{"href":783,"rel":784},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,786,779],{"href":787,"rel":788},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],"); tất cả được kiểm tra vào tháng 9 năm 2026. Đo lường: InterMIND speech bench, 2026-09-16, 153 đoạn ghi âm, 17 ngôn ngữ.",{"title":791,"searchDepth":792,"depth":793,"links":794},"",2,3,[795,796,797,798,799,800,801,802],{"id":29,"depth":792,"text":30},{"id":153,"depth":792,"text":154},{"id":186,"depth":792,"text":187},{"id":526,"depth":792,"text":527},{"id":563,"depth":792,"text":564},{"id":599,"depth":792,"text":600},{"id":606,"depth":792,"text":607},{"id":716,"depth":792,"text":717},"2026-09-16",false,"Chúng tôi đã đo lường các dịch vụ speech-to-text của ba cloud gateway mà một tổ chức InterMIND có thể chọn — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) và Amazon Transcribe — trên cùng 153 đoạn ghi âm giọng nói bằng 17 ngôn ngữ, cùng một bộ kiểm thử, trong một ngày. Tỷ lệ lỗi từ trên mỗi ngôn ngữ, phương pháp, giới hạn của từng API, và lý do bộ nhận dạng tuân theo gateway thay vì bảng xếp hạng.","md","editorial",null,{"role":810,"spend":811},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":805},"blog\u002Fspeech-to-text-on-your-own-gateway","g87WFYXK6S5tAYVZOQmh4dLw3I8eVMeunfoYy-HVr6I",[820,825],{"title":821,"path":822,"stem":823,"description":824,"children":-1},"Chỉ trả tiền cho những người thực sự sử dụng: InterMIND chuyển sang thanh toán theo số thành viên hoạt động","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","Pro và Business ngừng việc bán ghế mà bạn phải gán thủ công. Mời toàn bộ đội ngũ của bạn; mỗi lần gia hạn sẽ đếm số thành viên hoạt động trong 28 ngày trước đó và chỉ tính phí cho họ. Một thành viên ngừng hoạt động vẫn giữ nguyên quyền truy cập và không tốn chi phí; khách mời trong cuộc họp và người tham gia kênh bên ngoài vẫn hoàn toàn miễn phí. Thế nào được tính là hoạt động, con số thay đổi như thế nào trong chu kỳ thanh toán, nội dung bức thư trước khi gia hạn nói gì, và những gì thay đổi trên trang thanh toán của bạn.",{"title":826,"path":827,"stem":828,"description":829,"children":-1},"Phụ đề dịch trực tiếp cho toàn bộ khán giả: những gì Zoom, Teams và Google Meet yêu cầu, và cách mỗi người tham dự đọc theo ngôn ngữ của họ (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","Một diễn giả, khán giả với mười ngôn ngữ. Phụ đề được dịch có sẵn trên Zoom, Microsoft Teams và Google Meet — mỗi nền tảng đằng sau một giấy phép khác nhau, và mỗi nền tảng trả lời cùng một câu hỏi theo cách khác nhau: ai quyết định khán giả được đọc bằng ngôn ngữ nào. Teams cho phép người tổ chức buổi họp mặt toàn thể chọn trước sáu ngôn ngữ (mười ngôn ngữ với Teams Premium); các cặp ngôn ngữ của Zoom được thiết lập trong cài đặt tài khoản của người chủ trì; Google Meet hạn chế phụ đề dịch chỉ dành cho các phiên bản Workspace trả phí. Sơ đồ được ghi lại chi tiết, cùng với cách nó hoạt động trong InterMIND, nơi ngôn ngữ phụ đề là một cài đặt ở phía người tham dự và căn phòng cũng được dịch bằng giọng nói."]