Tại sao tiếp thị về chất lượng dịch thuật đang thất bại — và những gì chúng tôi công bố thay thế
Mở bất kỳ trang web của nhà cung cấp dịch trực tiếp nào. Bạn sẽ thấy những loại con số tương tự:
- "200+ ngôn ngữ"
- "6.000+ cặp ngôn ngữ"
- "Đầu tiên trên thế giới" / "Độ chính xác cao nhất"
- "Chính xác 99%"
Bây giờ hãy thử tìm — trên bất kỳ trang nào của những nhà cung cấp đó — xem những con số đó có ý nghĩa gì đối với một cuộc họp bạn sắp tổ chức. Chất lượng theo từng ngôn ngữ. Phương pháp có thể tái lập. Kích thước mẫu. Điểm số theo thời gian. Sự công bố trung thực về nơi mô hình còn yếu.
Bạn sẽ không tìm thấy. Không có trong văn bản tiếp thị, và hiếm khi có trong tài liệu.
Đây là trạng thái cân bằng của ngành. Nó tồn tại vì ba điều:
- Hầu hết các nhà cung cấp không sở hữu engine dịch thuật của riêng họ. Họ định tuyến qua OpenAI, Google, DeepL, Microsoft, hoặc một số kết hợp. Việc công bố dữ liệu chất lượng theo từng cặp sẽ giống như đánh giá mô hình của người khác — không có giá trị tiếp thị trong việc đó.
- Dữ liệu chất lượng trung thực rất khó để đặt lên một tấm biển quảng cáo. Một điểm số đơn lẻ chứa nhiều nhiễu. Một phân phối thì hữu ích hơn nhưng lại khó nén lại hơn. Một
last-six-months trendthì lại hữu ích hơn nữa, và càng khó hơn. - Bộ phận mua hàng vẫn chưa phản bác lại. Người mua chấp nhận các con số tiếp thị theo mặt giá trị, và do đó trạng thái cân bằng vẫn duy trì.
Trạng thái cân bằng này sẽ không còn duy trì được. Lớp người mua tiếp theo — dược phẩm, pháp lý, tài chính, kiểm toán, khu vực công — sẽ đặt ra những câu hỏi khó hơn là "bao nhiêu ngôn ngữ". Chúng tôi đã xây dựng /benchmark vì chúng tôi nghĩ họ không nên phải chỉ tin vào lời nói của một nhà cung cấp.
Những gì các con số tiếp thị không cho bạn biết
"200+ ngôn ngữ" có nghĩa là một nhà cung cấp có một mô hình phát ra văn bản bằng 200 ngôn ngữ. Chất lượng trên các ngôn ngữ đó dao động từ cấp độ sản xuất cho các cặp chính (EN↔DE, EN↔ES, EN↔FR) đến hầu như không thể sử dụng cho các cặp tài nguyên thấp. Nếu không có phân tích chi tiết theo từng cặp, bạn không thể biết cuộc họp của bạn sẽ rơi vào bên nào của ranh giới đó.
"6.000+ cặp ngôn ngữ" là tổ hợp N × N trên 80 ngôn ngữ nguồn. Nói rằng bạn hỗ trợ 6.000 cặp là phần dễ nhất. Nói rằng một cặp cụ thể nào đó đủ tốt cho một đánh giá CAPA, một cuộc đàm phán hợp đồng, hoặc một cuộc gọi báo cáo tài chính — đó mới là phần không có trong tờ rơi giới thiệu.
"Chính xác 99%", nếu không chỉ rõ cái gì được đo lường, so với tài liệu tham chiếu nào, trên mẫu nào, bởi người đánh giá nào — là hoàn toàn vô nghĩa. Chất lượng dịch thuật không có một thang đo phổ quát duy nhất. Nó có một phân phối phụ thuộc vào cặp ngôn ngữ, lĩnh vực nội dung, chất lượng âm thanh (đối với giọng nói), ngân sách độ trễ, và "đủ tốt" có ý nghĩa gì đối với trường hợp sử dụng cụ thể.
Những gì người mua thực sự cần biết
Những câu hỏi xuất hiện trong các đánh giá DPA thực tế và thẩm định mua hàng:
- Chất lượng theo từng cặp — hiệu suất của hệ thống trên DE↔EN, EN↔AR, JA↔KO như thế nào, một cách cụ thể?
- Kích thước mẫu — số liệu bạn báo cáo dựa trên bao nhiêu lần chạy? Mười? Mười nghìn?
- Phương pháp luận — ai đang đánh giá các bản dịch, so với tài liệu tham chiếu nào, với tiêu chí nào?
- Phân phối, không phải trung bình — 10% trường hợp xấu nhất trông như thế nào? 10% tốt nhất? Trung vị?
- Độ trôi theo thời gian — một cặp nhất định đã tốt lên hay xấu đi kể từ lần cuối bạn công bố một con số?
- Những gì bạn không đo lường — benchmark của bạn chủ ý không ghi lại điều gì?
Không có câu hỏi nào trong số này là không thể trả lời. Chúng chỉ không có trên trang tiếp thị của bất kỳ ai.
Những gì chúng tôi công bố
/benchmark là câu trả lời của chúng tôi. Phương pháp luận nằm tại /benchmark/methodology — được viết trước khi chúng tôi biết bạn sẽ đọc điều này.
Ba điều tách biệt nó khỏi các chuẩn mực của ngành.
1. Lưu lượng truy cập thực, không phải một bộ chọn lọc
Mọi điểm số trong benchmark công khai đều đến từ một lần chạy thử nghiệm /demo thực tế. Chúng tôi không chọn trước các cặp hoạt động tốt. Cùng một pipeline phục vụ bản demo cho người mua cũng là pipeline đang được đo lường.
2. Trọng tài được nêu đích danh
Trọng tài chính: google/gemini-3.5-flash. Trọng tài dự phòng: anthropic/claude-sonnet-5. Cả hai đều thông qua Vercel AI Gateway. Trọng tài là một phần của phương pháp luận — được công bố đích danh. Khi chúng tôi thay đổi trọng tài (chúng tôi đã từng thay đổi, khi các mô hình ngừng hỗ trợ), các hàng dữ liệu cũ mang theo trọng tài thực sự đã chấm điểm chúng; các điểm số cũ không bao giờ được chấm lại một cách im lặng.
3. Phân phối chính là dữ liệu, không phải trung bình cộng
Mỗi hàng dữ liệu được công bố hiển thị trung vị, p10, p90, min, max và kích thước mẫu — thay vì một con số duy nhất. Một con số duy nhất cho một cặp dịch thuật chỉ là nhiễu. Hình dáng của phân phối mới là tín hiệu.
Các thông lệ mà ngành chưa áp dụng
- Các cặp điểm thấp không bị ẩn đi. Chỉ mục công khai được thiết lập ngưỡng dựa trên
≥ 10 distinct IPs, ≥ 10 runs, median ≥ 60— nhưng bất kỳ ai cũng có thể liên kết sâu trực tiếp đến bất kỳ cặp nào và xem các con số thực tế, bao gồm cả những cặp đang hoạt động tồi trong tháng này. - Các vấn đề đã biết được ghi lại. Khi bộ công cụ kiểm tra chat bị hỏng trong vài tuần vào đầu năm 2026, khoảng thời gian đó đã bị loại khỏi chỉ mục và được ghi chú bằng văn bản trên trang phương pháp luận. Lịch sử không được viết lại một cách im lặng.
- Những gì chúng tôi cố tình KHÔNG tuyên bố là một phần đầy đủ trên trang phương pháp luận. Chúng tôi nêu rõ trọng tài LLM bản thân nó không hoàn hảo ở điểm nào. Chúng tôi nêu những gì chúng tôi không đo lường (độ trễ, chi phí, mức độ hài lòng của người dùng, lỗi ASR trước khi bản dịch được chạy). Chúng tôi công bố rằng các bài kiểm tra smoke test tự động của chính chúng tôi cũng là một phần của lưu lượng truy cập.
Một bộ lọc cho lần thẩm định nhà cung cấp tiếp theo
Nếu bạn đang thẩm định bất kỳ nền tảng họp đa ngôn ngữ nào — của chúng tôi hoặc của bên khác — thì phương pháp luận là trang đáng để đọc. Các con số tự thân chúng là phần dễ.
Một bộ lọc thực tế cho bất kỳ nhà cung cấp nào trong ngành này:
- Hãy yêu cầu dữ liệu chất lượng theo từng cặp ngôn ngữ, từng tháng trên lưu lượng truy cập thực. Không phải một benchmark được chọn lọc. Không phải một số liệu tổng hợp.
- Hãy hỏi trọng tài của họ là gì, những gì họ rõ ràng không đo lường, và điều gì đã thay đổi trong sáu tháng qua.
- Hãy hỏi điều gì xảy ra khi điểm số của một cặp giảm — họ có nói cho ai biết không, hay họ sửa nó một cách im lặng?
Nếu nhà cung cấp có cả ba câu trả lời bằng văn bản, hãy thẩm định họ một cách nghiêm túc. Nếu không, bạn đang mua tiếp thị — chứ không phải chất lượng dịch thuật.
Thử nghiệm ngay
- Thử bản demo trực tiếp — chạy pipeline dịch thuật sản xuất trên âm thanh của bạn, chấm điểm nó bằng cùng trọng tài chấm điểm benchmark công khai, và cho bạn thấy kết quả đầu ra.
- Xem benchmark — mọi cặp ngôn ngữ được công bố, mọi tháng, với phân phối đầy đủ.
- Đọc phương pháp luận — cách các con số được tính toán, những gì chúng bao gồm, và những gì chúng không bao gồm.
Bạn sẽ không cần phải chỉ tin lời nói của chúng tôi về bất kỳ điều nào trong đó. Đó chính là mục đích.
Nguồn: các mã định danh trọng tài, ngưỡng kiểm soát và quy tắc loại bỏ ở trên được xác minh đối với mã nguồn đã triển khai và công bố tại /benchmark/methodology; các trọng tài được phục vụ thông qua Vercel AI Gateway; các tuyên bố tiếp thị được trích dẫn ở đầu bài là những cách diễn đạt điển hình của ngành, không phải là trích dẫn từ một nhà cung cấp được nêu đích danh; được kiểm tra vào tháng 8 năm 2026.