Phương pháp luận

Bộ đánh giá chất lượng dịch thuật của InterMIND được tạo ra hoàn toàn tự động bởi bộ kiểm thử của chính chúng tôi: mỗi tuần, một lượt chạy tổng hợp sẽ điều khiển cùng quy trình dịch đang vận hành trang /demo công khai trên một bộ tham chiếu cố định, theo cùng một cách cho mọi cặp ngôn ngữ. Lượt chạy này mang tính tổng hợp và có thể tái lập — không có gì ở đây được tuyển chọn hay chọn lọc có chủ đích, và không có con người tham gia vào khâu chấm điểm.

Một bài kiểm thử đơn lẻ hoạt động như thế nào

Mỗi lượt kiểm thử phát một tệp âm thanh tham chiếu (kiểm thử giọng nói) hoặc gửi một văn bản tham chiếu (kiểm thử chat) từ ngôn ngữ nguồn qua quy trình dịch thời gian thực của chúng tôi sang ngôn ngữ đích. Bản dịch thu được được một LLM giám khảo chấm điểm từ 0–100 so với một bản dịch tham chiếu chuẩn.

LLM giám khảo: google/gemini-3.8-flash là chính, anthropic/claude-sonnet-5 là dự phòng (qua Vercel AI Gateway). Cùng một prompt, cùng một thang chấm và cùng các văn bản tham chiếu được dùng cho mọi cặp ngôn ngữ.

Cách tổng hợp dữ liệu theo tháng

  1. Mọi lượt chạy benchmark đầy đủ đã hoàn tất đều được ghi vào demo_test_runs cùng điểm số theo từng ngôn ngữ đích. Các bản xem trước cho một cặp đơn lẻ bị loại trừ — chỉ các lượt chạy đầy đủ nhiều ngôn ngữ mới được đưa vào tính trung vị.
  2. Với mỗi tổ hợp (ngôn ngữ nguồn, ngôn ngữ đích, loại kiểm thử, tuần), chúng tôi chỉ giữ lượt chạy mới nhất, rồi tổng hợp theo tháng — nhờ vậy một nguồn đơn lẻ không thể làm lệch trung vị bằng cách lặp lại một cặp trong cùng một tuần.
  3. Từ tập dữ liệu đã loại trùng, chúng tôi tính trung vị, giá trị nhỏ nhất, giá trị lớn nhất, p10, p90, trung bình và kích thước mẫu.
  4. Chúng tôi lưu ảnh chụp nhanh (snapshot) các điểm số riêng lẻ để khi một tháng đã khép lại, các con số vẫn ổn định ngay cả khi dữ liệu thô của các lượt chạy bị xóa theo TTL.

Khi nào một cặp ngôn ngữ xuất hiện trong chỉ mục công khai

Một hàng (cặp ngôn ngữ × loại kiểm thử × tháng) đủ điều kiện vào chỉ mục công khai và sitemap khi đạt kích thước mẫu tối thiểu và vượt ngưỡng điểm trung vị tối thiểu (ngưỡng này thấp hơn đối với giọng nói, vì ASR không thể tránh khỏi nhiễu). Do tập dữ liệu đến từ một nguồn tự động duy nhất chứ không phải nhiều khách truy cập độc lập, yêu cầu về nguồn duy nhất được nới lỏng đối với dữ liệu tổng hợp này — các ngưỡng về kích thước mẫu và chất lượng vẫn được áp dụng.

Những cặp chưa đạt vẫn có thể truy cập qua liên kết trực tiếp — các ngưỡng chỉ quyết định những gì công cụ tìm kiếm nhìn thấy. Chúng tôi không giấu điểm thấp với bất kỳ ai trực tiếp yêu cầu.

Những điều chúng tôi chủ ý KHÔNG khẳng định

  • Một điểm số đơn lẻ không đáng tin cậy. Một cặp ngôn ngữ vốn hoạt động ổn vẫn có thể dao động 30 điểm giữa các lượt chạy vì cả ASR lẫn đánh giá của LLM đều có nhiễu. Đó là lý do mỗi trang đều hiển thị một phân phối, chứ không phải một con số đơn lẻ.
  • Bản thân LLM giám khảo cũng không hoàn hảo. Trong tương lai chúng tôi có thể thay đổi hoặc dùng song song hai giám khảo; khi đó các hàng dữ liệu lịch sử sẽ ghi kèm mã định danh của giám khảo.
  • Benchmark không đo độ trễ, chi phí, tính khả dụng hay mức độ hài lòng của người dùng. Những chỉ số đó nằm ở nơi khác.
  • Tập dữ liệu mang tính tổng hợp — được tạo bởi bộ kiểm thử tự động của chính chúng tôi, không phải từ lưu lượng của bên thứ ba độc lập. Chúng tôi nêu rõ điều này thay vì ngụ ý rằng có một hội đồng bên ngoài.

Minh bạch trong từng lần công bố

Khi chất lượng của một cặp ngôn ngữ cụ thể giảm trong một tháng — kết quả vẫn được hiển thị. Khi một lỗi được sửa và tháng tiếp theo cải thiện rõ rệt — sự cải thiện đó hiển thị ngay trên cùng một trang. Chúng tôi không bao giờ viết lại các số liệu tổng hợp trong quá khứ. Quản trị viên chỉ có thể ẩn từng tháng riêng lẻ khỏi chỉ mục công khai; họ không thể thay đổi những con số đã được công bố.

Các vấn đề đã biết ảnh hưởng đến dữ liệu lịch sử

  • Bộ chạy kiểm thử chat, trước ngày 2026-04-23: quy trình kiểm thử chat tự động từng gặp lỗi theo từng ngôn ngữ. Số liệu tổng hợp của chat ở các tháng trước đó có thể cho điểm thấp hơn chất lượng dịch thực tế của các giai đoạn ấy. Các tháng bị ảnh hưởng vẫn được lưu trong cơ sở dữ liệu nhưng bị loại khỏi chỉ mục công khai; biểu đồ xu hướng sẽ cho thấy một bước nhảy tại thời điểm sửa lỗi.

Câu hỏi

Bạn không đồng ý với điều gì ở đây? Hãy mở một issue hoặc viết thư cho chúng tôi. Chúng tôi sẽ cập nhật trang này và ghi chú lại thay đổi.