วิธีการ
เกณฑ์วัดคุณภาพการแปลของ InterMIND สร้างขึ้นโดยอัตโนมัติจากชุดทดสอบของเราเอง: การทดสอบสังเคราะห์รายสัปดาห์จะรันผ่านไปป์ไลน์การแปลเดียวกันกับที่ขับเคลื่อน /demo สาธารณะ โดยใช้ชุดข้อมูลอ้างอิงที่ตายตัว และดำเนินการด้วยวิธีเดียวกันสำหรับทุกคู่ภาษา การทดสอบนี้เป็นแบบสังเคราะห์และทำซ้ำได้ — ไม่มีสิ่งใดในที่นี้ถูกคัดเลือกหรือเลือกเฉพาะผลที่ดี และไม่มีมนุษย์อยู่ในกระบวนการให้คะแนน
การทดสอบหนึ่งครั้งทำงานอย่างไร
การทดสอบแต่ละครั้งจะเล่นไฟล์เสียงอ้างอิง (การทดสอบด้วยเสียง) หรือส่งข้อความอ้างอิง (การทดสอบแชต) จากภาษาต้นทางผ่านไปป์ไลน์การแปลแบบสดของเราไปยังภาษาปลายทาง จากนั้น LLM judge จะให้คะแนนผลการแปลที่ได้ในช่วง 0–100 โดยเทียบกับคำแปลอ้างอิงมาตรฐาน
LLM judge: google/gemini-3.8-flash เป็นตัวหลัก และ anthropic/claude-sonnet-5 เป็นตัวสำรอง (ผ่าน Vercel AI Gateway) ใช้พรอมต์ เกณฑ์การให้คะแนน และข้อความอ้างอิงชุดเดียวกันสำหรับทุกคู่ภาษา
การรวมคะแนนรายเดือนทำอย่างไร
- ทุกการรันเกณฑ์วัดแบบเต็มที่เสร็จสมบูรณ์จะถูกบันทึกไว้ใน
demo_test_runsพร้อมคะแนนแยกตามภาษาปลายทาง การดูตัวอย่างแบบคู่ภาษาเดียวจะถูกตัดออก — เฉพาะการรันแบบเต็มหลายภาษาเท่านั้นที่นำมาคำนวณค่ามัธยฐาน - สำหรับแต่ละชุด (ภาษาต้นทาง ภาษาปลายทาง ประเภทการทดสอบ สัปดาห์) เราเก็บการรัน_ล่าสุด_ไว้ แล้วจึงรวมคะแนนเป็นรายเดือน — ดังนั้นแหล่งที่มาเดียวจะไม่สามารถทำให้ค่ามัธยฐานเบี่ยงเบนได้ด้วยการรันคู่ภาษาเดิมซ้ำภายในสัปดาห์เดียวกัน
- จากชุดข้อมูลที่ตัดรายการซ้ำแล้ว เราคำนวณค่ามัธยฐาน ค่าต่ำสุด ค่าสูงสุด p10 p90 ค่าเฉลี่ย และขนาดตัวอย่าง
- เราบันทึกสแนปช็อตของคะแนนรายตัว เพื่อให้เมื่อปิดเดือนแล้ว ตัวเลขยังคงเสถียรแม้การรันดิบจะถูกลบตาม TTL ไปแล้ว
เมื่อใดที่คู่ภาษาจะปรากฏในดัชนีสาธารณะ
แถวข้อมูล (คู่ภาษา × ประเภทการทดสอบ × เดือน) จะมีสิทธิ์ปรากฏในดัชนีสาธารณะและ sitemap เมื่อผ่านเกณฑ์ขนาดตัวอย่างขั้นต่ำและเกณฑ์ขั้นต่ำของคะแนนมัธยฐาน (โดยเกณฑ์สำหรับเสียงจะต่ำกว่า เนื่องจากมีสัญญาณรบกวนจาก ASR ที่หลีกเลี่ยงไม่ได้) เนื่องจากชุดข้อมูลมาจากแหล่งอัตโนมัติแหล่งเดียว ไม่ได้มาจากผู้เข้าชมอิสระจำนวนมาก จึงผ่อนปรนข้อกำหนดเรื่องแหล่งที่มาที่ไม่ซ้ำกันสำหรับข้อมูลสังเคราะห์นี้ — แต่เกณฑ์ขนาดตัวอย่างและเกณฑ์คุณภาพยังคงมีผลบังคับใช้
คู่ภาษาที่ไม่ผ่านเกณฑ์ยังคงเข้าถึงได้ผ่านลิงก์โดยตรง — เกณฑ์เหล่านี้ควบคุมเฉพาะสิ่งที่เสิร์ชเอนจินมองเห็นเท่านั้น เราไม่ซ่อนคะแนนต่ำจากผู้ที่ขอดูโดยตรง
สิ่งที่เราจงใจไม่กล่าวอ้าง
- คะแนนเดียวไม่น่าเชื่อถือ คู่ภาษาที่ทำงานได้ดีอาจมีคะแนนแกว่งได้ถึง 30 คะแนนระหว่างการรันแต่ละครั้ง เพราะทั้ง ASR และการตัดสินของ LLM ล้วนมีสัญญาณรบกวน นี่คือเหตุผลที่ทุกหน้าแสดงการกระจายของคะแนน ไม่ใช่ตัวเลขเดียว
- LLM judge เองก็ไม่สมบูรณ์แบบ ในอนาคตเราอาจเปลี่ยนตัวตัดสินหรือใช้ตัวตัดสินสองตัวร่วมกัน แถวข้อมูลในอดีตจะระบุตัวระบุของ judge เมื่อเกิดกรณีนั้น
- เกณฑ์วัดนี้ไม่ได้วัดความหน่วง ต้นทุน ความพร้อมใช้งาน หรือความพึงพอใจของผู้ใช้ สิ่งเหล่านั้นอยู่ที่อื่น
- ชุดข้อมูลเป็นแบบสังเคราะห์ — สร้างโดยชุดทดสอบอัตโนมัติของเราเอง ไม่ใช่จากทราฟฟิกของบุคคลที่สามอิสระ เราเปิดเผยข้อนี้อย่างชัดเจน แทนที่จะบอกเป็นนัยว่ามีคณะผู้ประเมินภายนอก
การเปิดเผยอย่างตรงไปตรงมา
เมื่อคะแนนของเดือนใดลดลงในคู่ภาษาใดคู่ภาษาหนึ่ง — ข้อมูลนั้นจะยังคงมองเห็นได้ เมื่อมีการแก้ไขข้อบกพร่องและเดือนถัดไปคะแนนดีขึ้น — การปรับปรุงนั้นก็มองเห็นได้ในหน้าเดียวกัน เราจะไม่เขียนทับข้อมูลรวมในอดีต ผู้ดูแลระบบสามารถซ่อนได้เฉพาะแต่ละเดือนออกจากดัชนีสาธารณะเท่านั้น และไม่สามารถแก้ไขตัวเลขที่เผยแพร่ไปแล้วได้
ปัญหาที่ทราบซึ่งส่งผลต่อข้อมูลในอดีต
- ชุดทดสอบแชต ก่อนวันที่ 2026-04-23: ไปป์ไลน์ทดสอบแชตอัตโนมัติเกิดความล้มเหลวในบางภาษา ข้อมูลรวมของแชตในเดือนก่อนหน้านั้นอาจแสดงคะแนนต่ำกว่าคุณภาพการแปลที่แท้จริงของช่วงเวลานั้น เดือนที่ได้รับผลกระทบยังคงเก็บไว้ในฐานข้อมูล แต่ถูกระงับจากดัชนีสาธารณะ กราฟแนวโน้มจะแสดงการเปลี่ยนแปลงแบบก้าวกระโดดที่จุดแก้ไข
คำถาม
ไม่เห็นด้วยกับบางสิ่งในที่นี้? เปิด issue หรือเขียนถึงเรา เราจะอัปเดตหน้านี้และระบุการเปลี่ยนแปลงไว้