เหตุใดการตลาดด้านคุณภาพการแปลจึงมีปัญหา — และสิ่งที่เราเผยแพร่แทน
ลองเปิดเว็บไซต์ของผู้ให้บริการแปลแบบสดรายใดก็ได้ คุณจะเห็นตัวเลขหน้าตาเดิม ๆ ซ้ำกัน:
- "200+ languages"
- "6,000+ language pairs"
- "World's first" / "Highest accuracy"
- "99% accurate"
ลองหาดูในหน้าเว็บของผู้ให้บริการเหล่านั้นว่า ตัวเลขพวกนี้มีความหมายอย่างไรต่อการประชุมที่คุณกำลังจะจัด คุณภาพรายภาษา วิธีการวัดที่ทำซ้ำได้ ขนาดตัวอย่าง คะแนนที่เปลี่ยนไปตามเวลา การเปิดเผยอย่างตรงไปตรงมาว่าโมเดลอ่อนด้านไหน
คุณจะไม่พบสิ่งเหล่านี้ ทั้งในข้อความการตลาด และแทบไม่พบในเอกสารทางเทคนิคด้วย
นี่คือภาวะสมดุลของตลาดกลุ่มนี้ ซึ่งเกิดขึ้นจากสามสาเหตุ:
- ผู้ให้บริการส่วนใหญ่ไม่ได้เป็นเจ้าของเอนจินแปลภาษาเอง พวกเขาส่งต่อผ่าน OpenAI, Google, DeepL, Microsoft หรือหลายรายผสมกัน การเผยแพร่ข้อมูลคุณภาพรายคู่ภาษาจึงเท่ากับการวัดประสิทธิภาพโมเดลของคนอื่น ซึ่งไม่มีคุณค่าทางการตลาดเลย
- ข้อมูลคุณภาพที่ตรงไปตรงมานั้นนำไปขึ้นป้ายโฆษณาได้ยาก คะแนนเดี่ยวมีความผันผวน การแจกแจงมีประโยชน์กว่าแต่บีบให้สั้นได้ยากกว่า และ
last-six-months trendมีประโยชน์ยิ่งกว่า แต่ก็ยิ่งยากขึ้นไปอีก - ฝ่ายจัดซื้อยังไม่ได้ทักท้วง ผู้ซื้อยอมรับตัวเลขทางการตลาดตามที่เห็น ภาวะสมดุลนี้จึงดำรงอยู่ต่อไป
ภาวะสมดุลนี้จะไม่คงอยู่ตลอดไป ผู้ซื้อรุ่นถัดไป ไม่ว่าจะเป็นอุตสาหกรรมยา กฎหมาย การเงิน การตรวจสอบ หรือภาครัฐ จะถามคำถามที่ลึกกว่า "รองรับกี่ภาษา" เราจึงสร้าง /benchmark ขึ้นมา เพราะเราเชื่อว่าพวกเขาไม่ควรต้องเชื่อคำพูดของผู้ให้บริการเพียงอย่างเดียว
สิ่งที่ตัวเลขทางการตลาดไม่ได้บอกคุณ
"200+ languages" หมายความเพียงว่าผู้ให้บริการมีโมเดลที่สร้างข้อความได้ใน 200 ภาษา คุณภาพของแต่ละภาษามีตั้งแต่ระดับพร้อมใช้งานจริงสำหรับคู่ภาษาหลัก (EN↔DE, EN↔ES, EN↔FR) ไปจนถึงแทบใช้งานไม่ได้สำหรับคู่ภาษาที่มีข้อมูลน้อย หากไม่มีการแจกแจงรายคู่ภาษา คุณก็ไม่อาจรู้ได้ว่าการประชุมของคุณจะอยู่ฝั่งไหนของเส้นนั้น
"6,000+ language pairs" คือการคำนวณเชิงจัดหมู่แบบ N × N จากภาษาต้นทาง 80 ภาษา การบอกว่ารองรับ 6,000 คู่เป็นเรื่องง่าย ส่วนการบอกว่าคู่ภาษาใดคู่หนึ่งดีพอสำหรับการทบทวน CAPA การเจรจาสัญญา หรือการประชุมแถลงผลประกอบการ นั่นคือส่วนที่ไม่มีอยู่ในโบรชัวร์
"99% accurate" หากไม่ระบุว่าวัดอะไร เทียบกับข้อมูลอ้างอิงใด ใช้ตัวอย่างอะไร และใครเป็นผู้ตัดสิน ก็ไม่มีเนื้อหาสาระใด ๆ คุณภาพการแปลไม่มีค่าตัวเลขเดียวที่ใช้ได้ทุกกรณี แต่เป็นการแจกแจงที่ขึ้นอยู่กับคู่ภาษา โดเมนของเนื้อหา คุณภาพเสียง (สำหรับเสียงพูด) งบประมาณด้านความหน่วง และนิยามของคำว่า "ดีพอ" สำหรับกรณีใช้งานนั้น ๆ