เจาะลึกสี่ไปป์ไลน์การแปลที่ขับเคลื่อน InterMIND
หน้า /product/overview/how-it-works เดิมบน mind.com ล้าหลังไปหลายเวอร์ชันหลักแล้ว หน้านั้นอธิบาย "เอนจินแปลภาษา" ตัวเดียวแบบที่หน้าเว็บของผู้ให้บริการส่วนใหญ่ทำกัน คือมีลูกศรใหญ่เส้นเดียวจาก "คุณพูด" ไปยัง "พวกเขาได้ยิน" ภาพนั้นเป็นการทำให้ง่ายเกินจริงมาตั้งแต่สองปีก่อน และวันนี้ก็ไม่ถูกต้องอีกต่อไป
ความจริงคือ InterMIND ทำงานด้วย ไปป์ไลน์การแปลสี่ตัวที่แยกจากกัน แต่ละตัวแก้ปัญหาต่างกัน ใช้เอนจินต่างกัน มีงบเวลาแฝง (latency) ต่างกัน และมีขอบเขตคุณภาพต่างกัน ทั้งสี่ตัวใช้ตัวเลือกภาษาร่วมกัน แต่ไม่ได้ใช้เอนจินร่วมกัน
บทความนี้คือคำตอบฉบับอัปเดตสำหรับคำถามที่ว่า "ระบบทำงานอย่างไร"
บทความคู่กัน: "InterMIND รองรับกี่ภาษา?" อธิบายว่าแต่ละไปป์ไลน์ รองรับ ภาษาอะไรบ้าง (23 / 23 / 30 / 17) ส่วนบทความนี้อธิบายว่าแต่ละไปป์ไลน์ ทำอะไร และทำไมจึงต้องแยกเป็นอีกส่วนหนึ่งต่างหาก
ทำไม "เอนจินเดียวทำได้ทุกอย่าง" จึงเป็นเรื่องหลอกลวง
แพลตฟอร์มการประชุมสดต้องทำอย่างน้อยสี่งานพร้อมกัน และแต่ละงานดึงไปคนละทิศทาง
- เสียงแบบเรียลไทม์ — รับเสียงเข้า ส่งเสียงที่แปลแล้วออก ภายในหนึ่งวินาที ให้ผู้ชมทุกคนได้ยินในภาษาของตนเอง ข้อจำกัดสำคัญคือเวลาแฝง
- ข้อความแชตแบบเรียลไทม์ — ข้อความสั้น ส่งเร็ว โดยต้องรักษาการแก้ไข การอ้างอิง และโครงสร้าง HTML ไว้
- บันทึกที่ใช้ร่วมกันแบบเรียลไทม์ — การพิมพ์ร่วมกันทีละตัวอักษร พร้อมโครงสร้างลำดับชั้น (รายการ หัวข้อ ช่องทำเครื่องหมาย) ที่ต้องคงอยู่ครบหลังการแปล
- ไฟล์เอกสารแบบอะซิงโครนัส — ไฟล์ PDF 40 หน้าที่ส่งเข้าแชต ไม่มีงบเวลาแฝง ข้อจำกัดสำคัญคือ ความเที่ยงตรง ของรูปแบบ ตาราง เลขหน้า และฟอนต์
คุณสร้างการเรียก LLM ก้อนใหญ่ครั้งเดียวเพื่อทำทั้งสี่อย่างได้ เราเคยลองแล้ว และผลคือแย่ทั้งสี่อย่าง งบเวลาแฝงของเสียงหมายความว่าโมเดลไม่มีเวลาคิด ส่วนงบความเที่ยงตรงของเอกสารหมายความว่าโมเดลจำเป็นต้องคิด การแก้ไขข้อความแชตต้องการ diff ในภาษาของผู้ชม ส่วน PDF 40 หน้าต้องการการรักษารูปแบบที่โมเดลแบบสตรีมโทเค็นไม่สามารถให้ได้
เราจึงใช้สี่ไปป์ไลน์ ต่อไปนี้คือแต่ละตัว