พูดด้วยเสียงของคุณเอง — ในภาษาที่คุณไม่ได้พูด
ในเรื่องการแปลแบบเรียลไทม์ มีเรื่องหนึ่งที่เกือบทุกคนพลาด และแทบไม่มีใครพูดถึง นั่นคือ เสียงที่คุณได้ยิน
ระบบรู้จำเสียงพูดอาจยอดเยี่ยมและการแปลอาจยอดเยี่ยม แต่การประชุมก็ยังฟังเหมือนเครื่องจักรอ่านรายการอยู่ดี เพราะขั้นตอนสุดท้ายคือการแปลงข้อความที่แปลแล้วกลับเป็นเสียง และเครื่องมือส่วนใหญ่มักเงียบ ๆ แทนที่ คุณ ด้วยเสียงสังเคราะห์ทั่วไปเพียงเสียงเดียว ในห้องมีแปดคน แต่ทุกคนใช้เสียงหุ่นยนต์เสียงเดียวกัน คุณจึงสูญเสียความรู้สึกว่าใครกำลังพูด น้ำเสียงเน้นย้ำ และบุคลิกของผู้พูด ฟังเข้าใจได้ แต่ไม่ใช่บทสนทนา
InterMIND ทำขั้นตอนสุดท้ายนี้ต่างออกไป เมื่อคุณพูด ผู้เข้าร่วมคนอื่นจะได้ยินคำแปลด้วยเสียงที่ จำได้ว่าเป็นเสียงของคุณ ซึ่งมีทั้งลักษณะเสียงและวิธีการพูดของคุณ เพียงแต่กำลังพูดถ้อยคำเหล่านั้นเป็นภาษาของพวกเขา ตอนนี้ยังไม่ใช่การเลียนเสียงที่สมบูรณ์แบบ แต่จุดสำคัญคือมันเป็น คุณ ไม่ใช่ผู้บรรยายสำเร็จรูป และยังพัฒนาดีขึ้นเรื่อย ๆ ฟีเจอร์นี้ใช้ได้กับผู้เข้าร่วมทุกคน ทั้งสองทิศทาง และพร้อมกันในเวลาเดียวกัน
บทความนี้เป็นบทที่ขาดหายไปของ เจาะลึกสี่ไปป์ไลน์การแปลที่ขับเคลื่อน InterMIND บทความนั้นอธิบายว่าเสียงกลายเป็นเสียงที่แปลแล้วได้อย่างไร ส่วนบทความนี้พูดถึงว่าเสียงที่ออกมาปลายทางเป็นเสียงของใคร
ค่าเริ่มต้นที่ทุกเจ้าใช้ และเหตุผลที่มันแบนราบ
หากคุณเคยใช้การแปลสดในแพลตฟอร์มประชุมรายใหญ่ คุณจะรู้จักเสียงแบบนั้นดี เป็นเสียงกลาง ๆ จังหวะสม่ำเสมอ อ่านคำแปลออกมา ไม่ว่าผู้พูดจะเป็น CEO ที่กำลังเปิดงานประชุมพนักงาน หรือเพื่อนร่วมงานที่กำลังเล่นมุกตลก ก็เป็นเสียงเดียวกัน เทคโนโลยีเบื้องหลังคือระบบแปลงข้อความเป็นเสียงพูด (text-to-speech) ที่ใช้โมเดลเสียงคงที่เพียงเสียงเดียว โดยมีสมมติฐานในการออกแบบว่าแค่ฟังเข้าใจก็เพียงพอ
ในการประชุมจริง แค่นั้นไม่พอ ครึ่งหนึ่งของสิ่งที่การประชุมสื่อสารคือ ใคร เป็นคนพูด และพูด อย่างไร ถ้าตัดเสียงออกไป การสนทนาก็กลายเป็นเพียงบันทึกถ้อยคำที่บังเอิญถูกอ่านออกเสียง ผู้คนเลิกตอบสนองต่อกันและเริ่มรอคิวของตัวเอง