พูดด้วยเสียงของคุณเอง — ในภาษาที่คุณไม่ได้พูด

เครื่องมือแปลสดส่วนใหญ่แทนที่คุณด้วยผู้บรรยายหุ่นยนต์เพียงเสียงเดียว แต่ InterMIND คงเสียงของคุณไว้ ผู้เข้าร่วมทุกคนจะได้ยินคำแปลด้วยเสียงของผู้พูดต้นฉบับเอง บทความนี้อธิบายว่า cascade ทำเช่นนี้ได้อย่างไร ตัวอย่างเสียงที่บันทึกไว้ใน Settings ซึ่งเป็นตัวเลือกเสริมช่วยเพิ่มอะไรให้บ้าง และมีการจัดเก็บข้อมูลอะไรบ้าง

The Mind.com Team

พูดด้วยเสียงของคุณเอง — ในภาษาที่คุณไม่ได้พูด

พูดด้วยเสียงของคุณเอง — ในภาษาที่คุณไม่ได้พูด

ในเรื่องการแปลแบบเรียลไทม์ มีเรื่องหนึ่งที่เกือบทุกคนพลาด และแทบไม่มีใครพูดถึง นั่นคือ เสียงที่คุณได้ยิน

ระบบรู้จำเสียงพูดอาจยอดเยี่ยมและการแปลอาจยอดเยี่ยม แต่การประชุมก็ยังฟังเหมือนเครื่องจักรอ่านรายการอยู่ดี เพราะขั้นตอนสุดท้ายคือการแปลงข้อความที่แปลแล้วกลับเป็นเสียง และเครื่องมือส่วนใหญ่มักเงียบ ๆ แทนที่ คุณ ด้วยเสียงสังเคราะห์ทั่วไปเพียงเสียงเดียว ในห้องมีแปดคน แต่ทุกคนใช้เสียงหุ่นยนต์เสียงเดียวกัน คุณจึงสูญเสียความรู้สึกว่าใครกำลังพูด น้ำเสียงเน้นย้ำ และบุคลิกของผู้พูด ฟังเข้าใจได้ แต่ไม่ใช่บทสนทนา

InterMIND ทำขั้นตอนสุดท้ายนี้ต่างออกไป เมื่อคุณพูด ผู้เข้าร่วมคนอื่นจะได้ยินคำแปลด้วยเสียงที่ จำได้ว่าเป็นเสียงของคุณ ซึ่งมีทั้งลักษณะเสียงและวิธีการพูดของคุณ เพียงแต่กำลังพูดถ้อยคำเหล่านั้นเป็นภาษาของพวกเขา ตอนนี้ยังไม่ใช่การเลียนเสียงที่สมบูรณ์แบบ แต่จุดสำคัญคือมันเป็น คุณ ไม่ใช่ผู้บรรยายสำเร็จรูป และยังพัฒนาดีขึ้นเรื่อย ๆ ฟีเจอร์นี้ใช้ได้กับผู้เข้าร่วมทุกคน ทั้งสองทิศทาง และพร้อมกันในเวลาเดียวกัน

บทความนี้เป็นบทที่ขาดหายไปของ เจาะลึกสี่ไปป์ไลน์การแปลที่ขับเคลื่อน InterMIND บทความนั้นอธิบายว่าเสียงกลายเป็นเสียงที่แปลแล้วได้อย่างไร ส่วนบทความนี้พูดถึงว่าเสียงที่ออกมาปลายทางเป็นเสียงของใคร


ค่าเริ่มต้นที่ทุกเจ้าใช้ และเหตุผลที่มันแบนราบ

หากคุณเคยใช้การแปลสดในแพลตฟอร์มประชุมรายใหญ่ คุณจะรู้จักเสียงแบบนั้นดี เป็นเสียงกลาง ๆ จังหวะสม่ำเสมอ อ่านคำแปลออกมา ไม่ว่าผู้พูดจะเป็น CEO ที่กำลังเปิดงานประชุมพนักงาน หรือเพื่อนร่วมงานที่กำลังเล่นมุกตลก ก็เป็นเสียงเดียวกัน เทคโนโลยีเบื้องหลังคือระบบแปลงข้อความเป็นเสียงพูด (text-to-speech) ที่ใช้โมเดลเสียงคงที่เพียงเสียงเดียว โดยมีสมมติฐานในการออกแบบว่าแค่ฟังเข้าใจก็เพียงพอ

ในการประชุมจริง แค่นั้นไม่พอ ครึ่งหนึ่งของสิ่งที่การประชุมสื่อสารคือ ใคร เป็นคนพูด และพูด อย่างไร ถ้าตัดเสียงออกไป การสนทนาก็กลายเป็นเพียงบันทึกถ้อยคำที่บังเอิญถูกอ่านออกเสียง ผู้คนเลิกตอบสนองต่อกันและเริ่มรอคิวของตัวเอง

InterMIND ทำอะไรแทน

การแปลทำงานเป็น ไปป์ไลน์แบบคาสเคด คือสามขั้นตอนเฉพาะทางที่ทำงานต่อเนื่องกัน แทนที่จะใช้โมเดลเดียวทำทุกอย่าง สองขั้นตอนแรกอธิบายไว้ในบทความเรื่องไปป์ไลน์ ส่วนขั้นตอนเสียงคือสิ่งที่บทความนี้กล่าวถึง

  1. ASR — การรู้จำเสียงพูด คำพูดของคุณถูกถอดเป็นข้อความในภาษาของคุณเองขณะที่คุณพูด บนเอนจินของเราเอง คือมีเดียเซิร์ฟเวอร์ที่รับส่งการสนทนา (Mind API, OVH ฝรั่งเศส) เพื่อให้การแปลเริ่มได้ก่อนที่ประโยคจะจบ
  2. MT — การแปล ข้อความที่ถอดได้จะถูกจัดกลุ่มเป็นส่วนของประโยคที่คงที่ หรือ อนุประโยค เพื่อให้การแปลเริ่มได้ก่อนที่คุณจะพูดจบประโยค และแต่ละส่วนจะถูกแปลต่อเนื่องเป็นภาษาของผู้ฟัง
  3. Zero-shot TTS — การสังเคราะห์เสียง แต่ละส่วนที่แปลแล้วจะถูกพูดออกมา โดยใช้ตัวอย่างเสียงของคุณเอง แล้วสตรีมไปยังผู้ฟัง

ขั้นตอนที่สามนี้เอง คือ ASR → MT → zero-shot TTS ที่สร้างผลลัพธ์ดังกล่าว คำว่า "Zero-shot" หมายความว่าระบบไม่จำเป็นต้องมีการบันทึกเสียงลงทะเบียนไว้ล่วงหน้า หรือต้องมีรอบการฝึกสำหรับเสียงของคุณ ระบบสร้างแบบจำลองเสียงของคุณจากเสียงในการประชุมที่คุณกำลังเข้าร่วมอยู่แล้ว

ช่วงวอร์มอัป: ทำไมจึงเริ่มฟังเหมือนคุณได้เร็วขนาดนี้

มีปัญหาแบบ "ไก่กับไข่" ซ่อนอยู่ในประโยค "ใช้ตัวอย่างเสียงของคุณเอง" ตอนเริ่มต้นการสนทนา ระบบยังไม่ได้ ได้ยิน เสียงของคุณมากพอที่จะสร้างแบบจำลองเสียงได้ดี

InterMIND จัดการเรื่องนี้ด้วยการวอร์มอัปแบบก้าวหน้า

  • ในช่วงประมาณ 5–10 วินาทีแรก ขณะที่ยังรวบรวมเสียงพูดของคุณได้ไม่พอ แต่ละส่วนที่แปลแล้วจะถูกสังเคราะห์โดยใช้ช่วงเสียงที่ตรงกับสิ่งที่คุณ เพิ่งพูดไป ในภาษาต้นทาง การสร้างเสียงจึงยึดโยงกับเสียงพูดจริงของคุณในขณะนั้น
  • เมื่อมีตัวอย่างยาวพอแล้ว คือเมื่อถึงช่วง 5–10 วินาทีนั้น ระบบจะล็อกตัวอย่างนั้นไว้และใช้สร้างเสียงสำหรับทุกอย่างหลังจากนั้น

ในทางปฏิบัติ คุณจะไม่ได้ยินการสลับใด ๆ คำแปลจะฟังคล้ายคุณมากขึ้นเมื่อบทสนทนาเดินหน้าไป ไม่ใช่เสียงแฝดที่เหมือนเป๊ะ แต่ชัดเจนว่าเป็นของคุณไม่ใช่ของเครื่องจักร และดีขึ้นเรื่อย ๆ เมื่อโมเดลได้ยินมากขึ้น การแปลแบบ ก้าวหน้า (ทีละอนุประโยค ไม่ใช่ทีละประโยค) ร่วมกับการสร้างเสียงแบบ ก้าวหน้า คือสิ่งที่ทำให้ทั้งระบบอยู่ในงบความหน่วงที่กำหนด โดยยังฟังดูเป็นมนุษย์

บันทึกเสียงของคุณครั้งเดียว แล้วข้ามช่วงวอร์มอัป

การวอร์มอัปข้างต้นคือสิ่งที่เกิดขึ้นโดยค่าเริ่มต้น โดยไม่ต้องตั้งค่าอะไร ตั้งแต่เดือนกันยายน 2026 มีเส้นทางที่สองแบบเลือกใช้ได้สำหรับผู้ใช้ที่ลงชื่อเข้าใช้แล้ว คือ ตัวอย่างเสียงที่บันทึกไว้ ใน Settings → Your voice in translation

การบันทึกทำได้ในขั้นตอนเดียว กด Record my voice รอจนเห็น Speak now แล้วพูดตัวเลขหนึ่งถึงสิบโดยเรียงลำดับแบบใดก็ได้ ตัวเลขแต่ละตัวจะสว่างขึ้นบนการ์ดเมื่อเอนจินรู้จำเสียงได้ และเมื่อสว่างครบทั้งสิบตัว ตัวอย่างจะถูกตรวจสอบและบันทึกให้เองโดยอัตโนมัติ ไม่ต้องเล่นฟังซ้ำหรือกดยืนยัน และไม่มีการนับถอยหลัง การ์ดจะเก็บเฉพาะช่วงของการอัดที่มีตัวเลขเหล่านั้น ห้องที่เงียบและการใช้หูฟังพร้อมไมค์จะให้ผลดีที่สุด

สิ่งที่ตัวอย่างที่บันทึกไว้เปลี่ยนไป: ตั้งแต่การประชุมครั้งถัดไป ตัวสังเคราะห์เสียงจะใช้ตัวอย่างนั้นสร้างเสียงคำแปลของคุณ ตั้งแต่ส่วนแรก อีกฝ่ายจึงได้ยินคุณเป็นคุณตั้งแต่ประโยคแรก ไม่ต้องรอหลังช่วงวอร์มอัป เบื้องหลังยังเป็นการสังเคราะห์แบบ zero-shot เดิม เพียงแต่มีจุดเริ่มต้นที่ดีกว่า และการวอร์มอัปสดจะยังคงปรับแต่งเสียงให้ดีขึ้นต่อไปเมื่อการสนทนาดำเนินไป

การอัดเสียงจะถูกตรวจสอบก่อนจัดเก็บ ต้องเป็นเสียงพูดที่ชัดเจนความยาว 3 ถึง 10 วินาที (ช่วงอินพุตของตัวสังเคราะห์เสียง) หากเบาเกินไป เสียงแตก เงียบเป็นส่วนใหญ่ หรือมีเสียงรบกวนพื้นหลังกลบ การ์ดจะบอกว่าต้องแก้อะไรและขอให้อัดใหม่ เหตุผลเชิงปฏิบัติที่เลือกใช้ตัวเลขเป็นวลีสำหรับพูดคือ ตัวเลขสั้น จำได้ในทุกภาษาจากทั้ง 23 ภาษา และเอนจินยืนยันได้ว่าได้ยินครบทั้งสิบตัว ทำให้คำถามว่า "บันทึกสำเร็จหรือไม่?" กลายเป็นคำตอบที่มองเห็นได้ว่า "สำเร็จ"

ตัวอย่างเสียงสองแบบ อายุการเก็บสองแบบ

นี่คือเรื่องที่ทีมความปลอดภัยหรือทีมกฎหมายจะถามทันที จึงขออธิบายอย่างตรงไปตรงมา มีตัวอย่างเสียงสองแบบที่แตกต่างกัน และมีอายุการเก็บไม่เหมือนกัน

ตัวอย่างสด ที่ใช้ในการวอร์มอัประหว่างการประชุมเป็นแบบ ชั่วคราว มีอยู่เฉพาะในช่วงเซสชันการประชุมสด เพื่อใช้สร้างเสียงคำแปลเท่านั้น และไม่ถูกจัดเก็บที่ใดเลย Mind API และ SDK ที่ขับเคลื่อนเซสชันเรียลไทม์ไม่เก็บข้อมูลใด ๆ ทุกอย่างที่เป็นข้อมูลชั่วคราวจะหายไปเมื่อเซสชันการประชุมสิ้นสุดลง

ตัวอย่างที่บันทึกไว้ จาก Settings จะถูกจัดเก็บ ไว้กับบัญชีของคุณ เพื่อวัตถุประสงค์เดียว คือส่งไปยังเอนจินแปลทุกครั้งที่คุณเข้าร่วมการประชุม เพื่อให้เสียงคำแปลของคุณถูกสร้างด้วยตัวอย่างนั้น และไม่ใช้เพื่ออย่างอื่น ตัวอย่างจะอยู่ต่อไปจนกว่าคุณจะกด Remove บนการ์ด ซึ่งจะพาคุณกลับสู่การวอร์มอัปมาตรฐานทันที และจะถูกลบพร้อมกับบัญชีของคุณ ผู้เข้าร่วมแบบแขก (Guest) ไม่สามารถบันทึกได้ เพราะเป็นฟีเจอร์สำหรับผู้ที่ลงชื่อเข้าใช้โดยการออกแบบ

ควรระบุให้ชัดว่าตัวอย่างทั้งสองแบบไม่ใช่อะไร: ไม่ใช่ฟีเจอร์ การบันทึก ของ InterMIND การบันทึกวิดีโอและเสียงของการประชุมเป็นการกระทำแยกต่างหากที่คุณตั้งใจทำ พร้อมตัวควบคุมของมันเอง ตัวอย่างเสียงเป็นเพียงอินพุตของตัวสังเคราะห์เสียงพูด: ชั่วคราวในกรณีสด และเป็นของคุณที่จะเก็บหรือลบในกรณีที่บันทึกไว้

ทำไมจึงไม่มีใครทำแบบนี้

การโคลนเสียงไม่ใช่ความลับ แต่การทำ แบบสด แยกตามผู้เข้าร่วมแต่ละคน ทั้งสองทิศทาง ภายใต้งบเวลาไม่เกินหนึ่งวินาที ครอบคลุม 23 ภาษา โดยไม่จัดเก็บสิ่งที่คุณไม่ได้สั่งให้เก็บ เป็นปัญหาคนละแบบกับการโคลนเสียงแบบออฟไลน์สำหรับพอดแคสต์

แพลตฟอร์มรายใหญ่ปรับแต่งการแปลของตนเพื่อให้ครอบคลุมคำบรรยายและใช้เสียงผู้บรรยายที่ปลอดภัยเพียงเสียงเดียว ซึ่งเป็นค่าเริ่มต้นที่ประหยัดและทนทานเมื่อให้บริการในระดับขนาดใหญ่ การรักษาเสียงของผู้พูดแต่ละคนหมายความว่าขั้นตอนสังเคราะห์เสียงต้องติดตามผู้เข้าร่วมทุกคนแยกกัน และยังต้องอยู่ในงบความหน่วงเดียวกับส่วนอื่นของไปป์ไลน์ เราสร้างเอนจินเสียงขึ้นเอง บนโครงสร้างพื้นฐานของเราเอง ซึ่งทำให้เราเป็นผู้ตัดสินใจเรื่องข้อแลกเปลี่ยนนี้ (อ่านเพิ่มเติมว่าทำไมเอนจินจึงเป็นโค้ดของเราเอง: การประชุม InterMIND หนึ่งครั้งประกอบขึ้นจากอะไรบ้าง)

ก้าวต่อไป: การซิงก์ปาก (lip-sync)

การรักษาเสียงของคุณเป็นเพียงครึ่งหนึ่งของเป้าหมายที่ใหญ่กว่า อีกครึ่งหนึ่งคือ ใบหน้า ของคุณ

ตอนนี้คุณได้ยินอีกฝ่ายด้วยเสียงของเขาเอง แต่ถ้าเปิดกล้องอยู่ ริมฝีปากของเขายังคงขยับตามถ้อยคำที่เขาพูดจริง ซึ่งเป็นภาษาที่คุณอ่านไม่ออก ก้าวต่อไปคือ lip-sync คือการปรับจังหวะการขยับปากของผู้พูดให้ตรงกับเสียงที่แปลแล้ว เพื่อให้บนหน้าจอของคุณ เขาดูเหมือนกำลังพูด ภาษาของคุณ

เมื่อรวมสองสิ่งนี้เข้าด้วยกัน จุดมุ่งหมายทั้งหมดของงานนี้ก็ชัดเจนขึ้น คนสองคนที่ไม่มีภาษากลางร่วมกันนั่งอยู่คนละฟากของวิดีโอคอล และเห็นและได้ยินกันราวกับต่างฝ่ายต่างเป็นเจ้าของภาษาของอีกฝ่าย ด้วยเสียงเดิม ใบหน้าเดิม ไม่มีล่ามคั่นกลาง ไม่มีหุ่นยนต์อ่านสคริปต์

เพื่อความชัดเจนเรื่องสถานะ: เสียงใช้งานได้แล้วในวันนี้ ส่วน lip-sync อยู่ในโรดแมป ยังไม่เปิดให้ใช้ เราพูดถึงจุดหมายปลายทางนี้เพราะมันคือเหตุผลที่งานด้านเสียงสำคัญ การแปลด้วยเสียงของตัวเองไม่ใช่ฟีเจอร์สุดท้าย แต่เป็นครึ่งแรกของ "คุยกับใครก็ได้ ในภาษาใดก็ได้ ในแบบที่เป็นตัวเอง"

ฟังได้ที่ไหน

การแปลด้วยเสียงของตัวเอง ใช้งานได้แล้วในวันนี้ ครอบคลุมทั้ง 23 ภาษาเสียง ซึ่งเป็นภาษาเดียวกับที่ระบุไว้ในเอกสาร ไม่ต้องเปิดใช้แยกต่างหาก เมื่อเปิดการแปลในการประชุม ผู้เข้าร่วมจะได้ยินกันและกันด้วยเสียงของตนเองโดยอัตโนมัติ เราขอพูดตามตรงเกี่ยวกับสถานะปัจจุบัน: วันนี้เสียงจำได้อยู่แล้วว่าเป็น คุณ และเรากำลังพยายามอย่างต่อเนื่องให้ความคล้ายยิ่งใกล้เคียงขึ้น ลองฟังแล้วตัดสินด้วยตัวคุณเอง

การประชุมที่มีการแปลควรให้ความรู้สึกเหมือนผู้คนที่อยู่ในการประชุมนั้นกำลังคุยกันจริง ๆ การรักษาเสียงของคุณคือหนทางที่พาไปถึงจุดนั้น

เพิ่มเติมใน การแปลแบบเรียลไทม์

บทความทั้งหมดใน การแปลแบบเรียลไทม์
เครื่องแปลเสียงภาษาตุรกี: กริยามาอยู่ท้ายประโยค และนั่นคือสิ่งที่ตัดสินว่าคุณควรเลือกแบบไหน
การแปลแบบเรียลไทม์

เครื่องแปลเสียงภาษาตุรกี: กริยามาอยู่ท้ายประโยค และนั่นคือสิ่งที่ตัดสินว่าคุณควรเลือกแบบไหน

ภาษาตุรกีวางกริยา รวมถึงการปฏิเสธและกาล ไว้ท้ายประโยค ข้อเท็จจริงข้อนี้เพียงข้อเดียวแบ่งผลิตภัณฑ์สามประเภทที่ขายในชื่อ "เครื่องแปลเสียง" ออกจากกัน ได้แก่ แอปบนมือถือ หูฟังแปลภาษา และการแปลภาษาในการประชุมแบบสด บทความนี้อธิบายว่าแต่ละแบบทำอะไรได้และทำอะไรไม่ได้กับประโยคภาษาตุรกี และเหตุใดจำนวนภาษาที่ผู้จำหน่ายโฆษณาจึงบอกอะไรไม่ได้เลยเกี่ยวกับคู่ภาษานี้

The Mind.com Team

ล่ามแปลพร้อมกัน: ล่ามมนุษย์ แพลตฟอร์ม RSI หรือ AI — สิ่งที่ meeting หลายภาษาของคุณต้องการ (2026)
การแปลแบบเรียลไทม์

ล่ามแปลพร้อมกัน: ล่ามมนุษย์ แพลตฟอร์ม RSI หรือ AI — สิ่งที่ meeting หลายภาษาของคุณต้องการ (2026)

"ล่ามแปลพร้อมกัน" เป็นอาชีพหนึ่ง แต่สิ่งที่การค้นหาส่วนใหญ่ต้องการจริง ๆ คือเสียงพูดที่ถูกส่งมาเป็นอีกภาษาหนึ่งในขณะที่กำลังพูดอยู่ คู่มือนี้แยกความแตกต่างระหว่างห้องล่าม แพลตฟอร์ม RSI และการแปลพร้อมกันด้วย AI เปรียบเทียบเครื่องมือต่าง ๆ จากเอกสารประกอบของแต่ละเครื่องมือ ได้แก่ Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet และ InterMIND และตั้งคำถามกับสิ่งที่การเปรียบเทียบมักข้ามไป นั่นคือ meeting ถูกถ่ายทอดกลับมาเป็นภาษาของคุณได้มากแค่ไหน และข้อมูลถูกประมวลผลที่ไหน

The Mind.com Team

การแปลพร้อมกัน: ล่ามในบูธ, RSI หรือ AI — และเครื่องมือใดเหมาะกับการประชุมของคุณ (2026)
การแปลแบบเรียลไทม์

การแปลพร้อมกัน: ล่ามในบูธ, RSI หรือ AI — และเครื่องมือใดเหมาะกับการประชุมของคุณ (2026)

"การแปลพร้อมกัน" ครอบคลุมสามรูปแบบที่แตกต่างกัน ได้แก่ ล่ามในบูธ การแปลแบบพร้อมกันระยะไกล (RSI) และการแปลด้วย AI แบบเรียลไทม์ คู่มือนี้แยกทั้งสามแบบออกจากกัน เปรียบเทียบเครื่องมือที่มีเอกสารยืนยัน ได้แก่ Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND และตั้งคำถามที่บทความเปรียบเทียบทั่วไปมักมองข้าม: เนื้อหาของการประชุมถูกถ่ายทอดกลับมาเป็นภาษาของคุณได้มากน้อยแค่ไหน?

The Mind.com Team

รับบทความใหม่และอัปเดตผลิตภัณฑ์ทางอีเมล

อีเมลเดือนละฉบับพร้อมบทความใหม่และอัปเดตผลิตภัณฑ์ ยกเลิกการรับได้ทุกเมื่อ


เราตรวจสอบ GDPR เสร็จแล้ว นี่คือสิ่งที่เราปิดช่องว่างได้จริง

ป้าย "GDPR-compliant" ของผู้ให้บริการไม่มีความหมายเลยหากไม่มีการทำงานรองรับอยู่เบื้องหลัง เราได้ตรวจสอบโค้ดเบสของเราเองอย่างครบถ้วนเทียบกับภาระหน้าที่ตาม GDPR ที่ตกอยู่กับผู้ประมวลผลข้อมูล ได้แก่ การลบข้อมูล การเก็บรักษาข้อมูล ผู้ประมวลผลช่วง และรันไทม์ในสหภาพยุโรป และนี่คือแต่ละรายการที่เราปิดได้ พร้อมการตรวจสอบยืนยันกับโค้ด

การแปลสดใน Microsoft Teams (2026): ทำงานอย่างไร ราคาเท่าไร และข้อจำกัดอยู่ตรงไหน

Teams แปลแบบเรียลไทม์ได้ไหม? ได้ มีสามวิธี ได้แก่ คำบรรยายแปลสด, เอเจนต์ AI Interpreter และช่องล่ามมนุษย์ ต้องใช้ไลเซนส์ใด (Teams Premium, Microsoft 365 Copilot) ราคาต่อผู้ใช้เท่าไร รองรับกี่ภาษา เปิดใช้งานอย่างไร และข้อจำกัดที่ช่วยตัดสินว่าเหมาะกับการประชุมของคุณหรือไม่