Kiến trúc

Nói bằng chính giọng của bạn — bằng một ngôn ngữ bạn không biết

Hầu hết các công cụ dịch thuật trực tiếp đều thay thế bạn bằng một giọng đọc robot. InterMIND giữ nguyên giọng của bạn: mọi người tham gia đều nghe bản dịch bằng chính giọng nói của người phát ngôn gốc. Dưới đây là cách mô hình thác thực hiện việc này, mẫu giọng nói tùy chọn đã lưu trong Cài đặt mang lại lợi ích gì và dữ liệu nào được lưu trữ.

The Mind.com Team

Nói bằng chính giọng của bạn — bằng một ngôn ngữ bạn không biết

Nói bằng giọng của chính bạn — bằng một ngôn ngữ bạn không biết

Đây là khía cạnh của bản dịch thời gian thực mà hầu hết mọi người đều làm sai, và hầu như không ai nói đến: giọng nói mà bạn nghe được.

Bạn có thể có nhận dạng giọng nói tuyệt vời và bản dịch tuyệt vời, nhưng vẫn kết thúc với một cuộc họp có cảm giác như một cỗ máy đang đọc danh sách. Bởi vì bước cuối cùng — chuyển văn bản được dịch trở lại thành âm thanh — là nơi hầu hết các công cụ âm thầm thay thế bạn bằng một giọng đọc tổng hợp chung chung duy nhất. Tám người trong phòng, một giọng robot cho tất cả. Bạn đánh mất người đang nói, sự nhấn mạnh, cá tính. Nghe hiểu được, nhưng không phải là một cuộc trò chuyện.

InterMIND thực hiện bước cuối cùng này theo cách khác. Khi bạn nói, những người tham gia khác nghe bản dịch bằng một giọng nói có thể nhận ra là của bạn — mang theo âm sắc và cách nói của bạn — giờ đang nói những từ ngữ bằng ngôn ngữ của họ. Nó chưa phải là một sự bắt chước hoàn hảo; điểm mấu chốt là nó là bạn chứ không phải một giọng đọc có sẵn, và nó đang ngày càng tốt hơn. Điều này hoạt động cho mọi người tham gia, ở cả hai chiều, cùng lúc.

Bài viết này là chương bị thiếu của Bên trong bốn quy trình dịch thuật chạy InterMIND: bài kia đã giải thích cách âm thanh trở thành âm thanh đã dịch. Bài viết này nói về giọng nói của ai sẽ phát ra ở đầu kia.


Mặc định mà mọi nhà cung cấp đưa ra, và lý do tại sao nó lại nhạt nhẽo

Nếu bạn đã sử dụng tính năng dịch trực tiếp trên bất kỳ nền tảng cuộc họp lớn nào, bạn sẽ biết âm thanh đó. Một giọng nói trung tính, có nhịp độ đều đặn đọc bản dịch. Đó là cùng một giọng nói cho dù người nói là CEO của bạn đang khai mạc một buổi town hall hay một đồng nghiệp đang nói đùa. Công nghệ bên dưới là chuyển văn bản thành giọng nói với một mô hình giọng nói cố định, và giả định thiết kế là khả năng nghe hiểu là đủ dùng.

Trong một cuộc họp thực tế thì không phải vậy. Một nửa những gì một cuộc họp giao tiếp là ai đang nói và thế nào. Tước bỏ giọng nói và bạn đã biến một cuộc thảo luận thành một bản chép lại được đọc to. Mọi người ngừng phản ứng với nhau và bắt đầu chờ đến lượt mình.

Thay vào đó, InterMIND làm gì

Bản dịch chạy như một quy trình dạng thác (cascaded pipeline) — ba giai đoạn chuyên biệt theo trình tự thay vì một mô hình cố gắng làm mọi thứ. Hai giai đoạn đầu được đề cập trong bài viết về quy trình; bước giọng nói là bước mà bài viết này nói đến:

  1. ASR — nhận dạng giọng nói. Các từ của bạn được chuyển ngữ trong ngôn ngữ của riêng bạn, khi bạn nói, trên engine của chính chúng tôi — máy chủ media truyền tải cuộc gọi (Mind API, OVH France) — để bản dịch có thể bắt đầu trước khi câu kết thúc.
  2. MT — dịch thuật. Bản chép lại được nhóm thành các đoạn câu ổn định — các mệnh đề — để bản dịch có thể bắt đầu trước khi bạn nói xong câu, và mỗi đoạn được dịch tiến dần vào ngôn ngữ của người nghe.
  3. Zero-shot TTS — tổng hợp giọng nói. Mỗi đoạn đã dịch được đọc lại sử dụng mẫu giọng nói của chính bạn, và truyền trực tuyến đến người nghe.

Chính giai đoạn thứ ba đó — ASR → MT → zero-shot TTS — tạo ra hiệu ứng này. "Zero-shot" có nghĩa là hệ thống không cần một bản ghi âm sẵn hay một phiên đào tạo cho giọng nói của bạn. Nó mô hình hóa giọng nói của bạn từ âm thanh của cuộc họp mà bạn đang tham gia.

Quá trình khởi động: làm thế nào nó bắt đầu nghe giống bạn nhanh như vậy

Có một vấn đề giống như "con gà hay quả trứng" ẩn trong câu "sử dụng mẫu giọng nói của riêng bạn." Ngay từ đầu cuộc gọi, hệ thống chưa nghe đủ giọng của bạn để mô hình hóa giọng nói của bạn thật tốt.

InterMIND xử lý việc này bằng một quá trình khởi động tiến dần:

  • Trong khoảng 5–10 giây đầu tiên, trong khi nó vẫn đang thu thập đủ âm thanh phát ngôn của bạn, mỗi đoạn đã dịch được tổng hợp bằng cách sử dụng đoạn âm thanh khớp với những gì bạn vừa nói bằng ngôn ngữ nguồn của mình. Việc tạo giọng nói được neo vào bài phát ngôn thực tế và ngay lập tức của bạn.
  • Khi đã có một mẫu đủ dài — mốc 5–10 giây đó — hệ thống sẽ khóa vào nó và dùng để tạo giọng nói cho mọi thứ sau đó.

Trên thực tế, bạn không nghe thấy tiếng công tắc bật. Bản dịch nghe giống bạn hơn khi cuộc trò chuyện bắt đầu — không phải bản sao hoàn hảo giọng nói của bạn, nhưng rõ ràng là của bạn thay vì của máy, và cải thiện khi mô hình nghe được nhiều hơn. Sự kết hợp giữa bản dịch tiến dần (từng mệnh đề, không phải từng câu) và việc tạo giọng nói tiến dần là thứ giữ cho toàn bộ quá trình nằm trong ngân sách độ trễ mà vẫn nghe giống con người.

Ghi âm giọng nói của bạn một lần, và bỏ qua quá trình khởi động

Quá trình khởi động ở trên là điều xảy ra theo mặc định, mà không cần thiết lập gì. Từ tháng 9 năm 2026, có một tùy chọn thứ hai dành cho người dùng đã đăng nhập: một mẫu giọng nói đã lưu trong Cài đặt → Giọng nói của bạn trong bản dịch.

Việc ghi âm chỉ là một thao tác. Nhấn Ghi âm giọng nói của tôi, đợi cho đến khi hiện Hãy nói ngay, và đọc các số từ một đến mười theo bất kỳ thứ tự nào. Mỗi số sẽ sáng lên trên thẻ khi engine nhận dạng giọng nói nghe thấy nó; khi cả mười số đều sáng, mẫu sẽ được kiểm tra và tự lưu lại. Không có gì để phát lại hay xác nhận, và không có đếm ngược: thẻ sẽ giữ lại phần ghi âm của bạn có chứa các con số. Một căn phòng yên tĩnh và tai nghe sẽ cho kết quả tốt nhất.

Những gì mẫu đã lưu thay đổi: từ cuộc họp tiếp theo của bạn, bộ tổng hợp sẽ tạo giọng nói cho bản dịch của bạn bằng nó từ đoạn đầu tiên, để bên kia nghe thấy bạn là chính bạn từ câu đầu tiên thay vì sau khi khởi động. Về cơ bản, đó là cùng một quá trình tổng hợp zero-shot với một điểm khởi đầu tốt hơn; quá trình khởi động trực tiếp vẫn tinh chỉnh giọng nói khi cuộc gọi diễn ra.

Bản ghi âm được kiểm duyệt trước khi lưu. Nó phải là 3 đến 10 giây giọng nói rõ ràng (cửa sổ đầu vào của bộ tổng hợp): quá nhỏ, bị cắt xén, hầu hết là im lặng hoặc bị chìm trong tiếng ồn nền, và thẻ sẽ cho bạn biết cần sửa gì và yêu cầu ghi lại. Các con số được chọn làm cụm từ vì một lý do thực tế: chúng ngắn, có thể nhận dạng trong tất cả 23 ngôn ngữ, và engine có thể xác nhận rằng nó đã nghe thấy cả mười con số, điều này biến "cái bản ghi đó có hoạt động không?" thành một lời xác nhận bằng mắt thường.

Hai mẫu giọng nói, hai vòng đời

Đây là phần mà đội ngũ an ninh hoặc pháp lý sẽ hỏi ngay lập tức, nên đây là lời giải thích rõ ràng. Có hai mẫu khác nhau, và chúng tồn tại khác nhau.

Mẫu trực tiếp được sử dụng cho quá trình khởi động trong cuộc họp là tạm thời. Nó chỉ tồn tại cho phiên hội nghị trực tiếp, phục vụ cho việc tạo giọng nói cho bản dịch, và không được lưu trữ ở bất cứ đâu. Mind API và SDK cung cấp năng lực cho phiên thời gian thực không giữ lại dữ liệu nào; mọi thứ tạm thời sẽ bị xóa khi phiên hội nghị kết thúc.

Mẫu đã lưu từ Cài đặt được lưu trữ cùng với tài khoản của bạn, cho một mục đích: nó được gửi đến engine dịch thuật mỗi khi bạn tham gia một cuộc họp để giọng nói đã dịch của bạn có thể được tạo bằng nó, và không cho mục đích nào khác. Nó sẽ tồn tại cho đến khi bạn nhấn Xóa trên thẻ, điều này sẽ đưa bạn trở lại quá trình khởi động tiêu chuẩn ngay lập tức, và nó sẽ bị xóa cùng với tài khoản của bạn. Khách không thể ghi âm mẫu này; theo thiết kế, đây là tính năng dành cho người đã đăng nhập.

Đáng để nói chính xác về việc cả hai mẫu đều không phải là: không phải là một trong các tính năng ghi âm của InterMIND. Việc ghi âm video và âm thanh của một cuộc họp là một hành động tách biệt, có chủ đích mà bạn thực hiện cố ý, với các điều khiển riêng của nó. Mẫu giọng nói là một đầu vào cho bộ tổng hợp giọng nói: thoáng qua trong trường hợp trực tiếp, và là của bạn để giữ lại hoặc xóa đi trong trường hợp đã lưu.

Tại sao không ai khác cung cấp điều này

Không phải vì nhân bản giọng nói là một bí mật. Mà là vì việc thực hiện nó trực tiếp, cho từng người tham gia, ở cả hai chiều, trong ngân sách dưới một giây, trên 23 ngôn ngữ, mà không lưu trữ bất cứ thứ gì bạn không yêu cầu là một vấn đề khác với việc nhân bản giọng nói ngoại tuyến cho một podcast.

Các nền tảng lớn tối ưu hóa bản dịch của họ cho độ phủ phụ đề và một giọng người kể chuyện an toàn duy nhất — đó là mặc định rẻ, mạnh mẽ ở quy mô lớn. Việc giữ lại giọng nói của từng người nói có nghĩa là giai đoạn tổng hợp phải theo dõi độc lập từng người tham gia và nằm trong cùng ngân sách độ trễ mà phần còn lại của quy trình phải tuân thủ. Chúng tôi đã tự xây dựng engine giọng nói, trên cơ sở hạ tầng của riêng chúng tôi, điều này làm cho sự đánh đổi đó là của chúng tôi. (Thêm về lý do tại sao engine là mã của chính chúng tôi: Một cuộc họp InterMIND được xây dựng từ những gì.)

Hướng đi tiếp theo: đồng bộ môi (lip-sync)

Giữ lại giọng nói của bạn là một nửa của một mục tiêu lớn hơn. Nửa còn lại là khuôn mặt của bạn.

Ngay bây giờ, bạn nghe thấy người khác bằng chính giọng nói của họ, nhưng nếu bạn đang bật camera, môi của họ vẫn cử động theo những từ mà họ thực sự nói — bằng một ngôn ngữ mà bạn không đọc được. Bước tiếp theo là đồng bộ môi (lip-sync): căn chỉnh lại thời gian cử động miệng của người nói với âm thanh đã dịch, sao cho trên màn hình của bạn, họ có vẻ như đang nói ngôn ngữ của bạn.

Đặt hai thứ này lại với nhau và toàn bộ mục đích của công việc này trở nên rõ ràng. Hai người không có chung ngôn ngữ ngồi qua một cuộc gọi video và nhìn thấy, nghe thấy nhau như thể mỗi người là người bản xứ của ngôn ngữ còn lại — cùng giọng nói, cùng khuôn mặt, không có thông dịch viên ở giữa, không có robot đọc kịch bản.

Để rõ ràng về trạng thái: giọng nói đã chạy trực tiếp hôm nay; đồng bộ môi nằm trong lộ trình, chưa được phát hành. Chúng tôi chỉ ra điểm đến vì đó là lý do tại sao công việc về giọng nói lại quan trọng — bản dịch bằng chính giọng nói không phải là tính năng, nó là nửa đầu của "nói chuyện với bất kỳ ai, bằng bất kỳ ngôn ngữ nào, với tư cách là chính bạn."

Nơi để nghe thử nó

Bản dịch bằng chính giọng nói đã chạy trực tiếp hôm nay, trên toàn bộ 23 ngôn ngữ giọng nói — cùng các ngôn ngữ được liệt kê trong tài liệu. Không có gì phải bật riêng: khi bản dịch được kích hoạt trong một cuộc họp, những người tham gia sẽ tự động nghe thấy nhau bằng chính giọng nói của họ. Chúng tôi sẽ thành thật về vị trí hiện tại của nó: ngày nay giọng nói đã có thể nhận ra là bạn, và sự tương đồng là thứ chúng tôi đang tích cực đẩy mạnh hơn nữa. Hãy tự nghe và đánh giá.

Một cuộc họp được dịch nên mang lại cảm giác như những người thực sự ở trong đó đang nói chuyện với nhau. Giữ lại giọng nói của bạn chính là cách để đạt được điều đó.

Nhận bài viết mới và cập nhật sản phẩm qua email

Một email mỗi tháng với các bài viết mới và cập nhật sản phẩm. Hủy đăng ký bất cứ lúc nào.