Giọng nói của chính bạn

Cách InterMIND thể hiện bản dịch bằng chính giọng nói của từng người tham gia thay vì một giọng đọc nhân tạo.

Giọng của chính bạn

Khi InterMIND dịch lời nói của bạn cho một người tham gia khác, họ không nghe thấy giọng đọc text-to-speech máy móc. Họ nghe thấy một giọng nói có thể nhận ra là của bạn — mang âm sắc và cách nói chuyện của bạn — lúc này đang nói các từ ngữ bằng ngôn ngữ của họ.

Tính năng này hoạt động theo cả hai hướng và độc lập cho từng người tham gia. Trong một cuộc họp nơi năm người nói năm ngôn ngữ, mỗi người nghe bốn người kia bằng ngôn ngữ của riêng mình, và mỗi trong bốn người đó vẫn nghe như chính mình.

Nghe như thế nào

Hầu hết các công cụ dịch thời gian thực thay người nói bằng một giọng tổng hợp chung chung duy nhất. Kết quả có thể hiểu được nhưng nhạt nhòa — bạn mất dấu người đang nói, điểm nhấn, và cá tính. InterMIND giữ lại giọng nói của người nói, nên một cuộc họp được dịch mang cảm giác như một cuộc trò chuyện giữa những người thực sự tham gia, chứ không phải một chuỗi thông báo được máy đọc lên.

Cách hoạt động

InterMIND sử dụng một quy trình phân tầng (cascaded pipeline), và bước giọng nói là giai đoạn cuối cùng:

  1. Nhận dạng giọng nói — các từ của bạn được chuyển thành văn bản trong ngôn ngữ của chính bạn, ngay khi bạn nói.
  2. Phân đoạn — bản chép lời được nhóm thành các mảnh câu ổn định (mệnh đề) để có thể bắt đầu dịch trước khi bạn kết thúc câu.
  3. Dịch — mỗi mảnh được dịch dần sang ngôn ngữ của người nghe.
  4. Tổng hợp giọng nói — mỗi mảnh đã dịch được đọc lại bằng mẫu giọng nói của chính bạn, và gửi tới người nghe.

Trong khi cuộc họp vẫn đang thu thập đủ lời nói của bạn để mô hình hóa giọng (khoảng 5–10 giây đầu tiên), sự tổng hợp sử dụng mảnh âm thanh khớp với điều bạn vừa nói bằng ngôn ngữ nguồn của bạn. Khi đã có mẫu đủ dài, nó chuyển sang sử dụng mẫu đó cho mọi thứ sau đó. Trong thực tế, bạn không nhận ra sự chuyển đổi — bản dịch ngày càng nghe giống bạn hơn khi cuộc gọi tiếp diễn. Nó không phải là bản sao hoàn hảo giọng của bạn, nhưng vẫn là bạn có thể nhận ra được thay vì một người đọc chung chung — và nó tiếp tục cải thiện khi mô hình nghe thấy nhiều hơn về bạn.

Ngôn ngữ

Bản dịch bằng giọng nói của chính bạn khả dụng cho tất cả 23 ngôn ngữ giọng nói — cùng bộ ngôn ngữ như được liệt kê trong Chọn ngôn ngữ. Không cần bật riêng: khi dịch được bật, những người tham gia tự động nghe bạn bằng giọng của chính bạn.

Mẫu giọng nói đã lưu của bạn (tùy chọn)

Người dùng đã đăng nhập có thể bỏ qua bước khởi động bằng cách thu một mẫu giọng nói một lần trong Settings → Your voice in translation: nhấn Ghi lại giọng nói của tôi, nói các con số từ một đến mười theo bất kỳ thứ tự nào, và mẫu sẽ tự lưu khi cả mười đều sáng lên.

Từ cuộc họp tiếp theo, lời nói đã dịch của bạn sẽ được phát bằng mẫu đó ngay từ câu đầu tiên.

Thẻ Your voice in translation trong Settings: các con số từ một đến mười và nút Ghi lại giọng nói của tôi

Quyền riêng tư

Hai mẫu, hai vòng đời. Mẫu trực tiếp dùng cho bước khởi động trong cuộc họp là tạm thời: nó chỉ tồn tại trong suốt thời gian cuộc họp trực tiếp và không được lưu trữ ở đâu; Mind API và SDK cấp năng lượng cho phiên thời gian thực không giữ lại dữ liệu nào sau khi phiên hội nghị kết thúc. Mẫu đã lưu từ Settings được lưu cùng tài khoản của bạn cho một mục đích — cung cấp giọng cho lời nói đã được dịch của bạn — được gửi tới bộ dịch mỗi khi bạn tham gia một cuộc họp, và bị xóa ngay khi bạn gỡ bỏ nó hoặc xóa tài khoản. Cả hai đều không phải là một trong các tính năng ghi hình / ghi âm của InterMIND, vốn là các bản ghi riêng biệt, được bạn chủ động bắt đầu.

Theo lộ trình: Đồng bộ môi

Nghe bản dịch bằng giọng của chính bạn là nửa đầu của một mục tiêu lớn hơn. Bước tiếp theo mà chúng tôi đang hướng tới là đồng bộ môi — điều chỉnh lại nhịp miệng của người nói trên camera để khớp với âm thanh đã dịch, sao cho mỗi người tham gia trông như đang nói ngôn ngữ của người kia. Kết hợp với bản dịch bằng giọng của chính mình, mục tiêu là một cuộc gọi nơi những người không chia sẻ ngôn ngữ chung nhìn thấy và nghe thấy nhau như thể mỗi người đều nói ngôn ngữ kia như ngôn ngữ mẹ đẻ.

Đây là một hạng mục trên lộ trình, chưa phải là một tính năng đã phát hành — bản dịch bằng giọng của chính bạn ở trên đã có mặt hiện nay.

Muốn xem bức tranh kỹ thuật đầy đủ? Xem Nói bằng giọng của chính mình — bằng một ngôn ngữ mà bạn không nói trên blog.