Giọng nói của bạn

Cách InterMIND đọc bản dịch bằng chính giọng nói của từng người tham gia thay vì một giọng đọc tổng hợp.

Giọng nói của bạn

Khi InterMIND dịch lời nói của bạn cho người tham gia khác, họ không nghe thấy một giọng đọc văn bản thành giọng nói máy móc. Họ nghe thấy một giọng rõ ràng là của bạn — mang âm sắc và cách nói của bạn — giờ đang nói những từ ngữ bằng ngôn ngữ của họ.

Tính năng này hoạt động theo cả hai chiều và độc lập với từng người tham gia. Trong một cuộc họp nơi năm người nói năm ngôn ngữ, mỗi người nghe bốn người còn lại bằng ngôn ngữ của mình, và mỗi người trong bốn người đó vẫn giữ nguyên giọng nói đặc trưng của họ.

Kết quả nghe như thế nào

Hầu hết các công cụ dịch trực tuyến thay thế người nói bằng một giọng tổng hợp chung chung. Kết quả là dễ hiểu nhưng thiếu sức sống — bạn mất đi cảm giác về người đang nói, sự nhấn nhá, và cá tính. InterMIND giữ lại giọng nói của người nói, do đó một cuộc họp có dịch thuật mang cảm giác như một cuộc trò chuyện giữa những người thực sự tham gia, chứ không phải một hàng đợi các thông báo được đọc bởi máy.

Cách hoạt động

InterMIND sử dụng một pipeline dạng tầng, và bước tạo giọng là giai đoạn cuối cùng:

  1. Nhận dạng giọng nói — lời của bạn được chuyển thành văn bản bằng ngôn ngữ của chính bạn, ngay khi bạn nói.
  2. Phân đoạn — văn bản được nhóm thành các mảng câu ổn định (mệnh đề) để việc dịch có thể bắt đầu trước khi bạn kết thúc câu.
  3. Dịch thuật — từng mảng được dịch dần sang ngôn ngữ của người nghe.
  4. Tổng hợp giọng nói — từng mảng đã dịch được đọc lại bằng một mẫu chính giọng nói của bạn, và gửi đến người nghe.

Trong khi cuộc họp vẫn đang thu thập đủ lời nói của bạn để mô hình hóa giọng nói của bạn (khoảng 5–10 giây đầu tiên), quá trình tổng hợp sử dụng đoạn âm thanh khớp với những gì bạn vừa nói trong ngôn ngữ gốc của bạn. Khi đã có mẫu đủ dài, hệ thống chuyển sang sử dụng mẫu đó cho mọi nội dung sau đó. Trong thực tế, bạn sẽ không nhận thấy sự chuyển đổi — bản dịch nghe càng giống bạn hơn khi cuộc gọi diễn ra. Sẽ không phải là một bản sao hoàn hảo giọng nói của bạn, nhưng nghe rõ ràng là bạn thay vì một giọng đọc chung chung — và nó tiếp tục cải thiện khi mô hình nghe được nhiều hơn về bạn.

Ngôn ngữ

Tính năng dịch bằng chính giọng nói của bạn có sẵn cho tất cả 24 ngôn ngữ giọng nói — cùng bộ ngôn ngữ được liệt kê trong Chọn ngôn ngữ. Không cần bật riêng: khi tính năng dịch đã bật, người tham gia sẽ tự động nghe bạn bằng chính giọng nói của bạn.

Quyền riêng tư

Mẫu giọng nói được sử dụng cho việc tổng hợp là tạm thời. Nó chỉ tồn tại trong thời gian cuộc họp trực tiếp diễn ra và không được lưu trữ ở bất kỳ đâu — Mind API và SDK cấp nguồn cho phiên làm việc thời gian thực không giữ lại dữ liệu nào sau khi phiên hội nghị kết thúc. Mẫu giọng nói này không liên quan đến tính năng ghi hình video và giọng nói của InterMIND, vốn là các bản ghi độc lập, được chủ động thực hiện.

Trong lộ trình: Đồng bộ môi

Nghe bản dịch bằng chính giọng nói của bạn là nửa đầu của một mục tiêu lớn hơn. Bước tiếp theo mà chúng tôi đang hướng tới là đồng bộ môi (lip-sync) — căn chỉnh lại thời gian miệng của người nói trên camera để khớp với âm thanh đã dịch, sao cho mỗi người tham gia trông như đang nói ngôn ngữ của người kia. Kết hợp với tính năng dịch bằng giọng nói riêng, mục tiêu là một cuộc gọi nơi những người không có ngôn ngữ chung nhìn thấy và nghe thấy nhau như thể mỗi người đều nói ngôn ngữ của người kia một cách bản ngữ.

Đây là một hạng mục trong lộ trình, chưa phải là tính năng đã phát hành — tính năng dịch bằng giọng nói riêng ở trên đã hoạt động ngay hôm nay.

Muốn xem bức tranh kỹ thuật đầy đủ? Xem Nói bằng chính giọng nói của bạn — bằng một ngôn ngữ bạn không biết trên blog.