Kiến trúc

Nói bằng giọng của chính bạn — bằng một ngôn ngữ bạn không biết

Hầu hết các công cụ dịch thuật trực tiếp thay bạn bằng một giọng đọc robot đơn điệu. InterMIND giữ lại giọng của bạn: mỗi người tham gia nghe bản dịch bằng chính giọng của người nói gốc. Dưới đây là cách pipeline nối tiếp thực hiện điều đó — và lý do mẫu giọng không bao giờ được lưu trữ.

The Mind.com Team

Nói bằng giọng của chính bạn — bằng một ngôn ngữ bạn không biết

Nói bằng giọng của chính bạn — bằng một ngôn ngữ bạn không biết

Đây là phần của dịch thuật thời gian thực mà gần như ai cũng làm sai, và gần như không ai nói đến: giọng mà bạn nghe được.

Bạn có thể có nhận dạng giọng nói xuất sắc và dịch thuật xuất sắc, nhưng vẫn kết thúc với một cuộc họp nghe như máy móc đang đọc một danh sách. Bởi vì bước cuối cùng — biến văn bản đã dịch trở lại thành âm thanh — là nơi hầu hết các công cụ lặng lẽ thay bạn bằng một giọng tổng hợp chung chung. Tám người trong phòng, một giọng robot cho tất cả. Bạn mất đi ai đang nói, nhấn mạnh, tính cách. Hiểu được, nhưng không phải một cuộc trò chuyện.

InterMIND thực hiện bước cuối cùng khác đi. Khi bạn nói, những người tham gia khác nghe bản dịch bằng giọng được nhận ra là của bạn — mang âm sắc và cách nói của bạn — nay đang nói những từ ngữ bằng ngôn ngữ của họ. Nó chưa phải là một sự bắt chước hoàn hảo; điểm mấu chốt là đó là bạn thay vì một giọng đọc có sẵn, và nó đang ngày càng tốt hơn. Điều này hoạt động cho mỗi người tham gia, theo cả hai chiều, cùng lúc.

Bài viết này là chương còn thiếu của Bên trong bốn pipeline dịch thuật vận hành InterMIND: bài kia giải thích cách âm thanh trở thành âm thanh đã dịch. Bài này nói về giọng của ai sẽ phát ra ở đầu bên kia.


Mặc định mà ai cũng tung ra, và lý do tại sao nó nhạt nhẽo

Nếu bạn đã dùng dịch thuật trực tiếp trên bất kỳ nền tảng họp lớn nào, bạn đều biết âm thanh đó. Một giọng trung tính, đều đều đọc bản dịch. Đó là cùng một giọng cho dù người nói là CEO của bạn khai mạc một buổi town hall hay một đồng nghiệp đang nói đùa. Công nghệ bên dưới là text-to-speech với một mô hình giọng cố định, và giả định thiết kế là khả năng hiểu được là đủ.

Trong một cuộc họp thực tế thì không. Một nửa những gì một cuộc họp truyền đạt là ai đang nói và như thế nào. Loại bỏ giọng nói và bạn đã biến một cuộc thảo luận thành một bản ghi chép tình cờ được đọc thành tiếng. Mọi người ngừng phản ứng với nhau và bắt đầu chờ đến lượt mình.

Thay vào đó InterMIND làm gì

Bản dịch chạy như một pipeline nối tiếp — ba giai đoạn chuyên biệt theo trình tự thay vì một mô hình cố gắng làm mọi thứ. Hai giai đoạn đầu được đề cập trong bài về pipeline; bước giọng nói là bước mà bài viết này nói về:

  1. ASR — nhận dạng giọng nói. Từ ngữ của bạn được ghi chép bằng ngôn ngữ của bạn, trong trình duyệt của bạn, khi bạn nói. (Chạy cục bộ tiết kiệm một lượt khứ hồi mạng và cho độ trễ thấp nhất có thể trước khi dịch thuật có thể bắt đầu.)
  2. MT — dịch thuật. Bản ghi chép được nhóm thành các mảnh câu ổn định — mệnh đề — để dịch thuật có thể bắt đầu trước khi bạn kết thúc câu, và mỗi mảnh được dịch dần dần sang ngôn ngữ của người nghe.
  3. Zero-shot TTS — tổng hợp giọng nói. Mỗi mảnh đã dịch được đọc lại sử dụng một mẫu giọng của chính bạn, và được phát trực tuyến đến người nghe.

Chính giai đoạn thứ ba đó — ASR → MT → zero-shot TTS — tạo ra hiệu ứng. "Zero-shot" nghĩa là hệ thống không cần một đoạn ghi âm đăng ký trước hoặc một phiên huấn luyện cho giọng của bạn. Nó mô hình hóa giọng của bạn từ âm thanh của cuộc họp mà bạn đang tham gia.

Khởi động: làm sao nó nghe như bạn nhanh đến vậy

Có một bài toán con gà và quả trứng ẩn trong "sử dụng một mẫu giọng của chính bạn." Ngay từ đầu một cuộc gọi, hệ thống chưa nghe đủ bạn để mô hình hóa giọng của bạn tốt.

InterMIND xử lý việc này bằng một khởi động dần dần:

  • Trong khoảng 5–10 giây đầu tiên, trong khi vẫn đang thu thập đủ lời nói của bạn, mỗi mảnh đã dịch được tổng hợp sử dụng mảnh âm thanh khớp với những gì bạn vừa nói bằng ngôn ngữ nguồn. Việc phát giọng được neo vào lời nói thực tế, tức thời của bạn.
  • Khi đã có mẫu đủ dài — mốc 5–10 giây đó — hệ thống chốt vào nó và dùng nó để phát giọng cho mọi thứ sau đó.

Trong thực tế bạn không nghe thấy một công tắc bật. Bản dịch nghe ngày càng giống bạn hơn khi cuộc trò chuyện tiến triển — không phải một bản sao hoàn hảo giọng của bạn, nhưng rõ ràng là của bạn thay vì của máy, và cải thiện dần khi mô hình nghe được nhiều hơn. Sự kết hợp giữa dịch thuật dần dần (mệnh đề theo mệnh đề, không phải câu theo câu) và phát giọng dần dần là điều giữ cho toàn bộ hệ thống nằm trong ngân sách độ trễ trong khi vẫn nghe tự nhiên.

Mẫu giọng không bao giờ được lưu trữ

Đây là phần mà đội bảo mật hoặc pháp lý hỏi ngay lập tức, nên đây là câu trả lời thẳng thắn.

Mẫu giọng được sử dụng cho tổng hợp là tạm thời. Nó chỉ tồn tại cho phiên họp trực tiếp, phục vụ việc phát giọng cho bản dịch, và nó không được lưu trữ ở đâu cả. Mind API và SDK vận hành phiên thời gian thực không giữ lại dữ liệu nào — mọi thứ tạm thời biến mất khi phiên họp kết thúc.

Đáng để nói chính xác về những gì mẫu này không phải: nó không phải là một trong những tính năng ghi âm của InterMIND. Ghi âm video và âm thanh cuộc họp là một hành động riêng biệt, có chủ đích mà bạn thực hiện cố ý, với các điều khiển riêng. Mẫu giọng cá nhân không phải là bản ghi — nó là đầu vào tạm thời cho bộ tổng hợp giọng nói, không bao giờ tồn tại sau cuộc gọi.

Điều này quan trọng hơn cả vệ sinh quyền riêng tư. "Nói bằng giọng của chính bạn" đúng là loại tính năng mà nghe có vẻ như nên liên quan đến việc lưu trữ một dấu giọng nói ở đâu đó. Nhưng không. Phiên bản trung thực là câu chuyện tốt hơn: giọng của bạn được mô hình hóa trong khoảnh khắc và biến mất khi bạn cúp máy.

Tại sao không ai khác tung ra tính năng này

Không phải vì nhân bản giọng nói là bí mật. Mà vì việc thực hiện nó trực tiếp, theo từng người tham gia, theo cả hai chiều, trong ngân sách dưới một giây, cho 24 ngôn ngữ, mà không lưu trữ gì là một bài toán khác với việc nhân bản giọng nói ngoại tuyến cho một podcast.

Các nền tảng lớn tối ưu hóa bản dịch của họ cho độ phủ phụ đề và một giọng đọc an toàn duy nhất — đó là mặc định rẻ, ổn định ở quy mô lớn. Việc giữ giọng của từng người nói nghĩa là giai đoạn tổng hợp phải theo dõi mỗi người tham gia độc lập và nằm trong cùng ngân sách độ trễ mà phần còn lại của pipeline phải tuân thủ. Chúng tôi tự xây dựng engine giọng nói, trên hạ tầng riêng của mình, đó là điều khiến sự đánh đổi đó thuộc về chúng tôi. (Thêm về lý do engine là code của chúng tôi: Một cuộc họp InterMIND được xây dựng từ gì.)

Hướng đi tiếp theo: lip-sync

Giữ giọng của bạn là một nửa của một mục tiêu lớn hơn. Nửa còn lại là khuôn mặt của bạn.

Hiện tại bạn nghe người khác bằng chính giọng của họ, nhưng nếu bạn đang bật camera, môi họ vẫn nhép theo những từ họ thực sự nói — bằng một ngôn ngữ bạn không đọc được. Bước tiếp theo là lip-sync: điều chỉnh lại thời gian miệng của người nói khớp với âm thanh đã dịch, sao cho trên màn hình của bạn họ có vẻ đang nói ngôn ngữ của bạn.

Kết hợp cả hai lại và toàn bộ mục đích của công việc này hiện ra rõ ràng. Hai người không có ngôn ngữ chung ngồi ở hai đầu một cuộc gọi video và nhìn thấy, nghe thấy nhau như thể mỗi người là người bản xứ của ngôn ngữ người kia — cùng giọng, cùng khuôn mặt, không cần phiên dịch ở giữa, không có robot đọc kịch bản.

Để rõ về trạng thái: giọng nói đã live hôm nay; lip-sync nằm trong roadmap, chưa tung ra. Chúng tôi nêu điểm đến vì đó là lý do công việc về giọng nói quan trọng — dịch thuật bằng giọng cá nhân không phải là tính năng, nó là nửa đầu của "nói chuyện với bất kỳ ai, bằng bất kỳ ngôn ngữ nào, với tư cách là chính bạn."

Nơi để nghe thử

Dịch thuật bằng giọng cá nhân đã live hôm nay, cho tất cả 21 ngôn ngữ giọng nói — cùng các ngôn ngữ được liệt kê trong tài liệu. Không cần bật gì riêng: khi dịch thuật được kích hoạt trong một cuộc họp, người tham gia tự động nghe nhau bằng giọng của chính họ. Chúng tôi sẽ thành thật về vị trí hiện tại: hôm nay giọng nói đã được nhận ra là bạn, và độ tương tự là điều chúng tôi đang tích cực đẩy gần hơn. Hãy nghe thử và tự đánh giá.

  • Thử demo — chạy pipeline giọng trực tiếp với âm thanh của bạn bằng bất kỳ ngôn ngữ nào trong 24 ngôn ngữ.
  • Xem các con số chất lượng — cùng pipeline production, được chấm điểm hàng tháng dựa trên FLORES-200, với phân phối đầy đủ được công bố theo từng cặp ngôn ngữ.
  • Cách hoạt động, trong tài liệu — phiên bản tóm tắt của bài viết này.

Một cuộc họp đã dịch nên có cảm giác như những người thực sự trong đó đang nói chuyện với nhau. Giữ giọng của bạn là cách để đạt được điều đó.

Nhận bài viết mới qua email

Chúng tôi sẽ gửi email cho bạn khi đăng bài mới. Bạn có thể hủy đăng ký bất cứ lúc nào.