Suara Anda Sendiri

Bagaimana InterMIND mengucapkan terjemahan dengan suara masing-masing peserta sendiri alih-alih narator sintetis.

Suara Anda Sendiri

Saat InterMIND menerjemahkan ucapan Anda untuk peserta lain, mereka tidak mendengar narator text-to-speech yang robotik. Mereka mendengar suara yang jelas milik Anda — membawa timbre dan cara berbicara Anda — kini mengucapkan kata-kata dalam bahasa mereka.

Ini berfungsi di kedua arah dan untuk setiap peserta secara independen. Dalam rapat di mana lima orang berbicara dalam lima bahasa, setiap orang mendengar empat orang lainnya dalam bahasa mereka sendiri, dan keempat orang tersebut masih terdengar seperti diri mereka sendiri.

Seperti Apa Bunyinya

Sebagian besar alat terjemahan langsung menggantikan pembicara dengan satu suara sintetis generik. Hasilnya dapat dipahami namun datar — Anda kehilangan siapa yang sedang berbicara, penekanan, dan kepribadian. InterMIND mempertahankan suara pembicara, sehingga rapat yang diterjemahkan terasa seperti percakapan antara orang-orang yang benar-benar di dalamnya, bukan antrean pengumuman yang dibaca oleh mesin.

Cara Kerjanya

InterMIND menggunakan cascaded pipeline, dan langkah suara adalah tahap terakhir:

  1. Pengenalan ucapan — kata-kata Anda ditranskripsi dalam bahasa Anda sendiri, saat Anda berbicara.
  2. Segmentasi — transkrip dikelompokkan menjadi fragmen kalimat yang stabil (klausa) sehingga penerjemahan dapat dimulai sebelum Anda selesai berbicara.
  3. Penerjemahan — setiap fragmen diterjemahkan secara progresif ke dalam bahasa pendengar.
  4. Sintesis suara — setiap fragmen yang diterjemahkan diucapkan kembali menggunakan sampel suara Anda sendiri, dan dikirim ke pendengar.

Sementara rapat masih mengumpulkan cukup ucapan Anda untuk memodelkan suara Anda (kira-kira 5–10 detik pertama), sintesis menggunakan fragmen audio yang cocok dengan apa yang baru saja Anda katakan dalam bahasa sumber Anda. Setelah ada sampel yang cukup panjang, sistem beralih untuk menggunakan sampel tersebut untuk semua ucapan berikutnya. Dalam praktiknya, Anda tidak melihat adanya pergantian — terjemahan terdengar lebih seperti Anda seiring berjalannya panggilan. Ini mungkin bukan kesan yang sempurna dari suara Anda, tetapi suara tersebut jelas terdengar seperti Anda alih-alih narator generik — dan terus meningkat seiring model mendengar lebih banyak dari Anda.

Bahasa

Terjemahan suara Anda sendiri tersedia untuk semua 24 bahasa suara — set yang sama dengan yang tercantum dalam Memilih Bahasa. Tidak ada yang perlu diaktifkan secara terpisah: ketika penerjemahan diaktifkan, peserta secara otomatis mendengar Anda dengan suara Anda sendiri.

Privasi

Sampel suara yang digunakan untuk sintesis bersifat sementara. Sampel ini hanya ada selama rapat langsung berlangsung dan tidak disimpan di mana pun — API dan SDK Mind yang mendukung sesi waktu nyata tidak menyimpan data apa pun setelah sesi konferensi berakhir. Sampel suara ini tidak terkait dengan fitur perekaman video-dan-suara InterMIND, yang merupakan rekaman terpisah dan eksplisit yang Anda mulai dengan sengaja.

Pada Peta Jalan: Lip-Sync

Mendengar terjemahan dalam suara Anda sendiri adalah separuh dari tujuan yang lebih besar. Langkah selanjutnya yang sedang kami kerjakan adalah lip-sync — menyesuaikan waktu bibir pembicara di kamera agar cocok dengan audio yang diterjemahkan, sehingga setiap peserta tampak seolah-olah berbicara dalam bahasa satu sama lain. Dikombinasikan dengan terjemahan suara Anda sendiri, tujuannya adalah sebuah panggilan di mana orang-orang yang tidak memiliki bahasa yang sama dapat saling melihat dan mendengar seolah-olah masing-masing berbicara dalam bahasa satu sama lain secara native.

Ini adalah bagian dari peta jalan, bukan fitur yang sudah dirilis — terjemahan suara Anda sendiri di atas sudah aktif hari ini.