Arsitektur

Berbicara dengan suara Anda sendiri — dalam bahasa yang tidak Anda kuasai

Sebagian besar alat terjemahan langsung menggantikan Anda dengan satu narator robotik. InterMIND mempertahankan suara Anda: setiap peserta mendengarkan terjemahan dengan suara penutur aslinya sendiri. Berikut cara cascade melakukannya, apa yang ditambahkan oleh sampel suara tersimpan opsional di Pengaturan, dan apa yang disimpan.

The Mind.com Team

Berbicara dengan suara Anda sendiri — dalam bahasa yang tidak Anda kuasai

Berbicara dengan suara Anda sendiri — dalam bahasa yang tidak Anda kuasai

Berikut adalah bagian dari terjemahan real-time yang hampir semua orang salah persepsikan, dan hampir tidak ada yang membicarakannya: suara yang Anda dengar.

Anda bisa memiliki pengenalan ucapan yang sangat baik dan terjemahan yang sangat baik, namun tetap berakhir dengan rapat yang terasa seperti mesin sedang membaca sebuah daftar. Karena langkah terakhir — mengubah teks yang diterjemahkan kembali menjadi suara — adalah tempat di mana sebagian besar alat diam-diam menggantikan Anda dengan satu narator sintetis generik. Delapan orang di dalam ruangan, satu suara robot untuk semuanya. Anda kehilangan siapa yang sedang berbicara, penekanannya, dan kepribadiannya. Dapat dipahami, tetapi bukan sebuah percakapan.

InterMIND melakukan langkah terakhir secara berbeda. Saat Anda berbicara, peserta lain mendengar terjemahan dengan suara yang dapat dikenali sebagai suara Anda — membawa timbre dan gaya bicara Anda — yang kini mengucapkan kata-kata dalam bahasa mereka. Ini belum menjadi kesan yang sempurna; intinya adalah itu Anda alih-alih narator standar, dan hal ini semakin membaik. Fitur ini berfungsi untuk setiap peserta, ke kedua arah, pada saat yang sama.

Postingan ini adalah bab yang hilang dari Di dalam empat pipeline terjemahan yang menjalankan InterMIND: tulisan tersebut menjelaskan bagaimana audio menjadi audio yang diterjemahkan. Postingan ini membahas tentang suara siapa yang keluar di ujung lain.


Bawaan yang dirilis semua orang, dan mengapa itu terasa datar

Jika Anda pernah menggunakan terjemahan langsung di salah satu platform rapat besar, Anda tahu bunyinya. Suara netral yang berirama teratur membaca terjemahan tersebut. Suaranya sama baik pembicarnya CEO Anda yang membuka town hall maupun rekan kerja yang sedang melontarkan lelucon. Teknologi di baliknya adalah text-to-speech dengan satu model suara tetap, dan asumsi desainnya adalah bahwa kejelasan dengar saja sudah cukup.

Dalam rapat yang sebenarnya, tidak demikian. Setengah dari apa yang dikomunikasikan dalam rapat adalah siapa yang mengatakannya dan bagaimana. Hilangkan suaranya dan Anda telah mengubah diskusi menjadi transkrip yang kebetulan diucapkan dengan lantang. Orang-orang berhenti bereaksi satu sama lain dan mulai menunggu giliran mereka.

Apa yang dilakukan InterMIND sebagai gantinya

Terjemahan berjalan sebagai pipeline berjenjang — tiga tahap khusus secara berurutan alih-alih satu model yang mencoba melakukan semuanya. Dua tahap pertama dibahas di dalam postingan pipeline; langkah suara adalah topik dari postingan ini:

  1. ASR — pengenalan ucapan. Kata-kata Anda ditranskripsi dalam bahasa Anda sendiri, saat Anda berbicara, di mesin kami sendiri — server media yang membawa panggilan (Mind API, OVH France) — sehingga terjemahan dapat dimulai sebelum kalimat berakhir.
  2. MT — terjemahan. Transkrip dikelompokkan menjadi fragmen kalimat yang stabil — klausa — sehingga terjemahan dapat dimulai sebelum Anda selesai kalimat, dan setiap fragmen diterjemahkan secara progresif ke dalam bahasa pendengar.
  3. TTS zero-shot — sintesis suara. Setiap fragmen yang diterjemahkan diucapkan kembali menggunakan sampel suara Anda sendiri, dan dialirkan ke pendengar.

Tahap ketiga inilah — ASR → MT → TTS zero-shot — yang menghasilkan efek tersebut. "Zero-shot" berarti sistem tidak memerlukan pendaftaran pra-rekam atau sesi pelatihan untuk suara Anda. Sistem memodelkan suara Anda dari audio rapat yang sedang Anda ikuti.

Pemanasan: bagaimana suaranya mulai terdengar seperti Anda begitu cepat

Ada masalah telur dan ayam yang tersembunyi dalam "menggunakan sampel suara Anda sendiri." Pada awal panggilan, sistem belum mendengar cukup banyak suara Anda untuk memodelkan suara Anda dengan baik.

InterMIND menangani ini dengan pemanasan progresif:

  • Selama kira-kira 5–10 detik pertama, sambil mengumpulkan cukup ucapan Anda, setiap fragmen yang diterjemahkan disintesis menggunakan fragmen audio yang cocok dengan apa yang baru saja Anda katakan dalam bahasa sumber Anda. Pengisian suara berlabuh pada ucapan Anda yang nyata dan langsung.
  • Setelah ada sampel yang cukup panjang — pada batas 5–10 detik tersebut — sistem akan menguncinya dan menggunakannya untuk mengisi suara semua bagian selanjutnya.

Dalam praktiknya, Anda tidak mendengar peralihan yang mendadak. Terjemahan terdengar lebih seperti Anda seiring percakapan berlangsung — bukan duplikat sempurna dari suara Anda, tetapi jelas milik Anda alih-alih suara mesin, dan terus membaik seiring model mendengar lebih banyak. Kombinasi terjemahan progresif (klausa demi klausa, bukan kalimat demi kalimat) dan pengisian suara progresif adalah yang menjaga semuanya tetap berada di bawah batas latensi sambil masih terdengar manusiawi.

Rekam suara Anda sekali, dan lewati pemanasan

Pemanasan di atas adalah apa yang terjadi secara bawaan, tanpa pengaturan apa pun. Sejak September 2026 ada jalur kedua opsional bagi pengguna yang telah masuk: sampel suara tersimpan di Settings → Your voice in translation.

Merekamnya hanya satu gerakan. Tekan Record my voice, tunggu hingga Speak now, dan ucapkan angka dari satu hingga sepuluh dalam urutan apa pun. Setiap angka akan menyala di kartu saat mesin ucapan mendengarnya; ketika kesepuluhnya menyala, sampel diperiksa dan disimpan dengan sendirinya. Tidak ada yang perlu diputar ulang atau dikonfirmasi, dan tidak ada hitungan mundur: kartu akan menyimpan bagian rekaman Anda yang memuat angka-angka tersebut. Ruangan yang tenang dan penggunaan headset memberikan hasil terbaik.

Apa yang diubah oleh sampel tersimpan: pada rapat berikutnya, synthesizer akan mengisi suara terjemahan Anda dengannya mulai dari fragmen pertama, sehingga pihak lain mendengar Anda sebagai diri Anda sendiri sejak kalimat pertama, alih-alih setelah pemanasan. Di balik layar, ini adalah sintesis zero-shot yang sama tetapi dengan titik awal yang lebih baik; pemanasan langsung masih menyempurnakan suara seiring panggilan berlangsung.

Rekaman tersebut disaring sebelum disimpan. Itu harus berupa 3 hingga 10 detik ucapan yang jelas (jendela input synthesizer): terlalu pelan, terpotong, sebagian besar diam, atau terendam dalam kebisingan latar belakang, dan kartu akan memberi tahu Anda apa yang harus diperbaiki serta meminta untuk mengambil rekaman ulang. Angka dipilih sebagai frasa karena alasan praktis: angka bersifat pendek, dikenali di setiap 23 bahasa, dan mesin dapat mengonfirmasi bahwa ia telah mendengar kesepuluh angka tersebut, yang mengubah "apakah rekaman itu berhasil?" menjadi jawaban "ya" yang terlihat.

Dua sampel suara, dua masa pakai

Ini adalah bagian yang langsung ditanyakan oleh tim keamanan atau hukum, jadi di sini dijelaskan dengan lugas. Ada dua sampel yang berbeda, dan keduanya disimpan dengan cara yang berbeda.

Sampel langsung yang digunakan untuk pemanasan dalam rapat bersifat sementara. Sampel ini hanya ada selama sesi konferensi langsung, untuk melayani pengisian suara terjemahan, dan tidak disimpan di mana pun. Mind API dan SDK yang menjalankan sesi real-time tidak menyimpan data apa pun; semua hal yang bersifat sementara hilang saat sesi konferensi berakhir.

Sampel tersimpan dari Settings disimpan bersama akun Anda, untuk satu tujuan: dikirim ke mesin terjemahan setiap kali Anda bergabung dalam rapat agar ucapan Anda yang diterjemahkan dapat disuarakan dengannya, dan untuk tidak ada yang lain. Sampel ini akan tetap ada hingga Anda menekan Remove pada kartu, yang akan segera mengembalikan Anda ke pemanasan standar, dan akan dihapus bersamaan dengan akun Anda. Tamu tidak dapat merekamnya; fitur ini dirancang khusus bagi pengguna yang telah masuk.

Perlu ditegaskan secara tepat mengenai apa yang bukan kedua sampel tersebut: ini bukan salah satu fitur perekaman InterMIND. Merekam video dan audio rapat merupakan tindakan terpisah yang sengaja Anda lakukan, dengan kontrolnya sendiri. Sampel suara hanyalah masukan untuk synthesizer ucapan: bersifat sementara dalam kasus langsung, dan terserah Anda untuk disimpan atau dihapus pada sampel tersimpan.

Mengapa tidak ada orang lain yang merilis ini

Bukan karena kloning suara adalah sebuah rahasia. Melainkan karena melakukannya secara langsung, per peserta, ke dua arah, di bawah batas anggaran satu detik, di 23 bahasa, tanpa menyimpan apa pun yang tidak Anda minta adalah masalah yang berbeda dibandingkan mengkloning suara secara offline untuk podcast.

Platform besar mengoptimalkan terjemahan mereka untuk cakupan takarir dan satu suara narator yang aman — itulah bawaan yang murah dan tangguh dalam skala besar. Mempertahankan suara asli setiap pembicara berarti tahap sintesis harus melacak setiap peserta secara mandiri dan tetap berada dalam batas latensi yang sama dengan bagian pipeline lainnya. Kami membangun mesin suara kami sendiri, di infrastruktur kami sendiri, sehingga trade-off tersebut menjadi keputusan kami. (Selengkapnya tentang mengapa mesin tersebut adalah kode kami sendiri: Dari apa satu rapat InterMIND dibangun.)

Ke mana arah ini: lip-sync

Mempertahankan suara Anda adalah setengah dari tujuan yang lebih besar. Setengah lainnya adalah wajah Anda.

Saat ini Anda mendengar orang lain dengan suara mereka sendiri, tetapi jika Anda menggunakan kamera, bibir mereka masih bergerak mengikuti kata-kata yang sebenarnya mereka ucapkan — dalam bahasa yang tidak Anda pahami. Langkah selanjutnya adalah lip-sync: menyesuaikan waktu gerakan mulut pembicara dengan audio yang diterjemahkan, sehingga di layar Anda mereka tampak sedang berbicara dalam bahasa Anda.

Gabungkan keduanya dan seluruh inti dari pekerjaan ini akan menjadi jelas. Dua orang yang tidak memiliki bahasa yang sama duduk berhadapan dalam panggilan video, saling melihat dan mendengar seolah-olah masing-masing adalah penutur asli bahasa orang lain — dengan suara dan wajah yang sama, tanpa penerjemah di tengah, dan tanpa robot yang membaca skrip.

Untuk menjelaskan statusnya: suara sudah langsung hari ini; lip-sync ada di peta jalan, belum dirilis. Kami menyebutkan tujuan ini karena alasan inilah pekerjaan suara ini menjadi penting — terjemahan suara sendiri bukanlah fitur akhir, melainkan setengah pertama dari "berbicara dengan siapa pun, dalam bahasa apa pun, sebagai diri sendiri."

Di mana bisa mendengarkannya

Terjemahan suara sendiri sudah langsung hari ini, di seluruh 23 bahasa suara — bahasa yang sama yang tercantum dalam dokumen. Tidak ada yang perlu diaktifkan secara terpisah: ketika terjemahan diaktifkan dalam rapat, peserta secara otomatis mendengar satu sama lain dalam suara mereka sendiri. Kami akan jujur tentang posisinya saat ini: hari ini suaranya sudah dapat dikenali sebagai Anda, dan kemiripan ini adalah sesuatu yang terus kami tingkatkan secara aktif. Silakan dengarkan dan nilai sendiri.

Rapat yang diterjemahkan harus terasa seperti orang-orang yang benar-benar di dalamnya sedang berbicara satu sama lain. Mempertahankan suara Anda adalah cara kami mencapai hal tersebut.

Dapatkan postingan baru dan pembaruan produk melalui email

Satu email sebulan dengan postingan baru dan pembaruan produk. Berhenti berlangganan kapan saja.