Arsitektur

Berbicara dengan suara Anda sendiri — dalam bahasa yang tidak Anda kuasai

Sebagian besar alat terjemahan langsung menggantikan Anda dengan satu narator robotik. InterMIND mempertahankan suara Anda: setiap peserta mendengar terjemahan dalam suara sang pembicara asli. Berikut adalah cara kerja cascade — dan mengapa sampel suara tidak pernah disimpan.

The Mind.com Team

Berbicara dengan suara Anda sendiri — dalam bahasa yang tidak Anda kuasai

Berbicara dengan suara Anda sendiri — dalam bahasa yang tidak Anda kuasai

Berikut adalah bagian dari terjemahan real-time yang hampir semua orang keliru memahaminya, dan nyaris tidak pernah dibicarakan: suara yang Anda dengar.

Anda bisa memiliki pengenalan suara yang sangat baik dan terjemahan yang sangat baik, namun tetap saja berakhir dengan sebuah rapat yang terasa seperti mesin membacakan daftar. Karena langkah terakhir — mengubah teks terjemahan kembali menjadi suara — adalah titik di mana sebagian besar alat secara diam-diam menggantikan Anda dengan satu narator sintetis generik. Delapan orang di dalam ruangan, satu suara robot untuk semuanya. Anda kehilangan siapa yang sedang berbicara, penekanannya, dan kepribadiannya. Dapat dimengerti, tetapi bukan sebuah percakapan.

InterMIND melakukan langkah terakhir secara berbeda. Saat Anda berbicara, peserta lain mendengar terjemahan dengan suara yang teridentifikasi sebagai milik Anda — membawa timbre dan gaya bicara Anda — kini mengucapkan kata-kata dalam bahasa mereka. Ini belum menjadi tiruan yang sempurna; intinya adalah ini suara Anda, bukan narator stok, dan terus membaik. Hal ini berlaku untuk setiap peserta, ke kedua arah, secara bersamaan.

Pos ini adalah bab yang kurang dari Inside the four translation pipelines that run InterMIND: artikel tersebut menjelaskan bagaimana audio menjadi audio terjemahan. Pos ini membahas tentang suara siapa yang keluar di ujung lain.


Bawaan yang dikirimkan semua orang, dan mengapa itu terasa datar

Jika Anda pernah menggunakan terjemahan langsung di platform rapat besar mana pun, Anda mengenal suaranya. Suara yang netral dan berirama merata membacakan terjemahan. Suara ini sama saja baik pembicaranya adalah CEO Anda yang membuka town hall maupun rekan kerja yang melempar lelucon. Teknologi di baliknya adalah text-to-speech dengan satu model suara tetap, dan asumsi desainnya adalah bahwa keterpahaman sudah cukup.

Dalam rapat yang nyata, hal itu tidaklah cukup. Setengah dari apa yang disampaikan dalam rapat adalah siapa yang mengatakannya dan bagaimana cara mengatakannya. Hilangkan suaranya dan Anda telah mengubah diskusi menjadi transkrip yang kebetulan diucapkan dengan lantang. Orang-orang berhenti bereaksi satu sama lain dan mulai menunggu giliran mereka.

Apa yang dilakukan InterMIND sebagai gantinya

Terjemahan berjalan sebagai cascade pipeline — tiga tahap khusus secara berurutan, bukan satu model yang mencoba melakukan semuanya. Dua tahap pertama dibahas di pos pipeline; langkah suara adalah hal yang dibahas dalam pos ini:

  1. ASR — pengenalan suara. Kata-kata Anda ditranskripsi dalam bahasa Anda sendiri, di peramban Anda, saat Anda berbicara. (Menjalankannya secara lokal menghemat perjalanan pulang-pergi dan memberikan penundaan serendah mungkin sebelum terjemahan bahkan bisa dimulai.)
  2. MT — terjemahan. Transkrip dikelompokkan menjadi fragmen kalimat yang stabil — klausa — sehingga terjemahan dapat dimulai sebelum Anda selesai mengucapkan kalimat, dan setiap fragmen diterjemahkan secara progresif ke dalam bahasa pendengar.
  3. Zero-shot TTS — sintesis suara. Setiap fragmen terjemahan diucapkan kembali menggunakan sampel suara Anda sendiri, dan dialirkan ke pendengar.

Tahap ketiga inilah — ASR → MT → zero-shot TTS — yang menghasilkan efek tersebut. "Zero-shot" berarti sistem tidak memerlukan pendaftaran rekaman sebelumnya atau sesi pelatihan untuk suara Anda. Sistem memodelkan suara Anda dari audio rapat yang sedang Anda ikuti.

Pemanasan: bagaimana suaranya bisa terdengar seperti Anda begitu cepat

Ada masalah telur-dan-ayam yang tersembunyi dalam "menggunakan sampel suara Anda sendiri." Pada awal panggilan, sistem belum mendengar cukup banyak suara Anda untuk memodelkan suara Anda dengan baik.

InterMIND menangani hal ini dengan pemanasan progresif:

  • Selama kira-kira 5–10 detik pertama, sementara sistem masih mengumpulkan cukup ucapan Anda, setiap fragmen terjemahan disintesis menggunakan fragmen audio yang cocok dengan apa yang baru saja Anda katakan dalam bahasa sumber Anda. Suara tersebut ditambatkan pada ucapan nyata dan langsung Anda.
  • Setelah ada sampel yang cukup panjang — pada batas 5–10 detik tersebut — sistem akan menguncinya dan menggunakannya untuk menghasilkan suara untuk seluruh ucapan berikutnya.

Dalam praktiknya, Anda tidak akan mendengar peralihan yang mendadak. Terjemahan terdengar lebih seperti Anda seiring percakapan berlangsung — bukan duplikat sempurna dari suara Anda, tetapi jelas merupakan suara Anda alih-alih suara mesin, dan terus membaik seiring model mendengar lebih banyak. Kombinasi terjemahan progresif (klausa demi klausa, bukan kalimat demi kalimat) dan pengisian suara progresif adalah yang membuat semuanya tetap berada di bawah batas latensi sambil tetap terdengar manusiawi.

Sampel suara tidak pernah disimpan

Ini adalah bagian yang langsung ditanyakan oleh tim keamanan atau hukum, jadi mari kita bahas secara lugas.

Sampel suara yang digunakan untuk sintesis bersifat sementara (ephemeral). Ia hanya ada selama sesi konferensi langsung, untuk menghasilkan suara terjemahan, dan tidak disimpan di mana pun. Mind API dan SDK yang menggerakkan sesi real-time ini tidak menyimpan data apa pun — semua hal sementara akan hilang saat sesi konferensi berakhir.

Penting untuk menjelaskan dengan tepat apa yang bukan sampel ini: ini bukan salah satu fitur rekaman InterMIND. Merekam video dan audio rapat adalah tindakan terpisah yang Anda lakukan dengan sengaja, dengan kontrolnya tersendiri. Sampel suara asli bukanlah rekaman — ia adalah masukan sementara ke synthesizer suara yang tidak akan bertahan setelah panggilan berakhir.

Hal ini penting melampaui sekadar kebersihan privasi. "Berbicara dengan suara Anda sendiri" adalah persis jenis fitur yang terdengar seolah-olah melibatkan penyimpanan sidik suara di suatu tempat. Faktanya tidak. Versi yang jujur adalah cerita yang lebih baik: suara Anda dimodelkan pada saat itu dan hilang saat Anda memutus panggilan.

Mengapa pihak lain belum menghadirkan ini

Bukan karena kloning suara adalah sebuah rahasia. Melainkan karena melakukannya secara langsung, per peserta, ke kedua arah, dengan batas waktu kurang dari satu detik, dalam 24 bahasa, tanpa menyimpan apa pun adalah masalah yang berbeda dibandingkan dengan mengkloning suara secara offline untuk sebuah podcast.

Platform besar mengoptimalkan terjemahan mereka untuk cakupan takarir dan satu suara narator yang aman — itulah bawaan yang murah dan tangguh dalam skala besar. Mempertahankan suara masing-masing pembicara berarti tahap sintesis harus melacak setiap peserta secara mandiri dan tetap berada dalam batas latensi yang sama dengan pipeline lainnya. Kami membangun mesin suara sendiri, di atas infrastruktur kami sendiri, yang membuat trade-off tersebut menjadi keputusan kami. (Selengkapnya tentang mengapa mesin ini menggunakan kode kami sendiri: What one InterMIND meeting is built from.)

Ke mana arah ini: lip-sync

Mempertahankan suara Anda adalah setengah dari tujuan yang lebih besar. Setengah lainnya adalah wajah Anda.

Saat ini Anda mendengar orang lain dalam suara mereka sendiri, tetapi jika Anda mengaktifkan kamera, bibir mereka masih bergerak mengikuti kata-kata yang sebenarnya mereka ucapkan — dalam bahasa yang tidak Anda baca. Langkah selanjutnya adalah lip-sync: menyesuaikan waktu gerakan mulut pembicara dengan audio terjemahan, sehingga di layar Anda mereka tampak sedang berbicara dalam bahasa Anda.

Gabungkan keduanya dan seluruh maksud pekerjaan ini menjadi jelas. Dua orang yang tidak memiliki bahasa bersama duduk berhadapan dalam panggilan video dan saling melihat serta mendengar seolah-olah masing-masing adalah penutur asli bahasa satu sama lain — suara yang sama, wajah yang sama, tanpa penerjemah di tengah, tanpa robot membacakan skrip.

Untuk memperjelas statusnya: suara sudah langsung aktif hari ini; lip-sync ada di peta jalan, belum dirilis. Kami menyebutkan tujuan akhir ini karena itulah alasan pekerjaan suara ini penting — terjemahan suara asli bukanlah fitur akhir, ini adalah separuh dari "berbicara dengan siapa pun, dalam bahasa apa pun, sebagai diri Anda sendiri."

Di mana bisa mendengarkannya

Terjemahan suara asli sudah langsung aktif hari ini, di seluruh 21 bahasa suara — bahasa yang sama yang tercantum dalam dokumentasi. Tidak ada yang perlu diaktifkan secara terpisah: saat terjemahan diaktifkan dalam rapat, peserta secara otomatis mendengar satu sama lain dalam suara mereka sendiri. Kami akan jujur tentang posisinya saat ini: hari ini suara tersebut sudah dapat dikenali sebagai Anda, dan kemiripannya adalah sesuatu yang terus kami tingkatkan. Pergilah dengarkan dan nilai sendiri.

Sebuah rapat yang diterjemahkan harus terasa seperti orang-orang yang benar-benar ada di dalamnya sedang berbicara satu sama lain. Mempertahankan suara Anda adalah cara untuk mencapai hal tersebut.

Dapatkan postingan baru melalui email

Kami akan mengirimkan email saat kami mempublikasikan postingan baru. Berhenti berlangganan kapan saja.