Mimari

Kendi sesinizle konuşun — bilmediğiniz bir dilde

Çoğu canlı çeviri aracı sizi tek bir robotik anlatıcıyla değiştirir. InterMIND sesinizi korur: her katılımcı çeviriyi orijinal konuşanın kendi sesinde duyar. İşte kademeli sistemin bunu nasıl yaptığı — ve ses örneğinin neden hiçbir zaman saklanmadığı.

The Mind.com Team

Kendi sesinizle konuşun — bilmediğiniz bir dilde

Kendi sesinizle konuşun — bilmediğiniz bir dilde

Gerçek zamanlı çevirinin neredeyse herkesin yanlış anladığı ve neredeyse hiç kimsenin konuşmadığı kısmı burada: duyduğunuz ses.

Mükemmel bir konuşma tanıma ve mükemmel bir çeviriye sahip olabilirsiniz, ancak yine de bir makinenin liste okuduğunu hissettiren bir toplantıyla sonuçlanabilirsiniz. Çünkü son adım — çevrilmiş metni tekrar sese dönüştürmek — çoğu aracın sizi sessizce tek tip, sentetik bir anlatıcıyla değiştirdiği yerdir. Odadaki sekiz kişi, hepsi için tek bir robot sesi. Kimin konuştuğunu, vurguyu, kişiliği kaybedersiniz. Anlaşılır, ama bir sohbet değil.

InterMIND son adımı farklı yapar. Siz konuştuğunuzda, diğer katılımcılar çeviriyi açıkça size ait olan — tınınızı ve konuşma tarzınızı taşıyan — şimdi kelimeleri kendi dillerinde söyleyen bir sesle duyar. Henüz kusursuz bir taklit değil; önemli olan, stok bir anlatıcı yerine siz olmanızdır ve gittikçe iyileşmektedir. Bu, her katılımcı için her iki yönde aynı anda çalışır.

Bu yazı, InterMIND'i çalıştıran dört çeviri işlem hattının içinden adlı yazının eksik bölümüdür: o yazı sesin nasıl çevrilmiş sese dönüştüğünü açıklıyordu. Bu yazı ise diğer uçtan kimin sesinin çıkacağı hakkındadır.


Herkesin sunduğu varsayılan ve neden düz olduğu

Büyük toplantı platformlarından herhangi birinde canlı çeviri kullandıysanız, o sesi bilirsiniz. Nötr, düzgün tempolu bir ses çeviriyi okur. Konuşan, şirket içi toplantıyı açan CEO'nuz veya şaka yapan bir meslektaşınız olsa da aynı sestir. Altındaki teknoloji, sabit bir ses modeline sahip metin-konuşma (text-to-speech) dönüşümüdür ve tasarım varsayımı, anlaşılırlığın yeterli olduğudur.

Gerçek bir toplantıda öyle değildir. Toplantının ilettiği şeyin yarısı kimin söylediği ve nasıl söylediğidir. Sesi çıkarınca bir tartışmayı yüksek sesle okunan bir metne dönüştürmüş olursunuz. İnsanlar birbirlerine tepki vermeyi bırakır ve sıralarını beklemeye başlar.

InterMIND bunun yerine ne yapıyor

Çeviri kademeli bir işlem hattı olarak çalışır — her şeyi yapmaya çalışan tek bir model yerine sıralı üç özel aşama. İlk iki aşama işlem hattı yazısında ele alındı; ses adımı ise bu yazının konusu olan şeydir:

  1. ASR — konuşma tanıma. Siz konuşurken kelimeleriniz kendi dilinizde, tarayıcınızda metne dönüştürülür. (Yerel olarak çalıştırmak bir gidiş-dönüş turunu tasarruf sağlar ve çeviri başlamadan önce mümkün olan en düşük gecikmeyi verir.)
  2. MT — çeviri. Metin, kararlı cümle parçalarına — cümleciklere (clauses) — ayrılır, böylece cümleyi bitirmeden önce çeviri başlayabilir ve her parça dinleyicinin diline aşamalı olarak çevrilir.
  3. Zero-shot TTS — ses sentezleme. Çevrilmiş her parça, kendi sesinizin bir örneği kullanılarak seslendirilir ve dinleyiciye akıtılır.

Bu etkiyi yaratan üçüncü aşamadır — ASR → MT → zero-shot TTS. "Zero-shot", sistemin sesiniz için önceden kaydedilmiş bir kayıt veya bir eğitim oturumuna ihtiyaç duymadığı anlamına gelir. Sesinizi, içinde bulunduğunuz toplantının sesinden modelleyerek oluşturur.

Isınma: bu kadar hızlı size benzemeye nasıl başlıyor

"Kendi sesinizin bir örneğini kullan" ifadesinin içinde bir tavuk-yumurta problemi gizli. Bir çağrının en başında, sistem sesinizi iyi modelleyebilmek için henüz yeterince duymamıştır.

InterMIND bunu aşamalı bir ısınma ile çözer:

  • Yaklaşık ilk 5–10 saniye boyunca, konuşmanızdan yeterince örnek toplarken, çevrilmiş her parça, kaynak dilinizde az önce söylediğiniz şeyle eşleşen ses parçası kullanılarak sentezlenir. Seslendirme, gerçek ve o anki konuşmanıza sabitlenir.
  • Yeterince uzun bir örnek olduğunda — o 5–10 saniyelik eşik — sistem buna kilitlenir ve sonrasında her şeyi seslendirmek için onu kullanır.

Uygulamada bir anahtarın döndüğünü duymazsınız. Sohbet ilerledikçe çeviri daha çok size benzer — sesinizin kusursuz bir ikizi değil, ancak açıkça bir makineninkine göre sizin sesiniz ve model daha çok duydukça iyileşir. Aşamalı çeviri (cümle cümle değil, cümlecik cümlecik) ve aşamalı seslendirme kombinasyonu, tüm bunları gecikme bütçesinin altında tutarken hala insani tınlamasını sağlar.

Ses örneği asla saklanmaz

Güvenlik veya hukuk ekibinin hemen soracağı kısım burası, bu yüzden açıkça belirtelim.

Sentezleme için kullanılan ses örneği geçicidir. Yalnızca çeviriyi seslendirme amacıyla canlı konferans oturumu boyunca mevcuttur ve hiçbir yerde saklanmaz. Gerçek zamanlı oturumu destekleyen Mind API ve SDK hiçbir veriyi tutmaz — geçici olan her şey konferans oturumu sona erdiğinde yok olur.

Bu örneğin ne olmadığının netleştirilmesi önemlidir: InterMIND'in kayıt (recording) özelliklerinden biri değildir. Bir toplantının video ve sesini kaydetmek, kendi kontrolleri olan, bilinçli olarak gerçekleştirdiğiniz ayrı bir eylemdir. Kendi ses örneği bir kayıt değildir — çağrıdan daha uzun ömürlü olmayan, konuşma sentezleyicisine geçici bir girdidir.

Bu, gizlilik hijyeninin ötesinde önemlidir. "Kendi sesinizle konuşun", bir yerde ses baskısı (voiceprint) depolamayı gerektirmesi gerektiği izlenimini veren türden bir özelliktir. Gerektirmez. Dürüst versiyon daha iyi bir hikayedir: sesiniz o an için modellenir ve çağrıyı bitirdiğinizde yok olur.

Başka hiç kimse neden bunu sunmuyor

Ses klonlamanın gizli bir teknoloji olması değil. Bunu canlı, katılımcı bazında, her iki yönde, bir saniyelik bütçe altında, 24 dilde ve hiçbir şey depolamadan yapmanın, bir podcast için çevrimdışı ses klonlamaktan farklı bir problem olmasıdır.

Büyük platformlar çevirilerini altyazı kapsamı ve tek bir güvenli anlatıcı sesi için optimize eder — bu ölçeklendirmede ucuz, sağlam varsayılandır. Her konuşanın kendi sesini korumak, sentezleme aşamasının her katılımcıyı bağımsız olarak takip etmesi ve işlem hattının geri kalanının yaşadığı aynı gecikme bütçesi içinde kalması anlamına gelir. Ses motorunu kendi altyapımız üzerinde kendimiz inşa ettik, bu yüzden bu ödünleşime karar vermek bizim elimizde. (Motorun neden kendi kodumuz olduğuna dair daha fazlası: Bir InterMIND toplantısı neden oluşur.)

Bunun gittiği yer: dudak senkronizasyonu

Sesi korumak daha büyük bir hedefin yarısıdır. Diğer yarısı ise yüzünüz.

Şu an karşı taraftaki kişiyi kendi sesinde duyuyorsunuz, ancak kameradayken dudakları, okumadığınız bir dilde — aslında söylediği kelimelere göre hareket etmeye devam ediyor. Sonraki adım dudak senkronizasyonudur (lip-sync): konuşanın dudaklarını çevrilmiş sesle yeniden zamanlamak, böylece ekranınızda sizin dilinizi konuşuyormuş gibi görünmelerini sağlamak.

İkisini bir araya getirin ve bu çalışmanın tüm amacı netleşir. Ortak bir dili paylaşmayan iki kişi bir video çağrısında karşı karşıya oturur ve ortada bir tercüman, bir senaryo okuyan bir robot olmadan, her biri diğerinin dilinin ana dili konuşanıymış gibi birbirlerini görür ve duyarlar.

Durum hakkında net olmak gerekirse: ses bugün canlı; dudak senkronizasyonu yol haritasında, henüz sunulmadı. Hedefi belirtiyoruz çünkü ses çalışmasının önemi buradan geliyor — kendi sesinden çeviri bir özellik değil, "herhangi biriyle, herhangi bir dilde, kendiniz olarak konuşmanın" ilk yarısıdır.

Nerede duyabileceğiniz

Kendi sesinden çeviri bugün, 21 ses dilinin tamamında canlıdırdokümantasyonda listelenen aynı diller. Ayrı olarak açmanız gereken bir şey yok: bir toplantıda çeviri etkinleştirildiğinde, katılımcılar birbirlerini otomatik olarak kendi seslerinde duyarlar. Durumuna dair dürüst olmak gerekirse: bugün ses açıkça sizsiniz ve bu benzerliği aktif olarak daha da artırıyoruz. Gidip dinleyin ve kendiniz karar verin.

Çevrilmiş bir toplantı, gerçekte içinde olan insanların birbirleriyle konuşuyormuş gibi hissettirmelidir. Sesi korumak, bunu başarmanın yoludur.

Yeni yazıları e-posta ile alın

Yeni bir yazı yayımladığımızda size e-posta göndereceğiz. İstediğiniz zaman abonelikten çıkabilirsiniz.