Mimari

Kendi sesinizle konuşun — bilmediğiniz bir dilde

Çoğu canlı çeviri aracı sizi tek bir robotik anlatıcıyla değiştirir. InterMIND sesinizi korur: Her katılımcı çeviriyi orijinal konuşmacının kendi sesinden duyar. İşte kaskadın bunu nasıl yaptığı, Ayarlar'daki isteğe bağlı kaydedilmiş ses örneğinin neler eklediği ve nelerin saklandığı.

The Mind.com Team

Kendi sesinizle konuşun — bilmediğiniz bir dilde

Kendi sesinizle konuşun — konuşmadığınız bir dilde

Gerçek zamanlı çevirinin neredeyse herkesin yanlış anladığı ve neredeyse kimsenin konuşmadığı kısmı burada: duyduğunuz ses.

Mükemmel konuşma tanıma ve mükemmel çeviriye sahip olabilirsiniz, ancak yine de bir makinenin liste okuduğunu hissettiren bir toplantıyla sonuçlanabilirsiniz. Çünkü son adım — çevrilmiş metni tekrar sese dönüştürme — çoğu aracın sizi sessizce tek bir genel sentetik anlatıcıyla değiştirdiği yerdir. Odadaki sekiz kişi, hepsi için tek bir robot ses. Kimin konuştuğunu, vurguyu, kişiliği kaybedersiniz. Anlaşılır, ama bir sohbet değil.

InterMIND bu son adımı farklı yapar. Siz konuştuğunuzda, diğer katılımcılar çeviriyi kolayca tanınan sizin sesinizle duyarlar — tınınızı ve konuşma tarzınızı taşıyan, şimdi ise kelimeleri kendi dillerinde söyleyen bir ses. Henüz kusursuz bir taklit değil; önemli olan siz olmanızdır, hazır bir anlatıcı değil, ve gitgide daha iyi hale geliyor. Bu, her katılımcı için her iki yönde aynı anda çalışır.

Bu yazı, InterMIND'ı çalıştıran dört çeviri hattının içi başlıklı yazının eksik bölümüdür: o yazı, sesin nasıl çevrilmiş ses haline geldiğini açıklıyordu. Bu yazı ise diğer uçtan kimin sesinin çıkacağı hakkındadır.


Herkesin sunduğu varsayılan ve neden tek düze olduğu

Büyük toplantı platformlarından herhangi birinde canlı çeviri kullandıysanız, o sesi bilirsiniz. Nötr, eşit tempolu bir ses çeviriyi okur. Konuşmacı CEO'nuz bir genel toplantı açıyor veya bir meslektaşınız şaka yapıyor olsa da bu ses aynıdır. Altındaki teknoloji, tek bir sabit ses modeline sahip metin-konuşma (text-to-speech) teknolojisidir ve tasarım varsayımı anlaşılabilirliğin yeterli olduğudur.

Gerçek bir toplantıda öyle değildir. Bir toplantının ilettiği şeyin yarısı kimin söylediği ve nasıl söylediğidir. Sesi çıkardığınızda bir tartışmayı yüksek sesle konuşulan bir dile çevrilmiş bir metne dönüştürmüş olursunuz. İnsanlar birbirlerine tepki vermeyi bırakır ve sıralarını beklemeye başlarlar.

InterMIND bunun yerine ne yapıyor

Çevirimiz basamaklı bir hat (cascaded pipeline) olarak çalışır — her şeyi tek başına yapmaya çalışan bir model yerine, sırayla çalışan üç uzmanlaşmış aşama. İlk iki aşama hatlar yazısında ele alınmıştır; ses aşaması ise bu yazının konusudur:

  1. ASR — konuşma tanıma. Kelimeleriniz siz konuşurken kendi motorumuzda — çağrıyı taşıyan medya sunucusunda (Mind API, OVH France) — kendi dilinizde yazıya dökülür, böylece çeviri cümle bitmeden başlayabilir.
  2. MT — çeviri. Metin, kararlı cümle parçalarına — cümleciklere — bölünür, böylece siz cümleyi bitirmeden çeviriye başlanabilir ve her parça dinleyicinin diline aşamalı olarak çevrilir.
  3. Zero-shot TTS — ses sentezi. Çevrilmiş her parça kendi sesinizin bir örneği kullanılarak seslendirilir ve dinleyiciye akışla iletilir.

Bu etkiyi yaratan, bu üçüncü aşamadır — ASR → MT → zero-shot TTS. "Zero-shot", sistemin sesiniz için önceden kaydedilmiş bir kayıt veya bir eğitim seansına ihtiyaç duymaması anlamına gelir. Sesinizi, zaten içinde bulunduğunuz toplantının ses kaydından modeller.

Isınma aşaması: sesiniz size nasıl bu kadar çabuk benziyor

"Kendi sesinizin bir örneğini kullan" ifadesinin içinde bir tavuk-yumurta problemi gizli. Çağrının en başında sistem, sesinizi iyi modellemek için sizi yeterince duymamıştır.

InterMIND bunu aşamalı bir ısınma ile çözer:

  • İlk kabaca 5–10 saniye boyunca, daha yeterince konuşmanızı toplarken, çevrilmiş her parça, kaynak dilinizde henüz söylediğiniz şeyle eşleşen ses parçası kullanılarak sentezlenir. Seslendirme, gerçek ve anlık konuşmanıza sabitlenir.
  • Yeterince uzun bir örnek olduğunda — o 5–10 saniyelik işaret — sistem buna kilitlenir ve sonrasında her şeyi seslendirmek için bunu kullanır.

Uygulamada bir düğmenin açıldığını duymazsınız. Sohbet ilerledikçe çeviri size daha çok benzemeye başlar — sesinizin mükemmel bir kopyası değil, ama açıkça size ait olan, makinenin değil, model daha çok duydukça iyileşen bir ses. Aşamalı çeviri (cümle cümle değil, cümlecik cümlecik) ve aşamalı seslendirmenin birleşimi, her şeyi gecikme bütçesi altında tutarken hâlâ insani tınıda kalmasını sağlar.

Sesinizi bir kez kaydedin ve ısınmayı atlayın

Yukarıdaki ısınma, hiçbir ayar yapmadan varsayılan olarak gerçekleşendir. Eylül 2026'dan beri oturum açmış kullanıcılar için isteğe bağlı ikinci bir yol vardır: Settings → Your voice in translation içinde kaydedilmiş bir ses örneği.

Bunu kaydetmek tek bir harekettir. Sesimi kaydet'e basın, Şimdi konuş ifadesini bekleyin ve bir'den on'a kadar sayıları herhangi bir sırayla söyleyin. Konuşma motoru duydukça her sayı kart üzerinde yanar; on'u da yandığında örnek kontrol edilip kendiliğinden kaydedilir. Geri çalınacak veya onaylanacak bir şey yoktur ve geri sayım da yoktur: kart, kaydınızın sayıları içeren bölümünü tutar. Sessiz bir oda ve bir kulaklık en iyi sonucu verir.

Kaydedilmiş örneğin değiştirdiği şey: bir sonraki toplantınızdan itibaren sentezleyici çevirinizi ilk parçadan itibaren bununla seslendirir, böylece karşı taraf sizi ısınma aşamasından sonra değil ilk cümleden itibaren siz olarak duyar. Arka planda bu, daha iyi bir başlangıç noktasına sahip aynı zero-shot sentezdir; canlı ısınma, çağrı devam ettikçe sesi yine de rafine eder.

Kayıt depolanmadan önce kontrol edilir. 3 ila 10 saniye net konuşma (sentezleyicinin giriş penceresi) olmalıdır: çok sessizse, kesilirse, çoğunlukla sessizse veya arka plan gürültüsünde boğulursa, kart size neyi düzeltmeniz gerektiğini söyler ve başka bir kayıt ister. Sayıların ifade olarak seçilmesinin pratik bir nedeni vardır: kısadırlar, 23 dilden her birinde tanınabilirler ve motor on'unun da duyduğunu onaylayabilir, bu da "o kayıt işe yaradı mı?" sorusunu görünür bir "evet"e çevirir.

İki ses örneği, iki ömür

Bir güvenlik veya hukuk ekibinin hemen soracağı kısım burası, o yüzden açıkça söyleyelim. İki farklı örnek vardır ve farklı yaşarlar.

Toplantı içi ısınma için kullanılan canlı örnek geçicidir. Yalnızca çeviriyi seslendirmek amacıyla canlı konferans oturumunda var olur ve hiçbir yerde depolanmaz. Gerçek zamanlı oturumu güçlendiren Mind API ve SDK hiçbir veri saklamaz; konferans oturumu sona erdiğinde geçici olan her şey yok olur.

Settings üzerinden alınan kaydedilmiş örnek, hesabınızla birlikte, tek bir amaç için depolanır: her toplantıya katıldığınızda çevrilmiş konuşmanız bununla seslendirilebilsin diye çeviri motoruna gönderilir, başka hiçbir şey için değil. Kart üzerindeki Kaldır'a basana kadar kalır, bu da sizi hemen standart ısınmaya geri döndürür ve hesabınızla birlikte silinir. Misafirler bunu kaydedemez; tasarım gereği oturum açmış kullanıcılara özel bir özelliktir.

İki örneğin de ne olmadığını netleştirmeye değer: InterMIND'in kayıt (recording) özelliklerinden biri değildir. Bir toplantının video ve sesini kaydetmek, kendi kontrolleri olan, bilinçli olarak yaptığınız ayrı bir eylemdir. Ses örneği, konuşma sentezleyicisine bir girdidir: canlı durumda geçici, kaydedilmiş durumda ise tutmak veya silmek sizin elinizdedir.

Başka kimse neden bunu sunmuyor

Ses klonlamanın bir sır olduğu için değil. Bunu canlı, katılımcı bazında, her iki yönde, bir saniyelik bir bütçe altında, 23 dilde, istemediğiniz hiçbir şeyi depolamadan yapmanın, bir podcast için çevrimdışı bir sesi klonlamaktan farklı bir problem olduğu içindir.

Büyük platformlar çevirilerini altyazı kapsama ve güvenli tek bir anlatıcı sesi için optimize eder — bu ölçeklendirildiğinde ucuz, sağlam varsayılandır. Her konuşmacının kendi sesini korumak, sentez aşamasının her katılımcıyı bağımsız olarak takip etmesi ve hattın geri kalanının yaşadığı aynı gecikme bütçesi içinde kalması anlamına gelir. Ses motorunu kendi altyapımız üzerinde kendimiz inşa ettik, bu da bu takası yapma hakkının bize ait olmasını sağlar. (Motorun neden kendi kodumuz olduğuna dair daha fazlası: Bir InterMIND toplantısı nelerden oluşur.)

Bu nereye gidiyor: lip-sync

Sesinizi korumak daha büyük bir hedefin yarısıdır. Diğer yarısı ise yüzünüz.

Şu anda diğer kişiyi kendi sesinde duyuyorsunuz, ancak kamerasındanaysanız, dudakları hâlâ okumadığınız bir dilde asıl söyledikleri kelimelere göre hareket ediyor. Sonraki adım lip-sync'tir: konuşmacının ağzını çevrilmiş sese göre yeniden zamanlamak, böylece ekranınızda sizin dilinizi konuşuyormuş gibi görünmesi.

İkisini bir araya getirdiğinizde bu çalışmanın tüm amacı netleşir. Ortak dili olmayan iki kişi bir video çağrısında karşılıklı oturur ve ortada bir çevirmen, set okuyan bir robot yokken, her biri sanki diğerinin dilinin ana dili konuşucusuymuş gibi birbirlerini görür ve duyar.

Durum açısından netleştirelim: ses bugün canlı; lip-sync ise yol haritasında, henüz sunulmadı. Hedefi belirtiyoruz çünkü ses çalışmasının önemli olduğu yer burası — kendi sesinize olan çeviri özellik değil, "kim olursanız ol, herhangi bir dilde herkesle konuşun" vizyonunun ilk yarısıdır.

Bunu nerede duyabilirsiniz

Kendi-sesinize çeviri bugün, tüm 23 ses dilinde canlı olarak mevcuttur — belgelerde listelenen dillerle aynı. Ayrı olarak açmanız gereken bir şey yok: bir toplantıda çeviri etkinleştirildiğinde katılımcılar birbirlerini otomatik olarak kendi seslerinde duyar. Nerede olduğuna dair dürüst olacağız: bugün ses halihazırda siz olarak tanınabilir durumda ve benzerlik, bizim aktif olarak daha da yaklaştırdığımız bir şey. Gidin dinleyin ve kendiniz karar verin.

Çevrilmiş bir toplantı, gerçekten içinde olan insanların birbirleriyle konuştuğunu hissettirmelidir. Sesinizi korumak, oraya ulaşmanın yoludur.

Yeni gönderileri ve ürün güncellemelerini e-posta ile al

Ayda bir, yeni gönderiler ve ürün güncellemeleri içeren e-posta. İstediğiniz zaman abonelikten çıkın.