Kendi Sesiniz
Kendi Sesiniz
InterMIND, konuşmanızı başka bir katılımcı için çevirdiğinde, karşı taraf robotik bir metin-okuma anlatıcısı duymaz. Tanınabilir şekilde size ait bir ses duyar — tınınızı ve konuşma tarzınızı taşıyan bu ses — artık kelimeleri onların dilinde söylemektedir.
Bu, her iki yönde de ve her katılımcı için bağımsız olarak çalışır. Beş kişinin beş farklı dil konuştuğu bir toplantıda, her kişi diğer dördünü kendi dilinde duyar ve bu dört kişinin her biri yine kendisi gibi ses çıkarır.
Nasıl Duyulur
Çoğu canlı çeviri aracı, konuşmacının yerine tek bir jenerik sentetik ses koyar. Sonuç anlaşılır ama düzdür — kimin konuştuğunu, vurguyu, kişiliği kaybedersiniz. InterMIND konuşmacının sesini korur, böylece çevrilmiş bir toplantı, bir makine tarafından okunan duyuru sırası değil, gerçekten içinde bulunan kişiler arasındaki bir sohbet gibi hissettirir.
Nasıl Çalışır
InterMIND, basamaklı bir pipeline (cascaded pipeline) kullanır ve ses adımı bu sürecin son aşamasıdır:
- Konuşma tanıma — sözleriniz, siz konuştukça kendi dilinizde yazıya dökülür.
- Segmentasyon — döküm, cümleyi bitirmeden çevirinin başlayabilmesi için kararlı cümle parçalarına (yan cümlecikler) gruplanır.
- Çeviri — her parça, dinleyicinin diline kademeli olarak çevrilir.
- Ses sentezi — çevrilen her parça, kendi sesinizin bir örneği kullanılarak seslendirilir ve dinleyiciye gönderilir.
Toplantı, sesinizi modellemek için yeterli konuşmanızı henüz toplarken (kabaca ilk 5-10 saniye), sentez, kaynak dilinizde az önce söylediklerinize karşılık gelen ses parçasını kullanır. Yeterince uzun bir örnek elde edildiğinde, bundan sonraki her şey için o örneği kullanmaya geçer. Pratikte bu geçişi fark etmezsiniz — görüşme ilerledikçe çeviri size daha çok benzemeye başlar. Sesinizin kusursuz bir taklidi olmayacaktır, ancak jenerik bir anlatıcı yerine tanınabilir şekilde siz olacaktır — ve model sizi dinledikçe gelişmeye devam eder.
Diller
Kendi sesinizle çeviri, Dil Seçimi sayfasında listelenen aynı set olan tüm 24 sesli dil için kullanılabilir. Ayrıca etkinleştirilmesi gereken bir şey yoktur: çeviri açık olduğunda, katılımcılar sizi otomatik olarak kendi sesinizle duyar.
Gizlilik
Sentez için kullanılan ses örneği geçicidir. Yalnızca canlı toplantı süresince var olur ve hiçbir yerde saklanmaz — gerçek zamanlı oturumu destekleyen Mind API ve SDK, konferans oturumu sona erdiğinde hiçbir veri tutmaz. Bu ses örneği, InterMIND'ın video ve ses kayıt özellikleriyle ilgisizdir; bunlar sizin bilerek başlattığınız, ayrı ve açık kayıtlardır.
Yol Haritasında: Dudak Senkronizasyonu
Çeviriyi kendi sesinizle duymak, daha büyük bir hedefin ilk yarısıdır. Üzerinde çalıştığımız bir sonraki adım dudak senkronizasyonudur — konuşmacının kameradaki ağız hareketlerinin, çevrilmiş sesle eşleşecek şekilde yeniden zamanlanmasıdır; böylece her katılımcı diğerinin dilini konuşuyormuş gibi görünür. Kendi sesinizle çeviriyle birleştiğinde amaç, ortak bir dili paylaşmayan insanların sanki her biri diğerinin dilini ana dili gibi konuşuyormuş gibi birbirlerini görüp duyabildiği bir görüşme yaratmaktır.
Bu bir yol haritası maddesidir, henüz kullanıma sunulmuş bir özellik değildir — yukarıda anlatılan kendi sesinizle çeviri özelliği ise bugün itibarıyla aktif olarak kullanılabilir.