صوتك الخاص
صوتك الخاص
عندما يقوم InterMIND بترجمة كلامك لمشارك آخر، فلن يسمعوا راوياً آلياً لتحويل النص إلى كلام. بل سيسمعون صوتاً يُعرف بأنه صوتك — يحمل طابع صوتك وطريقتك في الكلام — وهو ينطق الآن بالكلمات بلغتهم.
يعمل هذا في كلا الاتجاهين وبشكل مستقل لكل مشارك. في اجتماع يتحدث فيه خمسة أشخاص بخمس لغات، يسمع كل شخص الأشخاص الأربعة الآخرين بلغته الخاصة، ويظل صوت كل من هؤلاء الأربعة يشبه صوتهم الأصلي.
كيف يبدو الصوت
تستبدل معظم أدوات الترجمة الفورية المتحدث بصوت اصطناعي عام واحد. والنتيجة مفهومة ولكنها تبدو مسطحة — تفقد من يتحدث، والنبرة، والشخصية. يحتفظ InterMIND بصوت المتحدث، لذا فإن الاجتماع المترجم يبدو وكأنه محادثة بين الأشخاص الموجودين بالفعل فيه، وليس قائمة من الإعلانات يقرأها آلة.
كيف يعمل
يستخدم InterMIND خط أنابيب متسلسل، وتمثل خطوة الصوت المرحلة الأخيرة:
- التعرف على الكلام — تُنسخ كلماتك بلغتك الخاصة أثناء التحدث.
- التقسيم — يُجمّع النص المنسوخ في أجزاء جمل مستقرة (عبارات) بحيث يمكن بدء الترجمة قبل أن تنهي الجملة.
- الترجمة — تُترجم كل جزء تدريجياً إلى لغة المستمع.
- تركيب الصوت — يُنطق كل جزء مترجم باستخدام عينة من صوتك الخاص، ويُرسل إلى المستمع.
بينما لا يزال الاجتماع يجمع ما يكفي من كلامك لنمذجة صوتك (تقريباً في أول 5-10 ثوانٍ)، يستخدم تركيب الصوت الجزء الصوتي الذي يطابق ما قلته للتو بلغتك المصدرية. بمجرد أن تتوفر عينة طويلة بما يكفي، يتحول إلى استخدام تلك العينة لكل ما يأتي بعد ذلك. في الممارسة العملية، لن تلاحظ وجود تبديل — تبدو الترجمة أشبه بك مع استمرار المكالمة. لن تكون مطابقة تامة لصوتك، لكنها صوتك المميز بدلاً من راوٍ عام — وتستمر في التحسن كلما سمع النموذج المزيد منك.
اللغات
ترجمة صوتك الخاص متاحة لـ جميع لغات الصوت الـ 22 — وهي نفس المجموعة المدرجة في اختيار اللغات. لا يوجد شيء لتمكينه بشكل منفصل: عندما تكون الترجمة قيد التشغيل، يسمع المشاركون صوتك تلقائياً.
الخصوصية
عينة الصوت المستخدمة في التركيب عابرة. وهي موجودة فقط طوال مدة الاجتماع المباشر وغير مخزنة في أي مكان — لا تحتفظ Mind API و SDK اللتان يشغلان جلسة الوقت الفعلي بأي بيانات بمجرد انتهاء جلسة المؤتمر. عينة الصوت هذه لا علاقة لها بميزتي التسجيل المرئي والصوتي في InterMIND، والتي تعد تسجيلات منفصلة وصريحة تبدأها عمداً.
على خارطة الطريق: مزامنة حركة الشفاه
سماع الترجمة بصوتك الخاص هو النصف الأول من هدف أكبر. الخطوة التالية التي نعمل نحو تحقيقها هي مزامنة حركة الشفاه — إعادة توقيت فم المتحدث على الكاميرا ليتطابق مع الصوت المترجم، بحيث يبدو كل مشارك وكأنه يتحدث لغة الآخر. بالدمج مع ترجمة الصوت الخاص، الهدف هو الوصول إلى مكالمة حيث يرى الأشخاص الذين لا يجمعهم لغة مشتركة ويسمعون بعضهم البعض وكأن كل واحد منهم يتحدث لغة الآخر بطلاقة.
هذا عنصر موجود على خارطة الطريق، وليس ميزة تم إصدارها بعد — ترجمة الصوت الخاص المذكورة أعلاه متاحة اليوم.