صوتك الخاص

كيف ينطق InterMIND بالترجمة بصوت كل مشارك الخاص بدلاً من راوٍ اصطناعي.

صوتك أنت

عندما تترجم InterMIND كلامك لمشارك آخر، فإنه لا يسمع راوياً آلياً يحول النص إلى كلام. بل يسمع صوتاً يميزه على أنه صوتك — يحمل طابع صوتك وطريقتك في الكلام — وهو الآن ينطق الكلمات بلغته.

يعمل هذا في كلا الاتجاهين وبشكل مستقل لكل مشارك. في اجتماع يتحدث فيه خمسة أشخاص بخمس لغات، يسمع كل شخص الآخرين الأربعة بلغته الخاصة، ولا يزال صوت كل واحد منهم الأربعة يبدو كصوته الأصلي.

كيف يبدو الصوت

تستبدل معظم أدوات الترجمة المباشرة المتحدث بصوت اصطناعي عام واحد. والنتيجة مفهومة ولكنها رتيبة — تفقد من يتحدث، والتركيز، والشخصية. تحافظ InterMIND على صوت المتحدث، لذا يبدو الاجتماع المترجم كمحادثة بين الأشخاص الموجودين فعلياً فيه، وليس طابوراً من الإعلانات يقرأها جهاز.

كيف يعمل

تستخدم InterMIND مساراً متسلسلاً، وخطوة الصوت هي المرحلة الأخيرة:

  1. التعرف على الكلام — تُنسخ كلماتك بلغتك الخاصة، أثناء كلامك.
  2. التقسيم — يُجمَّع النص المنسوخ إلى أجزاء جملة مستقرة (بنود) بحيث تبدأ الترجمة قبل أن تنتهي من الجملة.
  3. الترجمة — تُترجم كل قطعة تدريجياً إلى لغة المستمع.
  4. تركيب الصوت — يُنطق كل جزء مترجم باستخدام عينة من صوتك أنت، ويُرسل إلى المستمع.

بينما لا يزال الاجتماع يجمع ما يكفي من كلامك لنمذجة صوتك (تقريباً أول 5–10 ثوانٍ)، يستخدم التركيب الجزء الصوتي الذي يطابق ما قلته للتو بلغتك المصدرية. بمجرد أن يتوفر عينة طويلة بما يكفي، يتحول إلى استخدام تلك العينة لكل ما يأتي بعدها. في الممارسة لا تلاحظ تبديلاً — تبدو الترجمة أشبه بك مع استمرار المكالمة. لن تكون انطباعاً مثالياً عن صوتك، لكنه صوتك المعروف بدلاً من راوٍ عام — ويستمر في التحسن كلما سمع النموذج المزيد منك.

اللغات

ترجمة صوتك متاحة لـ جميع لغات الصوت الـ 23 — المجموعة نفسها المدرجة في اختيار اللغات. لا يوجد ما يجب تمكينه بشكل منفصل: عندما تكون الترجمة قيد التشغيل، يسمع المشاركون كلامك بصوتك أنت تلقائياً.

الخصوصية

عينة الصوت المستخدمة في التركيب مؤقتة. توجد فقط طوال مدة الاجتماع المباشر ولا تُخزن في أي مكان — إنّ واجهة برمجة تطبيقات Mind وSDK التي تشغل الجلسة في الوقت الفعلي لا تحتفظ بأي بيانات بمجرد انتهاء جلسة المؤتمر. عينة الصوت هذه لا علاقة لها بميزات التسجيل الخاصة بالفيديو والصوت في InterMIND، وهي تسجيلات منفصلة وصريحة تبدؤها عمداً.

على خارطة الطريق: مزامنة الشفاه

سماع الترجمة بصوتك هو النصف الأول من هدف أكبر. الخطوة التالية التي نعمل نحوها هي مزامنة الشفاه — إعادة توقيت فم المتحدث على الكاميرا ليتطابق مع الصوت المترجم، بحيث يبدو كل مشارك وكأنه يتحدث لغة الآخر. مدمجةً مع ترجمة الصوت الأصلي، الهدف هو مكالمة يرى فيها ويسمع فيها الأشخاص الذين لا يتشاركون لغة مشتركة بعضهم بعضاً وكأن كل واحد منهم يتحدث لغة الآخر بطلاقة.

هذا عنصر على خارطة الطريق، وليس ميزة متاحة بعد — ترجمة الصوت الأصلي أعلاه متاحة اليوم.

هل تريد الصورة التقنية الكاملة؟ راجع تحدث بصوتك أنت — بلغة لا تتحدثها على المدونة.