تحدث بصوتك الخاص — بلغة لا تتقنها
إليك الجزء من الترجمة في الوقت الفعلي الذي يخطئ فيه الجميع تقريباً، ولا يتحدث عنه أحد تقريباً: الصوت الذي تسمعه.
يمكن أن يكون لديك تعرف ممتاز على الكلام وترجمة ممتازة، ومع ذلك ينتهي بك الأمر باجتماع يبدو وكأنه آلة تقرأ قائمة. لأن الخطوة الأخيرة — تحويل النص المترجم إلى صوت مرة أخرى — هي حيث تستبدل معظم الأدوات أنت بهدوء براوٍ اصطناعي عام واحد. ثمانية أشخاص في الغرفة، وصوت روبوت واحد لهم جميعاً. تفقد من يتحدث، والتأكيد، والشخصية. مفهوم، لكنه ليس محادثة.
يقوم InterMIND بالخطوة الأخيرة بشكل مختلف. عندما تتحدث، يسمع المشاركون الآخرون الترجمة بصوت يمكن التعرف عليه على أنه صوتك — يحمل طابع صوتك وطريقتك في التحدث — وهو الآن ينطق الكلمات بلغتهم. إنه ليس انطباعاً مثالياً بعد؛ والنقطة هي أنه أنت بدلاً من راوٍ جاهز، وأنه يتحسن. يعمل هذا لكل مشارك، في كلا الاتجاهين، في نفس الوقت.
هذا المنشور هو الفصل المفقود من داخل مسارات الترجمة الأربعة التي تشغل InterMIND: ذلك المقال أوضح كيف يتحول الصوت إلى صوت مترجم. هذا المنشور يدور حول صوت من يخرج من الطرف الآخر.
الوضع الافتراضي الذي يطرحه الجميع، ولماذا هو مسطح
إذا كنت قد استخدمت الترجمة المباشرة في أي من منصات الاجتماعات الكبرى، فأنت تعرف الصوت. صوت محايد، بإيقاع متساوٍ يقرأ الترجمة. إنه نفس الصوت سواء كان المتحدث رئيسك التنفيذي يفتتح اجتماعاً عاماً أم زميلاً يلقي نكتة. التقنية الكامنة هي تحويل النص إلى كلام باستخدام نموذج صوتي واحد ثابت، والافتراض في التصميم هو أن الوضوح كافٍ.
في اجتماع حقيقي، الأمر ليس كذلك. نصف ما ي_communicateه الاجتماع هو من يقوله وكيف. تجريد الصوت يحول النقاش إلى نص مكتوب يُقرأ بصوت عالٍ. يتوقف الناس عن التفاعل مع بعضهم البعض ويبدؤون في انتظار دورهم.
ماذا يفعل InterMIND بدلاً من ذلك
تعمل الترجمة كـ مسار متسلسل — ثلاث مراحل متخصصة بالتتابع بدلاً من نموذج واحد يحاول القيام بكل شيء. المرحلتان الأوليان مغطاتان في منشور المسارات؛ خطوة الصوت هي ما يدور حوله هذا المنشور:
- ASR — التعرف على الكلام. تُنسخ كلماتك بلغتك الخاصة، في متصفحك، أثناء كلامك. (تشغيله محلياً يوفر رحلة ذهاب وإياب ويمنح أقل تأخير ممكن قبل أن تبدأ الترجمة حتى.)
- MT — الترجمة. يُجمَّع النص المنسخ في أجزاء جمل مستقرة — أو clauses — بحيث يمكن أن تبدأ الترجمة قبل أن تنتهي من الجملة، ويُترجم كل جزء تدريجياً إلى لغة المستمع.
- Zero-shot TTS — تركيب الصوت. يُنطق كل جزء مترجم مرة أخرى باستخدام عينة من صوتك الخاص، ويُبث إلى المستمع.
إنها تلك المرحلة الثالثة — ASR ← MT ← zero-shot TTS — التي تنتج التأثير. "Zero-shot" تعني أن النظام لا يحتاج إلى تسجيل مسبق أو جلسة تدريب لصوتك. إنه ينمذج صوتك من صوت الاجتماع الذي أنت فيه بالفعل.
الإحماء: كيف يبدأ بال sounding مثلك بهذه السرعة
هناك مشكلة الدجاجة والبيضة المخبأة في "استخدم عينة من صوتك الخاص". في بداية المكالمة تماماً، لم يكن النظام قد سمع ما يكفي منك بعد لينمذج صوتك جيداً.
يتعامل InterMIND مع هذا من خلال إحماء تدريجي:
- لأول 5–10 ثوانٍ تقريباً، بينما لا يزال يجمع ما يكفي من كلامك، يُركب كل جزء مترجم باستخدام الجزء الصوتي الذي يطابق ما قلته للتو بلغتك المصدرية. يُربط الصوت بكلامك الحقيقي والفوري.
- بمجرد وجود عينة طويلة بما يكفي — عند علامة 5–10 ثوانٍ تلك — يلتقطها النظام ويستخدمها لأداء كل شيء بعدها.
في الممارسة العملية، أنت لا تسمع مفتاحاً يُقلب. تبدو الترجمة أكثر شبهاً بك مع استمرار المحادثة — ليس نسخة مطابقة من صوتك، لكنها بوضوح صوتك وليس صوت آلة، وتتحسن مع سماع النموذج للمزيد. الجمع بين الترجمة التقدمية (clause بـ clause، وليس جملة بجملة) والأداء التقدمي هو ما يبقي كل شيء ضمن ميزانية التأخير مع الحفاظ على صوت بشري.
عينة الصوت لا تُخزن أبداً
هذا هو الجزء الذي يسأل عنه فريق الأمن أو القانون على الفور، لذا ها هو بوضوح.
عينة الصوت المستخدمة في التركيب عابرة. إنها موجودة فقط لجلسة المؤتمر المباشرة، في خدمة أداء الترجمة، وهي لا تُخزن في أي مكان. تحتفظ Mind API و SDK اللتان يشغلان جلسة الوقت الفعلي بـ لا بيانات — كل شيء مؤقت يموت عندما تنتهي جلسة المؤتمر.
من المهم أن نكون دقيقين بشأن ما هذه العينة ليست عليه: إنها ليست واحدة من ميزات التسجيل الخاصة بـ InterMIND. إن تسجيل فيديو وصوت الاجتماع هو إجراء منفصل ومتعمد تتخذه عمداً، وله ضوابط خاصة به. عينة الصوت الخاص ليست تسجيلاً — إنها مدخل عابر إلى مركب الكلام لا ي survives المكالمة أبداً.
هذا يهم أكثر من مجرد النظافة المتعلقة بالخصوصية. "تحدث بصوتك الخاص" هو بالضبط نوع الميزة التي تبدو وكأنها تتضمن تخزين بصمة صوتية في مكان ما. إنها لا تفعل. النسخة الصادقة هي القصة الأفضل: صوتك يُنمذج في اللحظة ويختفي عندما تُنهي المكالمة.
لماذا لا يطرح أحد آخر هذا
ليس لأن استنساخ الصوت سر. بل لأن القيام به مباشرة، لكل مشارك، في كلا الاتجاهين، ضمن ميزانية ثانية واحدة، عبر 23 لغة، دون تخزين أي شيء هو مشكلة مختلفة عن استنساخ صوت دون اتصال لبث صوتي.
المنصات الكبرى تحسن ترجمتها لتغطية الترجمة النصية وصوت راوٍ آمن واحد — هذا هو الوضع الافتراضي الرخيص والمتين على نطاق واسع. الاحتفاظ بصوت كل متحدث يعني أن مرحلة التركيب يجب أن تتعقب كل مشارك بشكل مستقل وتبقى داخل نفس ميزانية التأخير التي يعيش باقي المسار تحتها. لقد بنينا محرك الصوت بأنفسنا، على بنيتنا التحتية الخاصة، وهذا ما يجعل تلك المقايضة لنا لنتخذها. (المزيد عن سبب كون المحرك كودنا الخاص: مما يُبنى اجتماع InterMIND واحد.)
إلى أين يتجه هذا: تزامن حركة الشفاه
الاحتفاظ بصوتك هو نصف هدف أكبر. النصف الآخر هو وجهك.
الآن أنت تسمع الشخص الآخر بصوته الخاص، لكن إذا كنت على الكاميرا، فإن شفتيه لا تزالان تتحركان بالكلمات التي قالها فعلاً — بلغة لا تقرأها. الخطوة التالية هي lip-sync: إعادة توقيت فم المتحدث لتطبيق الصوت المترجم، بحيث أنه على شاشتك يبدو وكأنه يتحدث لغتك.
اجمع الاثنين معاً ويصبح الهدف الكامل من هذا العمل واضحاً. شخصان لا يشتركان في أي لغة مشتركة يجلسان عبر مكالمة فيديو ويران ويسمعان بعضهما البعض وكأن كل واحد منهما متحدث أصلي بلغة الآخر — نفس الصوت، نفس الوجه، لا مترجم فوري في الوسط، لا روبوت يقرأ نصاً.
لتوضيح الحالة: الصوت متاح اليوم؛ lip-sync على خارطة الطريق، وليس متاحاً بعد. نحن نشير إلى الوجهة لأنها السبب في أن عمل الصوت يهم — الترجمة بصوتك الخاص ليست هي الميزة، إنها النصف الأول من "تحدث مع أي شخص، بأي لغة، كما أنت".
أين تستمع إليه
الترجمة بصوتك الخاص متاحة اليوم، عبر جميع لغات الصوت الـ 23 — نفس اللغات المذكورة في الوثائق. لا يوجد شيء لتشغيله بشكل منفصل: عندما يتم تمكين الترجمة في اجتماع، يسمع المشاركون بعضهم البعض تلقائياً بأصواتهم الخاصة. سنكون صادقين بشأن مكانتها: اليوم الصوت هو بالفعل أنت يمكن التعرف عليه، والتشابه هو شيء نعمل بنشاط على دفعه ليكون أقرب. اذهب واستمع واحكم بنفسك.
- جرب العرض التوضيحي — يشغل مسار الصوت المباشر مقابل صوتك في أي من اللغات الـ 23.
- شاهد أرقام الجودة — نفس مسار الإنتاج، يُقيَّم شهرياً مقابل FLORES-200، مع نشر التوزيع الكامل لكل زوج لغات.
- كيف يعمل، في الوثائق — النسخة المختصرة من هذا المنشور.
يجب أن يبدو الاجتماع المترجم وكأن الأشخاص الذين هم فيه بالفعل يتحدثون مع بعضهم البعض. الاحتفاظ بصوتك هو كيف نصل إلى هناك.