לדבר בקולכם שלכם — בשפה שאינכם דוברים
הנה החלק בתרגום בזמן אמת שכמעט כולם טועים בו, ושכמעט אף אחד לא מדבר עליו: הקול שאתם שומעים.
אפשר לקבל זיהוי דיבור מצוין ותרגום מצוין, ועדיין לסיים עם פגישה שמרגישה כמו מכונה שמקריאה רשימה. הסיבה היא שהשלב האחרון, הפיכת הטקסט המתורגם בחזרה לצליל, הוא המקום שבו רוב הכלים מחליפים בשקט את אתכם במקריא סינתטי גנרי אחד. שמונה אנשים בחדר, קול רובוטי אחד לכולם. אתם מאבדים את זהות הדובר, את ההדגשות ואת האישיות. התוצאה מובנת, אבל היא לא שיחה.
InterMIND עושה את השלב האחרון אחרת. כשאתם מדברים, המשתתפים האחרים שומעים את התרגום בקול שאפשר לזהות כשלכם, עם הגוון שלכם ועם אופן הדיבור שלכם, אבל באמירת המילים בשפה שלהם. זו עדיין לא חיקוי מושלם. הנקודה היא שזה אתם ולא מקריא מוכן מראש, והחיקוי משתפר כל הזמן. זה עובד לכל משתתף, בשני הכיוונים, בו-זמנית.
הפוסט הזה הוא הפרק החסר של מבט פנימי על ארבעת צינורות התרגום שמפעילים את InterMIND: הפוסט ההוא הסביר איך אודיו הופך לאודיו מתורגם, והפוסט הזה עוסק בשאלה של מי הקול שיוצא בסוף.
ברירת המחדל שכולם מספקים, ולמה היא שטוחה
אם השתמשתם בתרגום חי באחת מפלטפורמות הפגישות הגדולות, אתם מכירים את הצליל. קול ניטרלי בקצב אחיד מקריא את התרגום. זה אותו קול בין אם הדובר הוא המנכ"ל שפותח אסיפה כללית ובין אם הוא עמית שמספר בדיחה. הטכנולוגיה שביסוד זה הקראת טקסט (text-to-speech) עם מודל קול קבוע אחד, וההנחה בתכנון היא שמספיק שהדברים יהיו מובנים.
בפגישה אמיתית זה לא מספיק. חצי ממה שפגישה מעבירה הוא מי אומר את הדברים ואיך. כשמסירים את הקול, דיון הופך לתמליל שבמקרה מושמע בקול. אנשים מפסיקים להגיב זה לזה ומתחילים לחכות לתורם.