דברו בקולכם שלכם — בשפה שאתם לא דוברים

רוב כלי התרגום בזמן אמת מחליפים אתכם בקריין רובוטי אחד. InterMIND שומרת על הקול שלכם: כל משתתף שומע את התרגום בקולו של הדובר המקורי. כך זה עובד בתהליך המדורג, מה מוסיפה דגימת הקול השמורה האופציונלית בהגדרות, ומה נשמר.

The Mind.com Team

דברו בקולכם שלכם — בשפה שאתם לא דוברים

לדבר בקולכם שלכם — בשפה שאינכם דוברים

הנה החלק בתרגום בזמן אמת שכמעט כולם טועים בו, ושכמעט אף אחד לא מדבר עליו: הקול שאתם שומעים.

אפשר לקבל זיהוי דיבור מצוין ותרגום מצוין, ועדיין לסיים עם פגישה שמרגישה כמו מכונה שמקריאה רשימה. הסיבה היא שהשלב האחרון, הפיכת הטקסט המתורגם בחזרה לצליל, הוא המקום שבו רוב הכלים מחליפים בשקט את אתכם במקריא סינתטי גנרי אחד. שמונה אנשים בחדר, קול רובוטי אחד לכולם. אתם מאבדים את זהות הדובר, את ההדגשות ואת האישיות. התוצאה מובנת, אבל היא לא שיחה.

InterMIND עושה את השלב האחרון אחרת. כשאתם מדברים, המשתתפים האחרים שומעים את התרגום בקול שאפשר לזהות כשלכם, עם הגוון שלכם ועם אופן הדיבור שלכם, אבל באמירת המילים בשפה שלהם. זו עדיין לא חיקוי מושלם. הנקודה היא שזה אתם ולא מקריא מוכן מראש, והחיקוי משתפר כל הזמן. זה עובד לכל משתתף, בשני הכיוונים, בו-זמנית.

הפוסט הזה הוא הפרק החסר של מבט פנימי על ארבעת צינורות התרגום שמפעילים את InterMIND: הפוסט ההוא הסביר איך אודיו הופך לאודיו מתורגם, והפוסט הזה עוסק בשאלה של מי הקול שיוצא בסוף.


ברירת המחדל שכולם מספקים, ולמה היא שטוחה

אם השתמשתם בתרגום חי באחת מפלטפורמות הפגישות הגדולות, אתם מכירים את הצליל. קול ניטרלי בקצב אחיד מקריא את התרגום. זה אותו קול בין אם הדובר הוא המנכ"ל שפותח אסיפה כללית ובין אם הוא עמית שמספר בדיחה. הטכנולוגיה שביסוד זה הקראת טקסט (text-to-speech) עם מודל קול קבוע אחד, וההנחה בתכנון היא שמספיק שהדברים יהיו מובנים.

בפגישה אמיתית זה לא מספיק. חצי ממה שפגישה מעבירה הוא מי אומר את הדברים ואיך. כשמסירים את הקול, דיון הופך לתמליל שבמקרה מושמע בקול. אנשים מפסיקים להגיב זה לזה ומתחילים לחכות לתורם.

מה InterMIND עושה במקום

התרגום פועל כצינור מדורג (cascaded pipeline): שלושה שלבים ייעודיים ברצף, במקום מודל אחד שמנסה לעשות הכול. שני השלבים הראשונים מוסברים בפוסט על הצינורות, ושלב הקול הוא נושא הפוסט הזה:

  1. ASR — זיהוי דיבור. המילים שלכם מתומללות בשפה שלכם, תוך כדי הדיבור, על המנוע שלנו, שרת המדיה שנושא את השיחה (Mind API, OVH France), כך שהתרגום יכול להתחיל עוד לפני שהמשפט נגמר.
  2. MT — תרגום. התמליל מקובץ למקטעי משפט יציבים, פסוקיות, כך שהתרגום יכול להתחיל לפני שסיימתם את המשפט, וכל מקטע מתורגם בהדרגה לשפת המאזין.
  3. Zero-shot TTS — יצירת קול. כל מקטע מתורגם מושמע בחזרה באמצעות דגימה של הקול שלכם ומוזרם אל המאזין.

השלב השלישי, ASR ← MT ← zero-shot TTS, הוא שיוצר את האפקט. "Zero-shot" פירושו שהמערכת לא צריכה הקלטת הרשמה מראש או מפגש אימון עבור הקול שלכם. היא בונה מודל של הקול שלכם מתוך האודיו של הפגישה שבה אתם כבר נמצאים.

החימום: איך זה מתחיל להישמע כמוכם כל כך מהר

יש בעיית "ביצה ותרנגולת" שמסתתרת בביטוי "להשתמש בדגימה של הקול שלכם". בתחילת שיחה, המערכת עדיין לא שמעה מספיק מכם כדי לבנות מודל טוב של הקול.

InterMIND מטפלת בכך בחימום הדרגתי:

  • במשך כ-5 עד 10 השניות הראשונות, בזמן שהיא עדיין אוספת מספיק מהדיבור שלכם, כל מקטע מתורגם מסונתז באמצעות מקטע האודיו שמתאים למה שאמרתם הרגע בשפת המקור. השמעת הקול מעוגנת בדיבור האמיתי והמיידי שלכם.
  • ברגע שיש דגימה ארוכה מספיק, כלומר אחרי אותן 5 עד 10 שניות, המערכתננעלת עליה ומשתמשת בה כדי להשמיע בקולכם את כל מה שאחר כך.

בפועל, אתם לא שומעים מעבר חד. התרגום נשמע יותר ויותר כמוכם ככל שהשיחה מתקדמת. זה לא כפיל מושלם של הקול שלכם, אבל הוא ברור שלכם ולא של מכונה, ומשתפר ככל שהמודל שומע יותר. השילוב של תרגום הדרגתי (פסוקית אחר פסוקית ולא משפט אחר משפט) והשמעת קול הדרגתית הוא מה ששומר על כל התהליך בתוך תקציב ההשהיה, ועדיין נשמע אנושי.

הקליטו את הקול פעם אחת, ודלגו על החימום

החימום שתואר למעלה הוא מה שקורה כברירת מחדל, בלי הגדרה כלשהי. מאז ספטמבר 2026 יש למשתמשים מחוברים דרך שנייה, אופציונלית: דגימת קול שמורה ב-Settings → Your voice in translation.

ההקלטה היא מחווה אחת. לוחצים על Record my voice, ממתינים ל-Speak now, ואומרים את המספרים מאחד עד עשר בסדר כלשהו. כל מספר נדלק על הכרטיס ברגע שמנוע הדיבור שומע אותו, וכשכל עשרת המספרים דולקים, הדגימה נבדקת ונשמרת מעצמה. אין מה להשמיע או לאשר, ואין ספירה לאחור: הכרטיס שומר את קטע ההקלטה שמכיל את המספרים. חדר שקט ואוזניית ראש נותנים את התוצאה הטובה ביותר.

מה הדגימה השמורה משנה: מהפגישה הבאה שלכם, הסינתיסייזר משמיע את התרגום שלכם בקולכם כבר מהמקטע הראשון, כך שהצד השני שומע אתכם כמוכם מהמשפט הראשון ולא רק אחרי החימום. מאחורי הקלעים זו אותה סינתזת zero-shot עם נקודת פתיחה טובה יותר, והחימום החי ממשיך לחדד את הקול ככל שהשיחה נמשכת.

ההקלטה נבדקת לפני שהיא נשמרת. היא חייבת להכיל 3 עד 10 שניות של דיבור ברור (חלון הקלט של הסינתיסייזר). אם היא שקטה מדי, חתוכה, ברובה שקט או מוצפת ברעשי רקע, הכרטיס אומר מה לתקן ומבקש הקלטה נוספת. בחרנו במספרים כביטוי להקלטה מסיבה מעשית: הם קצרים, מוכרים בכל אחת מ-23 השפות, והמנוע יכול לאשר ששמע את כל העשרה, וכך השאלה "האם ההקלטה הצליחה?" הופכת לכן ברור לעין.

שתי דגימות קול, שני אורכי חיים

זה החלק ששאלו עליו מיד צוותי אבטחה או משפטיים, ולכן הוא מוצג כאן בפשטות. יש שתי דגימות שונות, והן חיות באופן שונה.

הדגימה החיה שמשמשת לחימום בזמן הפגישה היא ארעית. היא קיימת רק לאורך מפגש הכנס החי, לצורך השמעת התרגום, והיא לא נשמרת בשום מקום. ה-Mind API וה-SDK שמפעילים את המפגש בזמן אמת לא שומרים נתונים, וכל מה שזמני נעלם עם סיום מפגש הכנס.

הדגימה השמורה מההגדרות נשמרת בחשבון שלכם, למטרה אחת: היא נשלחת למנוע התרגום בכל פעם שאתם מצטרפים לפגישה כדי שאפשר יהיה להשמיע את הדיבור המתורגם שלכם בקולכם, ולשום דבר אחר. היא נשארת עד שתלחצו על Remove בכרטיס, ואז אתם חוזרים מיד לחימום הרגיל, והיא נמחקת יחד עם החשבון שלכם. אורחים לא יכולים להקליט דגימה כזו. זו יכולת למשתמשים מחוברים בלבד, בכוונה.

כדאי להיות מדויקים לגבי מה שאף אחת מהדגימות אינה: היא אינה אחת מיכולות ההקלטה של InterMIND. הקלטת הווידאו והאודיו של פגישה היא פעולה נפרדת ומכוונת שאתם נוקטים ביוזמתכם, עם פקדים משלה. דגימת קול היא קלט לסינתיסייזר הדיבור: זמנית במקרה החי, ובידיכם לשמור או למחוק במקרה השמור.

למה אף אחד אחר לא מספק את זה

קלונינג קול הוא לא סוד. הקושי הוא לעשות אותו בזמן אמת, לכל משתתף בנפרד, בשני הכיוונים, בתקציב של פחות משנייה, ב-23 שפות, בלי לשמור שום דבר שלא ביקשתם לשמור. זו בעיה שונה מקלונינג של קול offline לפודקאסט.

הפלטפורמות הגדולות מייעלות את התרגום שלהן לכיסוי כתוביות ולקול מקריא יחיד ובטוח, וזו ברירת מחדל זולה ויציבה בקנה מידה גדול. שמירה על הקול של כל דובר פירושה ששלב הסינתזה צריך לעקוב אחרי כל משתתף בנפרד ולהישאר באותו תקציב השהיה שבו שאר הצינור פועל. בנינו את מנוע הקול בעצמנו, על תשתית משלנו, ולכן ההחלטה על פשרה זו בידינו. (עוד על הסיבה שהמנוע הוא קוד שלנו: ממה בנויה פגישה אחת ב-InterMIND.)

לאן זה הולך: סנכרון שפתיים

לשמור על הקול שלכם זו חצי ממטרה גדולה יותר. החצי השני הוא הפנים שלכם.

כרגע אתם שומעים את האדם השני בקולו שלו, אבל אם המצלמה פועלת, שפתיו עדיין נעות לפי המילים שהוא אמר בפועל, בשפה שאתם לא קוראים. הצעד הבא הוא סנכרון שפתיים (lip-sync): תזמון מחדש של תנועת הפה של הדובר לפי האודיו המתורגם, כך שעל המסך שלכם נראה שהוא מדבר בשפה שלכם.

כששני הדברים באים יחד, כל המטרה של העבודה הזאת מתבהרת. שני אנשים שאין להם שפה משותפת יושבים משני צדי שיחת וידאו ורואים ושומעים זה את זה כאילו כל אחד מהם דובר שפת אם של השפה של השני: אותו קול, אותן פנים, בלי מתורגמן באמצע ובלי רובוט שמקריא תסריט.

כדי להיות ברורים לגבי הסטטוס: הקול זמין היום, וסנכרון שפתיים נמצא במפת הדרכים ועדיין לא יצא. אנחנו מציינים את היעד כי בגללו עבודת הקול חשובה: תרגום בקול שלכם הוא לא התכונה עצמה, אלא החצי הראשון של "לדבר עם כל אחד, בכל שפה, כמו שאתם".

איפה אפשר לשמוע את זה

תרגום בקול שלכם זמין היום, בכל 23 שפות הקול, אותן שפות שמופיעות בתיעוד. אין צורך להפעיל משהו בנפרד: כשהתרגום מופעל בפגישה, המשתתפים שומעים זה את זה אוטומטית בקולותיהם שלהם. נהיה כנים לגבי המצב הנוכחי: כבר היום הקול ניתן לזיהוי כשלכם, והדמיון הוא דבר שאנחנו פועלים באופן פעיל כדי לקרב עוד. לכו להקשיב ותשפטו בעצמכם.

פגישה מתורגמת צריכה להרגיש כמו האנשים שנמצאים בה בפועל, מדברים זה עם זה. שמירה על הקול שלכם היא הדרך להגיע לזה.

עוד בתרגום בזמן אמת

כל הפוסטים בתרגום בזמן אמת
מתרגם קולי לטורקית: הפועל מגיע בסוף, וזה מה שקובע איזה מהם אתם צריכים
תרגום בזמן אמת

מתרגם קולי לטורקית: הפועל מגיע בסוף, וזה מה שקובע איזה מהם אתם צריכים

בטורקית הפועל – וגם השלילה והזמן הדקדוקי – מופיעים בסוף המשפט. עובדה אחת זו מבדילה בין שלושת המוצרים שנמכרים כ"מתרגם קולי": אפליקציות לנייד, אוזניות תרגום ותרגום חי ב-meeting. מה כל אחד מהם יכול ולא יכול לעשות עם משפט בטורקית, ולמה מספר השפות שספק מציג לא אומר דבר על צמד השפות הזה.

The Mind.com Team

מתורגמן סימולטני: אדם, פלטפורמת RSI או בינה מלאכותית — מה הפגישה הרב-לשונית שלכם צריכה (2026)
תרגום בזמן אמת

מתורגמן סימולטני: אדם, פלטפורמת RSI או בינה מלאכותית — מה הפגישה הרב-לשונית שלכם צריכה (2026)

"מתורגמן סימולטני" הוא מקצוע; מה שרוב החיפושים מבקשים בפועל הוא דיבור שמגיע בשפה אחרת בזמן שהוא נאמר. המדריך הזה מפריד בין תא התרגום, פלטפורמת RSI ותרגום סימולטני מבוסס בינה מלאכותית, משווה את הכלים לפי התיעוד שלהם — Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND — ושואל את מה שההשוואות מדלגות עליו: כמה מהפגישה באמת חוזר בשפה שלכם, והיכן הנתונים עוברים.

The Mind.com Team

תרגום סימולטני: תא תרגום, RSI או AI — ואילו כלים מתאימים לפגישות שלכם (2026)
תרגום בזמן אמת

תרגום סימולטני: תא תרגום, RSI או AI — ואילו כלים מתאימים לפגישות שלכם (2026)

"תרגום סימולטני" מכסה שלוש מציאויות: המתורגמן בתא התרגום, תרגום סימולטני מרחוק (RSI), ותרגום AI בזמן אמת. המדריך הזה מפריד בין השלוש, משווה את הכלים המתועדים — Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND — ושואל את השאלה שפוסטים של השוואות מדלגים עליה: כמה מהפגישה באמת חוזר אליכם בשפה שלכם?

The Mind.com Team

קבלו פוסטים חדשים ועדכוני מוצר בדוא"ל

אימייל אחד בחודש עם פוסטים חדשים ועדכוני מוצר. אפשר לבטל את ההרשמה בכל עת.