מבט מבפנים על ארבעת צינורות התרגום שמפעילים את InterMIND
הדף הישן /product/overview/how-it-works ב-mind.com מיושן בכמה גרסאות מרכזיות. הוא מתאר "מנוע תרגום" יחיד, כמו רוב דפי הספקים: חץ גדול אחד מ"אתם מדברים" אל "הם שומעים". כבר לפני שנתיים התמונה הזו הייתה פישוט. כיום היא פשוט שגויה.
האמת היא ש-InterMIND מפעילה ארבעה צינורות תרגום נפרדים. כל אחד פותר בעיה אחרת, עם מנוע אחר, תקציב השהיה אחר ומעטפת איכות אחרת. הם חולקים בורר שפות, אבל לא מנוע.
זו התשובה המעודכנת לשאלה "איך זה עובד".
מאמר משלים: "כמה שפות אתם תומכים בהן?" מסביר מה כל צינור מכסה (23 / 23 / 30 / 17). המאמר הזה מסביר מה כל צינור עושה, ולמה הוא עומד בפני עצמו.
למה "מנוע אחד לכול" הוא שקר
לפלטפורמת פגישות חיות יש לפחות ארבע משימות במקביל, והן מושכות בכיוונים שאינם מתיישבים זה עם זה:
- קול בזמן אמת — אודיו נכנס, אודיו מתורגם יוצא, בפחות משנייה, וכל צופה שומע בשפתו. האילוץ הקשה הוא השהיה.
- צ'אט טקסטואלי בזמן אמת — הודעות קצרות ומהירות, כשעריכות, ציטוטים ומבנה HTML נשמרים.
- הערות משותפות בזמן אמת — הקלדה שיתופית תו אחר תו, עם היררכיה מבנית (רשימות, כותרות, תיבות סימון) שחייבת לשרוד את התרגום.
- קובצי מסמכים אסינכרוניים — קובץ PDF בן 40 עמודים שנזרק לצ'אט. אין תקציב השהיה. האילוץ הקשה הוא נאמנות: עיצוב, טבלאות, מספרי עמודים, גופן.
אפשר לבנות קריאת LLM ענקית אחת שמנסה לעשות את כל הארבעה. ניסינו. היא גרועה בכולם. תקציב ההשהיה של הקול אומר שהמודל לא יכול לחשוב, ותקציב הנאמנות של מסמכים אומר שהוא חייב. עריכה בצ'אט דורשת diff בשפת הצופה, ו-PDF בן 40 עמודים דורש שימור פורמט שאף מודל סטרימינג של טוקנים לא נותן.
אז אנחנו מפעילים ארבעה. הנה כל אחד מהם.