מדוע שיווק איכות התרגום שבור — ומה אנחנו מפרסמים במקומו
היכנסו לאתר של כל ספק תרגום חי. תראו את אותם סוגי מספרים:
- "200+ שפות"
- "6,000+ צמדי שפות"
- "הראשון בעולם" / "הדיוק הגבוה ביותר"
- "דיוק של 99%"
עכשיו נסו למצוא — בכל אחד מדפי הספקים האלה — מה המספרים האלה אומרים על פגישה שאתם עומדים לקיים. איכות לכל שפה. מתודולוגיה שניתן לשחזר. גודל מדגם. ציון לאורך זמן. גילוי כן של המקומות שבהם המודל חלש.
לא תמצאו את זה. לא בטקסטים השיווקיים, ולעיתים נדירות גם בתיעוד.
זהו שיווי המשקל של הקטגוריה. הוא קיים בגלל שלושה דברים:
- רוב הספקים אינם הבעלים של מנוע התרגום שלהם. הם מנתבים דרך OpenAI, Google, DeepL, Microsoft או שילוב כלשהו ביניהם. פרסום נתוני איכות לכל צמד שפות יהיה בעצם מדידה של המודל של מישהו אחר — ואין בכך ערך שיווקי.
- נתוני איכות כנים קשה לתלות על שלט חוצות. ציון בודד הוא רועש. התפלגות שימושית יותר אך קשה יותר לדחיסה.
מגמה של ששת החודשים האחרוניםשימושית עוד יותר, וקשה עוד יותר. - הרכש עדיין לא התנגד. הקונים מקבלים את המספרים השיווקיים כפשוטם, ולכן שיווי המשקל נשמר.
שיווי המשקל הזה לא יחזיק מעמד. הדור הבא של הקונים — פארמה, משפט, פיננסים, ביקורת, המגזר הציבורי — הולך לשאול שאלות קשות יותר מ"כמה שפות". בנינו את /benchmark כי אנחנו סבורים שהם לא צריכים להסתמך על המילה של הספק.
מה שהמספרים השיווקיים לא מספרים לכם
"200+ שפות" פירושו שלספק יש מודל שמפיק טקסט ב-200 שפות. האיכות בין השפות האלה נעה מרמת ייצור עבור צמדים מרכזיים (EN↔DE, EN↔ES, EN↔FR) ועד שימושיות גבולית עבור צמדים דלי-משאבים. בלי פירוט לפי צמד שפות, אי אפשר לדעת באיזה צד של הקו תנחת הפגישה שלכם.
"6,000+ צמדי שפות" הוא קומבינטוריקה של N × N על 80 שפות מקור. לומר שאתם תומכים ב-6,000 צמדים זו החלק הקל. לומר שצמד מסוים טוב מספיק לסקירת CAPA, למשא ומתן על חוזה או לשיחת דוחות רבעוניים — זה החלק שאינו בחוברת.
"דיוק של 99%", בלי לציין מה נמדד, ביחס לאיזה ייחוס, על איזה מדגם, ובידי איזה שופט — הוא נטול תוכן. לאיכות תרגום אין סקלר אוניברסלי. יש לה התפלגות שתלויה בצמד השפות, בתחום התוכן, באיכות האודיו (בקול), בתקציב ההשהיה, ובמשמעות של "טוב מספיק" עבור מקרה השימוש הספציפי.