Azure AI Speech מול Google Chirp 3 מול Amazon Transcribe על 153 הודעות קוליות: למה InterMIND מריץ המרת דיבור לטקסט על שער הענן של הארגון שלכם (2026)

מדדנו את שירותי המרת הדיבור לטקסט של שלושת שערי הענן שארגון InterMIND יכול לבחור — Azure AI Speech, ‏Google Cloud Speech-to-Text (Chirp 3) ו-Amazon Transcribe — על אותם 153 קטעי הודעות קוליות ב-17 שפות, באותה סביבת בדיקה ובאותו יום. שיעורי שגיאות מילים לפי שפה, שיטת המדידה, המגבלות של כל API, והסיבה שמנוע הזיהוי נגזר מהשער ולא מטבלת הדירוג.

The Mind.com Team

Azure AI Speech מול Google Chirp 3 מול Amazon Transcribe על 153 הודעות קוליות: למה InterMIND מריץ המרת דיבור לטקסט על שער הענן של הארגון שלכם (2026)

Azure AI Speech מול Google Chirp 3 מול Amazon Transcribe על 153 הודעות קוליות: מדוע InterMIND מפעילה זיהוי דיבור (speech-to-text) בשער הענן הייעודי של הארגון שלכם (2026)

הודעה קולית בערוץ של InterMIND הופכת להודעת טקסט שכל חברי הצוות קוראים בשפה שלהם. השלב הראשון בדרך לשם הוא זיהוי דיבור. השאלה שאנו מקבלים מבודקי IT וציות אינה "מה רמת הדיוק", אלא "של מי השירות, ולאן האודיו הולך".

התשובה הקצרה: Azure AI Speech, שירות הדיבור של שער ה-AI המוגדר כברירת מחדל, בדייר (tenant) Azure הייעודי של InterMIND בשוודיה מרכז (Sweden Central). לצידו בדקנו את שירותי הדיבור של שני השערים האחרים שארגון יכול לבחור, על אותם קליפים, כך שהבחירה מבוססת על מספר ולא על העדפה. הפוסט מציג את המספרים שמאחורי הבחירה: אותם 153 קליפים דרך Azure AI Speech, Google Cloud Speech-to-Text ו-Amazon Transcribe באותו יום. הוא מציג גם שתי עובדות על כל API שחשובות יותר מנקודת אחוז של דיוק.

הכלל קודם: שער אחד לכל ארגון

כל יכולת AI ב-InterMIND, ובהן סיכומי פגישות, סיכומי מסמכים, עוזר הכתיבה, Ask AI ו-Mia בפגישה, פועלת על שער אחד של מודל שפה שהארגון בוחר. ברירת המחדל היא Azure OpenAI ב-EU Data Zone. לחלופין אפשר לבחור ב-Google Vertex AI בנקודת הקצה הרב-אזורית של האיחוד האירופי או ב-Amazon Bedrock בפרנקפורט, וכל אחד מהם בדייר הייעודי של InterMIND. הסברנו את ההיגיון בפוסט בינה מלאכותית בפגישות על שער הענן שלכם: ברוב הארגונים השער הזה כבר נמצא ברשימת מעבדי המשנה המאושרים, ולכן יכולת AI אינה מוסיפה חברה חדשה לרשימה.

זיהוי דיבור להודעות קוליות פועל היום לפי אותו כלל בשער ברירת המחדל. לכל אחד משלושת השערים יש שירות דיבור לצד מודלי השפה שלו, וזה מה שהפוסט הזה מודד:

שערשירות דיבוראזור ששימש בבדיקהכיצד ה-API מקבל הקלטה
Azure OpenAI (Microsoft)Azure AI Speech, fast transcription APISweden Centralבקשה אחת לקובץ של עד 5 שעות ו-500 MB (תיעוד fast transcription, נבדק בספטמבר 2026)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, מודל Chirp 3אזור רב-אזורי euזיהוי סינכרוני מוגבל ל-60 שניות ול-10 MB; אודיו ארוך יותר עובר זיהוי אצווה (batch) או סטרימינג (מגבלות סינכרוני, Chirp 3, נבדק בספטמבר 2026)
Amazon Bedrock (AWS)Amazon Transcribe, סטרימינגeu-central-1 (פרנקפורט)סשן סטרימינג מעל HTTP/2 או WebSocket; הקלט הוא PCM, FLAC או Ogg-Opus (תיעוד סטרימינג, נבדק בספטמבר 2026)

בכל המקרים מזהה הדיבור מקבל את שפת הדובר, השפה שחבר הגדיר בפרופיל שלו. בבדיקות שלנו זיהוי שפה אוטומטי התגלה כבלתי אמין בקליפים קצרים: הודעה קצרה ברוסית, בת ארבע שניות, חזרה כאנגלית. כך המוצר קורא ל-Azure כיום, וכך קראנו בבדיקה גם לשניים האחרים.

מה מדדנו

הסט. 153 קליפים ב-17 שפות. 136 מהם תורות דיאלוג: שני דיאלוגים עסקיים (משא ומתן על חוזה ופגישת סטנד-אפ יומית) שנאמרו בידי שני הקולות הסינתטיים של המוצר בעשר שפות. בנוסף 17 קטעים רשמיים, משפטי העסקים של FLORES-200 מתוך מבחן התרגום הציבורי שלנו, בהקראת קול סינתטי, אחד לכל שפה ובאורך 71 עד 109 שניות. תורות הדיאלוג נעות בין 3 ל-30 שניות, כאורכה של הודעה קולית אמיתית.

המדד. שיעור שגיאות מילים (WER) ביחס לטקסט הייחוס, כלומר חלק המילים שהוחלפו, הוכנסו או נמחקו, לאחר נרמול אותיות רישיות, פיסוק ורווחים. סינית ויפנית הושוו לפי תו. שיעור שגיאות התווים נרשם גם הוא ומספר את אותו סיפור.

הסביבה. סקריפט אחד, מכונה אחת, שעה אחת ב-2026-09-16, וכל מנוע עבר על כל 153 הקליפים. Azure ו-Amazon Transcribe קיבלו כל קליפ בשלמותו. המזהה הסינכרוני של Google מקבל עד 60 שניות, ולכן 17 הקליפים הרשמיים נחתכו בשתיקות לחלקים של פחות מ-55 שניות והתמלולים חוברו, ואילו 136 קליפי הדיאלוג נשלחו בשלמותם. Amazon Transcribe מצפה לאודיו בקצב בזמן אמת, ולכן הסביבה הזינה אותו מהר פי ארבעה מזמן אמת. נתון ההשהיה שלו בהמשך הוא לכן רצפה שנקבעת לפי ההזנה, ולא לפי השירות.

מה זה לא. קולות סינתטיים באודיו שקט, לא הקלטות שטח מטלפון ברכב. יום אחד, הרצה אחת לכל קליפ. זו השוואה על האודיו שעליו נבדק צינור התרגום שלנו, בשפות שבהן המשתמשים שלנו כותבים, ולא טבלת דירוג.

תוצאות: שיעור שגיאות מילים לפי שפה

ממוצע WER על הקליפים של כל שפה. כל מנוע החזיר תמלול לכל 153 הקליפים.

שפהקליפיםAzure AI SpeechGoogle Chirp 3Amazon Transcribe
ערבית1332%46%26%
סינית133%3%8%
צ'כית11%2%3%
הולנדית12%2%3%
אנגלית212%5%2%
צרפתית135%11%12%
גרמנית137%9%13%
הינדי1310%10%12%
הונגרית19%7%8%
איטלקית11%1%3%
יפנית136%5%5%
קוריאנית19%11%11%
פולנית11%1%2%
פורטוגזית (ברזיל)135%4%6%
רוסית2114%10%14%
ספרדית136%5%6%
טורקית14%3%4%
כל 153 הקליפים1539%10%10%
תורות דיאלוג בלבד1369%11%10%
קטעים רשמיים בלבד174%5%5%
זמן עיבוד ÷ אורך האודיו0.100.220.41 (מוגבל על ידי ההזנה)

שפות עם קליפ בודד (הקטע הרשמי בלבד) מוצגות לשם שלמות. נתון של קליפ אחד הוא נקודת מידע, לא שיעור.

מה המספרים אומרים

  • על הסט כולו שלושת השירותים נמצאים בטווח של נקודה אחת זה מזה: 9%, 10% ו-10%. כל אחד מ-153 הקליפים חזר עם תמלול מכל מנוע, כך שהכיסוי של 17 השפות מלא בשלושתם.
  • ההבדלים הם לפי שפה, ולשני הכיוונים. ל-Azure היה שיעור השגיאות הנמוך ביותר בצרפתית (5% לעומת 11% ו-12%) ובגרמנית (7% לעומת 9% ו-13%), והוא שיתף את המקום הנמוך ביותר באנגלית (2%, עם Amazon Transcribe) ובסינית (3%, עם Google). ל-Amazon Transcribe היה השיעור הנמוך ביותר בערבית (26% לעומת 32% ו-46%). ל-Google היה השיעור הנמוך ביותר ברוסית (10% לעומת 14% ו-14%), בפורטוגזית, בהונגרית ובטורקית.
  • ערבית קשה לשלושתם. התוצאה הטובה ביותר בקליפי הדיאלוג בערבית היא מילה אחת מתוך ארבע שגויה. זה עולה בקנה אחד עם מה שראינו בצד התרגום, שם הסרנו את הערבית מבורר שפות הפגישה באוגוסט 2026 עד שהאיכות תעמוד ברף שלנו (כמה שפות אנחנו תומכים).
  • זמן העיבוד נמוך בהרבה מזמן אמת בשלושתם. הודעה בת 30 שניות אורכת כשלוש שניות ב-Azure וכשבע ב-Google בסביבה הזו. נתון Amazon נשלט על ידי ההזנה בקצב מבוקר.

מדוע Azure AI Speech נשאר ברירת המחדל

שלוש סיבות, לפי הסדר שהכריע.

1. שער ברירת המחדל הוא Azure. ארגון שלא בחר שער מפעיל את יכולות ה-AI שלו על Azure OpenAI ב-EU Data Zone, ולכן ההודעות הקוליות שלו מתומללות על ידי Azure AI Speech באותו דייר. אין מעבד משנה נוסף ואין אזור נוסף. Microsoft מצהירה ש-Azure Speech אינו מאחסן או מעבד נתונים מחוץ לאזור של משאב ה-Speech (דף האזורים, נבדק בספטמבר 2026). המשאב שלנו נמצא ב-Sweden Central, שמופיע ברשימת האזורים של fast transcription.

2. צורת ה-API מתאימה להודעה קולית. הודעה קולית ב-InterMIND יכולה להימשך עד עשר דקות (הודעות קוליות). ה-fast transcription של Azure מקבל את ההקלטה כולה בבקשה אחת. הזיהוי הסינכרוני של Google נעצר ב-60 שניות, ולכן הודעה בת עשר דקות מצריכה זיהוי אצווה דרך דלי אחסון או סשן סטרימינג. Amazon Transcribe עובד בסטרימינג, אבל מקבל PCM, FLAC או Ogg-Opus ולא את הפורמטים שבהם טלפונים ודפדפנים מקליטים, ולכן האודיו עובר קודם המרה. אפשר לפתור את שני המקרים, והסביבה שלנו פותרת אותם, אבל אלה עוד חלקים נעים בנתיב של כל הודעה.

3. המספרים לא מדברים נגד. ב-9% לעומת 10% ו-10%, אף מנוע בסט הזה אינו טוב מספיק כדי להצדיק הוצאת הודעות קוליות משער ברירת המחדל. אילו Google או Amazon היו מגיעים לחצי משיעור השגיאות, הפוסט הזה היה אומר זאת.

מה המשמעות לארגונים ב-Vertex AI או ב-Bedrock

אם הארגון שלכם בחר ב-Google Vertex AI או ב-Amazon Bedrock כשער, יכולות ה-AI שלכם פועלות שם. הודעות קוליות בארגונים כאלה מגיעות כרגע כהקלטה בלי תמלול: מדדנו את Google Cloud Speech-to-Text ואת Amazon Transcribe, כפי שהפוסט מראה, אך עדיין לא חיברנו אותם למוצר. ההרשאות וקוד האינטגרציה קיימים, והפוסט יעודכן כשהם יהיו בנתיב של כל הודעה. עד אז, הודעה קולית בארגון על Vertex AI או Bedrock היא הקלטה שניתן להשמיע. ארגון שמעביר את השער שלו ל-Azure מקבל תמלולים להודעות שנשלחות מאותו רגע ואילך.

שאלות נפוצות

באיזה שירות זיהוי דיבור InterMIND משתמשת?

להודעות קוליות בצ'אט: Azure AI Speech (fast transcription API) בדייר Azure הייעודי של InterMIND ב-Sweden Central, שירות הדיבור של שער ה-AI המוגדר כברירת מחדל. דיבור חי בפגישות הוא נתיב אחר: הוא פועל על מנוע המדיה של InterMIND עצמה, ה-Mind API, המתארח ב-OVH בצרפת, ואינו נוגע אף פעם בשירות דיבור בענן (היכן פגישה אחת רצה).

האם Azure AI Speech מדויק יותר מ-Google Speech-to-Text או מ-Amazon Transcribe?

בסט שלנו, 153 קליפים של הודעות קוליות ב-17 שפות, שנמדדו באותו יום באותה סביבה, ל-Azure AI Speech היה שיעור שגיאות מילים ממוצע של 9%, ל-Google Cloud Speech-to-Text (Chirp 3) 10% ול-Amazon Transcribe 10%. לפי שפה הסדר משתנה: Azure היה הנמוך ביותר בצרפתית, באנגלית ובסינית, Amazon Transcribe בערבית, ו-Google ברוסית. על סט הקלטות אחר הדירוג יכול להיות שונה. הטבלה שלמעלה היא הראיה לסט שלנו.

מהו שיעור שגיאות מילים, ואיך חושב כאן?

שיעור שגיאות מילים הוא מספר המילים שהוחלפו, הוכנסו ונמחקו, חלקי מספר המילים בטקסט הייחוס. לפני ההשוואה אנו מנרמלים אותיות רישיות, פיסוק ורווחים, ומשווים סינית ויפנית לפי תו, כי הכתב בשפות אלה אינו מפריד מילים ברווחים. שיעור של 9% פירושו שבערך מילה אחת מתוך אחת-עשרה שונה מהייחוס.

האם האודיו של הודעה קולית יוצא מהאיחוד האירופי?

לא. ההקלטה נשמרת באחסון האובייקטים של InterMIND באיחוד האירופי, ושירות הדיבור שמתמלל אותה פועל באזור באיחוד האירופי: Sweden Central ב-Azure, האזור הרב-אזורי eu ב-Google Cloud, פרנקפורט ב-AWS. הרשימה המלאה של הגורמים והאזורים נמצאת בדף מעבדי המשנה ובדף האמון.

למה לא לזהות דיבור בצד הלקוח, באפליקציה, כך שהאודיו לא יעזוב את הטלפון?

מדדנו גם את זה, בספטמבר 2026. מזהה הדיבור המובנה של Chrome בעיבוד מקומי זיהה 0 מתוך 17 קליפים רשמיים בשפות המוצר, וכיסוי השפות של מזהי צד לקוח צר בהרבה מ-17 השפות שבטבלה למעלה. זיהוי בצד הלקוח הוא כיוון שנמדוד מחדש ככל שהפלטפורמות ישתפרו. היום נתיב השער הוא זה שעובד לכל חבר בכל שפה.

האם הארגון שלנו יכול לבחור איזה שירות דיבור מתמלל את ההודעות הקוליות שלו?

לא בנפרד: שער ה-AI הוא מה שמנהל הארגון בוחר בדף האינטגרציות. בשער ברירת המחדל הודעות קוליות מתומללות על ידי Azure AI Speech. ב-Vertex AI וב-Amazon Bedrock הודעות קוליות עדיין אינן מתומללות, ראו את הסעיף שלמעלה.

עד כמה ארוכה יכולה להיות הודעה קולית, והאם ה-API מגביל אותה?

עד עשר דקות. ה-fast transcription של Azure מקבל קבצים של עד 5 שעות ו-500 MB בבקשה אחת, ולכן הודעה מתומללת בקריאה אחת. הזיהוי הסינכרוני של Google מקבל 60 שניות ו-10 MB, ולכן הסביבה חתכה את הקליפים הארוכים לחלקים בשתיקות.

מדוע מזהה הדיבור מקבל את שפת הדובר במקום לזהות אותה?

כי הודעה קולית קצרה. בקליפ של ארבע שניות זיהוי שפה אוטומטי עלול להחזיר שפה שגויה: הודעת בדיקה ברוסית חזרה כאנגלית, ושפת הפרופיל של החבר נכונה כמעט תמיד. מזהה הדיבור מקבל את השפה הזו, ורק כשהיא אינה ידועה הוא מקבל את שפות החדר כמועמדות.

האם אודיו של פגישה מתומלל על ידי אותו שירות?

לא. דיבור חי בפגישה מזוהה ומתורגם על המנוע של InterMIND עצמה (ה-Mind API) בשרת המדיה שנושא את השיחה, המתארח ב-OVH בצרפת, ראו היכן פגישה אחת רצה. שער הענן רואה טקסט, אף פעם לא את האודיו של שיחה (בינה מלאכותית בפגישות על השער שלכם).

האם תפרסמו את התוצאות שוב?

הסביבה רצה בפקודה אחת וההרשאות של כל מנוע כבר במקומן, ולכן אפשר למדוד את הטבלה מחדש כשספק משחרר מודל חדש. כשזה ישנה את התמונה, הפוסט יעודכן עם התאריך.


ראו בעצמכם


מקורות: Microsoft — Azure AI Speech fast transcription (learn.microsoft.com) וטבלת אזורי Speech (learn.microsoft.com); Google Cloud — מודל Chirp 3 (docs.cloud.google.com), מגבלות זיהוי סינכרוני (docs.cloud.google.com) ושפות נתמכות (docs.cloud.google.com); AWS — סטרימינג של Amazon Transcribe (docs.aws.amazon.com), נקודות קצה ומכסות (docs.aws.amazon.com) ושפות נתמכות (docs.aws.amazon.com); הכול נבדק בספטמבר 2026. מדידה: InterMIND speech bench, 2026-09-16, 153 קליפים, 17 שפות.

עוד בIT ומנהלי מערכת

כל הפוסטים בIT ומנהלי מערכת
איך לראות מי משתמש בדקות התרגום ובנפח האחסון שלכם — ולקבל אימייל לפני שמגיעים למגבלה (2026)
IT ומנהלי מערכת

איך לראות מי משתמש בדקות התרגום ובנפח האחסון שלכם — ולקבל אימייל לפני שמגיעים למגבלה (2026)

כל מכסה ב-InterMIND נמדדת לפי מארח הפגישה: דקות של תרגום קולי ב-meetings שיצרתם, מילים של תרגום צ'אט עבור המשתתפים שלכם, מסמכים שתורגמו והאחסון המשותף של הצוות. עמוד החיוב (Billing) מציג כל מונה בחלון נע של 30 יום, ונשלח אימייל כשאתם מתקרבים למגבלת האחסון או כשמגיעים לראשונה למגבלת דקות התרגום. מה כל מונה סופר, מה קורה כשמגיעים למגבלה — ה-meeting נמשך והתרגום מושהה — וכיצד חלון 30 הימים מתמלא מחדש מעצמו.

The Mind.com Team

AI לפגישות על שער הענן שלכם: כיצד סיכומים, תקצירים והעוזר בתוך הפגישה נשארים בתוך הגבולות של Azure, Google או AWS שלכם
IT ומנהלי מערכת

AI לפגישות על שער הענן שלכם: כיצד סיכומים, תקצירים והעוזר בתוך הפגישה נשארים בתוך הגבולות של Azure, Google או AWS שלכם

כל כלי פגישות כולל כיום AI, וכל יכולת AI מוסיפה ספק משנה לעיבוד נתונים. כך InterMIND מפעילה את יכולות ה-AI שלה על שער ה-hyperscaler שהארגון שלכם כבר משתמש בו — Azure OpenAI ב-EU Data Zone, Google Vertex AI באיחוד האירופי, Amazon Bedrock בחשבון ה-AWS שלכם — עם מתג כיבוי נפרד לכל ארגון, ומה שצוותי הרכש יכולים לאמת.

The Mind.com Team

האם הפגישה שלך סודית?
IT ומנהלי מערכת

האם הפגישה שלך סודית?

בפגישות אתם אומרים דברים שלעולם לא הייתם מעלים על הכתב, ואז הפגישה עוברת דרך ענני אחסון, מודלים ומדיניות שמירת נתונים שמעולם לא קראתם. שלוש שאלות קונקרטיות שהופכות את המילה "סודי" ממילה בעמוד הבית למשהו שאפשר לבדוק, והתשובות שלנו לכל אחת מהן.

The Mind.com Team

קבלו פוסטים חדשים ועדכוני מוצר בדוא"ל

אימייל אחד בחודש עם פוסטים חדשים ועדכוני מוצר. אפשר לבטל את ההרשמה בכל עת.


משלמים רק על מי שמשתמש: InterMIND עוברת לחיוב לפי חברים פעילים

בתוכניות Pro ו-Business כבר לא מוכרים מושבים שמקצים ידנית. מזמינים את כל הצוות; בכל חידוש נספרים החברים שהיו פעילים ב-28 הימים הקודמים, והחיוב הוא רק עבורם. חבר שהפסיק להשתמש שומר על הגישה שלו ולא עולה דבר; אורחים ב-meetings ומשתתפים חיצוניים בערוצים נשארים בחינם. מה נחשב פעיל, איך המספר משתנה במהלך מחזור חיוב, מה כתוב במכתב שלפני החידוש, ומה משתנה בעמוד החיוב שלכם.

עוזר AI לפגישות שפועל במהלך הפגישה: מה עושים Teams Facilitator, Zoom AI Companion, Google Meet Gemini ו-Mia של InterMIND בחדר (2026)

רושם הערות AI כותב אחרי השיחה. עוזר AI לפגישות עובד במהלכה: מזכיר לחדר מה הוחלט בפעם הקודמת, מתעד התחייבות ברגע שנאמרה, קובע את הפגישה הבאה כשהמארח מבקש, ומציע את הצעד הבא לפני הסיום. כך זה נראה ב-Microsoft Teams (Facilitator), ב-Zoom (AI Companion, ZoomMate), ב-Google Meet (Ask Gemini, next steps) וב-InterMIND (Mia), על פי התיעוד של כל ספק, יחד עם מדריך להנחיית פגישה עם משתתף AI.