Azure AI Speech מול Google Chirp 3 מול Amazon Transcribe על 153 הודעות קוליות: מדוע InterMIND מפעילה זיהוי דיבור (speech-to-text) בשער הענן הייעודי של הארגון שלכם (2026)
הודעה קולית בערוץ של InterMIND הופכת להודעת טקסט שכל חברי הצוות קוראים בשפה שלהם. השלב הראשון בדרך לשם הוא זיהוי דיבור. השאלה שאנו מקבלים מבודקי IT וציות אינה "מה רמת הדיוק", אלא "של מי השירות, ולאן האודיו הולך".
התשובה הקצרה: Azure AI Speech, שירות הדיבור של שער ה-AI המוגדר כברירת מחדל, בדייר (tenant) Azure הייעודי של InterMIND בשוודיה מרכז (Sweden Central). לצידו בדקנו את שירותי הדיבור של שני השערים האחרים שארגון יכול לבחור, על אותם קליפים, כך שהבחירה מבוססת על מספר ולא על העדפה. הפוסט מציג את המספרים שמאחורי הבחירה: אותם 153 קליפים דרך Azure AI Speech, Google Cloud Speech-to-Text ו-Amazon Transcribe באותו יום. הוא מציג גם שתי עובדות על כל API שחשובות יותר מנקודת אחוז של דיוק.
הכלל קודם: שער אחד לכל ארגון
כל יכולת AI ב-InterMIND, ובהן סיכומי פגישות, סיכומי מסמכים, עוזר הכתיבה, Ask AI ו-Mia בפגישה, פועלת על שער אחד של מודל שפה שהארגון בוחר. ברירת המחדל היא Azure OpenAI ב-EU Data Zone. לחלופין אפשר לבחור ב-Google Vertex AI בנקודת הקצה הרב-אזורית של האיחוד האירופי או ב-Amazon Bedrock בפרנקפורט, וכל אחד מהם בדייר הייעודי של InterMIND. הסברנו את ההיגיון בפוסט בינה מלאכותית בפגישות על שער הענן שלכם: ברוב הארגונים השער הזה כבר נמצא ברשימת מעבדי המשנה המאושרים, ולכן יכולת AI אינה מוסיפה חברה חדשה לרשימה.
זיהוי דיבור להודעות קוליות פועל היום לפי אותו כלל בשער ברירת המחדל. לכל אחד משלושת השערים יש שירות דיבור לצד מודלי השפה שלו, וזה מה שהפוסט הזה מודד:
| שער | שירות דיבור | אזור ששימש בבדיקה | כיצד ה-API מקבל הקלטה |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | Sweden Central | בקשה אחת לקובץ של עד 5 שעות ו-500 MB (תיעוד fast transcription, נבדק בספטמבר 2026) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, מודל Chirp 3 | אזור רב-אזורי eu | זיהוי סינכרוני מוגבל ל-60 שניות ול-10 MB; אודיו ארוך יותר עובר זיהוי אצווה (batch) או סטרימינג (מגבלות סינכרוני, Chirp 3, נבדק בספטמבר 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe, סטרימינג | eu-central-1 (פרנקפורט) | סשן סטרימינג מעל HTTP/2 או WebSocket; הקלט הוא PCM, FLAC או Ogg-Opus (תיעוד סטרימינג, נבדק בספטמבר 2026) |
בכל המקרים מזהה הדיבור מקבל את שפת הדובר, השפה שחבר הגדיר בפרופיל שלו. בבדיקות שלנו זיהוי שפה אוטומטי התגלה כבלתי אמין בקליפים קצרים: הודעה קצרה ברוסית, בת ארבע שניות, חזרה כאנגלית. כך המוצר קורא ל-Azure כיום, וכך קראנו בבדיקה גם לשניים האחרים.