تتحول المذكرة الصوتية في قناة InterMIND إلى رسالة نصية يقرؤها كل فرد في الفريق بلغته الخاصة. الخطوة الأولى في ذلك هي تحويل الكلام إلى نص، والسؤال الذي نتلقاه من مراجعي تقنية المعلومات والامتثال ليس "ما مدى دقته" بل "لمن هذه الخدمة، وإلى أين تذهب الملفات الصوتية".
Azure AI Speech مقابل Google Chirp 3 مقابل Amazon Transcribe على 153 مذكرة صوتية: لماذا تُشغّل InterMIND تحويل الكلام إلى نص على بوابة السحابة الخاصة بمؤسستك (2026)
الإجابة المختصرة: Azure AI Speech، خدمة الكلام الخاصة ببوابة الذكاء الاصطناعي الافتراضية، ضمن مستأجر Azure الخاص بـ InterMIND في Sweden Central — إضافة إلى خدمات الكلام الخاصة بالبوابتين الأخريين اللتين يمكن للمؤسسة اختيارهما، تم قياسها على المقاطع ذاتها بحيث يصبح الاختيار رقمًا لا تفضيلًا. يعرض هذا المقال الأرقام وراء ذلك الاختيار — المقاطع الـ153 نفسها عبر Azure AI Speech وGoogle Cloud Speech-to-Text وAmazon Transcribe في اليوم ذاته — والحقيقتين المتعلقتين بكل واجهة برمجة تطبيقات (API) واللتين تهمّان أكثر من نقطة دقة مئوية واحدة.
القاعدة أولًا: بوابة واحدة لكل مؤسسة
تعمل كل ميزة ذكاء اصطناعي في InterMIND — ملخصات الاجتماعات، وملخصات المستندات، ومساعد الكتابة، وAsk AI، وMia أثناء الاجتماع — على بوابة نموذج لغوي واحدة تختارها المؤسسة: Azure OpenAI في منطقة بيانات الاتحاد الأوروبي (EU Data Zone) بشكل افتراضي، أو Google Vertex AI على نقطة النهاية متعددة المناطق للاتحاد الأوروبي، أو Amazon Bedrock في فرانكفورت حسب الاختيار، وكل منها ضمن مستأجر InterMIND الخاص. لقد شرحنا هذا المنطق في الذكاء الاصطناعي للاجتماعات على بوابة السحابة الخاصة بك: بالنسبة لمعظم المؤسسات، تكون تلك البوابة مدرجة بالفعل في قائمة الجهات الفرعية المعتمدة لمعالجة البيانات، لذا فإن أي ميزة ذكاء اصطناعي لا تضيف شركة جديدة إلى القائمة.
يتبع تحويل الكلام إلى نص الخاص بالمذكرات الصوتية القاعدة نفسها على البوابة الافتراضية اليوم، ولكل بوابة من البوابات الثلاث خدمة كلام إلى جانب نماذجها اللغوية — وهذا ما يقيسه هذا المقال:
| البوابة | خدمة الكلام | المنطقة المستخدمة في هذا الاختبار | كيف تتعامل واجهة برمجة التطبيقات مع التسجيل |
|---|---|---|---|
| Azure OpenAI (مايكروسوفت) | Azure AI Speech، واجهة النسخ السريع (fast transcription API) | Sweden Central | طلب واحد لملف يصل إلى 5 ساعات و500 ميغابايت (وثائق النسخ السريع، تم التحقق في سبتمبر 2026) |
| Google Vertex AI (جوجل كلاود) | Cloud Speech-to-Text v2، نموذج Chirp 3 | منطقة eu متعددة المناطق | يقتصر التعرف المتزامن على 60 ثانية و10 ميغابايت؛ الملفات الصوتية الأطول تمر عبر التعرف بالدفعات أو التعرف المتدفق (حدود التعرف المتزامن، Chirp 3، تم التحقق في سبتمبر 2026) |
| Amazon Bedrock (AWS) | Amazon Transcribe، البث المتدفق | eu-central-1 (فرانكفورت) | جلسة بث متدفق عبر HTTP/2 أو WebSocket؛ صيغ الإدخال المدعومة هي PCM أو FLAC أو Ogg-Opus (وثائق البث المتدفق، تم التحقق في سبتمبر 2026) |
يُبلَّغ نظام التعرف بلغة المتحدث نفسها في كل الحالات — وهي اللغة التي حددها العضو في ملفه الشخصي — لأن التعرف التلقائي على اللغة أثبت عدم موثوقيته على المقاطع القصيرة في اختباراتنا: مذكرة روسية مدتها أربع ثوانٍ عادت بالإنجليزية. هذه هي الطريقة التي يستدعي بها المنتج Azure اليوم، وبها استدعى الاختبار الخدمتين الأخريين أيضًا.