[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"blog-post-ar-\u002Fspeech-to-text-on-your-own-gateway":3},{"page":4,"surround":820},{"id":5,"title":6,"authors":7,"badge":10,"body":11,"date":804,"demo-cta":805,"description":806,"extension":807,"genre":808,"heroOrder":809,"icp":810,"image":813,"meta":814,"navigation":815,"no-translate":805,"path":816,"rank-country":809,"rank-keywords":809,"rank-tag":809,"seo":817,"stem":818,"updated":809,"video":815,"__hash__":819},"blog_ar\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.md","Azure AI Speech مقابل Google Chirp 3 مقابل Amazon Transcribe على 153 ملاحظة صوتية: لماذا يشغّل InterMIND تحويل الكلام إلى نص عبر بوابة المؤسسة السحابية الخاصة بك (2026)",[8],{"name":9},"The Mind.com Team","Architecture",{"type":12,"value":13,"toc":791},"minimark",[14,18,23,26,31,40,43,149,152,156,167,173,179,185,189,192,522,525,529,562,566,569,581,592,598,602,605,609,614,621,626,629,634,637,642,658,663,666,671,674,679,682,687,690,695,704,709,712,715,719,746,748],[15,16,17],"p",{},"تتحول المذكرة الصوتية في قناة InterMIND إلى رسالة نصية يقرؤها كل فرد في الفريق بلغته الخاصة. الخطوة الأولى في ذلك هي تحويل الكلام إلى نص، والسؤال الذي نتلقاه من مراجعي تقنية المعلومات والامتثال ليس \"ما مدى دقته\" بل \"لمن هذه الخدمة، وإلى أين تذهب الملفات الصوتية\".",[19,20,22],"h1",{"id":21},"azure-ai-speech-مقابل-google-chirp-3-مقابل-amazon-transcribe-على-153-مذكرة-صوتية-لماذا-تُشغّل-intermind-تحويل-الكلام-إلى-نص-على-بوابة-السحابة-الخاصة-بمؤسستك-2026","Azure AI Speech مقابل Google Chirp 3 مقابل Amazon Transcribe على 153 مذكرة صوتية: لماذا تُشغّل InterMIND تحويل الكلام إلى نص على بوابة السحابة الخاصة بمؤسستك (2026)",[15,24,25],{},"الإجابة المختصرة: Azure AI Speech، خدمة الكلام الخاصة ببوابة الذكاء الاصطناعي الافتراضية، ضمن مستأجر Azure الخاص بـ InterMIND في Sweden Central — إضافة إلى خدمات الكلام الخاصة بالبوابتين الأخريين اللتين يمكن للمؤسسة اختيارهما، تم قياسها على المقاطع ذاتها بحيث يصبح الاختيار رقمًا لا تفضيلًا. يعرض هذا المقال الأرقام وراء ذلك الاختيار — المقاطع الـ153 نفسها عبر Azure AI Speech وGoogle Cloud Speech-to-Text وAmazon Transcribe في اليوم ذاته — والحقيقتين المتعلقتين بكل واجهة برمجة تطبيقات (API) واللتين تهمّان أكثر من نقطة دقة مئوية واحدة.",[27,28,30],"h2",{"id":29},"القاعدة-أولًا-بوابة-واحدة-لكل-مؤسسة","القاعدة أولًا: بوابة واحدة لكل مؤسسة",[15,32,33,34,39],{},"تعمل كل ميزة ذكاء اصطناعي في InterMIND — ملخصات الاجتماعات، وملخصات المستندات، ومساعد الكتابة، وAsk AI، وMia أثناء الاجتماع — على بوابة نموذج لغوي واحدة تختارها المؤسسة: Azure OpenAI في منطقة بيانات الاتحاد الأوروبي (EU Data Zone) بشكل افتراضي، أو Google Vertex AI على نقطة النهاية متعددة المناطق للاتحاد الأوروبي، أو Amazon Bedrock في فرانكفورت حسب الاختيار، وكل منها ضمن مستأجر InterMIND الخاص. لقد شرحنا هذا المنطق في ",[35,36,38],"a",{"href":37},"\u002Fblog\u002Fmeeting-ai-on-your-own-cloud-gateway","الذكاء الاصطناعي للاجتماعات على بوابة السحابة الخاصة بك",": بالنسبة لمعظم المؤسسات، تكون تلك البوابة مدرجة بالفعل في قائمة الجهات الفرعية المعتمدة لمعالجة البيانات، لذا فإن أي ميزة ذكاء اصطناعي لا تضيف شركة جديدة إلى القائمة.",[15,41,42],{},"يتبع تحويل الكلام إلى نص الخاص بالمذكرات الصوتية القاعدة نفسها على البوابة الافتراضية اليوم، ولكل بوابة من البوابات الثلاث خدمة كلام إلى جانب نماذجها اللغوية — وهذا ما يقيسه هذا المقال:",[44,45,46,65],"table",{},[47,48,49],"thead",{},[50,51,52,56,59,62],"tr",{},[53,54,55],"th",{},"البوابة",[53,57,58],{},"خدمة الكلام",[53,60,61],{},"المنطقة المستخدمة في هذا الاختبار",[53,63,64],{},"كيف تتعامل واجهة برمجة التطبيقات مع التسجيل",[66,67,68,94,127],"tbody",{},[50,69,70,78,81,84],{},[71,72,73,77],"td",{},[74,75,76],"strong",{},"Azure OpenAI"," (مايكروسوفت)",[71,79,80],{},"Azure AI Speech، واجهة النسخ السريع (fast transcription API)",[71,82,83],{},"Sweden Central",[71,85,86,87,93],{},"طلب واحد لملف يصل إلى 5 ساعات و500 ميغابايت (",[35,88,92],{"href":89,"rel":90},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Ffast-transcription-create",[91],"nofollow","وثائق النسخ السريع","، تم التحقق في سبتمبر 2026)",[50,95,96,102,105,113],{},[71,97,98,101],{},[74,99,100],{},"Google Vertex AI"," (جوجل كلاود)",[71,103,104],{},"Cloud Speech-to-Text v2، نموذج Chirp 3",[71,106,107,108,112],{},"منطقة ",[109,110,111],"code",{},"eu"," متعددة المناطق",[71,114,115,116,121,122,93],{},"يقتصر التعرف المتزامن على 60 ثانية و10 ميغابايت؛ الملفات الصوتية الأطول تمر عبر التعرف بالدفعات أو التعرف المتدفق (",[35,117,120],{"href":118,"rel":119},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fsync-recognize",[91],"حدود التعرف المتزامن","، ",[35,123,126],{"href":124,"rel":125},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fchirp_3-model",[91],"Chirp 3",[50,128,129,135,138,141],{},[71,130,131,134],{},[74,132,133],{},"Amazon Bedrock"," (AWS)",[71,136,137],{},"Amazon Transcribe، البث المتدفق",[71,139,140],{},"eu-central-1 (فرانكفورت)",[71,142,143,144,93],{},"جلسة بث متدفق عبر HTTP\u002F2 أو WebSocket؛ صيغ الإدخال المدعومة هي PCM أو FLAC أو Ogg-Opus (",[35,145,148],{"href":146,"rel":147},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fstreaming.html",[91],"وثائق البث المتدفق",[15,150,151],{},"يُبلَّغ نظام التعرف بلغة المتحدث نفسها في كل الحالات — وهي اللغة التي حددها العضو في ملفه الشخصي — لأن التعرف التلقائي على اللغة أثبت عدم موثوقيته على المقاطع القصيرة في اختباراتنا: مذكرة روسية مدتها أربع ثوانٍ عادت بالإنجليزية. هذه هي الطريقة التي يستدعي بها المنتج Azure اليوم، وبها استدعى الاختبار الخدمتين الأخريين أيضًا.",[27,153,155],{"id":154},"ما-الذي-قِسناه","ما الذي قِسناه",[15,157,158,161,162,166],{},[74,159,160],{},"المجموعة."," 153 مقطعًا بـ17 لغة: 136 دورة حوارية — حواران من سياق العمل (تفاوض على عقد واجتماع يومي قصير) نطقهما الصوتان الاصطناعيان الخاصان بالمنتج بعشر لغات — بالإضافة إلى 17 مقطعًا رسميًا، وهي جمل الأعمال من FLORES-200 الخاصة بـ",[35,163,165],{"href":164},"\u002Fbenchmark\u002Fmethodology","معيار الترجمة العام لدينا","، قرأها صوت اصطناعي واحد لكل لغة، وتتراوح مدتها بين 71 و109 ثوانٍ. تتراوح مدة الدورات الحوارية بين 3 و30 ثانية، وهي طول المذكرة الصوتية الحقيقية.",[15,168,169,172],{},[74,170,171],{},"المقياس."," معدل خطأ الكلمات (WER) مقارنة بالنص المرجعي — نسبة الكلمات المستبدلة أو المضافة أو المحذوفة — بعد توحيد حالة الأحرف وعلامات الترقيم والمسافات؛ وتُقارن اللغتان الصينية واليابانية على مستوى الحرف. سُجِّل أيضًا معدل خطأ الأحرف بالتوازي، وهو يروي القصة نفسها.",[15,174,175,178],{},[74,176,177],{},"إطار الاختبار."," سكربت واحد، وجهاز واحد، وساعة واحدة بتاريخ 2026-09-16، حيث عالج كل محرك المقاطع الـ153 كاملة. أخذت Azure وAmazon Transcribe كل مقطع كاملًا. يقتصر التعرف المتزامن من Google على 60 ثانية كحد أقصى، لذا قُطعت المقاطع الرسمية الـ17 عند لحظات الصمت إلى أجزاء أقل من 55 ثانية ثم جُمعت النصوص المفرَّغة؛ أما المقاطع الحوارية الـ136 فمُررت كاملة. تريد Amazon Transcribe صوتًا بوتيرة الزمن الفعلي، لذا غذّاه إطار الاختبار بأربعة أضعاف سرعة الزمن الفعلي؛ لذلك فإن رقم زمن الاستجابة أدناه هو حد أدنى تفرضه طريقة التغذية لا الخدمة نفسها.",[15,180,181,184],{},[74,182,183],{},"ما هذا الاختبار ليس عليه."," أصوات اصطناعية في تسجيلات هادئة، وليست تسجيلات ميدانية من هاتف داخل سيارة. يوم واحد، وتشغيل واحد لكل مقطع. إنها مقارنة على الصوت الذي تُختبر عليه خطوط أنابيب الترجمة الخاصة بنا، وباللغات التي يكتب بها مستخدمونا — وليست لائحة تصنيف.",[27,186,188],{"id":187},"النتائج-معدل-خطأ-الكلمات-لكل-لغة","النتائج: معدل خطأ الكلمات لكل لغة",[15,190,191],{},"متوسط معدل خطأ الكلمات على مقاطع كل لغة؛ أعاد كل محرك نصًا مفرَّغًا للمقاطع الـ153 جميعها.",[44,193,194,213],{},[47,195,196],{},[50,197,198,201,204,207,210],{},[53,199,200],{},"اللغة",[53,202,203],{},"المقاطع",[53,205,206],{},"Azure AI Speech",[53,208,209],{},"Google Chirp 3",[53,211,212],{},"Amazon Transcribe",[66,214,215,232,247,263,276,291,306,322,336,349,362,376,389,402,416,430,443,456,478,492,506],{},[50,216,217,220,223,226,229],{},[71,218,219],{},"العربية",[71,221,222],{},"13",[71,224,225],{},"32%",[71,227,228],{},"46%",[71,230,231],{},"26%",[50,233,234,237,239,242,244],{},[71,235,236],{},"الصينية",[71,238,222],{},[71,240,241],{},"3%",[71,243,241],{},[71,245,246],{},"8%",[50,248,249,252,255,258,261],{},[71,250,251],{},"التشيكية",[71,253,254],{},"1",[71,256,257],{},"1%",[71,259,260],{},"2%",[71,262,241],{},[50,264,265,268,270,272,274],{},[71,266,267],{},"الهولندية",[71,269,254],{},[71,271,260],{},[71,273,260],{},[71,275,241],{},[50,277,278,281,284,286,289],{},[71,279,280],{},"الإنجليزية",[71,282,283],{},"21",[71,285,260],{},[71,287,288],{},"5%",[71,290,260],{},[50,292,293,296,298,300,303],{},[71,294,295],{},"الفرنسية",[71,297,222],{},[71,299,288],{},[71,301,302],{},"11%",[71,304,305],{},"12%",[50,307,308,311,313,316,319],{},[71,309,310],{},"الألمانية",[71,312,222],{},[71,314,315],{},"7%",[71,317,318],{},"9%",[71,320,321],{},"13%",[50,323,324,327,329,332,334],{},[71,325,326],{},"الهندية",[71,328,222],{},[71,330,331],{},"10%",[71,333,331],{},[71,335,305],{},[50,337,338,341,343,345,347],{},[71,339,340],{},"الهنغارية",[71,342,254],{},[71,344,318],{},[71,346,315],{},[71,348,246],{},[50,350,351,354,356,358,360],{},[71,352,353],{},"الإيطالية",[71,355,254],{},[71,357,257],{},[71,359,257],{},[71,361,241],{},[50,363,364,367,369,372,374],{},[71,365,366],{},"اليابانية",[71,368,222],{},[71,370,371],{},"6%",[71,373,288],{},[71,375,288],{},[50,377,378,381,383,385,387],{},[71,379,380],{},"الكورية",[71,382,254],{},[71,384,318],{},[71,386,302],{},[71,388,302],{},[50,390,391,394,396,398,400],{},[71,392,393],{},"البولندية",[71,395,254],{},[71,397,257],{},[71,399,257],{},[71,401,260],{},[50,403,404,407,409,411,414],{},[71,405,406],{},"البرتغالية (البرازيل)",[71,408,222],{},[71,410,288],{},[71,412,413],{},"4%",[71,415,371],{},[50,417,418,421,423,426,428],{},[71,419,420],{},"الروسية",[71,422,283],{},[71,424,425],{},"14%",[71,427,331],{},[71,429,425],{},[50,431,432,435,437,439,441],{},[71,433,434],{},"الإسبانية",[71,436,222],{},[71,438,371],{},[71,440,288],{},[71,442,371],{},[50,444,445,448,450,452,454],{},[71,446,447],{},"التركية",[71,449,254],{},[71,451,413],{},[71,453,241],{},[71,455,413],{},[50,457,458,463,466,470,474],{},[71,459,460],{},[74,461,462],{},"جميع المقاطع الـ153",[71,464,465],{},"153",[71,467,468],{},[74,469,318],{},[71,471,472],{},[74,473,331],{},[71,475,476],{},[74,477,331],{},[50,479,480,483,486,488,490],{},[71,481,482],{},"الدورات الحوارية فقط",[71,484,485],{},"136",[71,487,318],{},[71,489,302],{},[71,491,331],{},[50,493,494,497,500,502,504],{},[71,495,496],{},"المقاطع الرسمية فقط",[71,498,499],{},"17",[71,501,413],{},[71,503,288],{},[71,505,288],{},[50,507,508,511,513,516,519],{},[71,509,510],{},"زمن المعالجة ÷ طول الصوت",[71,512],{},[71,514,515],{},"0.10",[71,517,518],{},"0.22",[71,520,521],{},"0.41 (مقيد بطريقة التغذية)",[15,523,524],{},"اللغات ذات المقطع الواحد (المقطع الرسمي فقط) معروضة للاكتمال؛ رقم مبني على مقطع واحد هو نقطة بيانات وليس معدلًا.",[27,526,528],{"id":527},"ماذا-تقول-الأرقام","ماذا تقول الأرقام",[530,531,532,539,545,556],"ul",{},[533,534,535,538],"li",{},[74,536,537],{},"على مستوى المجموعة الكاملة، تتفاوت الخدمات الثلاث بنقطة واحدة فقط بينها:"," 9% و10% و10%. عاد كل مقطع من المقاطع الـ153 بنص مفرَّغ من كل محرك — وتغطية اللغات الـ17 كاملة على المحركات الثلاثة جميعها.",[533,540,541,544],{},[74,542,543],{},"تختلف الفروق حسب اللغة، وتذهب في الاتجاهين."," سجّلت Azure أدنى معدل خطأ في الفرنسية (5% مقابل 11% و12%) والألمانية (7% مقابل 9% و13%)، وتعادلت في المركز الأول في الإنجليزية (2%، مع Amazon Transcribe) والصينية (3%، مع Google). سجّلت Amazon Transcribe أدنى معدل في العربية (26% مقابل 32% و46%). وسجّلت Google أدنى معدل في الروسية (10% مقابل 14% و14%)، والبرتغالية، والهنغارية، والتركية.",[533,546,547,550,551,555],{},[74,548,549],{},"العربية صعبة على المحركات الثلاثة جميعها."," أفضل نتيجة على مقاطع الحوار العربية هي خطأ في كلمة واحدة من كل أربع كلمات. يتسق هذا مع ما رأيناه في جانب الترجمة، حيث سحبنا العربية من قائمة اختيار لغات الاجتماع في أغسطس 2026 إلى أن تتجاوز الجودة الحد الذي نضعه (",[35,552,554],{"href":553},"\u002Fblog\u002Fhow-many-languages-do-you-support","كم عدد اللغات التي ندعمها",").",[533,557,558,561],{},[74,559,560],{},"زمن المعالجة أقل بكثير من الزمن الفعلي على المحركات الثلاثة جميعها."," تستغرق مذكرة مدتها 30 ثانية نحو ثلاث ثوانٍ على Azure ونحو سبع ثوانٍ على Google في إطار الاختبار هذا؛ أما رقم Amazon فتهيمن عليه وتيرة التغذية المضبوطة.",[27,563,565],{"id":564},"لماذا-تبقى-azure-ai-speech-الخيار-الافتراضي","لماذا تبقى Azure AI Speech الخيار الافتراضي",[15,567,568],{},"ثلاثة أسباب، بالترتيب الذي حسم القرار.",[15,570,571,574,575,580],{},[74,572,573],{},"1. البوابة الافتراضية هي Azure."," المؤسسة التي لم تختر بوابة تُشغِّل ميزات الذكاء الاصطناعي الخاصة بها على Azure OpenAI في منطقة بيانات الاتحاد الأوروبي، لذا تُفرَّغ مذكراتها الصوتية عبر Azure AI Speech ضمن المستأجر نفسه. لا جهة معالجة فرعية إضافية، ولا منطقة إضافية. تنص مايكروسوفت على أن Azure Speech لا يخزّن البيانات ولا يعالجها خارج منطقة مورد الكلام (",[35,576,579],{"href":577,"rel":578},"https:\u002F\u002Flearn.microsoft.com\u002Fen-us\u002Fazure\u002Fai-services\u002Fspeech-service\u002Fregions",[91],"صفحة المناطق","، تم التحقق في سبتمبر 2026)؛ ومورِدنا موجود في Sweden Central، وهي مدرجة ضمن مناطق النسخ السريع.",[15,582,583,586,587,591],{},[74,584,585],{},"2. شكل واجهة برمجة التطبيقات يناسب المذكرة الصوتية."," يمكن أن تصل مدة المذكرة الصوتية في InterMIND إلى عشر دقائق (",[35,588,590],{"href":589},"\u002Fdocs\u002Fchat\u002Fvoice-notes","المذكرات الصوتية","). يأخذ النسخ السريع من Azure التسجيل بأكمله في طلب واحد. أما التعرف المتزامن من Google فيتوقف عند 60 ثانية، لذا تحتاج المذكرة التي مدتها عشر دقائق إلى تعرف بالدفعات عبر حاوية تخزين أو جلسة بث متدفق؛ وتبث Amazon Transcribe الصوت، لكنها تقبل صيغ PCM أو FLAC أو Ogg-Opus بدلًا من الصيغ التي تسجل بها الهواتف والمتصفحات، لذا يُعاد ترميز الصوت أولًا. كلا الأمرين قابل للحل — وإطار الاختبار يحلهما — لكنهما يمثلان أجزاء متحركة إضافية في مسار كل مذكرة.",[15,593,594,597],{},[74,595,596],{},"3. الأرقام لا تعارض هذا الخيار."," عند 9% مقابل 10% و10%، لا يتفوق أي محرك في هذه المجموعة بما يكفي لتبرير نقل المذكرات الصوتية خارج البوابة الافتراضية. لو جاءت Google أو Amazon بنصف معدل الخطأ، لذكر هذا المقال ذلك.",[27,599,601],{"id":600},"ماذا-يعني-هذا-للمؤسسات-التي-تستخدم-vertex-ai-أو-bedrock","ماذا يعني هذا للمؤسسات التي تستخدم Vertex AI أو Bedrock",[15,603,604],{},"إذا اختارت مؤسستك Google Vertex AI أو Amazon Bedrock بوابةً لها، فإن ميزات الذكاء الاصطناعي تعمل هناك. تصل المذكرات الصوتية في تلك المؤسسات حاليًا كتسجيل من دون نص مفرَّغ: فقد قسنا Google Cloud Speech-to-Text وAmazon Transcribe، كما يوضح هذا المقال، لكننا لم نربطهما بالمنتج بعد. الأذونات وشيفرة التكامل موجودة بالفعل؛ وسيُحدَّث هذا المقال عندما يصبحان جزءًا من مسار كل مذكرة. وإلى أن يحدث ذلك، تبقى المذكرة الصوتية في مؤسسة تستخدم Vertex AI أو Bedrock تسجيلًا قابلًا للتشغيل فقط؛ أما المؤسسة التي تحوّل بوابتها إلى Azure فتحصل على نصوص مفرَّغة للمذكرات المُرسلة منذ تلك اللحظة فصاعدًا.",[27,606,608],{"id":607},"الأسئلة-الشائعة","الأسئلة الشائعة",[15,610,611],{},[74,612,613],{},"ما خدمة تحويل الكلام إلى نص التي تستخدمها InterMIND؟",[15,615,616,617,555],{},"بالنسبة للمذكرات الصوتية في الدردشة، فهي Azure AI Speech (واجهة النسخ السريع) ضمن مستأجر Azure الخاص بـ InterMIND في Sweden Central — وهي خدمة الكلام الخاصة ببوابة الذكاء الاصطناعي الافتراضية. أما الكلام المباشر في الاجتماعات فيسلك مسارًا مختلفًا: إذ يعمل على محرك الوسائط الخاص بـ InterMIND، وهو Mind API، المستضاف لدى OVH في فرنسا، ولا يلامس أي خدمة كلام سحابية على الإطلاق (",[35,618,620],{"href":619},"\u002Fblog\u002Fwhere-one-intermind-meeting-actually-runs","أين يعمل الاجتماع فعليًا",[15,622,623],{},[74,624,625],{},"هل Azure AI Speech أكثر دقة من Google Speech-to-Text أو Amazon Transcribe؟",[15,627,628],{},"على مجموعتنا المكونة من 153 مقطعًا لمذكرات صوتية بـ17 لغة، قِيست في اليوم ذاته بإطار الاختبار نفسه، سجّلت Azure AI Speech متوسط معدل خطأ كلمات بلغ 9%، وGoogle Cloud Speech-to-Text (Chirp 3) بلغ 10%، وAmazon Transcribe بلغ 10%. يتغير الترتيب حسب اللغة: كانت Azure الأدنى في الفرنسية والإنجليزية والصينية، وAmazon Transcribe في العربية، وGoogle في الروسية. قد يختلف الترتيب على مجموعة تسجيلات مختلفة؛ والجدول أعلاه هو الدليل على مجموعتنا نحن.",[15,630,631],{},[74,632,633],{},"ما هو معدل خطأ الكلمات، وكيف احتُسب هنا؟",[15,635,636],{},"معدل خطأ الكلمات هو عدد الكلمات المستبدلة والمضافة والمحذوفة مقسومًا على عدد الكلمات في النص المرجعي. نقوم بتوحيد حالة الأحرف وعلامات الترقيم والمسافات قبل المقارنة، ونقارن الصينية واليابانية على مستوى الحرف لأن هاتين الكتابتين لا تفصلان بين الكلمات بمسافات. يعني معدل 9% أن كلمة واحدة تقريبًا من كل إحدى عشرة كلمة تختلف عن النص المرجعي.",[15,638,639],{},[74,640,641],{},"هل يخرج صوت المذكرة الصوتية من الاتحاد الأوروبي؟",[15,643,644,645,647,648,652,653,657],{},"لا. يُخزَّن التسجيل في وحدة تخزين الكائنات الخاصة بـ InterMIND داخل الاتحاد الأوروبي، وتعمل خدمة الكلام التي تُفرِّغه في منطقة تابعة للاتحاد الأوروبي: Sweden Central على Azure، ومنطقة ",[109,646,111],{}," متعددة المناطق على Google Cloud، وفرانكفورت على AWS. القائمة الكاملة للأطراف والمناطق متوفرة على ",[35,649,651],{"href":650},"\u002Flegal\u002Fsubprocessors","صفحة الجهات الفرعية لمعالجة البيانات"," و",[35,654,656],{"href":655},"\u002Ftrust","صفحة الثقة",".",[15,659,660],{},[74,661,662],{},"لماذا لا يتم التعرف على الكلام من جهة العميل، داخل التطبيق، بحيث لا يغادر الصوت الهاتف؟",[15,664,665],{},"قسنا ذلك أيضًا في سبتمبر 2026. لم يتعرف نظام التعرف المدمج في Chrome بالمعالجة المحلية على أي من المقاطع الرسمية الـ17 عبر لغات المنتج، وتغطية اللغات لأنظمة التعرف من جهة العميل أضيق بكثير من اللغات الـ17 الواردة في الجدول أعلاه. التعرف من جهة العميل اتجاه نعيد قياسه كلما تحسنت المنصات؛ أما اليوم فمسار البوابة هو الذي يعمل مع كل عضو وبكل لغة.",[15,667,668],{},[74,669,670],{},"هل يمكن لمؤسستنا اختيار خدمة الكلام التي تُفرِّغ مذكراتها الصوتية؟",[15,672,673],{},"ليس بشكل منفصل: فبوابة الذكاء الاصطناعي هي ما يختاره مسؤول المؤسسة من صفحة التكاملات (Integrations). على البوابة الافتراضية، تُفرَّغ المذكرات الصوتية عبر Azure AI Speech. أما على Vertex AI وAmazon Bedrock، فلا تُفرَّغ المذكرات الصوتية بعد — راجع القسم أعلاه.",[15,675,676],{},[74,677,678],{},"ما أقصى مدة يمكن أن تصل إليها المذكرة الصوتية، وهل تحدّها واجهة برمجة التطبيقات؟",[15,680,681],{},"حتى عشر دقائق. يقبل النسخ السريع من Azure ملفات تصل إلى 5 ساعات و500 ميغابايت في طلب واحد، لذا تُفرَّغ المذكرة في استدعاء واحد. ويقبل التعرف المتزامن من Google 60 ثانية و10 ميغابايت، وهذا سبب تقطيع إطار الاختبار للمقاطع الطويلة عند لحظات الصمت.",[15,683,684],{},[74,685,686],{},"لماذا يُبلَّغ نظام التعرف بلغة المتحدث بدلًا من اكتشافها تلقائيًا؟",[15,688,689],{},"لأن المذكرة الصوتية قصيرة. في مقطع مدته أربع ثوانٍ، قد يُرجع التعرف التلقائي على اللغة لغة خاطئة — إذ عادت مذكرة اختبار روسية باللغة الإنجليزية؛ في حين أن لغة الملف الشخصي للعضو تكون صحيحة في كل مرة تقريبًا. يحصل نظام التعرف على تلك اللغة، ولا يحصل على لغات الغرفة كمرشحات إلا عندما تكون اللغة غير معروفة.",[15,691,692],{},[74,693,694],{},"هل يُفرَّغ صوت الاجتماع بالخدمة نفسها؟",[15,696,697,698,700,701,555],{},"لا. يُتعرَّف على الكلام المباشر في الاجتماع ويُترجَم على محرك InterMIND الخاص (Mind API) على خادم الوسائط الذي يحمل المكالمة، المستضاف لدى OVH في فرنسا — راجع ",[35,699,620],{"href":619},". لا ترى بوابة السحابة سوى النص، ولا تصل إليها أبدًا الملفات الصوتية للمكالمة (",[35,702,703],{"href":37},"الذكاء الاصطناعي للاجتماعات على بوابتك الخاصة",[15,705,706],{},[74,707,708],{},"هل ستنشرون النتائج مرة أخرى؟",[15,710,711],{},"يعمل إطار الاختبار بأمر واحد، وأذونات كل محرك جاهزة، لذا يمكن إعادة قياس الجدول عندما يطلق أحد الموردين نموذجًا جديدًا. وعندما يتغير المشهد، يُحدَّث هذا المقال بذكر التاريخ.",[713,714],"hr",{},[27,716,718],{"id":717},"جرّبه-بنفسك","جرّبه بنفسك",[530,720,721,729,737],{},[533,722,723,728],{},[74,724,725],{},[35,726,727],{"href":589},"اطّلع على طريقة عمل المذكرات الصوتية"," — التسجيل، وحد العشر دقائق، والوجهة التي يذهب إليها الصوت.",[533,730,731,736],{},[74,732,733],{},[35,734,735],{"href":650},"اطّلع على قائمة الجهات الفرعية لمعالجة البيانات"," — المورّد، والبلد، والغرض، والمنطقة لكل طرف يعالج بياناتك.",[533,738,739,745],{},[74,740,741],{},[35,742,744],{"href":743},"\u002Fdemo","جرّب العرض التوضيحي المباشر"," — خط أنابيب الترجمة الإنتاجي على صوتك الخاص، من دون تسجيل.",[713,747],{},[15,749,750],{},[751,752,753,754,758,759,762,763,767,768,771,772,776,777,781,782,771,786,790],"em",{},"المصادر: مايكروسوفت — النسخ السريع في Azure AI Speech (",[35,755,757],{"href":89,"rel":756},[91],"learn.microsoft.com",") وجدول مناطق الكلام (",[35,760,757],{"href":577,"rel":761},[91],")؛ Google Cloud — نموذج Chirp 3 (",[35,764,766],{"href":124,"rel":765},[91],"docs.cloud.google.com",")، وحدود التعرف المتزامن (",[35,769,766],{"href":118,"rel":770},[91],")، واللغات المدعومة (",[35,773,766],{"href":774,"rel":775},"https:\u002F\u002Fdocs.cloud.google.com\u002Fspeech-to-text\u002Fv2\u002Fdocs\u002Fspeech-to-text-supported-languages",[91],")؛ AWS — البث المتدفق في Amazon Transcribe (",[35,778,780],{"href":146,"rel":779},[91],"docs.aws.amazon.com",")، ونقاط النهاية والحصص (",[35,783,780],{"href":784,"rel":785},"https:\u002F\u002Fdocs.aws.amazon.com\u002Fgeneral\u002Flatest\u002Fgr\u002Ftranscribe.html",[91],[35,787,780],{"href":788,"rel":789},"https:\u002F\u002Fdocs.aws.amazon.com\u002Ftranscribe\u002Flatest\u002Fdg\u002Fsupported-languages.html",[91],")؛ جميعها تم التحقق منها في سبتمبر 2026. القياس: مقياس الكلام الخاص بـ InterMIND، بتاريخ 2026-09-16، 153 مقطعًا، 17 لغة.",{"title":792,"searchDepth":793,"depth":794,"links":795},"",2,3,[796,797,798,799,800,801,802,803],{"id":29,"depth":793,"text":30},{"id":154,"depth":793,"text":155},{"id":187,"depth":793,"text":188},{"id":527,"depth":793,"text":528},{"id":564,"depth":793,"text":565},{"id":600,"depth":793,"text":601},{"id":607,"depth":793,"text":608},{"id":717,"depth":793,"text":718},"2026-09-16",false,"قمنا بقياس خدمات تحويل الكلام إلى نص للبوابات السحابية الثلاث التي يمكن للمؤسسة عبر InterMIND اختيارها — Azure AI Speech وGoogle Cloud Speech-to-Text (Chirp 3) وAmazon Transcribe — على نفس مقاطع الملاحظات الصوتية الـ153 وبـ17 لغة، باستخدام أداة واحدة، في يوم واحد. معدلات أخطاء الكلمات لكل لغة، والمنهجية، وحدود كل واجهة برمجة تطبيقات (API)، ولماذا يتبع أداة التعرف البوابة بدلاً من لوحة المتصدرين.","md","editorial",null,{"role":811,"spend":812},"it-compliance","incumbent-subscription","\u002Fblog\u002Fspeech-to-text-on-your-own-gateway.svg",{},true,"\u002Fblog\u002Fspeech-to-text-on-your-own-gateway",{"title":6,"description":806},"blog\u002Fspeech-to-text-on-your-own-gateway","X1pVzSLDd2mQIAj7v5zUE4OPBwEv4JKZHkN5WWjVsxI",[821,826],{"title":822,"path":823,"stem":824,"description":825,"children":-1},"ادفع فقط مقابل الأشخاص الذين يستخدمونه: انتقال InterMIND إلى الفوترة لكل عضو نشط","\u002Fblog\u002Fpay-only-for-active-members","blog\u002Fpay-only-for-active-members","توقف Pro و Business عن بيع المقاعد التي تُعيّن يدويًا. ادعُ فريقك بالكامل؛ يحسب كل تجديد الأعضاء الذين كانوا نشطين خلال الـ 28 يومًا السابقة ويفوتر فقط مقابلهم. العضو الذي يقل نشاطه يحتفظ بحسابه ولا يكلف شيئًا؛ يبقى ضيوف الاجتماع والمشاركون من القنوات الخارجية مجانًا. ما يُحتسب نشطًا، وكيف يتغير الرقم داخل دورة الفوترة، وماذا يقول الخطاب قبل التجديد، وما الذي يتغير على صفحة الفوترة الخاصة بك.",{"title":827,"path":828,"stem":829,"description":830,"children":-1},"ترجمات نصية مباشرة لكامل الجمهور: ما يتطلبه Zoom و Teams و Google Meet، وكيف يقرأ كل مشارك بلغته الخاصة (2026)","\u002Fblog\u002Flive-translated-captions-for-your-audience","blog\u002Flive-translated-captions-for-your-audience","متحدث واحد، وجمهور بعشر لغات. توجد الترجمات النصية في Zoom و Microsoft Teams و Google Meet — خلف ترخيص مختلف لكل منها، ويجيب كل واحد على نفس السؤال بشكل مختلف: من يقرر اللغات التي يمكن للجمهور القراءة بها. يتيح Teams لمنظم الاجتماع العام تحديد ست لغات مسبقًا (عشر لغات مع Teams Premium)؛ تُعين أزواج Zoom من خلال إعدادات حساب المضيف؛ ويقيد Google Meet الترجمات النصية على إصدارات Workspace المدفوعة. الخريطة الموثقة، إلى جانب كيفية عملها في InterMIND، حيث تكون لغة النصوص إعدادًا على جانب المشارك نفسه وتتم ترجمة الغرفة صوتيًا أيضًا."]