Azure AI Speech بمقابلہ Google Chirp 3 بمقابلہ Amazon Transcribe، 153 وائس نوٹس پر: InterMIND اسپیچ ٹو ٹیکسٹ آپ کی تنظیم کے اپنے کلاؤڈ گیٹ وے پر کیوں چلاتا ہے (2026)
InterMIND کے کسی چینل میں وائس نوٹ ایک ٹیکسٹ پیغام بن جاتا ہے جسے ہر ساتھی اپنی زبان میں پڑھتا ہے۔ اس کا پہلا مرحلہ اسپیچ ٹو ٹیکسٹ ہے۔ IT اور کمپلائنس کے جائزہ کار ہم سے یہ نہیں پوچھتے کہ "یہ کتنا درست ہے"، بلکہ یہ پوچھتے ہیں کہ "یہ سروس کس کی ہے، اور آڈیو کہاں جاتی ہے"۔
مختصر جواب: ڈیفالٹ AI گیٹ وے کی اسپیچ سروس Azure AI Speech ہے، جو Sweden Central میں InterMIND کے اپنے Azure ٹیننٹ میں چلتی ہے۔ تنظیم جو دو دوسرے گیٹ وے منتخب کر سکتی ہے، ان کی اسپیچ سروسز کو بھی انہی کلپس پر ناپا گیا ہے، تاکہ انتخاب پسند کا نہیں بلکہ ایک عدد کا معاملہ ہو۔ یہ پوسٹ اس انتخاب کے پیچھے موجود اعداد دکھاتی ہے: ایک ہی دن انہی 153 کلپس کو Azure AI Speech، Google Cloud Speech-to-Text اور Amazon Transcribe سے گزارا گیا۔ ساتھ ہی ہر API کے وہ دو حقائق بھی بتائے گئے ہیں جو درستگی کے ایک فیصد پوائنٹ سے زیادہ اہم ہیں۔
پہلے اصول: ہر تنظیم کے لیے ایک گیٹ وے
InterMIND کی ہر AI خصوصیت، یعنی میٹنگ کے خلاصے، دستاویزات کے خلاصے، تحریری معاون، Ask AI اور میٹنگ میں Mia، تنظیم کے منتخب کردہ ایک لینگویج ماڈل گیٹ وے پر چلتی ہے۔ ڈیفالٹ طور پر یہ EU Data Zone میں Azure OpenAI ہے۔ انتخاب کی صورت میں EU multi-region اینڈ پوائنٹ پر Google Vertex AI یا Frankfurt میں Amazon Bedrock ہو سکتا ہے، اور ہر ایک InterMIND کے اپنے ٹیننٹ میں ہے۔ ہم نے اس کی وجہ آپ کے اپنے کلاؤڈ گیٹ وے پر میٹنگ AI میں بیان کی تھی: زیادہ تر تنظیموں کے لیے یہ گیٹ وے پہلے ہی منظور شدہ سب پروسیسرز کی فہرست میں شامل ہوتا ہے، اس لیے کوئی AI خصوصیت فہرست میں کسی نئی کمپنی کا اضافہ نہیں کرتی۔
وائس نوٹس کی اسپیچ ٹو ٹیکسٹ آج ڈیفالٹ گیٹ وے پر اسی اصول پر چلتی ہے۔ تینوں گیٹ ویز میں سے ہر ایک کے لینگویج ماڈلز کے ساتھ ایک اسپیچ سروس بھی ہے، اور یہ پوسٹ اسی کو ناپتی ہے:
| گیٹ وے | اسپیچ سروس | اس ٹیسٹ میں استعمال شدہ ریجن | API ریکارڈنگ کیسے لیتی ہے |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech، fast transcription API | Sweden Central | 5 گھنٹے اور 500 MB تک کی فائل کے لیے ایک ہی درخواست (fast transcription docs، ستمبر 2026 میں جانچا گیا) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2، Chirp 3 ماڈل | eu multi-region | Synchronous recognition 60 سیکنڈ اور 10 MB تک محدود ہے؛ طویل آڈیو batch یا streaming recognition سے گزرتی ہے (sync limits، Chirp 3، ستمبر 2026 میں جانچا گیا) |
| Amazon Bedrock (AWS) | Amazon Transcribe، streaming | eu-central-1 (Frankfurt) | HTTP/2 یا WebSocket پر streaming سیشن؛ ان پٹ PCM، FLAC یا Ogg-Opus ہوتا ہے (streaming docs، ستمبر 2026 میں جانچا گیا) |
ہر صورت میں ریکگنائزر کو بولنے والے کی اپنی زبان بتائی جاتی ہے، یعنی وہ زبان جو رکن نے اپنی پروفائل میں مقرر کی ہے۔ ہماری جانچ میں مختصر کلپس پر خودکار زبان کی شناخت ناقابلِ اعتماد ثابت ہوئی: چار سیکنڈ کا ایک روسی نوٹ انگریزی کے طور پر واپس آیا۔ پروڈکٹ آج Azure کو اسی طرح کال کرتا ہے، اور ٹیسٹ نے بھی باقی دونوں کو اسی طرح کال کیا۔