153 वॉइस नोट्स पर Azure AI Speech बनाम Google Chirp 3 बनाम Amazon Transcribe: InterMIND आपके संगठन के अपने क्लाउड गेटवे पर स्पीच-टू-टेक्स्ट क्यों चलाता है (2026)
InterMIND चैनल में भेजा गया वॉइस नोट एक टेक्स्ट संदेश बन जाता है, जिसे हर टीम-सदस्य अपनी भाषा में पढ़ता है। इसका पहला चरण स्पीच-टू-टेक्स्ट है। IT और अनुपालन समीक्षक हमसे यह नहीं पूछते कि "यह कितना सटीक है", बल्कि यह पूछते हैं कि "यह सेवा किसकी है, और ऑडियो कहाँ जाता है"।
संक्षिप्त उत्तर: Azure AI Speech, जो डिफ़ॉल्ट AI गेटवे की स्पीच सेवा है, Sweden Central में InterMIND के अपने Azure टेनेंट में चलती है। संगठन जिन दो अन्य गेटवे को चुन सकता है, उनकी स्पीच सेवाओं को भी उन्हीं क्लिप्स पर मापा गया है, ताकि यह चुनाव पसंद का नहीं, एक संख्या का विषय रहे। यह पोस्ट उस चुनाव के पीछे के आँकड़े दिखाती है: एक ही दिन में वही 153 क्लिप्स Azure AI Speech, Google Cloud Speech-to-Text और Amazon Transcribe से गुज़रीं। साथ ही यह हर API के बारे में वे दो तथ्य बताती है जो सटीकता के एक प्रतिशत अंक से अधिक मायने रखते हैं।
नियम पहले: हर संगठन के लिए एक गेटवे
InterMIND की हर AI सुविधा एक ऐसे लैंग्वेज-मॉडल गेटवे पर चलती है जिसे संगठन चुनता है। इन सुविधाओं में मीटिंग रीकैप, दस्तावेज़ सारांश, राइटिंग असिस्टेंट, Ask AI और मीटिंग में Mia शामिल हैं। डिफ़ॉल्ट रूप से यह EU Data Zone में Azure OpenAI है। विकल्प के तौर पर EU मल्टी-रीजन एंडपॉइंट पर Google Vertex AI या Frankfurt में Amazon Bedrock चुना जा सकता है। हर गेटवे InterMIND के अपने टेनेंट में चलता है। इसका तर्क हमने क्लाउड गेटवे पर आपकी अपनी मीटिंग AI में समझाया है: अधिकांश संगठनों के लिए वह गेटवे पहले से स्वीकृत सब-प्रोसेसर सूची में होता है, इसलिए कोई AI सुविधा सूची में कोई नई कंपनी नहीं जोड़ती।
वॉइस नोट्स का स्पीच-टू-टेक्स्ट आज डिफ़ॉल्ट गेटवे पर इसी नियम का पालन करता है। तीनों गेटवे में से हर एक के पास अपने लैंग्वेज मॉडल के साथ एक स्पीच सेवा भी है, और इस पोस्ट में हम वही मापते हैं:
| गेटवे | स्पीच सेवा | इस परीक्षण में उपयोग किया गया रीजन | API रिकॉर्डिंग कैसे लेता है |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, फ़ास्ट ट्रांसक्रिप्शन API | Sweden Central | 5 घंटे और 500 MB तक की फ़ाइल के लिए एक अनुरोध (fast transcription docs, सितंबर 2026 में जाँचा गया) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, Chirp 3 मॉडल | eu मल्टी-रीजन | सिंक्रोनस रिकग्निशन 60 सेकंड और 10 MB तक सीमित है; लंबे ऑडियो बैच या स्ट्रीमिंग रिकग्निशन से गुज़रते हैं (sync limits, Chirp 3, सितंबर 2026 में जाँचा गया) |
| Amazon Bedrock (AWS) | Amazon Transcribe, स्ट्रीमिंग | eu-central-1 (Frankfurt) | HTTP/2 या WebSocket पर एक स्ट्रीमिंग सेशन; इनपुट PCM, FLAC या Ogg-Opus होता है (streaming docs, सितंबर 2026 में जाँचा गया) |
हर मामले में रिकग्नाइज़र को वक्ता की अपनी भाषा बताई जाती है, यानी वह भाषा जो सदस्य ने अपनी प्रोफ़ाइल में सेट की है। हमारे परीक्षणों में छोटी क्लिप्स पर स्वचालित भाषा-पहचान अविश्वसनीय निकली: चार सेकंड का एक रूसी नोट अंग्रेज़ी के रूप में लौटा। प्रोडक्ट आज Azure को इसी तरह कॉल करता है, और परीक्षण में बाकी दो को भी उसी तरह कॉल किया गया है।