153টি ভয়েস নোটে Azure AI Speech বনাম Google Chirp 3 বনাম Amazon Transcribe: কেন InterMIND স্পিচ-টু-টেক্সট চালায় আপনার প্রতিষ্ঠানের নিজস্ব ক্লাউড গেটওয়েতে (2026)
InterMIND চ্যানেলে একটি ভয়েস নোট টেক্সট বার্তায় রূপ নেয়, আর প্রতিটি সহকর্মী সেটি নিজের ভাষায় পড়েন। এর প্রথম ধাপ স্পিচ-টু-টেক্সট। আইটি ও কমপ্লায়েন্স পর্যালোচকদের কাছ থেকে আমরা যে প্রশ্ন পাই তা "এটি কতটা নির্ভুল" নয়, বরং "সার্ভিসটি কার, আর অডিও কোথায় যায়"।
সংক্ষিপ্ত উত্তর: ডিফল্ট AI গেটওয়েের স্পিচ সার্ভিস Azure AI Speech, যা চলে সুইডেন সেন্ট্রালে InterMIND-এর নিজস্ব Azure টেন্যান্টে। প্রতিষ্ঠান যে দুটি গেটওয়ে বেছে নিতে পারে, তাদের স্পিচ সার্ভিসও একই ক্লিপে মাপা হয়েছে, যাতে বেছে নেওয়াটা পছন্দের বিষয় না হয়ে সংখ্যার বিষয় হয়। এই পোস্টে সেই সংখ্যাগুলো আছে: একই দিনে একই 153টি ক্লিপ Azure AI Speech, Google Cloud Speech-to-Text ও Amazon Transcribe-এর মধ্য দিয়ে চালানো হয়েছে। সঙ্গে আছে প্রতিটি API সম্পর্কে এমন দুটি তথ্য, যা এক শতাংশ পয়েন্ট নির্ভুলতার চেয়েও বেশি গুরুত্বপূর্ণ।
নিয়মটি আগে: প্রতিষ্ঠানপ্রতি একটি গেটওয়ে
InterMIND-এর প্রতিটি AI ফিচার চলে প্রতিষ্ঠানের নির্বাচিত একটি ল্যাঙ্গুয়েজ-মডেল গেটওয়েতে। ফিচারগুলো হলো মিটিং রিক্যাপ, ডকুমেন্ট সারসংক্ষেপ, রাইটিং অ্যাসিস্ট্যান্ট, Ask AI এবং মিটিংয়ে Mia। ডিফল্ট হলো EU Data Zone-এ Azure OpenAI। ইচ্ছামতো বেছে নেওয়া যায় EU মাল্টি-রিজিয়ন এন্ডপয়েন্টে Google Vertex AI অথবা ফ্র্যাঙ্কফুর্টে Amazon Bedrock। প্রতিটিই InterMIND-এর নিজস্ব টেন্যান্টে চলে। এর যুক্তি আমরা ব্যাখ্যা করেছি নিজস্ব ক্লাউড গেটওয়েতে মিটিং AI লেখায়: বেশিরভাগ প্রতিষ্ঠানের ক্ষেত্রে সেই গেটওয়ে ইতিমধ্যেই অনুমোদিত সাব-প্রসেসর তালিকায় আছে, তাই AI ফিচার তালিকায় নতুন কোনো কোম্পানি যোগ করে না।
ভয়েস নোটের স্পিচ-টু-টেক্সট আজ ডিফল্ট গেটওয়েতে একই নিয়ম মেনে চলে। তিনটি গেটওয়ের প্রত্যেকটিতেই ল্যাঙ্গুয়েজ মডেলের পাশে একটি স্পিচ সার্ভিস আছে, আর এই পোস্টে সেগুলোই মাপা হয়েছে:
| গেটওয়ে | স্পিচ সার্ভিস | এই পরীক্ষায় ব্যবহৃত অঞ্চল | API কীভাবে রেকর্ডিং নেয় |
|---|---|---|---|
| Azure OpenAI (Microsoft) | Azure AI Speech, fast transcription API | সুইডেন সেন্ট্রাল | 5 ঘণ্টা ও 500 MB পর্যন্ত ফাইলের জন্য একটি অনুরোধ (fast transcription docs, সেপ্টেম্বর 2026-এ যাচাই করা) |
| Google Vertex AI (Google Cloud) | Cloud Speech-to-Text v2, Chirp 3 মডেল | eu মাল্টি-রিজিয়ন | সিঙ্ক্রোনাস রিকগনিশন 60 সেকেন্ড ও 10 MB-এর মধ্যে সীমাবদ্ধ; দীর্ঘ অডিও যায় ব্যাচ বা স্ট্রিমিং রিকগনিশনের মাধ্যমে (sync limits, Chirp 3, সেপ্টেম্বর 2026-এ যাচাই করা) |
| Amazon Bedrock (AWS) | Amazon Transcribe, streaming | eu-central-1 (ফ্র্যাঙ্কফুর্ট) | HTTP/2 বা WebSocket-এর উপর একটি স্ট্রিমিং সেশন; ইনপুট PCM, FLAC বা Ogg-Opus (streaming docs, সেপ্টেম্বর 2026-এ যাচাই করা) |
প্রতিটি ক্ষেত্রেই রিকগনাইজারকে বক্তার নিজের ভাষা জানিয়ে দেওয়া হয়, অর্থাৎ সদস্য প্রোফাইলে যে ভাষা ঠিক করেছেন সেটি। কারণ আমাদের পরীক্ষায় ছোট ক্লিপে স্বয়ংক্রিয় ভাষা শনাক্তকরণ নির্ভরযোগ্য প্রমাণিত হয়নি: চার সেকেন্ডের একটি রুশ নোট ইংরেজি হিসেবে ফিরে এসেছিল। পণ্যটি আজ Azure-কে এভাবেই কল করে, আর পরীক্ষায় বাকি দুটিকেও একইভাবে কল করা হয়েছে।