১৫৩টি ভয়েস নোটে Azure AI Speech বনাম Google Chirp 3 বনাম Amazon Transcribe: কেন InterMIND আপনার প্রতিষ্ঠানের নিজস্ব ক্লাউড গেটওয়েতে স্পিচ-টু-টেক্সট চালায় (২০২৬)

InterMIND-এর একটি প্রতিষ্ঠান যে তিনটি ক্লাউড গেটওয়ে বেছে নিতে পারে, তাদের স্পিচ-টু-টেক্সট সেবা — Azure AI Speech, Google Cloud Speech-to-Text (Chirp 3) এবং Amazon Transcribe — আমরা ১৭টি ভাষার একই ১৫৩টি ভয়েস-নোট ক্লিপে, একই হারনেসে, একই দিনে যাচাই করেছি। ভাষাভিত্তিক ওয়ার্ড এরর রেট, পদ্ধতি, প্রতিটি API-এর সীমাবদ্ধতা, এবং কেন রিকগনাইজার লিডারবোর্ডের পরিবর্তে গেটওয়েকে অনুসরণ করে।

The Mind.com Team

১৫৩টি ভয়েস নোটে Azure AI Speech বনাম Google Chirp 3 বনাম Amazon Transcribe: কেন InterMIND আপনার প্রতিষ্ঠানের নিজস্ব ক্লাউড গেটওয়েতে স্পিচ-টু-টেক্সট চালায় (২০২৬)

153টি ভয়েস নোটে Azure AI Speech বনাম Google Chirp 3 বনাম Amazon Transcribe: কেন InterMIND স্পিচ-টু-টেক্সট চালায় আপনার প্রতিষ্ঠানের নিজস্ব ক্লাউড গেটওয়েতে (2026)

InterMIND চ্যানেলে একটি ভয়েস নোট টেক্সট বার্তায় রূপ নেয়, আর প্রতিটি সহকর্মী সেটি নিজের ভাষায় পড়েন। এর প্রথম ধাপ স্পিচ-টু-টেক্সট। আইটি ও কমপ্লায়েন্স পর্যালোচকদের কাছ থেকে আমরা যে প্রশ্ন পাই তা "এটি কতটা নির্ভুল" নয়, বরং "সার্ভিসটি কার, আর অডিও কোথায় যায়"।

সংক্ষিপ্ত উত্তর: ডিফল্ট AI গেটওয়েের স্পিচ সার্ভিস Azure AI Speech, যা চলে সুইডেন সেন্ট্রালে InterMIND-এর নিজস্ব Azure টেন্যান্টে। প্রতিষ্ঠান যে দুটি গেটওয়ে বেছে নিতে পারে, তাদের স্পিচ সার্ভিসও একই ক্লিপে মাপা হয়েছে, যাতে বেছে নেওয়াটা পছন্দের বিষয় না হয়ে সংখ্যার বিষয় হয়। এই পোস্টে সেই সংখ্যাগুলো আছে: একই দিনে একই 153টি ক্লিপ Azure AI Speech, Google Cloud Speech-to-Text ও Amazon Transcribe-এর মধ্য দিয়ে চালানো হয়েছে। সঙ্গে আছে প্রতিটি API সম্পর্কে এমন দুটি তথ্য, যা এক শতাংশ পয়েন্ট নির্ভুলতার চেয়েও বেশি গুরুত্বপূর্ণ।

নিয়মটি আগে: প্রতিষ্ঠানপ্রতি একটি গেটওয়ে

InterMIND-এর প্রতিটি AI ফিচার চলে প্রতিষ্ঠানের নির্বাচিত একটি ল্যাঙ্গুয়েজ-মডেল গেটওয়েতে। ফিচারগুলো হলো মিটিং রিক্যাপ, ডকুমেন্ট সারসংক্ষেপ, রাইটিং অ্যাসিস্ট্যান্ট, Ask AI এবং মিটিংয়ে Mia। ডিফল্ট হলো EU Data Zone-এ Azure OpenAI। ইচ্ছামতো বেছে নেওয়া যায় EU মাল্টি-রিজিয়ন এন্ডপয়েন্টে Google Vertex AI অথবা ফ্র্যাঙ্কফুর্টে Amazon Bedrock। প্রতিটিই InterMIND-এর নিজস্ব টেন্যান্টে চলে। এর যুক্তি আমরা ব্যাখ্যা করেছি নিজস্ব ক্লাউড গেটওয়েতে মিটিং AI লেখায়: বেশিরভাগ প্রতিষ্ঠানের ক্ষেত্রে সেই গেটওয়ে ইতিমধ্যেই অনুমোদিত সাব-প্রসেসর তালিকায় আছে, তাই AI ফিচার তালিকায় নতুন কোনো কোম্পানি যোগ করে না।

ভয়েস নোটের স্পিচ-টু-টেক্সট আজ ডিফল্ট গেটওয়েতে একই নিয়ম মেনে চলে। তিনটি গেটওয়ের প্রত্যেকটিতেই ল্যাঙ্গুয়েজ মডেলের পাশে একটি স্পিচ সার্ভিস আছে, আর এই পোস্টে সেগুলোই মাপা হয়েছে:

গেটওয়েস্পিচ সার্ভিসএই পরীক্ষায় ব্যবহৃত অঞ্চলAPI কীভাবে রেকর্ডিং নেয়
Azure OpenAI (Microsoft)Azure AI Speech, fast transcription APIসুইডেন সেন্ট্রাল5 ঘণ্টা ও 500 MB পর্যন্ত ফাইলের জন্য একটি অনুরোধ (fast transcription docs, সেপ্টেম্বর 2026-এ যাচাই করা)
Google Vertex AI (Google Cloud)Cloud Speech-to-Text v2, Chirp 3 মডেলeu মাল্টি-রিজিয়নসিঙ্ক্রোনাস রিকগনিশন 60 সেকেন্ড ও 10 MB-এর মধ্যে সীমাবদ্ধ; দীর্ঘ অডিও যায় ব্যাচ বা স্ট্রিমিং রিকগনিশনের মাধ্যমে (sync limits, Chirp 3, সেপ্টেম্বর 2026-এ যাচাই করা)
Amazon Bedrock (AWS)Amazon Transcribe, streamingeu-central-1 (ফ্র্যাঙ্কফুর্ট)HTTP/2 বা WebSocket-এর উপর একটি স্ট্রিমিং সেশন; ইনপুট PCM, FLAC বা Ogg-Opus (streaming docs, সেপ্টেম্বর 2026-এ যাচাই করা)

প্রতিটি ক্ষেত্রেই রিকগনাইজারকে বক্তার নিজের ভাষা জানিয়ে দেওয়া হয়, অর্থাৎ সদস্য প্রোফাইলে যে ভাষা ঠিক করেছেন সেটি। কারণ আমাদের পরীক্ষায় ছোট ক্লিপে স্বয়ংক্রিয় ভাষা শনাক্তকরণ নির্ভরযোগ্য প্রমাণিত হয়নি: চার সেকেন্ডের একটি রুশ নোট ইংরেজি হিসেবে ফিরে এসেছিল। পণ্যটি আজ Azure-কে এভাবেই কল করে, আর পরীক্ষায় বাকি দুটিকেও একইভাবে কল করা হয়েছে।

আমরা কী মেপেছি

সেট। 17টি ভাষায় 153টি ক্লিপ: 136টি সংলাপের পালা, আর 17টি আনুষ্ঠানিক অংশ। সংলাপগুলো দশটি ভাষায় দুটি ব্যবসায়িক সংলাপ (একটি চুক্তি-আলোচনা ও একটি দৈনিক স্ট্যান্ড-আপ), যা পণ্যের দুটি সিন্থেটিক কণ্ঠে বলা। আনুষ্ঠানিক অংশগুলো আমাদের পাবলিক অনুবাদ বেঞ্চমার্কের FLORES-200 ব্যবসায়িক বাক্য, একটি সিন্থেটিক কণ্ঠে পড়া, প্রতি ভাষায় একটি, দৈর্ঘ্য 71 থেকে 109 সেকেন্ড। সংলাপের পালাগুলো 3 থেকে 30 সেকেন্ডের, অর্থাৎ বাস্তব ভয়েস নোটের দৈর্ঘ্যের।

মেট্রিক। রেফারেন্স টেক্সটের বিপরীতে ওয়ার্ড এরর রেট (WER), অর্থাৎ যত শতাংশ শব্দ প্রতিস্থাপিত, সংযোজিত বা বাদ পড়েছে। হিসাবের আগে কেস, যতিচিহ্ন ও হোয়াইটস্পেস নর্মালাইজ করা হয়েছে; চীনা ও জাপানি তুলনা করা হয়েছে অক্ষর ধরে। ক্যারেক্টার এরর রেটও পাশাপাশি রেকর্ড করা হয়েছে, এবং তাতেও একই চিত্র পাওয়া যায়।

হার্নেস। একটি স্ক্রিপ্ট, একটি মেশিন, 2026-09-16 তারিখে এক ঘণ্টা, প্রতিটি ইঞ্জিন 153টি ক্লিপেই। Azure ও Amazon Transcribe প্রতিটি ক্লিপ পুরোটা নিয়েছে। Google-এর সিঙ্ক্রোনাস রিকগনাইজার সর্বোচ্চ 60 সেকেন্ড নেয়, তাই 17টি আনুষ্ঠানিক ক্লিপ নীরবতার জায়গায় কেটে 55 সেকেন্ডের কম টুকরো করা হয়েছে এবং ট্রান্সক্রিপ্টগুলো জোড়া লাগানো হয়েছে; 136টি সংলাপ ক্লিপ গেছে পুরোটা। Amazon Transcribe রিয়েল-টাইম গতিতে অডিও চায়, তাই হার্নেস সেটিকে রিয়েল টাইমের চার গুণ দ্রুত ফিড করেছে। ফলে নিচে এর লেটেন্সির যে সংখ্যা আছে, সেটি ফিডের নির্ধারিত নিম্নসীমা, সার্ভিসের নয়।

এটি যা নয়। এগুলো শান্ত পরিবেশের সিন্থেটিক কণ্ঠ, গাড়িতে ফোন দিয়ে করা ফিল্ড রেকর্ডিং নয়। একটি দিন, প্রতি ক্লিপে একটি রান। এটি আমাদের নিজস্ব অনুবাদ পাইপলাইন যে অডিওতে পরীক্ষা করা হয় তার উপর, আমাদের ব্যবহারকারীরা যেসব ভাষায় লেখেন সেগুলোতে করা তুলনা, কোনো লিডারবোর্ড নয়।

ফলাফল: ভাষাভিত্তিক ওয়ার্ড এরর রেট

প্রতিটি ভাষার ক্লিপের গড় WER; প্রতিটি ইঞ্জিন সবকটি 153 ক্লিপের জন্য ট্রান্সক্রিপ্ট ফিরিয়েছে।

ভাষাক্লিপAzure AI SpeechGoogle Chirp 3Amazon Transcribe
আরবি1332%46%26%
চীনা133%3%8%
চেক11%2%3%
ডাচ12%2%3%
ইংরেজি212%5%2%
ফরাসি135%11%12%
জার্মান137%9%13%
হিন্দি1310%10%12%
হাঙ্গেরীয়19%7%8%
ইতালীয়11%1%3%
জাপানি136%5%5%
কোরিয়ান19%11%11%
পোলিশ11%1%2%
পর্তুগিজ (ব্রাজিল)135%4%6%
রুশ2114%10%14%
স্প্যানিশ136%5%6%
তুর্কি14%3%4%
সব 153টি ক্লিপ1539%10%10%
শুধু সংলাপের পালা1369%11%10%
শুধু আনুষ্ঠানিক অংশ174%5%5%
প্রক্রিয়াকরণ সময় ÷ অডিওর দৈর্ঘ্য0.100.220.41 (ফিড-নির্ভর)

যেসব ভাষায় মাত্র একটি ক্লিপ (শুধু আনুষ্ঠানিক অংশ), সেগুলো সম্পূর্ণতার জন্য দেখানো হয়েছে; এক ক্লিপের সংখ্যা একটি ডেটা পয়েন্ট, কোনো হার নয়।

সংখ্যাগুলো কী বলছে

  • পুরো সেটে তিনটি সার্ভিস এক পয়েন্টের মধ্যে: 9%, 10% ও 10%। 153টি ক্লিপের প্রতিটির জন্য প্রতিটি ইঞ্জিন ট্রান্সক্রিপ্ট ফিরিয়েছে, অর্থাৎ 17টি ভাষার কভারেজ তিনটিতেই সম্পূর্ণ।
  • পার্থক্যগুলো ভাষাভিত্তিক, এবং দুই দিকেই যায়। ফরাসি (5%, বিপরীতে 11% ও 12%) ও জার্মানে (7%, বিপরীতে 9% ও 13%) Azure-এর এরর রেট সবচেয়ে কম ছিল। ইংরেজিতে (2%, Amazon Transcribe-এর সঙ্গে) এবং চীনায় (3%, Google-এর সঙ্গে) সে সর্বনিম্নে সমান ছিল। আরবিতে সবচেয়ে কম ছিল Amazon Transcribe (26%, বিপরীতে 32% ও 46%)। রুশে (10%, বিপরীতে 14% ও 14%), পর্তুগিজ, হাঙ্গেরীয় ও তুর্কিতে সবচেয়ে কম ছিল Google।
  • আরবি তিনটির জন্যই কঠিন। আরবি সংলাপ ক্লিপে সেরা ফলাফলেও প্রতি চারটি শব্দের একটি ভুল। এটি অনুবাদের দিকে আমরা যা দেখেছি তার সঙ্গে সামঞ্জস্যপূর্ণ: মান আমাদের মানদণ্ড পূরণ না করা পর্যন্ত আমরা 2026 সালের আগস্টে মিটিংয়ের ভাষা বাছাইকারী থেকে আরবি তুলে নিয়েছি (আমরা কতগুলো ভাষা সমর্থন করি)।
  • তিনটিতেই প্রক্রিয়াকরণ সময় রিয়েল টাইমের চেয়ে অনেক কম। এই হার্নেসে 30 সেকেন্ডের একটি নোটে Azure-এর লাগে প্রায় তিন সেকেন্ড, Google-এর প্রায় সাত; Amazon-এর সংখ্যাটি নিয়ন্ত্রিত গতির ফিডেই প্রভাবিত।

কেন Azure AI Speech ডিফল্ট থাকছে

তিনটি কারণ, যে ক্রমে সিদ্ধান্তটি হয়েছে সেই ক্রমে।

1. ডিফল্ট গেটওয়ে Azure। যে প্রতিষ্ঠান কোনো গেটওয়ে বেছে নেয়নি, তার AI ফিচার চলে EU Data Zone-এ Azure OpenAI-তে, তাই তার ভয়েস নোট একই টেন্যান্টে Azure AI Speech দিয়ে ট্রান্সক্রাইব হয়। কোনো বাড়তি সাব-প্রসেসর নেই, কোনো বাড়তি অঞ্চলও নেই। Microsoft জানায় যে Azure Speech, Speech রিসোর্সের অঞ্চলের বাইরে ডেটা সংরক্ষণ বা প্রক্রিয়া করে না (regions page, সেপ্টেম্বর 2026-এ যাচাই করা)। আমাদের রিসোর্স সুইডেন সেন্ট্রালে, যা fast transcription-এর জন্য তালিকাভুক্ত।

2. API-র গঠন ভয়েস নোটের সঙ্গে মানানসই। InterMIND-এ একটি ভয়েস নোট দশ মিনিট পর্যন্ত দীর্ঘ হতে পারে (voice notes)। Azure-এর fast transcription পুরো রেকর্ডিং একটি অনুরোধেই নেয়। Google-এর সিঙ্ক্রোনাস রিকগনিশন 60 সেকেন্ডে থেমে যায়, তাই দশ মিনিটের নোটের জন্য স্টোরেজ বাকেটের মাধ্যমে ব্যাচ রিকগনিশন বা একটি স্ট্রিমিং সেশন লাগে। Amazon Transcribe স্ট্রিম করে, কিন্তু ফোন ও ব্রাউজার যে ফরম্যাটে রেকর্ড করে তার বদলে PCM, FLAC বা Ogg-Opus নেয়, ফলে অডিও আগে ট্রান্সকোড করতে হয়। দুটোরই সমাধান সম্ভব, হার্নেস সেগুলো সমাধান করেছেও, কিন্তু প্রতিটি নোটের পথে সেগুলো বাড়তি সচল অংশ।

3. সংখ্যাগুলো এর বিপক্ষে যুক্তি দেয় না। 10% ও 10%-এর বিপরীতে 9%-এ, এই সেটে কোনো ইঞ্জিনই এতটা ভালো নয় যে ভয়েস নোটকে ডিফল্ট গেটওয়ে থেকে সরানো যৌক্তিক হবে। Google বা Amazon যদি অর্ধেক এরর রেটে আসত, এই পোস্টে সেটাই বলা থাকত।

Vertex AI বা Bedrock-এ থাকা প্রতিষ্ঠানগুলোর জন্য এর অর্থ

আপনার প্রতিষ্ঠান যদি গেটওয়ে হিসেবে Google Vertex AI বা Amazon Bedrock বেছে থাকে, তাহলে আপনার AI ফিচার সেখানেই চলে। সেসব প্রতিষ্ঠানে ভয়েস নোট এখন ট্রান্সক্রিপ্ট ছাড়া রেকর্ডিং হিসেবে আসে: এই পোস্টে দেখানো মতো আমরা Google Cloud Speech-to-Text ও Amazon Transcribe মেপেছি, কিন্তু এখনও সেগুলো পণ্যে যুক্ত করিনি। পারমিশন ও ইন্টিগ্রেশন কোড তৈরি আছে; প্রতিটি নোটের পথে সেগুলো এলে এই পোস্ট হালনাগাদ করা হবে। ততদিন Vertex AI বা Bedrock প্রতিষ্ঠানে ভয়েস নোট একটি চালানোর যোগ্য রেকর্ডিং। যে প্রতিষ্ঠান গেটওয়ে Azure-এ বদলায়, তার সেই সময় থেকে পাঠানো নোটগুলোর ট্রান্সক্রিপ্ট পাওয়া যায়।

FAQ

InterMIND কোন স্পিচ-টু-টেক্সট সার্ভিস ব্যবহার করে?

চ্যাটের ভয়েস নোটের জন্য, সুইডেন সেন্ট্রালে InterMIND-এর নিজস্ব Azure টেন্যান্টে Azure AI Speech (fast transcription API), যা ডিফল্ট AI গেটওয়ের স্পিচ সার্ভিস। মিটিংয়ের লাইভ স্পিচ ভিন্ন পথে চলে: তা চলে InterMIND-এর নিজস্ব মিডিয়া ইঞ্জিন Mind API-তে, যা ফ্রান্সে OVH-এ হোস্ট করা, এবং কোনো ক্লাউড স্পিচ সার্ভিসকে কখনও স্পর্শ করে না (একটি মিটিং কোথায় চলে)।

Azure AI Speech কি Google Speech-to-Text বা Amazon Transcribe-এর চেয়ে বেশি নির্ভুল?

17টি ভাষায় আমাদের 153টি ভয়েস-নোট ক্লিপের সেটে, একই দিনে একই হার্নেসে মেপে, Azure AI Speech-এর গড় ওয়ার্ড এরর রেট ছিল 9%, Google Cloud Speech-to-Text (Chirp 3)-এর 10% এবং Amazon Transcribe-এর 10%। ভাষাভেদে ক্রম বদলায়: ফরাসি, ইংরেজি ও চীনায় Azure সবচেয়ে কম ছিল, আরবিতে Amazon Transcribe, রুশে Google। ভিন্ন ধরনের রেকর্ডিংয়ের সেটে র‍্যাঙ্কিং আলাদা হতে পারে; আমাদের সেটের প্রমাণ উপরের টেবিলে।

ওয়ার্ড এরর রেট কী, এবং এখানে কীভাবে হিসাব করা হয়েছে?

ওয়ার্ড এরর রেট হলো প্রতিস্থাপিত, সংযোজিত ও বাদ পড়া শব্দের সংখ্যাকে রেফারেন্স টেক্সটের শব্দসংখ্যা দিয়ে ভাগ করে পাওয়া মান। তুলনার আগে আমরা কেস, যতিচিহ্ন ও হোয়াইটস্পেস নর্মালাইজ করি, এবং চীনা ও জাপানি অক্ষর ধরে তুলনা করি, কারণ এই লিপিতে শব্দ স্পেস দিয়ে আলাদা করা হয় না। 9% হারের মানে প্রতি এগারোটি শব্দে প্রায় একটি রেফারেন্স থেকে আলাদা।

ভয়েস নোটের অডিও কি EU-এর বাইরে যায়?

না। রেকর্ডিং সংরক্ষিত থাকে EU-তে InterMIND-এর অবজেক্ট স্টোরেজে, এবং যে স্পিচ সার্ভিস এটি ট্রান্সক্রাইব করে সেটি চলে একটি EU অঞ্চলে: Azure-এ সুইডেন সেন্ট্রাল, Google Cloud-এ eu মাল্টি-রিজিয়ন, AWS-এ ফ্র্যাঙ্কফুর্ট। সব পক্ষ ও অঞ্চলের পূর্ণ তালিকা আছে সাবপ্রসেসর পেজে এবং ট্রাস্ট পেজে।

অ্যাপের ভেতরেই ক্লায়েন্ট-সাইডে স্পিচ চেনা হয় না কেন, যাতে অডিও কখনও ফোন ছেড়ে না যায়?

সেটাও আমরা মেপেছি, 2026 সালের সেপ্টেম্বরে। লোকাল প্রসেসিংসহ Chrome-এর বিল্ট-ইন রিকগনাইজার পণ্যের ভাষাগুলোর 17টি আনুষ্ঠানিক ক্লিপের মধ্যে 0টি চিনতে পেরেছে, এবং ক্লায়েন্ট-সাইড রিকগনাইজারের ভাষা-কভারেজ উপরের টেবিলের 17টি ভাষার চেয়ে অনেক সংকীর্ণ। ক্লায়েন্ট-সাইড রিকগনিশন এমন একটি দিক, যা প্ল্যাটফর্মগুলো উন্নত হলে আমরা আবার মাপি; আজ প্রতিটি ভাষায় প্রতিটি সদস্যের জন্য কাজ করে গেটওয়ে-পথটিই।

আমাদের প্রতিষ্ঠান কি বেছে নিতে পারে কোন স্পিচ সার্ভিস তার ভয়েস নোট ট্রান্সক্রাইব করবে?

আলাদাভাবে নয়: প্রতিষ্ঠানের অ্যাডমিন Integrations পেজে যে AI গেটওয়ে বেছে নেন, সেটিই নির্ধারক। ডিফল্ট গেটওয়েতে ভয়েস নোট ট্রান্সক্রাইব করে Azure AI Speech। Vertex AI ও Amazon Bedrock-এ ভয়েস নোট এখনও ট্রান্সক্রাইব করা হয় না; উপরের অংশ দেখুন।

একটি ভয়েস নোট কতক্ষণ দীর্ঘ হতে পারে, এবং API কি তা সীমাবদ্ধ করে?

দশ মিনিট পর্যন্ত। Azure-এর fast transcription একটি অনুরোধে 5 ঘণ্টা ও 500 MB পর্যন্ত ফাইল নেয়, তাই নোট একটিমাত্র কলেই ট্রান্সক্রাইব হয়। Google-এর সিঙ্ক্রোনাস রিকগনিশন নেয় 60 সেকেন্ড ও 10 MB, আর সেজন্যই হার্নেস দীর্ঘ ক্লিপগুলো নীরবতার জায়গায় টুকরো করেছে।

রিকগনাইজারকে বক্তার ভাষা জানিয়ে দেওয়া হয় কেন, নিজে শনাক্ত করতে দেওয়া হয় না কেন?

কারণ ভয়েস নোট ছোট। চার সেকেন্ডের ক্লিপে স্বয়ংক্রিয় ভাষা শনাক্তকরণ ভুল ভাষা ফেরাতে পারে: একটি রুশ পরীক্ষা-নোট ইংরেজি হিসেবে ফিরে এসেছিল, অথচ সদস্যের প্রোফাইল ভাষা প্রায় প্রতিবারই সঠিক। রিকগনাইজার সেই ভাষাই পায়, আর ভাষা অজানা থাকলেই কেবল রুমের ভাষাগুলো প্রার্থী হিসেবে পায়।

মিটিংয়ের অডিও কি একই সার্ভিস ট্রান্সক্রাইব করে?

না। মিটিংয়ে লাইভ স্পিচ চেনা ও অনুবাদ করা হয় InterMIND-এর নিজস্ব ইঞ্জিনে (Mind API), কলটি বহনকারী মিডিয়া সার্ভারে, যা ফ্রান্সে OVH-এ হোস্ট করা; দেখুন একটি মিটিং কোথায় চলে। ক্লাউড গেটওয়ে টেক্সট দেখে, কলের অডিও কখনও দেখে না (নিজস্ব গেটওয়েতে মিটিং AI)।

আপনারা কি ফলাফল আবার প্রকাশ করবেন?

হার্নেস চলে একটি কমান্ডে, এবং প্রতিটি ইঞ্জিনের পারমিশন জায়গামতো আছে, তাই কোনো ভেন্ডর নতুন মডেল আনলে টেবিলটি আবার মাপা যায়। চিত্র বদলে গেলে এই পোস্ট তারিখসহ হালনাগাদ করা হবে।


নিজে দেখে নিন


সূত্র: Microsoft — Azure AI Speech fast transcription (learn.microsoft.com) ও Speech regions table (learn.microsoft.com); Google Cloud — Chirp 3 model (docs.cloud.google.com), synchronous recognition limits (docs.cloud.google.com) ও supported languages (docs.cloud.google.com); AWS — Amazon Transcribe streaming (docs.aws.amazon.com), endpoints and quotas (docs.aws.amazon.com) ও supported languages (docs.aws.amazon.com); সবই সেপ্টেম্বর 2026-এ যাচাই করা। পরিমাপ: InterMIND speech bench, 2026-09-16, 153টি ক্লিপ, 17টি ভাষা।

আইটি ও অ্যাডমিন-এ আরও

আইটি ও অ্যাডমিন-এর সব পোস্ট
আপনার ট্রান্সলেশন মিনিট ও স্টোরেজ কারা ব্যবহার করছে তা কীভাবে দেখবেন — এবং সীমায় পৌঁছানোর আগে ইমেইল পাবেন (২০২৬)
আইটি ও অ্যাডমিন

আপনার ট্রান্সলেশন মিনিট ও স্টোরেজ কারা ব্যবহার করছে তা কীভাবে দেখবেন — এবং সীমায় পৌঁছানোর আগে ইমেইল পাবেন (২০২৬)

InterMIND-এর প্রতিটি ব্যবহারসীমা মিটিং হোস্ট অনুযায়ী পরিমাপ করা হয়: আপনার তৈরি করা মিটিংগুলোতে ভয়েস অনুবাদের মিনিট, আপনার অংশগ্রহণকারীদের জন্য চ্যাট অনুবাদের শব্দ, অনূদিত ডকুমেন্ট এবং টিমের শেয়ার্ড স্টোরেজ। Billing পেজে প্রতিটি মিটার ৩০ দিনের রোলিং সময়সীমায় দেখানো হয়, আর স্টোরেজ সীমার কাছাকাছি পৌঁছালে অথবা প্রথমবার অনুবাদ-মিনিটের সীমায় পৌঁছালে একটি ইমেইল আসে। প্রতিটি মিটার কী গণনা করে, সীমায় পৌঁছালে কী হয় — মিটিং চলতে থাকে, অনুবাদ বিরতিতে যায় — এবং ৩০ দিনের সময়সীমা কীভাবে নিজে থেকেই আবার পূর্ণ হয়।

The Mind.com Team

আপনার নিজস্ব ক্লাউড গেটওয়েতে মিটিং AI: রিক্যাপ, সারসংক্ষেপ এবং মিটিং-এর ভেতরের সহকারী কীভাবে আপনার Azure, Google বা AWS পরিসীমার মধ্যেই থাকে
আইটি ও অ্যাডমিন

আপনার নিজস্ব ক্লাউড গেটওয়েতে মিটিং AI: রিক্যাপ, সারসংক্ষেপ এবং মিটিং-এর ভেতরের সহকারী কীভাবে আপনার Azure, Google বা AWS পরিসীমার মধ্যেই থাকে

প্রতিটি মিটিং টুল এখন AI নিয়ে আসে, আর প্রতিটি AI ফিচার একটি করে সাব-প্রসেসর যোগ করে। InterMIND কীভাবে তার AI ফিচারগুলো আপনার প্রতিষ্ঠান ইতিমধ্যে যে হাইপারস্কেলার গেটওয়ে ব্যবহার করে সেখানেই চালায়, তা এখানে দেখুন — EU Data Zone-এ Azure OpenAI, EU-তে Google Vertex AI, আপনার নিজস্ব AWS অ্যাকাউন্টে Amazon Bedrock — প্রতিটি প্রতিষ্ঠানের জন্য আলাদা বন্ধ করার সুইচসহ, এবং প্রকিউরমেন্ট টিম কী যাচাই করতে পারে।

The Mind.com Team

আপনার মিটিং কি গোপনীয়?
আইটি ও অ্যাডমিন

আপনার মিটিং কি গোপনীয়?

মিটিংয়ে আপনি এমন অনেক কথা বলেন যা কখনো লিখিতভাবে প্রকাশ করতেন না — অথচ সেই মিটিং চলে এমন ক্লাউড, মডেল এবং রিটেনশন নীতির মধ্য দিয়ে, যা আপনি কখনো পড়েননি। তিনটি সুনির্দিষ্ট প্রশ্ন 'গোপনীয়' শব্দটিকে হোমপেজের একটি শব্দ থেকে যাচাই করার মতো কিছুতে পরিণত করে, আর প্রতিটির জন্য রয়েছে আমাদের উত্তর।

The Mind.com Team

ইমেইলে নতুন পোস্ট ও প্রোডাক্ট আপডেট পান

মাসে একটি ইমেইল, যাতে থাকবে নতুন পোস্ট ও প্রোডাক্ট আপডেট। যেকোনো সময় আনসাবস্ক্রাইব করতে পারবেন।


শুধু যারা ব্যবহার করেন তাদের জন্যই পে করুন: InterMIND এখন প্রতি-সক্রিয়-সদস্য বিলিংয়ে যাচ্ছে

Pro ও Business আর হাতে বরাদ্দ করা সিট বিক্রি করছে না। আপনার পুরো টিমকে আমন্ত্রণ জানান; প্রতিটি রিনিউয়ালে গত ২৮ দিনে সক্রিয় থাকা সদস্যদের গণনা করা হয় এবং শুধু তাদের জন্যই বিল করা হয়। যে সদস্য নিষ্ক্রিয় হয়ে পড়েন তিনি তাঁর অ্যাক্সেস বজায় রাখেন এবং তাঁর জন্য কোনো খরচ হয় না; মিটিংয়ের অতিথি ও বাইরের চ্যানেল অংশগ্রহণকারীরা বিনামূল্যেই থাকেন। সক্রিয় বলতে কী বোঝায়, একটি বিলিং চক্রের মধ্যে সংখ্যাটি কীভাবে বদলায়, রিনিউয়ালের আগের চিঠিতে কী লেখা থাকে এবং আপনার বিলিং পেজে কী পরিবর্তন হচ্ছে।

মিটিং চলাকালীন কাজ করে এমন AI মিটিং সহকারী: রুমে Teams Facilitator, Zoom AI Companion, Google Meet Gemini এবং InterMIND-এর Mia কী করে (2026)

একটি AI নোট টেকার কলের পরে লেখে। একটি AI মিটিং সহকারী মিটিং চলাকালেই কাজ করে: গতবার কী সিদ্ধান্ত হয়েছিল তা উপস্থিতদের মনে করিয়ে দেয়, প্রতিশ্রুতি উচ্চারিত হওয়ার মুহূর্তেই তা রেকর্ড করে, হোস্ট বললে ফলো-আপ নির্ধারণ করে এবং শেষ হওয়ার আগে পরবর্তী পদক্ষেপের প্রস্তাব দেয়। Microsoft Teams (Facilitator), Zoom (AI Companion, ZoomMate), Google Meet (Ask Gemini, next steps) এবং InterMIND (Mia)-এ এটি কেমন দেখায়, প্রতিটি ভেন্ডরের ডকুমেন্টেশন অনুযায়ী, সঙ্গে AI অংশগ্রহণকারীসহ মিটিং পরিচালনার একটি নির্দেশিকা।