আপনার নিজের কণ্ঠে কথা বলুন — এমন ভাষায়, যা আপনি বলতে পারেন না

বেশিরভাগ লাইভ অনুবাদ টুল আপনার জায়গায় একটিমাত্র যান্ত্রিক বর্ণনাকারীর কণ্ঠ বসিয়ে দেয়। InterMIND আপনার কণ্ঠ বজায় রাখে: প্রত্যেক অংশগ্রহণকারী অনুবাদটি মূল বক্তার নিজের কণ্ঠেই শুনতে পান। ক্যাসকেড কীভাবে এটি করে, Settings-এ ঐচ্ছিক সংরক্ষিত ভয়েস স্যাম্পল কী যোগ করে এবং কী কী সংরক্ষিত থাকে, তা এখানে জানুন।

The Mind.com Team

আপনার নিজের কণ্ঠে কথা বলুন — এমন ভাষায়, যা আপনি বলতে পারেন না

নিজের কণ্ঠেই কথা বলুন, এমন ভাষায় যা আপনি জানেন না

রিয়েল-টাইম অনুবাদের যে অংশটি প্রায় সবাই ভুল করে, আর যা নিয়ে প্রায় কেউ কথা বলে না, সেটি হলো: আপনি যে কণ্ঠ শোনেন।

স্পিচ রিকগনিশন চমৎকার হতে পারে, অনুবাদও চমৎকার হতে পারে, তবু মিটিংটা শেষে মনে হতে পারে যেন একটি যন্ত্র তালিকা পড়ে শোনাচ্ছে। কারণ শেষ ধাপে, অর্থাৎ অনূদিত লেখাকে আবার শব্দে রূপ দেওয়ার সময়, বেশির ভাগ টুল নীরবে আপনার জায়গায় একটি একই ধরনের কৃত্রিম বর্ণনাকারী বসিয়ে দেয়। ঘরে আটজন মানুষ, অথচ সবার জন্য একটিই রোবট-কণ্ঠ। কে বলছেন, কোন কথায় জোর পড়ছে, বক্তার ব্যক্তিত্ব, সবই হারিয়ে যায়। কথা বোঝা যায়, কিন্তু সেটি আর কথোপকথন থাকে না।

InterMIND শেষ ধাপটি অন্যভাবে করে। আপনি যখন কথা বলেন, অন্য অংশগ্রহণকারীরা অনুবাদটি শোনেন এমন কণ্ঠে যা স্পষ্টভাবে আপনারই। তাতে থাকে আপনার কণ্ঠের স্বর-বৈশিষ্ট্য (timbre) ও কথা বলার ধরন, শুধু কথাগুলো তাঁদের ভাষায়। এটি এখনো নিখুঁত অনুকরণ নয়। আসল কথা হলো, এটি তৈরি-করা কোনো বর্ণনাকারী নয়, আপনি, এবং এটি ক্রমশ আরও ভালো হচ্ছে। এটি প্রতিটি অংশগ্রহণকারীর জন্য, দুই দিকেই, একই সময়ে কাজ করে।

এই লেখাটি InterMIND-কে চালায় যে চারটি অনুবাদ পাইপলাইন, তার ভেতরের কথা লেখাটির হারানো অধ্যায়। সেই লেখায় ব্যাখ্যা করা হয়েছিল অডিও কীভাবে অনূদিত অডিওতে পরিণত হয়। এই লেখাটি বলছে, শেষ প্রান্তে যে কণ্ঠটি বেরিয়ে আসে সেটি কার।


সবাই যে ডিফল্ট দেয়, আর কেন তা একঘেয়ে

বড় মিটিং প্ল্যাটফর্মগুলোর কোনোটিতে লাইভ অনুবাদ ব্যবহার করে থাকলে আপনি এই শব্দটি চেনেন। একটি নিরপেক্ষ, সমগতির কণ্ঠ অনুবাদ পড়ে শোনায়। বক্তা আপনার CEO হয়ে টাউন হল শুরু করছেন, না কোনো সহকর্মী রসিকতা করছেন, কণ্ঠ একই থাকে। এর নিচের প্রযুক্তিটি হলো একটিমাত্র নির্দিষ্ট ভয়েস মডেলসহ টেক্সট-টু-স্পিচ, আর নকশার ধারণা হলো, কথা বোঝা গেলেই যথেষ্ট।

বাস্তব মিটিংয়ে তা যথেষ্ট নয়। একটি মিটিং যা কিছু জানায় তার অর্ধেক হলো কথাটা কে বলছেন এবং কীভাবে বলছেন। কণ্ঠ বাদ দিলে আলোচনা হয়ে যায় একটি ট্রান্সক্রিপ্ট, যা কেবল জোরে পড়া হচ্ছে। মানুষ একে অপরের কথায় সাড়া দেওয়া বন্ধ করে নিজের পালার অপেক্ষায় বসে থাকে।

InterMIND এর বদলে কী করে

অনুবাদ চলে একটি কাস্কেডেড পাইপলাইনে। একটি মডেল সবকিছু করার চেষ্টা না করে এখানে পরপর তিনটি বিশেষায়িত ধাপ কাজ করে। প্রথম দুটি ধাপ পাইপলাইন পোস্টে আলোচিত হয়েছে। এই লেখার বিষয় ভয়েস ধাপটি:

  1. ASR — স্পিচ রিকগনিশন। আপনি কথা বলার সঙ্গে সঙ্গে আপনার নিজের ভাষায় আপনার কথা ট্রান্সক্রাইব হয়। এটি আমাদের নিজস্ব ইঞ্জিনে চলে, অর্থাৎ যে মিডিয়া সার্ভার কলটি বহন করে (Mind API, OVH France), ফলে বাক্য শেষ হওয়ার আগেই অনুবাদ শুরু হতে পারে।
  2. MT — অনুবাদ। ট্রান্সক্রিপ্টকে স্থিতিশীল বাক্যাংশে, অর্থাৎ ক্লজে, ভাগ করা হয়, যাতে আপনার বাক্য শেষ হওয়ার আগেই অনুবাদ শুরু করা যায়। প্রতিটি অংশ শ্রোতার ভাষায় ধাপে ধাপে অনূদিত হয়।
  3. Zero-shot TTS — কণ্ঠ সংশ্লেষণ। প্রতিটি অনূদিত অংশ আপনার নিজের কণ্ঠের একটি নমুনা ব্যবহার করে আবার উচ্চারিত হয় এবং শ্রোতার কাছে স্ট্রিম করা হয়।

এই তৃতীয় ধাপটিই, অর্থাৎ ASR → MT → zero-shot TTS, প্রভাবটি তৈরি করে। "Zero-shot" মানে, আপনার কণ্ঠের জন্য আগে থেকে রেকর্ড করা এনরোলমেন্ট বা প্রশিক্ষণ সেশন সিস্টেমের লাগে না। আপনি যে মিটিংয়ে আছেন তারই অডিও থেকে সে আপনার কণ্ঠের মডেল তৈরি করে।

ওয়ার্ম-আপ: কীভাবে এত দ্রুত আপনার মতো শোনাতে শুরু করে

"নিজের কণ্ঠের নমুনা ব্যবহার করা" কথাটির ভেতরে একটি মুরগি-আর-ডিমের সমস্যা লুকিয়ে আছে। কলের একেবারে শুরুতে সিস্টেম আপনার কণ্ঠের ভালো মডেল তৈরি করার মতো যথেষ্ট কথা এখনো শোনেনি।

InterMIND এটি সামলায় একটি ধাপে ধাপে ওয়ার্ম-আপ দিয়ে:

  • প্রথম মোটামুটি 5–10 সেকেন্ড, যখন সে আপনার যথেষ্ট কথা সংগ্রহ করছে, প্রতিটি অনূদিত অংশ সংশ্লেষিত হয় সেই অডিও খণ্ড দিয়ে, যা আপনার মূল ভাষায় আপনি এইমাত্র যা বলেছেন তার সঙ্গে মেলে। কণ্ঠায়ন আপনার আসল, তাৎক্ষণিক কথার সঙ্গে বাঁধা থাকে।
  • যথেষ্ট দীর্ঘ নমুনা পাওয়ার পর, অর্থাৎ ওই 5–10 সেকেন্ডের মাথায়, সিস্টেম সেটিকে ধরে নেয় এবং এরপরের সবকিছু সেটি দিয়ে কণ্ঠায়ন করে।

বাস্তবে আপনি কোনো সুইচ পাল্টানো টের পান না। কথোপকথন জমে উঠলে অনুবাদ আরও বেশি আপনার মতো শোনায়। আপনার কণ্ঠের নিখুঁত প্রতিলিপি নয়, কিন্তু স্পষ্টতই যন্ত্রের নয়, আপনার, এবং মডেল যত বেশি শোনে ততই উন্নত হয়। ধাপে ধাপে অনুবাদ (বাক্য ধরে নয়, ক্লজ ধরে) এবং ধাপে ধাপে কণ্ঠায়নের সমন্বয়ই পুরো ব্যবস্থাকে বিলম্বের সীমার মধ্যে রাখে, অথচ শুনতে মানবিক রাখে।

একবার আপনার কণ্ঠ রেকর্ড করুন, ওয়ার্ম-আপ এড়িয়ে যান

উপরের ওয়ার্ম-আপ হলো ডিফল্ট, কিছু সেট আপ না করলে যা ঘটে। 2026 সালের সেপ্টেম্বর থেকে সাইন-ইন করা ব্যবহারকারীদের জন্য একটি ঐচ্ছিক দ্বিতীয় পথ আছে: Settings → Your voice in translation-এ একটি সংরক্ষিত কণ্ঠের নমুনা।

এটি রেকর্ড করা একটিমাত্র ধাপের ব্যাপার। Record my voice চাপুন, Speak now দেখা পর্যন্ত অপেক্ষা করুন, তারপর এক থেকে দশ পর্যন্ত সংখ্যাগুলো যেকোনো ক্রমে বলুন। স্পিচ ইঞ্জিন প্রতিটি সংখ্যা শোনার সঙ্গে সঙ্গে কার্ডে সেটি জ্বলে ওঠে, আর দশটিই জ্বলে উঠলে নমুনাটি যাচাই হয়ে নিজে থেকেই সংরক্ষিত হয়ে যায়। আবার চালিয়ে শোনা বা নিশ্চিত করার কিছু নেই, কোনো কাউন্টডাউনও নেই। আপনার রেকর্ডিংয়ের যে অংশে সংখ্যাগুলো আছে, কার্ড সেটুকুই রেখে দেয়। শান্ত ঘর আর একটি হেডসেট সবচেয়ে ভালো ফল দেয়।

সংরক্ষিত নমুনা কী বদলায়: আপনার পরের মিটিং থেকে সিন্থেসাইজার আপনার অনুবাদ প্রথম অংশ থেকেই এটি দিয়ে কণ্ঠায়ন করে। ফলে অন্য পক্ষ ওয়ার্ম-আপের পরে নয়, প্রথম বাক্য থেকেই আপনাকে আপনার মতো শোনে। ভেতরে এটি একই zero-shot সংশ্লেষণ, শুধু শুরুর বিন্দুটি ভালো; কল চলার সঙ্গে সঙ্গে লাইভ ওয়ার্ম-আপ তখনও কণ্ঠকে আরও পরিমার্জিত করে।

সংরক্ষণের আগে রেকর্ডিংটি যাচাই করা হয়। এতে 3 থেকে 10 সেকেন্ড স্পষ্ট কথা থাকতে হবে (সিন্থেসাইজারের ইনপুট উইন্ডো)। খুব নিচু স্বর, ক্লিপ হয়ে যাওয়া, বেশির ভাগই নীরবতা কিংবা পটভূমির শব্দে ডুবে যাওয়া হলে কার্ড আপনাকে বলে দেয় কী ঠিক করতে হবে এবং আরেকটি টেক চায়। বাক্য হিসেবে সংখ্যা বেছে নেওয়ার একটি ব্যবহারিক কারণ আছে: সংখ্যা ছোট, 23টি ভাষার প্রতিটিতেই চেনা যায়, আর ইঞ্জিন নিশ্চিত করতে পারে যে সে দশটিই শুনেছে, যা "রেকর্ডিংটা কি কাজ করেছে?" প্রশ্নটিকে একটি দৃশ্যমান "হ্যাঁ"-তে পরিণত করে।

দুই ধরনের কণ্ঠের নমুনা, দুই রকম আয়ুষ্কাল

নিরাপত্তা বা আইনি দল এই বিষয়েই সবার আগে প্রশ্ন করে, তাই এখানে সরাসরি বলা হলো। দুটি আলাদা নমুনা আছে, এবং তাদের আয়ুষ্কাল আলাদা।

মিটিংয়ের ওয়ার্ম-আপে ব্যবহৃত লাইভ নমুনাটি সাময়িক (ephemeral)। এটি শুধু লাইভ কনফারেন্স সেশনের জন্য থাকে, অনুবাদে কণ্ঠ দেওয়ার কাজে লাগে, এবং কোথাও সংরক্ষিত হয় না। রিয়েল-টাইম সেশন চালানো Mind API ও SDK কোনো ডেটা ধরে রাখে না। সাময়িক সবকিছু কনফারেন্স সেশন শেষ হলেই শেষ হয়ে যায়।

Settings থেকে নেওয়া সংরক্ষিত নমুনাটি আপনার অ্যাকাউন্টের সঙ্গে সংরক্ষিত থাকে, একটিমাত্র উদ্দেশ্যে: প্রতিবার আপনি কোনো মিটিংয়ে যোগ দিলে এটি অনুবাদ ইঞ্জিনে পাঠানো হয়, যাতে আপনার অনূদিত কথা এটি দিয়ে কণ্ঠায়ন করা যায়, আর অন্য কিছুর জন্য নয়। কার্ডে Remove চাপা পর্যন্ত এটি থাকে, চাপলে আপনি সঙ্গে সঙ্গে স্ট্যান্ডার্ড ওয়ার্ম-আপে ফিরে যান, এবং আপনার অ্যাকাউন্ট মুছলে এটিও মুছে যায়। অতিথিরা এটি রেকর্ড করতে পারেন না; নকশাগতভাবেই এটি সাইন-ইন করা ব্যবহারকারীর সুবিধা।

দুটি নমুনার কোনটি কী নয়, সেটিও স্পষ্ট থাকা দরকার: এগুলো InterMIND-এর রেকর্ডিং ফিচারের কোনোটি নয়। মিটিংয়ের ভিডিও ও অডিও রেকর্ড করা একটি আলাদা, ইচ্ছাকৃত পদক্ষেপ, যা আপনি সচেতনভাবে নেন এবং যার নিজস্ব নিয়ন্ত্রণ আছে। কণ্ঠের নমুনা হলো স্পিচ সিন্থেসাইজারের একটি ইনপুট: লাইভ ক্ষেত্রে ক্ষণস্থায়ী, আর সংরক্ষিত ক্ষেত্রে রাখা বা মুছে ফেলা আপনার হাতে।

কেন আর কেউ এটি দেয় না

ভয়েস ক্লোনিং কোনো গোপন বিষয় নয়। আসল কথা হলো, লাইভ, প্রতিটি অংশগ্রহণকারীর জন্য আলাদা, দুই দিকেই, এক সেকেন্ডের বিলম্ব-সীমার মধ্যে, 23টি ভাষায়, এবং আপনি চাননি এমন কিছু সংরক্ষণ না করে এটি করা, কোনো পডকাস্টের জন্য অফলাইনে কণ্ঠ ক্লোন করার চেয়ে ভিন্ন সমস্যা।

বড় প্ল্যাটফর্মগুলো তাদের অনুবাদকে অপ্টিমাইজ করে ক্যাপশনের কভারেজ আর একটিমাত্র নিরাপদ বর্ণনাকারী কণ্ঠের জন্য, কারণ বড় পরিসরে সেটিই সস্তা ও মজবুত ডিফল্ট। প্রত্যেক বক্তার নিজের কণ্ঠ রাখতে হলে সংশ্লেষণ ধাপকে প্রতিটি অংশগ্রহণকারীকে আলাদাভাবে অনুসরণ করতে হয়, এবং পাইপলাইনের বাকি অংশ যে বিলম্ব-সীমার মধ্যে চলে সেটির মধ্যেই থাকতে হয়। ভয়েস ইঞ্জিন আমরা নিজেরাই তৈরি করেছি, আমাদের নিজস্ব অবকাঠামোতে, আর সেজন্যই এই ট্রেড-অফ করার সিদ্ধান্ত আমাদের হাতে। (ইঞ্জিনটি কেন আমাদের নিজস্ব কোড, তা নিয়ে আরও: একটি InterMIND মিটিং কী দিয়ে তৈরি।)

এরপর কোথায় যাচ্ছি: লিপ-সিঙ্ক

নিজের কণ্ঠ ধরে রাখা একটি বড় লক্ষ্যের অর্ধেক। বাকি অর্ধেক হলো আপনার মুখ।

এখন আপনি অন্য ব্যক্তিকে তাঁর নিজের কণ্ঠে শোনেন, কিন্তু আপনি ক্যামেরায় থাকলে তাঁর ঠোঁট এখনো নড়ে তিনি আসলে যা বলেছেন সেই কথার সঙ্গে, এমন ভাষায় যা আপনি পড়তে পারেন না। পরবর্তী ধাপ হলো লিপ-সিঙ্ক: বক্তার মুখের নড়াচড়া অনূদিত অডিওর সঙ্গে নতুন করে মেলানো, যাতে আপনার স্ক্রিনে মনে হয় তিনি আপনার ভাষায় কথা বলছেন।

দুটিকে একসঙ্গে ধরলে এই কাজের পুরো উদ্দেশ্য পরিষ্কার হয়ে যায়। যে দুজন মানুষের কোনো সাধারণ ভাষা নেই, তাঁরা একটি ভিডিও কলে মুখোমুখি বসে একে অপরকে দেখছেন ও শুনছেন, যেন প্রত্যেকে অপরজনের ভাষার মাতৃভাষী। একই কণ্ঠ, একই মুখ, মাঝখানে কোনো দোভাষী নেই, স্ক্রিপ্ট পড়া কোনো রোবটও নেই।

অবস্থা নিয়ে স্পষ্ট থাকতে বলি: কণ্ঠ আজই চালু আছে; লিপ-সিঙ্ক রোডম্যাপে আছে, এখনো প্রকাশিত হয়নি। গন্তব্যটি আমরা আলাদা করে বলছি, কারণ কণ্ঠের কাজ কেন গুরুত্বপূর্ণ তা এর মধ্যেই আছে। নিজের কণ্ঠে অনুবাদ নিজেই মূল ফিচার নয়, এটি "যেকোনো ভাষায় যে কারও সঙ্গে কথা বলুন, নিজের মতো করেই" লক্ষ্যের প্রথম অর্ধেক।

কোথায় শুনবেন

নিজের কণ্ঠে অনুবাদ আজই চালু আছে, 23টি ভয়েস ভাষার সবকটিতে, অর্থাৎ ডক্সে তালিকাভুক্ত একই ভাষাগুলোতে। আলাদা করে কিছু চালু করার নেই: মিটিংয়ে অনুবাদ সক্রিয় থাকলে অংশগ্রহণকারীরা আপনা থেকেই একে অপরের নিজের কণ্ঠে শোনেন। এটি এখন কোথায় আছে, তা নিয়ে আমরা সৎ থাকতে চাই: আজই কণ্ঠটি স্পষ্টভাবে আপনার মতো শোনায়, আর সাদৃশ্য আরও কাছে নেওয়ার কাজ আমরা সক্রিয়ভাবে চালিয়ে যাচ্ছি। নিজে শুনে বিচার করুন।

অনূদিত মিটিংয়ে মনে হওয়া উচিত যে মিটিংয়ে যাঁরা সত্যিই আছেন, তাঁরাই একে অপরের সঙ্গে কথা বলছেন। নিজের কণ্ঠ ধরে রাখাই সেখানে পৌঁছনোর উপায়।

লাইভ অনুবাদ-এ আরও

লাইভ অনুবাদ-এর সব পোস্ট
তুর্কি ভয়েস অনুবাদক: ক্রিয়া আসে সবার শেষে, আর সেটাই ঠিক করে দেয় আপনার কোনটি দরকার
লাইভ অনুবাদ

তুর্কি ভয়েস অনুবাদক: ক্রিয়া আসে সবার শেষে, আর সেটাই ঠিক করে দেয় আপনার কোনটি দরকার

তুর্কি ভাষায় ক্রিয়া, নেতিবাচক রূপ এবং কাল—সবই বাক্যের শেষে বসে। শুধু এই একটি তথ্যই 'ভয়েস অনুবাদক' নামে বিক্রি হওয়া তিনটি পণ্যকে আলাদা করে দেয়: ফোন অ্যাপ, অনুবাদক ইয়ারবাড এবং রিয়েল-টাইম মিটিং অনুবাদ। একটি তুর্কি বাক্যের ক্ষেত্রে প্রতিটি কী পারে আর কী পারে না, এবং কেন কোনো ভেন্ডরের ভাষার সংখ্যা থেকে এই ভাষা-জোড়া সম্পর্কে কিছুই বোঝা যায় না।

The Mind.com Team

সাইমালটেনিয়াস ইন্টারপ্রেটার: মানব দোভাষী, RSI প্ল্যাটফর্ম, নাকি AI — আপনার বহুভাষিক মিটিংয়ের কী প্রয়োজন (2026)
লাইভ অনুবাদ

সাইমালটেনিয়াস ইন্টারপ্রেটার: মানব দোভাষী, RSI প্ল্যাটফর্ম, নাকি AI — আপনার বহুভাষিক মিটিংয়ের কী প্রয়োজন (2026)

"সাইমালটেনিয়াস ইন্টারপ্রেটার" একটি পেশা; কিন্তু বেশিরভাগ অনুসন্ধানে মানুষ আসলে যা চায় তা হলো কথা বলার সঙ্গে সঙ্গেই অন্য ভাষায় তা শোনা। এই গাইডে বুথ, RSI প্ল্যাটফর্ম এবং AI সাইমালটেনিয়াস অনুবাদকে আলাদা করা হয়েছে, টুলগুলোকে তাদের ডকুমেন্টেশনের ভিত্তিতে তুলনা করা হয়েছে — Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND — এবং সেই প্রশ্নগুলো তোলা হয়েছে যা তুলনাগুলো এড়িয়ে যায়: মিটিংয়ের কতটা অংশ আসলে আপনার ভাষায় ফিরে আসে, এবং ডেটা কোথায় প্রক্রিয়া হয়।

The Mind.com Team

সিমালটেনিয়াস অনুবাদ: বুথ, RSI, নাকি AI — এবং আপনার মিটিংয়ের জন্য কোন টুল (২০২৬)
লাইভ অনুবাদ

সিমালটেনিয়াস অনুবাদ: বুথ, RSI, নাকি AI — এবং আপনার মিটিংয়ের জন্য কোন টুল (২০২৬)

"সিমালটেনিয়াস অনুবাদ" বলতে তিনটি ভিন্ন বাস্তবতা বোঝায়: বুথে থাকা দোভাষী, দূরবর্তী সমকালীন দোভাষী পরিষেবা (RSI) এবং রিয়েল-টাইম AI অনুবাদ। এই নির্দেশিকায় তিনটিকে আলাদা করা হয়েছে এবং নথিভুক্ত টুলগুলোর তুলনা করা হয়েছে — Interprefy, KUDO, Wordly, DeepL Voice, Zoom, Teams, Google Meet, InterMIND — আর সেই প্রশ্নটিও তোলা হয়েছে যা তুলনামূলক লেখাগুলো এড়িয়ে যায়: মিটিংয়ের কতটুকু আসলে আপনার ভাষায় ফিরে আসে?

The Mind.com Team

ইমেইলে নতুন পোস্ট ও প্রোডাক্ট আপডেট পান

মাসে একটি ইমেইল, যাতে থাকবে নতুন পোস্ট ও প্রোডাক্ট আপডেট। যেকোনো সময় আনসাবস্ক্রাইব করতে পারবেন।


আমরা আমাদের GDPR অডিট শেষ করেছি। বাস্তবে আমরা যা যা সমাধান করেছি, তা এখানে।

কোনো ভেন্ডরের 'GDPR-compliant' ব্যাজ তার পেছনের কাজ ছাড়া কিছুই প্রমাণ করে না। ডেটা প্রসেসরের ওপর বর্তায় এমন GDPR বাধ্যবাধকতার বিপরীতে — ডেটা মুছে ফেলা, ডেটা সংরক্ষণ, সাব-প্রসেসর, EU রানটাইম — আমরা আমাদের নিজস্ব কোডবেসের একটি পূর্ণাঙ্গ অডিট চালিয়েছি। আমরা যে প্রতিটি বিষয় সমাধান করেছি এবং কোডের সঙ্গে মিলিয়ে যাচাই করেছি, তা এখানে তুলে ধরা হলো।

Microsoft Teams লাইভ অনুবাদ (২০২৬): এটি কীভাবে কাজ করে, খরচ কত, এবং কোথায় এর সীমা

Teams কি রিয়েল-টাইমে অনুবাদ করতে পারে? হ্যাঁ, তিনটি উপায়ে — লাইভ অনূদিত ক্যাপশন, AI Interpreter এজেন্ট এবং মানব দোভাষী চ্যানেল। প্রতিটির জন্য কোন লাইসেন্স লাগে (Teams Premium, Microsoft 365 Copilot), প্রতি ব্যবহারকারীর খরচ কত, কতগুলো ভাষা সমর্থিত, কীভাবে চালু করবেন, এবং কোন সীমাবদ্ধতাগুলো ঠিক করে দেয় এটি আপনার মিটিংয়ের জন্য উপযুক্ত কি না।