একটি InterMIND মিটিংয়ে লাইভ অনুবাদ, ক্যাপশন এবং অনুসন্ধানযোগ্য ট্রান্সক্রিপ্ট কীভাবে একসঙ্গে কাজ করে
চারটি টাইম জোনে ছড়িয়ে থাকা একটি টিমের ভাষার সমস্যা ক্যালেন্ডার আমন্ত্রণে ধরা পড়ে না, সেটি শুরু হয় কেউ কথা বলা শুরু করার মুহূর্তেই। লাইভ অনুবাদ, লাইভ ক্যাপশন এবং ফিরে দেখার মতো একটি ট্রান্সক্রিপ্ট, এই তিনটিই আসলে সেই বাধা দূর করে। আজকাল এগুলো ক্রমেই একটি প্রোডাক্ট পেজে একসঙ্গে দেখা যায় এবং তিনটি আলাদা অ্যাড-অনের বদলে একটি বান্ডল হিসেবে বর্ণনা করা হয়।
একটি সাম্প্রতিক উদাহরণ হলো ওয়ার্কপ্লেস প্ল্যাটফর্ম NexGen Virtual Workplace-এর সেপ্টেম্বর 2026-এর একটি পোস্ট। সেটি শুরু হয় এভাবে: "Live voice translation, meeting captions, and searchable transcripts, built into the workday rather than bolted onto the meeting", এবং বলে: "these features are available within the NexGen Virtual Workplace platform for subscribers to use।" পুরো বিবরণ এটুকুই। পোস্টে সমর্থিত ভাষার সংখ্যা বলা হয়নি, কোন সাবস্ক্রিপশন টিয়ারে এই তিনটি ফিচার পাওয়া যায় তা বলা হয়নি, এবং "searchable" বলতে কী বোঝানো হচ্ছে তাও ব্যাখ্যা করা হয়নি, শুধু বলা হয়েছে "people can also look up past transcriptions... for a reference" (সেপ্টেম্বর 2026-এ যাচাই করা, সূত্র শেষে দেওয়া আছে)। এটি ভেন্ডরের সমালোচনা নয়। বান্ডলটি নিজের টিমের জন্য উপযুক্ত কি না তা জানতে পাঠককে এই তথ্য অন্য কোথাও খুঁজে নিতে হবে, অথবা বিশ্বাস করে নিতে হবে।
অনুবাদ, ক্যাপশন, ট্রান্সক্রিপ্ট, এই তিনটি শব্দ বিভিন্ন প্রোডাক্টে বেশ ভিন্ন ভিন্ন কার্যপদ্ধতি বোঝাতে ব্যবহৃত হয়। তাই InterMIND-এ আজ এগুলো ঠিক কীভাবে কাজ করে, তার যাচাইযোগ্য বিবরণ নিচে দেওয়া হলো।
অনুবাদ: আপনি এটি চালু করেন, আর কণ্ঠটি আপনার নিজের
অনুবাদ নিজে থেকে চালু থাকে না। আপনি প্রতিটি মিটিংয়ে ইচ্ছা করে এটি চালু করেন, কন্ট্রোল বারের More মেনু থেকে (অথবা Alt+T শর্টকাট দিয়ে), এবং রুমে অন্তত দুটি ভাষা থাকলেই এটি পাওয়া যায়। এরপর প্রতিটি অংশগ্রহণকারী নিজের অনুবাদ ভাষা স্বতন্ত্রভাবে ঠিক করেন। পাঁচজনের কলে পাঁচটি ভাষা থাকলে প্রত্যেকে অন্য সবার কথা একই সঙ্গে নিজের ভাষায় অনূদিত অবস্থায় শোনেন।
আউটপুট কোনো একঘেয়ে ন্যারেটরের কণ্ঠ নয়। স্পিচ রিকগনিশন, বাক্য বিভাজন, অনুবাদ এবং ভয়েস সিনথেসিস একটি পাইপলাইন হিসেবে চলে। শেষ ধাপে অনূদিত বাক্যটি মূল বক্তার নিজের কণ্ঠের একটি রূপে পুনরায় সংশ্লেষিত হয়। ফলে কণ্ঠটি চেনা যায়, এটি সমতল টেক্সট-টু-স্পিচ পাঠ নয়। পাইপলাইনটি কীভাবে কাজ করে তার প্রযুক্তিগত বিশ্লেষণ রয়েছে আলাদা একটি পোস্টে। এখানে সারকথা হলো, অনুবাদ চালু থাকলে শুধু "কী বলা হয়েছে" নয়, "কে বলেছে"-ও অনুবাদের পরে টিকে থাকে। ভয়েস, চ্যাট ও শেয়ার্ড নোটের জন্য 23টি ভাষা সমর্থিত, আর পূর্ণ ডকুমেন্ট ফাইল অনুবাদের জন্য 30টি। এই পার্থক্য এবং তার কারণ রয়েছে ভাষার বিস্তারিত বিবরণে।