নিজের কণ্ঠেই কথা বলুন, এমন ভাষায় যা আপনি জানেন না
রিয়েল-টাইম অনুবাদের যে অংশটি প্রায় সবাই ভুল করে, আর যা নিয়ে প্রায় কেউ কথা বলে না, সেটি হলো: আপনি যে কণ্ঠ শোনেন।
স্পিচ রিকগনিশন চমৎকার হতে পারে, অনুবাদও চমৎকার হতে পারে, তবু মিটিংটা শেষে মনে হতে পারে যেন একটি যন্ত্র তালিকা পড়ে শোনাচ্ছে। কারণ শেষ ধাপে, অর্থাৎ অনূদিত লেখাকে আবার শব্দে রূপ দেওয়ার সময়, বেশির ভাগ টুল নীরবে আপনার জায়গায় একটি একই ধরনের কৃত্রিম বর্ণনাকারী বসিয়ে দেয়। ঘরে আটজন মানুষ, অথচ সবার জন্য একটিই রোবট-কণ্ঠ। কে বলছেন, কোন কথায় জোর পড়ছে, বক্তার ব্যক্তিত্ব, সবই হারিয়ে যায়। কথা বোঝা যায়, কিন্তু সেটি আর কথোপকথন থাকে না।
InterMIND শেষ ধাপটি অন্যভাবে করে। আপনি যখন কথা বলেন, অন্য অংশগ্রহণকারীরা অনুবাদটি শোনেন এমন কণ্ঠে যা স্পষ্টভাবে আপনারই। তাতে থাকে আপনার কণ্ঠের স্বর-বৈশিষ্ট্য (timbre) ও কথা বলার ধরন, শুধু কথাগুলো তাঁদের ভাষায়। এটি এখনো নিখুঁত অনুকরণ নয়। আসল কথা হলো, এটি তৈরি-করা কোনো বর্ণনাকারী নয়, আপনি, এবং এটি ক্রমশ আরও ভালো হচ্ছে। এটি প্রতিটি অংশগ্রহণকারীর জন্য, দুই দিকেই, একই সময়ে কাজ করে।
এই লেখাটি InterMIND-কে চালায় যে চারটি অনুবাদ পাইপলাইন, তার ভেতরের কথা লেখাটির হারানো অধ্যায়। সেই লেখায় ব্যাখ্যা করা হয়েছিল অডিও কীভাবে অনূদিত অডিওতে পরিণত হয়। এই লেখাটি বলছে, শেষ প্রান্তে যে কণ্ঠটি বেরিয়ে আসে সেটি কার।
সবাই যে ডিফল্ট দেয়, আর কেন তা একঘেয়ে
বড় মিটিং প্ল্যাটফর্মগুলোর কোনোটিতে লাইভ অনুবাদ ব্যবহার করে থাকলে আপনি এই শব্দটি চেনেন। একটি নিরপেক্ষ, সমগতির কণ্ঠ অনুবাদ পড়ে শোনায়। বক্তা আপনার CEO হয়ে টাউন হল শুরু করছেন, না কোনো সহকর্মী রসিকতা করছেন, কণ্ঠ একই থাকে। এর নিচের প্রযুক্তিটি হলো একটিমাত্র নির্দিষ্ট ভয়েস মডেলসহ টেক্সট-টু-স্পিচ, আর নকশার ধারণা হলো, কথা বোঝা গেলেই যথেষ্ট।
বাস্তব মিটিংয়ে তা যথেষ্ট নয়। একটি মিটিং যা কিছু জানায় তার অর্ধেক হলো কথাটা কে বলছেন এবং কীভাবে বলছেন। কণ্ঠ বাদ দিলে আলোচনা হয়ে যায় একটি ট্রান্সক্রিপ্ট, যা কেবল জোরে পড়া হচ্ছে। মানুষ একে অপরের কথায় সাড়া দেওয়া বন্ধ করে নিজের পালার অপেক্ষায় বসে থাকে।