মেটা এমন একটি কৃত্রিম বুদ্ধিমত্তা (এআই) মডেল উন্মোচন করেছে, যা একসঙ্গে একাধিক ব্যক্তির কথা শনাক্ত করে রিয়েল-টাইম বা তাৎক্ষণিকভাবে লিখিত রূপ দিতে পারে। ‘মিউজ ভয়েস ট্রান্সক্রাইব’ নামের মডেলটি একই সময়ে একাধিক ভাষা এবং একটি বাক্যে ভাষা পরিবর্তনের বিষয়ও শনাক্ত করতে পারে।
জাকারবার্গ জানান, এই মডেল নিজে থেকে ঠিক করে কখন শুনতে হবে। কঠিন শব্দের ক্ষেত্রে এটি একটু বেশি সময় নেয় এবং সহজ শব্দের ক্ষেত্রে দ্রুত কাজ করে। ফলে এর নির্ভুলতা অনেক বেড়ে যায়। এটি সাধারণ ও কোলাহলপূর্ণ অডিওতেও চমৎকার কাজ করে। ৭০টির বেশি ভাষার ওপর মডেলটিকে প্রশিক্ষণ দেওয়া হয়েছে। এর মধ্যে ২৫টি ভাষা শুরুতে ব্যবহার করা যাবে। মডেলটি এক ঘণ্টার দীর্ঘ কথোপকথন সামলাতে পারে।
গুগলের নিজস্ব অডিও মডেল ‘জেমিনাই ৩.৫ ট্রান্সক্রাইব’ আসার এক সপ্তাহের কম সময়ের মধ্যে মেটা তাদের এই নতুন প্রযুক্তি নিয়ে এল। গুগল তাদের মডেলটি অ্যান্ড্রয়েড ও ক্রোম ব্রাউজারে যুক্ত করার ঘোষণা দিলেও মেটা তাদের প্রধান সেবাগুলোতে এটি যুক্ত করবে কি না, তা এখনো স্পষ্ট নয়।
বর্তমানে ব্যবহারকারীরা মেটার সদ্য প্রকাশিত ‘মেটা এআই ম্যাক’ অ্যাপে এই নতুন মডেলের সুবিধা উপভোগ করতে পারবেন। এই ম্যাক অ্যাপ অন্যান্য অ্যাপেও ভয়েস সুবিধা দিতে সক্ষম। ডেভেলপাররা ‘মিউজ কোড’ এবং মেটার মডেল এপিআইয়ের মাধ্যমে এটি ব্যবহার করতে পারবেন। প্রতি এক হাজার অডিও মিনিটের জন্য খরচ হবে ৩ মার্কিন ডলার। মেটার রিসার্চ ব্লগে এর একটি ডেমো বা পরীক্ষামূলক সংস্করণও রয়েছে।
মিউজ ভয়েস ট্রান্সক্রাইব মডেলটি তৈরি করেছে মেটা সুপার ইন্টেলিজেন্স ল্যাব (এমএসআই)। সম্প্রতি এই ল্যাব থেকে একটি নতুন কোডিং এজেন্ট ও ওপেন-ওয়েট মডেলও প্রকাশ করা হয়েছে।




