উৎস: ডিজিটালটাইমস, প্রতিবেদক গুবন গিউ
“এআই স্টার্টআপ ক্লেভি, GAIA-এর শীর্ষ ২.৫%-এ প্রবেশ… যাচাইকৃত বিশ্বাসযোগ্যতা প্রদর্শন” নিবন্ধের সম্পূর্ণ উদ্ধৃতি
প্রকাশের তারিখ ২০২৬-০৪-০৮
লিংক : https://n.news.naver.com/article/029/0003020511?sid=105
দেশীয় এআই স্টার্টআপ ‘ক্লেভি (Clevi)’ from scratch পদ্ধতিতে তৈরি নিজস্ব মডেল ও নিজস্ব এজেন্ট সলিউশন নির্মাণের পাশাপাশি জানিয়েছে যে, দেশের প্রথম প্রতিষ্ঠান হিসেবে GAIA বেঞ্চমার্কে নিবন্ধিত মোট ৩,০৯০টি মডেলের ভিত্তিতে শীর্ষ ২.৫%-এ প্রবেশ করেছে।
শিল্পসংশ্লিষ্টদের ব্যাখ্যা অনুযায়ী, মেটা এআই-এর নকশা করা এবং হাগিং ফেস পরিচালিত GAIA এআই-এর কাছে ‘শুধু একটি কাজে দক্ষ হওয়ার ক্ষমতা’ নয়, বরং ‘বিভিন্ন সক্ষমতা সমন্বয় করে বাস্তব সমস্যার সমাধান করার ক্ষমতা’ দাবি করে। ওয়েবে তথ্য খুঁজে বের করা, PDF-এর ভেতরের টেবিল পড়া, ছবি বিশ্লেষণ করা, কোড চালিয়ে হিসাব করা এবং ফলাফলগুলো সমন্বয় করে একটি চূড়ান্ত উত্তর দিতে হয়। ৩০১টি গোপন প্রশ্ন, তিন স্তরের কঠিনতা এবং উত্তর প্রকাশ না করার নীতির কারণে এটি এমন একটি কাঠামো, যেখানে অতিরিক্ত ফিটিং বা প্রতারণা অসম্ভব।
এই পরীক্ষায় উচ্চ স্কোর পেতে দুটি বিষয় প্রয়োজন। একটি হলো ভিত্তি হিসেবে থাকা ভাষা মডেলের যুক্তি করার সক্ষমতা, আর অন্যটি হলো সেই মডেলকে বাস্তব বিশ্বের বিভিন্ন টুলের সঙ্গে যুক্ত করে স্বায়ত্তশাসিতভাবে কাজ সম্পাদন করানোর এজেন্ট সলিউশন। মডেল যতই ভালো হোক, এজেন্ট দুর্বল হলে Level 3 সমাধান করা যায় না; আবার এজেন্ট যতই পরিশীলিত হোক, মডেলের যুক্তি করার ক্ষমতা অপর্যাপ্ত হলে মধ্যবর্তী ধাপেই ভুল উত্তর ছড়িয়ে পড়ে।
GAIA লিডারবোর্ডের বর্তমান কাঠামো দেখলে একটি আকর্ষণীয় প্রবণতা দেখা যায়। শীর্ষস্থানীয় অধিকাংশ এজেন্ট GPT, Claude, Gemini-সহ বিভিন্ন বিগ টেক মডেল সমন্বয়কারী ‘মাল্টি-মডেল মিক্স’ কৌশল গ্রহণ করেছে। প্রতিটি মডেলের শক্তি একত্র করা এবং তথ্য হারানোর মতো কারণে স্কোর কমে যাওয়া প্রতিরোধ করার জন্য এটি একটি যৌক্তিক পদ্ধতি।
অন্যদিকে, ক্লেভি সেই সারিতে যোগ দেয়নি। from scratch পদ্ধতিতে তৈরি cip-5.5-agent (এজেন্টিক এআই) জটিল কাজের পরিকল্পনা, সম্পাদন ও যাচাই স্বায়ত্তশাসিতভাবে পরিচালনা করে, আর cip-5.5-mm (উচ্চক্ষমতাসম্পন্ন সাধারণ মাল্টিমোডাল) অডিও, ছবি, ভিডিওসহ বিভিন্ন ফাইল ফরম্যাট বুঝতে ও যুক্তি প্রয়োগ করতে পারে। এই দুটি মডেলই ক্লেভির অভ্যন্তরে স্বতন্ত্রভাবে তৈরি হয়েছে এবং কোনো বহিরাগত LLM API একেবারেই ব্যবহার করা হয়নি।
এবং এই নিজস্ব মডেল স্ট্যাক দিয়ে GAIA-তে ৫টি এজেন্ট প্রতিযোগিতায় নামিয়ে, সবাই ৭০-এর ঘরে বা তার বেশি স্কোর করেছে। সর্বোচ্চ ৭৯.০৭% থেকে ৭০.৭৬% পর্যন্ত—এটি কোনো একক ফলাফলের সৌভাগ্য নয়, বরং পুরো স্ট্যাকের স্থিতিশীলতার প্রমাণ।
প্রতিষ্ঠানটির ব্যাখ্যা অনুযায়ী, আনুষ্ঠানিক স্কোর ৭৯.০৭%-এর পেছনে আরও একটি সংখ্যা রয়েছে। ক্লেভির অভ্যন্তরীণ পরবর্তী পর্যালোচনায় দেখা গেছে, ৩০১টি প্রশ্নের মধ্যে উল্লেখযোগ্য সংখ্যক প্রশ্নের সঠিক উত্তরের প্রমাণ বর্তমানে উন্মুক্ত ওয়েবে আর পাওয়া যায় না। যেসব প্রশ্নের সঠিক উত্তর এখনও ওয়েবে বিদ্যমান, কেবল সেগুলোর ভিত্তিতে পুনর্মূল্যায়ন করলে ক্লেভির সঠিকতার হার ৯৮%-এর বেশি ছিল। এই হার ইতোমধ্যে মানব গড় (৯২%)-কে ছাড়িয়ে গেছে।
অবশ্য অন্য প্রতিষ্ঠানের শক্তিশালী সাধারণ উদ্দেশ্যের মডেল মিশ্রিত করলে আনুষ্ঠানিক স্কোর আরও বাড়ানো সম্ভব হতো। কিন্তু ক্লেভি ইচ্ছাকৃতভাবে সেই কৌশল গ্রহণ করেনি। কারণ এই বেঞ্চমার্কের লক্ষ্য ছিল সর্বোচ্চ স্কোরের প্রতিযোগিতা নয়, বরং from scratch নিজস্ব মডেল বৈশ্বিক মঞ্চে প্রতিযোগিতা করার মতো পর্যায়ে পৌঁছেছে কি না, তা যাচাই করা।
GAIA লিডারবোর্ডে নাম ওঠার অর্থ হলো, তৃতীয় পক্ষের স্বাধীন মূল্যায়নে স্বীকৃত যাচাইকৃত বিশ্বাসযোগ্যতা অর্জন করা—এটির তাৎপর্য অনেক বড়। বিনিয়োগ সংগ্রহ, বিদেশে সম্প্রসারণ এবং B2B বিক্রয়—সব ক্ষেত্রেই এটি ব্যবহারযোগ্য একটি বস্তুনিষ্ঠ ভিত্তি।
ক্লেভির এক কর্মকর্তা বলেন, “আনুষ্ঠানিকভাবে ভুল হওয়া ৬৩টি উত্তরের উল্লেখযোগ্য অংশের কারণ ছিল আউটপুট ফরম্যাটের অসামঞ্জস্য, ভিজ্যুয়াল উপাদান ব্যাখ্যার ত্রুটি এবং তথ্য হারিয়ে যাওয়ার কারণে উত্তর দিতে না পারা প্রশ্ন। এটি যৌক্তিক যুক্তির মৌলিক সীমাবদ্ধতার চেয়ে বরং পরবর্তী প্রক্রিয়াকরণের সূক্ষ্মতা এবং বাহ্যিক তথ্যের প্রাপ্যতার সমস্যা। নিজস্ব মডেল হওয়ায় ক্লেভি নিজেই এর উন্নতি করতে পারে। এটিই from scratch নিজস্ব মডেলের কাঠামোগত সুবিধা। ক্লেভির এই সাফল্য কোরিয়ার AI শিল্পের সামনে প্রশ্ন রাখে—‘আমরা আর কতদিন “ধার করা মস্তিষ্কের” ওপর নির্ভর করব?’ ক্লেভি from scratch-এর কঠিনতর পথ বেছে নিয়েছে এবং বৈশ্বিক মঞ্চে তার উত্তর প্রমাণ করতে চায়।”
