উৎস: ইলেকট্রনিক নিউজ, প্রতিবেদক লি ওন-জি
“ক্লেভি, from scratch নিজস্ব মডেল দিয়ে GAIA-তে 79.07%...3,090টি মডেলের মধ্যে শীর্ষ 2.5%” নিবন্ধটির সম্পূর্ণ উদ্ধৃতি
প্রকাশের তারিখ: 2026-04-07
লিংক: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm স্বতন্ত্র মডেল স্ট্যাকের 5টি এজেন্টই 70-এর বেশি স্কোর
তথ্য হারানোর বিষয়টি বিবেচনায় নিলে 98%+ সঠিকতার হার, মানুষের (92%) চেয়েও বেশি
AI স্টার্টআপ 'ক্লেভি' from scratch নিজস্ব মডেল ব্যবহার করে বৈশ্বিক AI এজেন্ট বেঞ্চমার্ক 'GAIA'-তে 79.07% সঠিকতার হার অর্জন করেছে এবং নিবন্ধিত মোট 3,090টি মডেলের ভিত্তিতে শীর্ষ 2.5%-এর মধ্যে স্থান করে নিয়েছে।
শিল্পসংশ্লিষ্টদের ব্যাখ্যা অনুযায়ী, AI বেঞ্চমার্ক বাজারে GAIA 'ব্যবহারিক AI এজেন্ট'-এর সক্ষমতা বিশ্বস্তভাবে প্রতিফলিত করে বলে মূল্যায়িত হয়। মেটা AI, HuggingFace এবং প্যারিস-সাকলে বিশ্ববিদ্যালয়সহ অন্যান্য প্রতিষ্ঠান যৌথভাবে তৈরি এই বেঞ্চমার্কটি 2023 সালের নভেম্বরে প্রথম প্রকাশিত হয়।
GAIA-কে অন্যান্য বেঞ্চমার্ক থেকে আলাদা করে এমন মূল বৈশিষ্ট্য তিনটি। প্রথমত, সঠিক উত্তর প্রকাশ করা হয় না, তাই overfitting অসম্ভব। দ্বিতীয়ত, multi-step·multimodal জটিল যুক্তি প্রয়োজন হওয়ায় সাধারণ pattern matching দিয়ে উচ্চ স্কোর করা অসম্ভব। তৃতীয়ত, HuggingFace-এর অফিসিয়াল লিডারবোর্ডের মাধ্যমে বিশ্বজুড়ে 3,090টিরও বেশি মডেল একই শর্তে প্রতিযোগিতা করে।
টেস্টসেটটি মোট 301টি প্রশ্ন নিয়ে গঠিত। Level 1-এ একটি টুল ব্যবহার ও সরল যুক্তি, Level 2-এ একাধিক টুলের সমন্বয় ও মধ্যম স্তরের যুক্তি, এবং Level 3-এ 5 বা তার বেশি ধাপের এজেন্ট পরিকল্পনা ও বাস্তবায়ন প্রয়োজন এমন সর্বোচ্চ কঠিন প্রশ্ন থাকে। বেঞ্চমার্ক প্রকাশের সময় GPT মডেল (প্লাগইন সংযুক্ত) প্রায় 15%-এ সীমাবদ্ধ ছিল, আর বর্তমানে শীর্ষস্থানীয় দলগুলো সেটিকে 70~80%-এ উন্নীত করেছে।
এর মধ্যে, ক্লেভি জোর দিয়ে বলেছে যে এই সাফল্যের ক্ষেত্রে প্রযুক্তিগতভাবে সবচেয়ে মনোযোগযোগ্য বিষয় হলো GPT, Claude, Gemini-সহ কোনো বাহ্যিক LLM API একেবারেই ব্যবহার না করা। ক্লেভির বৈশিষ্ট্য হলো from scratch পদ্ধতিতে স্বাধীনভাবে তৈরি দুটি মডেল ব্যবহার করা।
cip-5.5-agent একটি এজেন্টিক AI মডেল, যা জটিল কাজ স্বায়ত্তশাসিতভাবে পরিকল্পনা (planning)·সম্পাদন (execution)·যাচাই (verification) করা এজেন্ট পাইপলাইনের মূল মস্তিষ্ক হিসেবে কাজ করে। cip-5.5-mm হলো উচ্চক্ষমতাসম্পন্ন সাধারণ-উদ্দেশ্য মাল্টিমোডাল মডেল, যা অডিও·ছবি·ভিডিওসহ বিভিন্ন ফাইল ফরম্যাট বুঝতে ও যুক্তি প্রয়োগ করতে পারে। GAIA-এর উল্লেখযোগ্য সংখ্যক প্রশ্নে PDF, ছবি, অডিও ফাইলের মতো অ-পাঠ্য ইনপুট অন্তর্ভুক্ত থাকায়, এই মাল্টিমোডাল সক্ষমতা উচ্চ স্কোরের মূল কারণ হয়ে উঠেছে।
ক্লেভি এই দুই নিজস্ব মডেলের ভিত্তিতে ৫টি ভিন্ন এজেন্ট কনফিগারেশন নিয়ে GAIA-তে অংশগ্রহণ করেছে, এবং সবাই ৭০-এর বেশি স্কোর করেছে।
প্রতিষ্ঠানটির ব্যাখ্যা অনুযায়ী, ক্লেভির অভ্যন্তরীণ পরবর্তী পর্যালোচনায় একটি আকর্ষণীয় ফলাফল পাওয়া গেছে। মোট ৩০১টি প্রশ্নের মধ্যে কিছু প্রশ্নের সঠিক উত্তরের প্রমাণ বর্তমানে উন্মুক্ত ওয়েবে আর পাওয়া যায় না। অতীতে অনলাইনে বা সার্চ ইঞ্জিনে যাচাই করা সম্ভব ছিল এমন তথ্য মুছে ফেলা বা পরিবর্তন করা হয়েছে, ফলে সেগুলো আর প্রবেশযোগ্য নয়। বর্তমানে মানুষ প্রকাশ্যে যাচাই করতে পারে এমন তথ্যের পরিসরের মধ্যে পুনর্মূল্যায়ন করা হলে, ক্লেভির সঠিকতার হার ৯৮%-এর বেশি দেখা গেছে। এটি ইতিমধ্যেই মানুষের গড় ৯২%-কে ছাড়িয়ে যাওয়া একটি পরিসংখ্যান।
ক্লেভির এক কর্মকর্তা ব্যাখ্যা করেছেন, “ক্লেভি কোনো বাহ্যিক মডেল মিশ্রণ ছাড়াই, from scratch নিজস্ব মডেল এবং নিজস্ব AI এজেন্ট সমাধান ব্যবহার করে ৫টি এজেন্টের সবাইকে ৭০+ স্কোর করিয়ে উন্মুক্ত বেঞ্চমার্কে শীর্ষ ২.৫%-এ প্রবেশ করেছে। ভবিষ্যতে নিজস্ব মডেল·এজেন্ট সমাধানের উন্নতির মাধ্যমে আনুষ্ঠানিক স্কোরও আরও বাড়ানো সম্ভব হবে বলে মনে হচ্ছে। এই অর্জনের তাৎপর্য গভীর—কারণ এটি বৈশ্বিক উন্মুক্ত বেঞ্চমার্কে বাস্তব পরিমাপের মাধ্যমে ‘যাচাইকৃত আস্থা’ প্রদর্শন করে, দেশীয় AI উন্নয়ন প্রতিষ্ঠানের from scratch নিজস্ব মডেলভিত্তিক অর্জন হিসেবে বিবেচিত হয়, বাহ্যিক মডেল মিশ্রণ নয় বরং স্বতন্ত্র মডেল স্ট্যাকের ফলাফল, এবং কিছু প্রশ্নের তথ্য হারিয়ে যাওয়ার বিষয়টি বিবেচনায় নিলে স্কোরের চেয়েও বেশি ব্যাখ্যামূলক মূল্য বহন করে।”
