स्रोत: इलेक्ट्रोनिक न्युज, रिपोर्टर Lee Won-ji
“CLEVI, from scratch आफ्नै मोडेलबाट GAIA मा 79.07%... 3,090 मोडेलमध्ये शीर्ष 2.5%” लेखको पूर्ण उद्धरण
प्रकाशित मिति: 2026-04-07
लिङ्क: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm आफ्नै मोडेल स्ट्याकका 5 एजेन्ट सबैले 70 भन्दा बढी अंक प्राप्त गरे
सूचना हराएको अवस्थालाई ध्यानमा राख्दा 98%+ शुद्धता, मानव (92%) भन्दा बढी
AI स्टार्टअप 'CLEVI' ले from scratch आफ्नै मोडेल प्रयोग गरी विश्वव्यापी AI एजेन्ट बेन्चमार्क 'GAIA' मा 79.07% शुद्धता हासिल गरेको छ र कुल 3,090 दर्ता भएका मोडेलमध्ये शीर्ष 2.5% भित्र परेको छ।
उद्योगका अनुसार, AI बेन्चमार्क बजारमा GAIA ले 'व्यावहारिक AI एजेन्ट' को क्षमता विश्वसनीय रूपमा प्रतिबिम्बित गर्छ भन्ने मूल्याङ्कन गरिएको छ। Meta AI, HuggingFace र पेरिस–साक्ले विश्वविद्यालय आदिले संयुक्त रूपमा विकास गरेको यो बेन्चमार्क पहिलो पटक नोभेम्बर 2023 मा सार्वजनिक गरिएको थियो।
GAIA लाई अन्य बेन्चमार्कबाट अलग गर्ने मुख्य विशेषता तीनवटा छन्। पहिलो, सही उत्तरहरू सार्वजनिक नगरिएकाले ओभरफिटिङ सम्भव हुँदैन। दोस्रो, यसले मल्टिस्टेप र मल्टिमोडल जटिल तर्कको माग गर्ने भएकाले सरल प्याटर्न म्याचिङबाट उच्च अंक प्राप्त गर्न सकिँदैन। तेस्रो, HuggingFace को आधिकारिक लिडरबोर्डमार्फत विश्वभरका 3,090 भन्दा बढी मोडेलले समान सर्तमा प्रतिस्पर्धा गर्छन्।
परीक्षण सेटमा कुल 301 प्रश्न छन्। Level 1 मा एकल उपकरणको प्रयोग र सरल तर्क, Level 2 मा बहु-उपकरण संयोजन र मध्यम स्तरको तर्क, तथा Level 3 मा 5 वा बढी चरणको एजेन्ट योजना र कार्यान्वयन आवश्यक पर्ने उच्चतम कठिनाइका प्रश्नहरू समावेश छन्। बेन्चमार्क सार्वजनिक हुँदा GPT मोडेल (प्लगइनसहित) को आधारमा यो करिब 15% मात्र थियो, तर हाल शीर्ष टोलीहरूले यसलाई 70–80% को स्तरमा पुर्याएका छन्।
यसबीच, CLEVI ले उक्त उपलब्धिमा प्राविधिक रूपमा सबैभन्दा ध्यान दिनुपर्ने कुरा GPT, Claude, Gemini लगायतका बाह्य LLM API हरू बिल्कुलै प्रयोग नगरिएको हो भनेर जोड दिएको छ। CLEVI ले from scratch विधिबाट आफ्नै रूपमा विकास गरेका दुईवटा मोडेल प्रयोग गरेको हो।
cip-5.5-agent एजेन्टिक AI मोडेल हो, जसले जटिल कार्यहरू स्वायत्त रूपमा योजना (planning), कार्यान्वयन (execution) र प्रमाणीकरण (verification) गर्ने एजेन्ट पाइपलाइनको मुख्य मस्तिष्कको भूमिका निर्वाह गर्छ। cip-5.5-mm आवाज, तस्बिर, भिडियो लगायत विभिन्न फाइल स्वरूपहरू बुझेर तर्क गर्न सक्ने उच्च-प्रदर्शनयुक्त सामान्य-उद्देश्यीय मल्टिमोडल मोडेल हो। GAIA का धेरैजसो प्रश्नहरूले PDF, तस्बिर, अडियो फाइलजस्ता गैर-पाठ इनपुट समावेश गर्ने भएकाले, यो मल्टिमोडल क्षमता उच्च अंक प्राप्त गर्ने मुख्य कारक बन्यो।
CLEVI ले यी दुई स्वनिर्मित मोडेलमा आधारित भएर GAIA मा ५ वटा फरक एजेन्ट संरचना प्रस्तुत गर्यो, र सबैले ७० भन्दा बढी अंक प्राप्त गरे।
कम्पनीका अनुसार, CLEVI को आन्तरिक पश्चात् समीक्षामा रोचक नतिजा पुष्टि भयो। कुल ३०१ प्रश्नमध्ये केहीका सही उत्तरका आधारहरू हाल सार्वजनिक वेबमा हराइसकेका अवस्थामा रहेका थिए। पहिले अनलाइन वा सर्च इन्जिनमा पुष्टि गर्न सकिने जानकारी मेटाइएको वा परिवर्तन गरिएको र अब पहुँचयोग्य नरहेको अवस्था हो। हाल मानिसले सार्वजनिक रूपमा पुष्टि गर्न सक्ने जानकारीको दायराभित्र पुनर्मूल्याङ्कन गर्दा, CLEVI को सही उत्तर दर ९८% भन्दा बढी देखियो। यो मानिसको औसत ९२% लाई पहिले नै उछिनेको आँकडा हो।
CLEVI का सम्बन्धित अधिकारीले भने, “CLEVI ले बाह्य मोडेल मिश्रण नगरी, from scratch स्वनिर्मित मोडेल र आफ्नै AI एजेन्ट समाधानहरू मात्र प्रयोग गरेर ५ वटै एजेन्टमा ७०+ अंक प्राप्त गर्दै सार्वजनिक बेन्चमार्कको शीर्ष २.५% मा प्रवेश गरेको छ। भविष्यमा स्वनिर्मित मोडेल र एजेन्ट समाधानहरू सुधार गर्दै आधिकारिक स्कोरमा थप वृद्धि सम्भव हुने देखिन्छ। यो उपलब्धि वैश्विक सार्वजनिक बेन्चमार्कमा वास्तविक मापन भई ‘प्रमाणित विश्वसनीयता’ देखाउने कुरा, दक्षिण कोरियाली AI विकासकको from scratch स्वनिर्मित मोडेलमा आधारित उपलब्धि हुनु, बाह्य मोडेल मिश्रण नभई स्वतन्त्र मोडेल स्ट्याकको नतिजा हुनु, र केही प्रश्नका जानकारी हराएको कुरालाई ध्यानमा राख्दा स्कोरभन्दा पनि बढी व्याख्यात्मक महत्त्व राख्नुका कारण महत्त्वपूर्ण छ।”
