स्रोत: डिजिटल टाइम्स, रिपोर्टर गु बोन-ग्यु
“AI स्टार्टअप CLEVI, GAIA को शीर्ष 2.5% मा प्रवेश… प्रमाणित विश्वसनीयता प्रदर्शन” शीर्षकको लेखको पूर्ण उद्धरण
प्रकाशित मिति 2026-04-08
लिङ्क : https://n.news.naver.com/article/029/0003020511?sid=105
दक्षिण कोरियाली AI स्टार्टअप ‘CLEVI (Clevi)’ ले from scratch निर्माण गरेको आफ्नै मोडेल र आफ्नै एजेन्ट समाधान विकास गरेको अवस्थामा, दक्षिण कोरियामा पहिलोपटक GAIA बेन्चमार्कमा दर्ता भएका कुल 3,090 मोडेलमध्ये शीर्ष 2.5% मा प्रवेश गरेको घोषणा गरेको छ।
उद्योगका जानकारहरूका अनुसार, Meta AI ले डिजाइन गरेको र Hugging Face ले सञ्चालन गर्ने GAIA ले AI सँग ‘एउटा कुरा मात्र राम्रोसँग गर्ने क्षमता’ होइन, ‘धेरै क्षमताहरू संयोजन गरेर वास्तविक समस्या समाधान गर्ने क्षमता’ माग गर्छ। वेबमा जानकारी खोज्नुपर्ने, PDF भित्रका तालिका पढ्नुपर्ने, तस्बिर विश्लेषण गर्नुपर्ने, कोड चलाएर गणना गर्नुपर्ने र ती परिणामहरूलाई समेटेर एउटा सही उत्तर प्रस्तुत गर्नुपर्ने हुन्छ। 301 वटा गोप्य प्रश्न, तीन तहका कठिनाइ र उत्तर गोप्य राख्ने सिद्धान्तका कारण यो अतिअनुकूलन वा चिटिङ गर्न असम्भव हुने संरचना हो।
उक्त परीक्षामा उच्च अंक प्राप्त गर्न दुई कुरा आवश्यक हुन्छन्। आधारका रूपमा रहेको भाषा मोडेलको तर्क क्षमता र त्यस मोडेललाई वास्तविक संसारका उपकरणहरूसँग जोडेर स्वायत्त रूपमा कार्य गर्न सक्षम बनाउने एजेन्ट समाधान। मोडेल जति राम्रो भए पनि एजेन्ट कमजोर भएमा Level 3 समाधान गर्न सकिँदैन, र एजेन्ट जति परिष्कृत भए पनि मोडेलको तर्क क्षमता अपर्याप्त भएमा मध्य चरणमै गलत उत्तरहरू फैलिन्छन्।
GAIA लिडरबोर्डको वर्तमान संरचना हेर्दा एउटा रोचक ढाँचा देखिन्छ। शीर्ष स्थानका अधिकांश एजेन्टहरूले GPT, Claude, Gemini लगायत विभिन्न ठूला प्रविधि कम्पनीका मोडेलहरू संयोजन गर्ने ‘बहु-मोडेल मिश्रण’ रणनीति अपनाएका छन्। प्रत्येक मोडेलका सबल पक्षहरू संयोजन गर्ने र जानकारी गुम्नेजस्ता कारणले हुने अंकको कमीबाट बच्ने यो तर्कसंगत दृष्टिकोण हो।
तर CLEVI उक्त समूहमा सामेल भएन। from scratch विधिबाट विकसित cip-5.5-agent (एजेन्टिक AI) ले जटिल कार्यहरूको योजना, कार्यान्वयन र प्रमाणीकरण स्वायत्त रूपमा गर्छ, जबकि cip-5.5-mm (उच्च-प्रदर्शनको सामान्य-प्रयोग बहुमोडल) ले ध्वनि, तस्बिर, भिडियो लगायत विभिन्न फाइल ढाँचाहरू बुझेर तर्क गर्छ। यी दुवै मोडेल CLEVI भित्रै स्वतन्त्र रूपमा विकसित गरिएका हुन् र बाह्य LLM API कुनै पनि प्रयोग गरिएको छैन।
र यसै मौलिक मोडल स्ट्याकबाट GAIA मा ५ वटा एजेन्ट सहभागी गराई, सबैले ७० भन्दा बढी अंक प्राप्त गरे। उच्चतम 79.07% देखि 70.76% सम्मका नतिजाले एउटै परिणामको भाग्य नभई सम्पूर्ण स्ट्याकको स्थिरता प्रमाणित गरेको छ।
कम्पनीको विवरणअनुसार, आधिकारिक 79.07% स्कोर पछाडि अर्को अंक पनि छ। CLEVI को आन्तरिक पोस्ट-रिभ्युका क्रममा ३०१ प्रश्नमध्ये हाल सार्वजनिक वेबमा सही उत्तरको प्रमाण हराइसकेका प्रश्नहरू उल्लेख्य सङ्ख्यामा रहेको पुष्टि भयो। हाल पनि सही उत्तर वेबमा उपलब्ध रहेका प्रश्नहरूलाई मात्र आधार मानी पुनर्मूल्याङ्कन गर्दा, CLEVI को सही उत्तर दर 98% भन्दा बढी थियो। यो मानव औसत (92%) भन्दा पहिले नै माथि पुगेको अंक हो।
निस्सन्देह, अन्य कम्पनीका शक्तिशाली सामान्य-प्रयोगका मोडलहरू मिसाएको भए आधिकारिक स्कोर अझ बढाउन सकिन्थ्यो। तर CLEVI ले जानाजानी त्यो रणनीति अपनाएन। किनकि यस बेन्चमार्कको लक्ष्य उच्चतम स्कोरको प्रतिस्पर्धा गर्नु नभई, from scratch आफ्नै मोडल विश्वव्यापी मञ्चमा प्रतिस्पर्धा गर्न सक्ने स्तरमा पुगेको छ कि छैन भनेर प्रमाणीकरण गर्नु थियो।
GAIA लिडरबोर्डमा नाम समावेश हुनुको ठूलो महत्त्व भनेको तेस्रो पक्षको स्वतन्त्र मूल्याङ्कनबाट प्रदान गरिएको प्रमाणित विश्वसनीयता प्राप्त हुनु हो। यो लगानी भित्र्याउने, विदेश विस्तार गर्ने र B2B बिक्रीका सबै चरणमा प्रयोग गर्न सकिने वस्तुगत आधार बन्छ।
CLEVI का प्रतिनिधिले भने, “आधिकारिक रूपमा गलत भएका ६३ उत्तरमध्ये धेरैजसो आउटपुट ढाँचा नमिलेका, दृश्य सामग्रीको व्याख्यामा भएका त्रुटि र सूचना हराएका कारण उत्तर दिन नसकिने प्रश्नहरूबाट उत्पन्न भएका हुन्। यो तार्किक तर्कको आधारभूत सीमाभन्दा पनि पोस्ट-प्रोसेसिङको सूक्ष्मता र बाह्य सूचनाको उपलब्धतासँग सम्बन्धित समस्या हो। आफ्नै मोडल भएकाले CLEVI ले यसलाई आफैं सुधार गर्न सक्छ। यही from scratch आफ्नै मोडलको संरचनागत फाइदा हो। CLEVI को यस उपलब्धिले कोरियाली AI उद्योगसमक्ष ‘हामी कहिलेसम्म ‘उधारो लिएको मस्तिष्क’ मा निर्भर रहने?’ भन्ने प्रश्न खडा गर्छ। CLEVI ले from scratch को अझ कठिन बाटो रोजेको छ र विश्व मञ्चमा त्यसको उत्तर प्रमाणित गर्न चाहन्छ।”
