स्रोत: डिजिटलटाइम्स, रिपोर्टर गू बोन-ग्यू
“AI स्टार्टअप क्लेवी, GAIA के शीर्ष 2.5% में प्रवेश… प्रमाणित विश्वसनीयता का प्रदर्शन” लेख का पूर्ण उद्धरण
प्रकाशन तिथि 2026-04-08
लिंक : https://n.news.naver.com/article/029/0003020511?sid=105
घरेलू AI स्टार्टअप ‘क्लेवी(Clevi)’ ने from scratch विकसित अपने मॉडल और एजेंट समाधान तैयार किए हैं और बताया है कि उसने घरेलू स्तर पर पहली बार GAIA बेंचमार्क में पंजीकृत कुल 3,090 मॉडलों के आधार पर शीर्ष 2.5% में प्रवेश किया है।
उद्योग के अनुसार, मेटा AI द्वारा डिज़ाइन और हगिंग फेस द्वारा संचालित GAIA, AI से ‘केवल एक काम अच्छी तरह करने की क्षमता’ नहीं, बल्कि ‘कई क्षमताओं को मिलाकर वास्तविक समस्याएँ हल करने की क्षमता’ पूछता है। इसे वेब पर जानकारी ढूँढनी होती है, PDF में दी गई तालिका पढ़नी होती है, छवियों का विश्लेषण करना होता है, कोड चलाकर गणना करनी होती है और उन परिणामों को मिलाकर एक उत्तर प्रस्तुत करना होता है। 301 गोपनीय प्रश्न, कठिनाई के तीन स्तर और उत्तरों को गोपनीय रखने के सिद्धांत के कारण यह ऐसी संरचना है जिसमें न तो ओवरफिटिंग संभव है और न ही चीटिंग।
इस परीक्षा में उच्च अंक प्राप्त करने के लिए दो चीज़ों की आवश्यकता होती है। पहली, आधारभूत भाषा मॉडल की तर्क क्षमता; और दूसरी, उस मॉडल को वास्तविक दुनिया के उपकरणों से जोड़कर स्वायत्त रूप से कार्य करने में सक्षम बनाने वाला एजेंट समाधान। मॉडल कितना भी अच्छा हो, यदि एजेंट कमजोर है तो Level 3 हल नहीं किया जा सकता; और एजेंट कितना भी परिष्कृत हो, यदि मॉडल की तर्क क्षमता अपर्याप्त है तो मध्य चरण में गलत उत्तर आगे प्रसारित होते हैं।
GAIA लीडरबोर्ड की वर्तमान संरचना को देखने पर एक दिलचस्प पैटर्न दिखाई देता है। शीर्ष स्थानों पर मौजूद अधिकांश एजेंट GPT, Claude, Gemini जैसे कई बिग टेक मॉडलों को मिलाकर ‘मल्टी-मॉडल मिक्स’ रणनीति अपना रहे हैं। यह प्रत्येक मॉडल की खूबियों को मिलाने और सूचना के क्षरण आदि के कारण होने वाली स्कोर में कमी से बचाव करने का एक तर्कसंगत तरीका है।
इसके विपरीत, क्लेवी इस कतार में शामिल नहीं हुआ। from scratch तरीके से विकसित cip-5.5-agent(एजेंटिक AI) जटिल कार्यों की योजना, निष्पादन और सत्यापन स्वायत्त रूप से करता है, जबकि cip-5.5-mm(उच्च-प्रदर्शन सामान्य-उद्देश्यीय मल्टीमॉडल) आवाज़, छवियों और वीडियो सहित विभिन्न फ़ाइल फ़ॉर्मैट को समझकर तर्क करता है। ये दोनों मॉडल क्लेवी के भीतर स्वतंत्र रूप से विकसित किए गए हैं और बाहरी LLM API का बिल्कुल भी उपयोग नहीं किया गया।
और इस स्वनिर्मित मॉडल स्टैक के साथ GAIA में 5 एजेंट उतारकर, सभी ने 70 से अधिक अंक प्राप्त किए। सर्वोच्च 79.07% से लेकर 70.76% तक के परिणामों ने साबित किया कि यह किसी एक परिणाम का सौभाग्य नहीं, बल्कि पूरे स्टैक की स्थिरता है।
कंपनी के स्पष्टीकरण के अनुसार, आधिकारिक 79.07% स्कोर के पीछे एक और संख्या भी है। CLEVI की आंतरिक पश्च-समीक्षा में पाया गया कि 301 प्रश्नों में से काफी प्रश्नों के सही उत्तर के प्रमाण वर्तमान सार्वजनिक वेब से गायब हो चुके हैं। केवल उन प्रश्नों के आधार पर पुनर्मूल्यांकन करने पर, जिनके सही उत्तर वर्तमान में भी वेब पर मौजूद हैं, CLEVI की सटीकता 98% से अधिक थी। यह मानव औसत (92%) से पहले ही अधिक है।
निस्संदेह, यदि अन्य कंपनियों के शक्तिशाली सामान्य-उद्देश्यीय मॉडलों को मिलाया जाता, तो आधिकारिक स्कोर को और बढ़ाया जा सकता था। हालांकि, CLEVI ने जानबूझकर यह रणनीति नहीं अपनाई। इसका कारण यह था कि इस बेंचमार्क का लक्ष्य सर्वोच्च स्कोर की प्रतियोगिता नहीं, बल्कि यह सत्यापित करना था कि from scratch स्वयं का मॉडल वैश्विक मंच पर प्रतिस्पर्धा करने योग्य स्तर तक पहुंचा है या नहीं।
GAIA लीडरबोर्ड पर नाम दर्ज होना इस बात का बड़ा महत्व रखता है कि उसे तीसरे पक्ष के स्वतंत्र मूल्यांकन से प्राप्त सत्यापित विश्वसनीयता हासिल है। यह निवेश आकर्षित करने, विदेशों में विस्तार और B2B बिक्री के हर चरण में उपयोग किए जा सकने वाले वस्तुनिष्ठ प्रमाण का आधार बनता है।
CLEVI के एक प्रतिनिधि ने कहा, “आधिकारिक रूप से गलत 63 उत्तरों में से काफी संख्या आउटपुट फ़ॉर्मैट की असंगति, दृश्य सामग्री की व्याख्या में त्रुटि और जानकारी के लुप्त हो जाने के कारण उत्तर न दिए जा सकने वाले प्रश्नों से उत्पन्न हुई। यह तार्किक तर्क की मूलभूत सीमा की तुलना में पोस्ट-प्रोसेसिंग की सटीकता और बाहरी जानकारी की उपलब्धता की समस्या है। चूंकि यह स्वयं का मॉडल है, CLEVI इसे स्वयं सुधार सकता है। यही from scratch स्वयं के मॉडल का संरचनात्मक लाभ है। CLEVI की यह उपलब्धि कोरियाई AI उद्योग के सामने यह प्रश्न रखती है: “हम कब तक ‘उधार लिए हुए दिमाग’ पर निर्भर रहेंगे?” CLEVI ने from scratch का अधिक कठिन मार्ग चुना है और वैश्विक मंच पर इसका उत्तर सिद्ध करना चाहता है।”
