स्रोत: इलेक्ट्रॉनिक टाइम्स, रिपोर्टर ली वोन-जी
“क्लेवी, from scratch स्वनिर्मित मॉडल से GAIA में 79.07%...3,090 मॉडलों में शीर्ष 2.5%” लेख का पूर्ण उद्धरण
प्रकाशन तिथि: 2026-04-07
लिंक: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm स्वतंत्र मॉडल स्टैक के 5 एजेंटों ने सभी 70 से अधिक अंक प्राप्त किए
जानकारी के नुकसान को ध्यान में रखने पर 98%+ सटीकता, मानवों (92%) से अधिक
AI स्टार्टअप 'क्लेवी' ने from scratch स्वनिर्मित मॉडल का उपयोग करके वैश्विक AI एजेंट बेंचमार्क 'GAIA' में 79.07% की सटीकता दर्ज की और कुल 3,090 पंजीकृत मॉडलों में शीर्ष 2.5% के भीतर स्थान बनाया।
उद्योग के जानकारों के अनुसार, AI बेंचमार्क बाजार में GAIA को 'व्यावहारिक AI एजेंट' की क्षमताओं को सटीक रूप से प्रतिबिंबित करने वाला माना जाता है। Meta AI, HuggingFace और पेरिस-साक्ले विश्वविद्यालय आदि द्वारा संयुक्त रूप से विकसित यह बेंचमार्क पहली बार नवंबर 2023 में जारी किया गया था।
GAIA को अन्य बेंचमार्क से अलग करने वाली तीन मुख्य विशेषताएँ हैं। पहला, चूँकि उत्तर सार्वजनिक नहीं किए जाते, इसलिए ओवरफिटिंग संभव नहीं है। दूसरा, चूँकि इसमें मल्टीस्टेप·मल्टीमोडल जटिल तर्क की आवश्यकता होती है, इसलिए साधारण पैटर्न मैचिंग से उच्च अंक प्राप्त करना संभव नहीं है। तीसरा, HuggingFace के आधिकारिक लीडरबोर्ड के माध्यम से दुनिया भर के 3,090 से अधिक मॉडल समान परिस्थितियों में प्रतिस्पर्धा करते हैं।
टेस्ट सेट में कुल 301 प्रश्न होते हैं। Level 1 में एकल टूल का उपयोग और सरल तर्क, Level 2 में अनेक टूल का संयोजन और मध्यम स्तर का तर्क, जबकि Level 3 में 5 या अधिक चरणों वाली एजेंट योजना और कार्यान्वयन की आवश्यकता वाले सर्वाधिक कठिन प्रश्न होते हैं। बेंचमार्क जारी किए जाने के समय GPT मॉडल (प्लगइन से सुसज्जित) लगभग 15% तक ही पहुँच पाए थे, जबकि वर्तमान में शीर्ष टीमों ने इसे 70–80% तक बढ़ा दिया है।
इनमें, क्लेवी ने इस उपलब्धि में तकनीकी रूप से सबसे उल्लेखनीय बात के रूप में इस तथ्य पर जोर दिया कि GPT, Claude और Gemini जैसी बाहरी LLM API का बिल्कुल भी उपयोग नहीं किया गया। क्लेवी की विशेषता यह है कि उसने from scratch तरीके से स्वतंत्र रूप से विकसित किए गए दो मॉडलों का उपयोग किया।
cip-5.5-agent एक एजेंटिक AI मॉडल है, जो जटिल कार्यों की स्वायत्त रूप से योजना बनाने (planning), उन्हें क्रियान्वित करने (execution) और सत्यापित करने (verification) वाली एजेंट पाइपलाइन के मुख्य मस्तिष्क की भूमिका निभाता है। cip-5.5-mm एक उच्च-प्रदर्शन वाला सामान्य-उद्देश्यीय मल्टीमॉडल मॉडल है, जो आवाज़, छवियों और वीडियो सहित विभिन्न फ़ाइल फ़ॉर्मैट को समझकर उन पर तर्क कर सकता है। चूँकि GAIA के अधिकांश प्रश्नों में PDF, छवि और ऑडियो फ़ाइलों जैसे गैर-पाठ इनपुट शामिल होते हैं, इसलिए यह मल्टीमॉडल क्षमता उच्च स्कोर प्राप्त करने में मुख्य कारक रही।
CLEVI ने इन दोनों स्वनिर्मित मॉडलों के आधार पर 5 अलग-अलग एजेंट कॉन्फ़िगरेशन के साथ GAIA में भाग लिया और सभी ने 70 से अधिक अंक प्राप्त किए।
कंपनी के अनुसार, CLEVI की आंतरिक पश्च-समीक्षा में एक रोचक परिणाम सामने आया। कुल 301 प्रश्नों में से कुछ के सही उत्तरों के प्रमाण वर्तमान सार्वजनिक वेब पर उपलब्ध नहीं थे। पहले ऑनलाइन या सर्च इंजन के माध्यम से उपलब्ध जानकारी को हटा दिया गया था या बदल दिया गया था, इसलिए वह अब पहुँच से बाहर थी। वर्तमान में मनुष्यों द्वारा सार्वजनिक रूप से सत्यापित की जा सकने वाली जानकारी की सीमा के भीतर पुनर्मूल्यांकन करने पर, CLEVI की सटीकता 98% से अधिक पाई गई। यह मानव औसत 92% से पहले ही अधिक है।
CLEVI के एक प्रतिनिधि ने बताया, “CLEVI ने बाहरी मॉडलों के मिश्रण के बिना, from scratch स्वनिर्मित मॉडलों और अपने स्वयं के AI एजेंट समाधानों के साथ, सभी 5 एजेंटों में 70+ अंक प्राप्त करते हुए सार्वजनिक बेंचमार्क के शीर्ष 2.5% में प्रवेश किया। भविष्य में अपने मॉडलों और एजेंट समाधानों में सुधार के माध्यम से आधिकारिक स्कोर में भी और वृद्धि संभव प्रतीत होती है। यह उपलब्धि इसलिए महत्वपूर्ण है कि इसे वैश्विक सार्वजनिक बेंचमार्क पर वास्तविक रूप से मापा गया और यह ‘सत्यापित विश्वसनीयता’ दर्शाती है; यह घरेलू AI विकास कंपनी के from scratch स्वनिर्मित मॉडल पर आधारित उपलब्धि है; यह बाहरी मॉडलों के मिश्रण के बजाय स्वतंत्र मॉडल स्टैक का परिणाम है; और कुछ प्रश्नों की जानकारी के लुप्त हो जाने को ध्यान में रखने पर, इसका महत्व स्कोर से भी अधिक है।”
