स्रोत : इलेक्ट्रॉनिक न्यूज, पत्रकार ली वॉन-जी
“CLEVI, from scratch स्वयं-विकसित मॉडेलद्वारे GAIA मध्ये 79.07%...3,090 मॉडेल्सपैकी शीर्ष 2.5%” या लेखाचा संपूर्ण मजकूर उद्धृत
प्रकाशन दिनांक : 2026-04-07
लिंक : https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm स्वतंत्र मॉडेल स्टॅकमधील 5 एजंट्सनी सर्वांनी 70 पेक्षा अधिक गुण मिळवले
माहितीची हानी विचारात घेतल्यास 98% पेक्षा अधिक अचूकता, मानवांपेक्षा (92%) जास्त
AI स्टार्टअप 'CLEVI' ने from scratch स्वयं-विकसित मॉडेलचा वापर करून जागतिक AI एजंट बेंचमार्क 'GAIA' मध्ये 79.07% अचूकता नोंदवली आणि नोंदणीकृत एकूण 3,090 मॉडेल्समध्ये शीर्ष 2.5% मध्ये स्थान मिळवले.
उद्योगातील स्पष्टीकरणानुसार, AI बेंचमार्क बाजारात GAIA हे 'व्यावहारिक AI एजंट्स'च्या क्षमतेचे अचूक प्रतिबिंब दाखवते, असे मानले जाते. Meta AI, HuggingFace आणि पॅरिस-सॅक्ले विद्यापीठ यांनी संयुक्तपणे विकसित केलेला हा बेंचमार्क प्रथम नोव्हेंबर 2023 मध्ये सार्वजनिक करण्यात आला.
GAIA ला इतर बेंचमार्कपासून वेगळे करणारी तीन प्रमुख वैशिष्ट्ये आहेत. प्रथम, योग्य उत्तरे सार्वजनिक नसल्यामुळे ओव्हरफिटिंग शक्य नाही. दुसरे, मल्टी-स्टेप आणि मल्टीमोडल संयुक्त तर्कशक्ती आवश्यक असल्यामुळे साध्या पॅटर्न मॅचिंगद्वारे उच्च गुण मिळवणे शक्य नाही. तिसरे, HuggingFace च्या अधिकृत लीडरबोर्डद्वारे जगभरातील 3,090 पेक्षा अधिक मॉडेल्स समान अटींवर स्पर्धा करतात.
चाचणी संचात एकूण 301 प्रश्न आहेत. Level 1 मध्ये एकच साधन वापरणे आणि साधे तर्क, Level 2 मध्ये अनेक साधनांचे संयोजन आणि मध्यम-स्तरीय तर्क, तर Level 3 मध्ये 5 किंवा अधिक टप्प्यांचे एजंट नियोजन व अंमलबजावणी आवश्यक असलेले सर्वाधिक कठीण प्रश्न असतात. बेंचमार्क जाहीर करण्यात आला तेव्हा GPT मॉडेल्सच्या (प्लगइनसह) आधारे हा आकडा सुमारे 15% होता; सध्या आघाडीच्या संघांनी तो 70–80% पर्यंत वाढवला आहे.
यामध्ये, CLEVI ने या कामगिरीतील तांत्रिकदृष्ट्या सर्वाधिक लक्षवेधी बाब म्हणजे GPT, Claude, Gemini यांसारख्या बाह्य LLM API चा अजिबात वापर केला नाही, यावर भर दिला. CLEVI चे वैशिष्ट्य म्हणजे from scratch पद्धतीने स्वतंत्रपणे विकसित केलेली दोन मॉडेल्स वापरणे.
cip-5.5-agent हे एजेंटिक AI मॉडेल असून, जटिल कामांचे स्वायत्तपणे नियोजन(planning)·अंमलबजावणी(execution)·पडताळणी(verification) करणाऱ्या एजंट पाइपलाइनचे मुख्य मेंदू म्हणून कार्य करते. cip-5.5-mm हे आवाज·प्रतिमा·व्हिडिओ यांसारखे विविध फाइल फॉरमॅट समजून घेऊन तर्क करणारे उच्च-कार्यक्षमतेचे सर्वसाधारण मल्टीमोडल मॉडेल आहे. GAIA प्रश्नांपैकी मोठ्या संख्येत PDF, प्रतिमा, ऑडिओ फाइल्स यांसारख्या गैर-मजकूर इनपुटचा समावेश असल्याने, ही मल्टीमोडल क्षमता उच्च गुण मिळवण्याचा मुख्य घटक ठरली.
CLEVI ने या दोन स्वनिर्मित मॉडेल्सच्या आधारे 5 वेगवेगळ्या एजेंट संरचना GAIA मध्ये सादर केल्या आणि सर्वांनी 70 पेक्षा अधिक गुण मिळवले.
कंपनीच्या स्पष्टीकरणानुसार, CLEVI च्या अंतर्गत पश्चात्-पुनरावलोकनात एक मनोरंजक निष्कर्ष समोर आला. एकूण 301 प्रश्नांपैकी काही प्रश्नांची अचूक उत्तरांसाठीची आधारभूत माहिती सध्या सार्वजनिक वेबवर उपलब्ध नव्हती. पूर्वी ऑनलाइन किंवा शोध इंजिनवर पडताळता येणारी माहिती हटवली किंवा बदलली गेल्यामुळे ती आता प्रवेशयोग्य राहिलेली नाही. सध्या मानवांना सार्वजनिकरीत्या पडताळता येणाऱ्या माहितीच्या व्याप्तीत पुनर्मूल्यांकन केल्यावर, CLEVI चा अचूकता दर 98% पेक्षा अधिक असल्याचे दिसून आले. हा आकडा मानवी सरासरी 92% पेक्षा आधीच जास्त आहे.
CLEVI च्या प्रतिनिधींनी स्पष्ट केले, “CLEVI ने बाह्य मॉडेल्सचे मिश्रण न करता, from scratch स्वनिर्मित मॉडेल्स आणि स्वतःच्या AI एजंट सोल्यूशन्सच्या आधारे, 5 एजंट्सपैकी प्रत्येकाने 70+ गुण मिळवत सार्वजनिक बेंचमार्कमध्ये शीर्ष 2.5% मध्ये प्रवेश केला. भविष्यात स्वनिर्मित मॉडेल्स आणि एजंट सोल्यूशन्समध्ये सुधारणा केल्यास अधिकृत गुणांमध्येही आणखी वाढ शक्य असल्याचे दिसते. ही कामगिरी जागतिक सार्वजनिक बेंचमार्कमध्ये प्रत्यक्ष मोजली गेली असून 'सत्यापित विश्वासार्हता' दर्शवते; तसेच ती देशांतर्गत AI विकासक कंपनीच्या from scratch स्वनिर्मित मॉडेलवर आधारित कामगिरी आहे, बाह्य मॉडेल्सचे मिश्रण नसून स्वतंत्र मॉडेल स्टॅकचा परिणाम आहे, आणि काही प्रश्नांमधील माहिती गमावली गेल्याचा विचार करता, या कामगिरीचे गुणांपलीकडील अर्थ लावण्याचे मूल्य आहे—या सर्व कारणांमुळे तिचे महत्त्व अधिक आहे.”
