स्रोत: डिजिटलटाइम्स, वार्ताहर कू बोन-ग्यू
“AI स्टार्टअप क्लेवी, GAIA च्या शीर्ष 2.5% मध्ये प्रवेश… सिद्ध झालेली विश्वासार्हता दर्शवली” या लेखाचा संपूर्ण मजकूर उद्धृत
प्रकाशन दिनांक 2026-04-08
लिंक : https://n.news.naver.com/article/029/0003020511?sid=105
दक्षिण कोरियातील AI स्टार्टअप ‘क्लेवी(Clevi)’ने from scratch पद्धतीने विकसित केलेले स्वतःचे मॉडेल आणि स्वतःचे एजंट सोल्यूशन 구축 केले असून, दक्षिण कोरियात प्रथमच GAIA बेंचमार्कमध्ये नोंदणीकृत एकूण 3,090 मॉडेल्सच्या आधारे शीर्ष 2.5% मध्ये प्रवेश केल्याचे जाहीर केले.
उद्योगातील स्पष्टीकरणानुसार, Meta AI ने डिझाइन केलेले आणि Hugging Face द्वारे संचालित GAIA, AI कडे ‘केवळ एक गोष्ट उत्तम करण्याची क्षमता’ नव्हे, तर ‘अनेक क्षमता एकत्र करून वास्तविक समस्या सोडवण्याची क्षमता’ आहे का, हे तपासते. वेबवर माहिती शोधणे, PDF मधील तक्ते वाचणे, प्रतिमांचे विश्लेषण करणे, कोड चालवून गणना करणे आणि त्या निष्कर्षांचे एकत्रीकरण करून एकच अचूक उत्तर देणे आवश्यक असते. 301 गोपनीय प्रश्न, तीन पातळ्यांची कठीणता आणि उत्तरे गोपनीय ठेवण्याच्या तत्त्वामुळे ही रचना अतिशय जुळवून घेणे किंवा फसवणूक करणे अशक्य करते.
या परीक्षेत उच्च गुण मिळवण्यासाठी दोन गोष्टी आवश्यक आहेत. आधारभूत भाषा मॉडेलची तर्कशक्ती आणि त्या मॉडेलला वास्तविक जगातील साधनांशी जोडून स्वायत्तपणे कार्य करण्यास सक्षम करणारे एजंट सोल्यूशन. मॉडेल कितीही चांगले असले तरी एजंट कमकुवत असल्यास Level 3 सोडवता येत नाही; आणि एजंट कितीही परिष्कृत असला तरी मॉडेलची तर्कशक्ती अपुरी असल्यास मधल्या टप्प्यातील चुकीचे उत्तर पुढे प्रसारित होते.
GAIA लीडरबोर्डची सध्याची रचना पाहिल्यास एक मनोरंजक नमुना दिसतो. आघाडीवरील बहुतेक एजंट GPT, Claude, Gemini यांसारख्या अनेक बिग टेक मॉडेल्सना एकत्र करणारी ‘मल्टी-मॉडेल मिक्स’ रणनीती स्वीकारतात. प्रत्येक मॉडेलची बलस्थाने एकत्र करणे आणि माहिती गमावल्यामुळे होणारी गुणांची घट रोखणे हा एक तर्कसंगत दृष्टिकोन आहे.
याउलट, क्लेवी त्या समूहात सामील झाले नाही. from scratch पद्धतीने विकसित केलेले cip-5.5-agent(एजेंटिक AI) जटिल कार्यांचे नियोजन·अंमलबजावणी·पडताळणी स्वायत्तपणे करते, तर cip-5.5-mm(उच्च-कार्यक्षमता सर्वसाधारण मल्टीमोडल) ध्वनी·प्रतिमा·व्हिडिओ यांसारखे विविध फाइल फॉरमॅट समजून त्यावर तर्क करते. ही दोन्ही मॉडेल्स क्लेवीच्या अंतर्गत स्वतंत्रपणे विकसित करण्यात आली असून, बाह्य LLM API चा अजिबात वापर करण्यात आलेला नाही.
आणि या स्वतःच्या मॉडेल स्टॅकसह GAIA मध्ये 5 एजंट सहभागी करून, सर्वांनी 70 पेक्षा अधिक गुण मिळवले. सर्वोच्च 79.07% पासून 70.76% पर्यंतच्या निकालांनी हे सिद्ध केले की हा केवळ एका निकालाचा योगायोग नसून संपूर्ण स्टॅकची स्थिरता आहे.
कंपनीच्या स्पष्टीकरणानुसार, अधिकृत 79.07% गुणांमागे आणखी एक आकडा आहे. CLEVI च्या अंतर्गत पश्चात्-परीक्षणात, 301 प्रश्नांपैकी सध्याच्या सार्वजनिक वेबवर योग्य उत्तराचा आधार उपलब्ध नसलेले अनेक प्रश्न आढळले. ज्या प्रश्नांची योग्य उत्तरे अद्याप वेबवर उपलब्ध आहेत, त्यांच्यावर पुनर्मूल्यांकन केल्यास CLEVI चा अचूकता दर 98% पेक्षा अधिक होता. हा आकडा मानवी सरासरी (92%) आधीच ओलांडतो.
अर्थात, इतर कंपन्यांची शक्तिशाली सर्वसाधारण मॉडेल्स एकत्र केली असती, तर अधिकृत गुण आणखी वाढवता आले असते. मात्र, CLEVI ने जाणीवपूर्वक ही रणनीती स्वीकारली नाही. कारण या बेंचमार्कचे उद्दिष्ट सर्वोच्च गुणांसाठी स्पर्धा करणे नव्हते, तर from scratch स्वयं-विकसित मॉडेल जागतिक स्तरावर स्पर्धा करू शकेल अशा पातळीवर पोहोचले आहे की नाही, हे पडताळणे होते.
GAIA लीडरबोर्डवर नाव नोंदवले जाणे याचा मोठा अर्थ असा आहे की तृतीय-पक्षाच्या स्वतंत्र मूल्यांकनातून मान्यताप्राप्त विश्वासार्हता प्राप्त झाली आहे. गुंतवणूक उभारणी, परदेशातील विस्तार आणि B2B विक्री या सर्व टप्प्यांमध्ये वापरता येणारा हा वस्तुनिष्ठ पुरावा आहे.
CLEVI च्या प्रतिनिधींनी सांगितले, “अधिकृतरीत्या चुकीच्या ठरलेल्या 63 उत्तरांपैकी बरीचशी उत्तरे आउटपुट फॉरमॅटमधील विसंगती, दृश्य सामग्रीच्या अर्थ लावण्यातील चुका आणि माहिती नष्ट झाल्यामुळे उत्तर देता न येणाऱ्या प्रश्नांमुळे होती. ही तार्किक推推 reasoning ची मूलभूत मर्यादा नसून, पश्चात्-प्रक्रियेतील अचूकता आणि बाह्य माहितीच्या उपलब्धतेची समस्या आहे. स्वतःचे मॉडेल असल्यामुळे CLEVI स्वतःमध्ये सुधारणा करू शकते. हाच from scratch स्वयं-विकसित मॉडेलचा संरचनात्मक फायदा आहे. CLEVI च्या या कामगिरीने कोरियन AI उद्योगासमोर ‘आम्ही आणखी किती काळ “उधार घेतलेल्या मेंदूंवर” अवलंबून राहणार?’ हा प्रश्न उपस्थित केला आहे. CLEVI ने from scratch हा अधिक कठीण मार्ग निवडला असून, जागतिक स्तरावर त्याचे उत्तर सिद्ध करण्याचा प्रयत्न करत आहे.”
