સ્રોત: ઇલેક્ટ્રોનિક ન્યૂઝ, પત્રકાર Lee Won-ji
“CLEVI, from scratch પોતાના મોડલથી GAIAમાં 79.07%... 3,090 મોડલોમાં ટોચના 2.5%માં” લેખનો સંપૂર્ણ અંશ
પ્રકાશન તારીખ: 2026-04-07
લિંક: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm સ્વતંત્ર મોડલ સ્ટેકના 5 એજન્ટ, તમામે 70થી વધુ સ્કોર મેળવ્યો
માહિતીના નુકસાનને ધ્યાનમાં લેતાં 98%થી વધુ ચોકસાઈ, માનવીઓ (92%) કરતાં વધુ
AI સ્ટાર્ટઅપ 'CLEVI'એ from scratch પોતાના મોડલનો ઉપયોગ કરીને વૈશ્વિક AI એજન્ટ બેન્ચમાર્ક 'GAIA'માં 79.07%ની ચોકસાઈ નોંધાવી છે અને કુલ 3,090 નોંધાયેલા મોડલોમાં ટોચના 2.5%માં સ્થાન મેળવ્યું છે.
ઉદ્યોગના નિષ્ણાતોના જણાવ્યા અનુસાર, AI બેન્ચમાર્ક બજારમાં GAIAને 'વ્યવહારુ AI એજન્ટ'ની ક્ષમતાને વિશ્વસનીય રીતે પ્રતિબિંબિત કરતું માનવામાં આવે છે. Meta AI, HuggingFace અને યુનિવર્સિટી પેરિસ-સાક્લે દ્વારા સંયુક્ત રીતે વિકસાવવામાં આવેલ આ બેન્ચમાર્ક પહેલી વાર નવેમ્બર 2023માં જાહેર કરવામાં આવ્યો હતો.
GAIAને અન્ય બેન્ચમાર્કથી અલગ પાડતી ત્રણ મુખ્ય બાબતો છે. પ્રથમ, સાચા જવાબો જાહેર કરવામાં આવતા નથી, તેથી ઓવરફિટિંગ શક્ય નથી. બીજું, મલ્ટિસ્ટેપ·મલ્ટિમોડલ સંયુક્ત તર્કની જરૂર હોવાથી સાદી પેટર્ન મેચિંગથી ઊંચો સ્કોર મેળવવો શક્ય નથી. ત્રીજું, HuggingFaceના સત્તાવાર લીડરબોર્ડ દ્વારા વિશ્વભરના 3,090થી વધુ મોડલ સમાન પરિસ્થિતિઓમાં સ્પર્ધા કરે છે.
ટેસ્ટ સેટમાં કુલ 301 પ્રશ્નો છે. Level 1માં એકલ સાધનનો ઉપયોગ અને સાદું તર્ક, Level 2માં અનેક સાધનોનું સંયોજન અને મધ્યમ સ્તરનું તર્ક, જ્યારે Level 3માં પાંચ કે તેથી વધુ તબક્કાની એજન્ટ યોજના અને અમલીકરણ આવશ્યક હોય તેવા સર્વોચ્ચ મુશ્કેલીના પ્રશ્નોનો સમાવેશ થાય છે. બેન્ચમાર્ક જાહેર કરવામાં આવ્યો ત્યારે GPT મોડલ (પ્લગઇન સાથે) માટેનો સ્કોર આશરે 15% હતો, જ્યારે હાલમાં અગ્રણી ટીમોએ તેને 70થી 80%ના સ્તર સુધી પહોંચાડ્યો છે.
આ સંદર્ભમાં, CLEVIએ ભારપૂર્વક જણાવ્યું કે આ સિદ્ધિમાં તકનીકી રીતે સૌથી નોંધપાત્ર બાબત એ છે કે GPT, Claude, Gemini જેવી કોઈપણ બાહ્ય LLM APIનો બિલકુલ ઉપયોગ કરવામાં આવ્યો નથી. CLEVIની વિશેષતા એ છે કે તેણે from scratch પદ્ધતિથી સ્વતંત્ર રીતે વિકસાવેલા બે મોડલનો ઉપયોગ કર્યો છે.
cip-5.5-agent એ એજેન્ટિક AI મોડેલ છે, જે જટિલ કાર્યોનું સ્વાયત્ત રીતે આયોજન (planning)·અમલીકરણ (execution)·ચકાસણી (verification) કરતી એજેન્ટ પાઇપલાઇનના મુખ્ય મગજ તરીકે કાર્ય કરે છે. cip-5.5-mm એ અવાજ·છબી·વિડિયો સહિત વિવિધ ફાઇલ ફોર્મેટને સમજતું અને તર્કશક્તિથી વિશ્લેષણ કરતું ઉચ્ચ-પ્રદર્શન ધરાવતું સામાન્ય-ઉદ્દેશ્યનું મલ્ટીમોડલ મોડેલ છે. GAIAના ઘણા પ્રશ્નોમાં PDF, છબી, ઑડિયો ફાઇલ જેવી બિન-ટેક્સ્ટ ઇનપુટ સામેલ હોવાથી, આ મલ્ટીમોડલ ક્ષમતા ઉચ્ચ સ્કોરનું મુખ્ય પરિબળ બની.
CLEVI એ આ બે પોતાના મોડેલો પર આધારિત 5 અલગ-અલગ એજેન્ટ કન્ફિગરેશન સાથે GAIAમાં ભાગ લીધો અને તમામે 70થી વધુ સ્કોર નોંધાવ્યો.
કંપનીના વર્ણન અનુસાર, CLEVIની આંતરિક પશ્ચાત્-સમીક્ષામાં રસપ્રદ પરિણામો સામે આવ્યા. કુલ 301 પ્રશ્નોમાંથી કેટલાકના સાચા જવાબના આધાર હાલ જાહેર વેબ પર ઉપલબ્ધ રહ્યા નથી. ભૂતકાળમાં ઑનલાઇન અથવા સર્ચ એન્જિન પર ઉપલબ્ધ રહેલી માહિતી કાઢી નાખવામાં આવી છે અથવા બદલાઈ ગઈ છે અને હવે તેને ઍક્સેસ કરી શકાતી નથી. હાલમાં લોકો દ્વારા જાહેરમાં ચકાસી શકાય તેવી માહિતીની મર્યાદામાં પુનર્મૂલ્યાંકન કરવામાં આવ્યું ત્યારે, CLEVIનો સાચા જવાબનો દર 98%થી વધુ જણાયો. આ માનવ સરેરાશ 92% કરતાં પહેલેથી જ વધુ છે.
CLEVIના પ્રતિનિધિએ જણાવ્યું, “CLEVIએ બાહ્ય મોડેલોના મિશ્રણ વિના, from scratch પોતાના મોડેલો અને પોતાના AI એજેન્ટ સોલ્યુશનોના આધારે 5માંથી તમામ એજેન્ટમાં 70+ સ્કોર નોંધાવીને જાહેર બેન્ચમાર્કમાં ટોચના 2.5%માં સ્થાન મેળવ્યું છે. ભવિષ્યમાં પોતાના મોડેલો અને એજેન્ટ સોલ્યુશનોમાં સુધારા દ્વારા સત્તાવાર સ્કોરમાં પણ વધુ વધારો શક્ય જણાય છે. આ સિદ્ધિનું મહત્વ એ છે કે વૈશ્વિક જાહેર બેન્ચમાર્કમાં તેનું વાસ્તવિક માપન થયું છે અને તે 'ચકાસાયેલ વિશ્વસનીયતા' દર્શાવે છે; તે સ્થાનિક AI વિકાસકર્તા દ્વારા from scratch પોતાના મોડેલ પર આધારિત સિદ્ધિ છે; તે બાહ્ય મોડેલોના મિશ્રણને બદલે સ્વતંત્ર મોડેલ સ્ટેકનું પરિણામ છે; અને કેટલાક પ્રશ્નોની માહિતી ગુમ થઈ હોવાની બાબતને ધ્યાનમાં લેતાં, તે માત્ર સ્કોરથી વધુ અર્થઘટન મૂલ્ય ધરાવે છે.”
