ഉറവിടം: ഇലക്ട്രോണിക് ന്യൂസ്, റിപ്പോർട്ടർ ലീ വോൺജി
“ക്ലെവി, from scratch സ്വന്തം മോഡലിലൂടെ GAIA 79.07%...3,090 മോഡലുകളിൽ മുൻനിര 2.5%” എന്ന ലേഖനത്തിന്റെ പൂർണ്ണ ഉള്ളടക്കത്തിൽ നിന്നുള്ള ഉദ്ധരണം
പ്രസിദ്ധീകരിച്ച തീയതി: 2026-04-07
ലിങ്ക്: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm സ്വതന്ത്ര മോഡൽ സ്റ്റാക്കിലെ 5 ഏജന്റുകളും 70-നു മുകളിലുള്ള സ്കോർ നേടി
വിവര നഷ്ടം കണക്കിലെടുത്താലും 98%+ കൃത്യത, മനുഷ്യരെക്കാൾ (92%) ഉയർന്നത്
AI സ്റ്റാർട്ടപ്പ് 'ക്ലെവി' from scratch സ്വന്തം മോഡൽ ഉപയോഗിച്ച് ആഗോള AI ഏജന്റ് ബെഞ്ച്മാർക്ക് 'GAIA'-യിൽ 79.07% കൃത്യത രേഖപ്പെടുത്തി. രജിസ്റ്റർ ചെയ്ത ആകെ 3,090 മോഡലുകളിൽ മുൻനിര 2.5%-നുള്ളിൽ സ്ഥാനം നേടി.
വ്യവസായ രംഗത്തെ വിശദീകരണമനുസരിച്ച്, AI ബെഞ്ച്മാർക്ക് വിപണിയിൽ GAIA 'പ്രായോഗിക AI ഏജന്റുമാരുടെ' കഴിവുകൾ കൃത്യമായി പ്രതിഫലിപ്പിക്കുന്നതായി വിലയിരുത്തപ്പെടുന്നു. Meta AI, HuggingFace, പാരിസ്-സാക്ലേ സർവകലാശാല തുടങ്ങിയവർ സംയുക്തമായി വികസിപ്പിച്ച ഈ ബെഞ്ച്മാർക്ക് 2023 നവംബറിൽ ആദ്യമായി പുറത്തിറങ്ങി.
GAIA-യെ മറ്റ് ബെഞ്ച്മാർക്കുകളിൽ നിന്ന് വേർതിരിക്കുന്ന പ്രധാന സവിശേഷതകൾ മൂന്നാണ്. ഒന്നാമതായി, ശരിയുത്തരങ്ങൾ രഹസ്യമായി സൂക്ഷിക്കുന്നതിനാൽ ഓവർഫിറ്റിംഗ് സാധ്യമല്ല. രണ്ടാമതായി, മൾട്ടി-സ്റ്റെപ്പ്, മൾട്ടി-മോഡൽ സങ്കീർണ്ണമായ റീസണിംഗ് ആവശ്യമായതിനാൽ ലളിതമായ പാറ്റേൺ മാച്ചിംഗിലൂടെ ഉയർന്ന സ്കോർ നേടാനാവില്ല. മൂന്നാമതായി, HuggingFace ഔദ്യോഗിക ലീഡർബോർഡിലൂടെ ലോകമെമ്പാടുമുള്ള 3,090-ലധികം മോഡലുകൾ ഒരേ നിബന്ധനകളിൽ മത്സരിക്കുന്നു.
ടെസ്റ്റ് സെറ്റിൽ ആകെ 301 ചോദ്യങ്ങളുണ്ട്. Level 1-ൽ ഒരൊറ്റ ടൂൾ ഉപയോഗവും ലളിതമായ റീസണിംഗും, Level 2-ൽ ഒന്നിലധികം ടൂളുകളുടെ സംയോജനവും ഇടത്തരം റീസണിംഗും, Level 3-ൽ 5 ഘട്ടങ്ങളിലധികമുള്ള ഏജന്റ് പ്ലാനിംഗും നിർവഹണവും ആവശ്യമായ ഏറ്റവും ഉയർന്ന ബുദ്ധിമുട്ടുള്ള ചോദ്യങ്ങളുമാണ് ഉൾപ്പെടുന്നത്. ബെഞ്ച്മാർക്ക് പുറത്തിറങ്ങിയ സമയത്ത് GPT മോഡലുകൾ (പ്ലഗിൻ ഘടിപ്പിച്ചവ) ഏകദേശം 15% മാത്രമായിരുന്നു നേടിയത്; നിലവിൽ മുൻനിര ടീമുകൾ ഇത് 70–80% നിലവാരത്തിലേക്ക് ഉയർത്തിയിട്ടുണ്ട്.
ഇതിൽ, ഈ നേട്ടത്തിലെ സാങ്കേതികമായി ഏറ്റവും ശ്രദ്ധേയമായ കാര്യം GPT, Claude, Gemini തുടങ്ങിയ ബാഹ്യ LLM API-കൾ ഒന്നും ഉപയോഗിച്ചിട്ടില്ലെന്നതാണെന്ന് ക്ലെവി ഊന്നിപ്പറഞ്ഞു. from scratch രീതിയിൽ സ്വതന്ത്രമായി വികസിപ്പിച്ച രണ്ട് മോഡലുകൾ ഉപയോഗിച്ചതാണ് ക്ലെവിയുടെ പ്രത്യേകത.
cip-5.5-agent ഒരു ഏജന്റിക് AI മോഡലാണ്. സങ്കീർണ്ണമായ ജോലികൾ സ്വയം ആസൂത്രണം ചെയ്യുകയും (planning) നിർവഹിക്കുകയും (execution) പരിശോധിക്കുകയും (verification) ചെയ്യുന്ന ഏജന്റ് പൈപ്പ്ലൈനിന്റെ പ്രധാന മസ്തിഷ്കമായി ഇത് പ്രവർത്തിക്കുന്നു. cip-5.5-mm ശബ്ദം, ചിത്രങ്ങൾ, വീഡിയോകൾ തുടങ്ങിയ വിവിധ ഫയൽ ഫോർമാറ്റുകൾ മനസ്സിലാക്കി നിരീക്ഷണം നടത്താൻ കഴിയുന്ന ഉയർന്ന പ്രകടനമുള്ള പൊതുവായ മൾട്ടിമോഡൽ മോഡലാണ്. GAIA ചോദ്യങ്ങളിൽ വലിയൊരു പങ്കും PDF, ചിത്രം, ഓഡിയോ ഫയൽ തുടങ്ങിയ ടെക്സ്റ്റ് ഇതര ഇൻപുട്ടുകൾ ഉൾക്കൊള്ളുന്നതിനാൽ, ഈ മൾട്ടിമോഡൽ കഴിവ് ഉയർന്ന സ്കോർ നേടുന്നതിലെ പ്രധാന ഘടകമായി.
ക്ലെവി ഈ രണ്ട് സ്വന്തം മോഡലുകളെ അടിസ്ഥാനമാക്കി 5 വ്യത്യസ്ത ഏജന്റ് കോൺഫിഗറേഷനുകളുമായി GAIAയിൽ പങ്കെടുത്തു. അവയെല്ലാം 70-ലധികം സ്കോർ നേടി.
കമ്പനിയുടെ വിശദീകരണമനുസരിച്ച്, ക്ലെവിയുടെ ആഭ്യന്തര പോസ്റ്റ്-റിവ്യൂവിൽ രസകരമായ ഫലങ്ങൾ കണ്ടെത്തി. ആകെ 301 ചോദ്യങ്ങളിൽ ചിലതിനുള്ള ശരിയുത്തരത്തിന്റെ തെളിവുകൾ നിലവിലെ പൊതു വെബിൽ ലഭ്യമല്ലായിരുന്നു. മുമ്പ് ഓൺലൈനിലോ സെർച്ച് എൻജിനുകളിലോ പരിശോധിക്കാനായിരുന്ന വിവരങ്ങൾ ഇല്ലാതാക്കുകയോ മാറ്റുകയോ ചെയ്തതിനാൽ ഇനി അവയിലേക്ക് പ്രവേശിക്കാനാകാത്ത സാഹചര്യങ്ങളാണിത്. നിലവിൽ മനുഷ്യർക്ക് പൊതുവായി പരിശോധിക്കാനാകുന്ന വിവരങ്ങളുടെ പരിധിയിൽ പുനർമൂല്യനിർണയം നടത്തിയപ്പോൾ, ക്ലെവിയുടെ ശരിയുത്തര നിരക്ക് 98%-ത്തിലധികമാണെന്ന് കണ്ടെത്തി. ഇത് മനുഷ്യരുടെ ശരാശരിയായ 92%-നെ ഇതിനകം മറികടന്ന നിരക്കാണ്.
ക്ലെവി പ്രതിനിധി വിശദീകരിച്ചു: “ക്ലെവി ബാഹ്യ മോഡലുകളുടെ മിശ്രണം കൂടാതെ, from scratch സ്വന്തം മോഡലുകളും സ്വന്തം AI ഏജന്റ് സൊല്യൂഷനുകളും മാത്രം ഉപയോഗിച്ച് 5 ഏജന്റുകളും 70+ സ്കോർ നേടി, പൊതു ബെഞ്ച്മാർക്കിൽ മുൻനിര 2.5%-ൽ പ്രവേശിച്ചു. ഭാവിയിൽ സ്വന്തം മോഡലുകളും ഏജന്റ് സൊല്യൂഷനുകളും മെച്ചപ്പെടുത്തുന്നതിലൂടെ ഔദ്യോഗിക സ്കോർ ഇനിയും ഉയർത്താനാകുമെന്ന് കരുതുന്നു. ആഗോള പൊതു ബെഞ്ച്മാർക്കിൽ ഈ നേട്ടം യഥാർത്ഥ അളവെടുപ്പിലൂടെ തെളിയിക്കപ്പെട്ട 'സ്ഥിരീകരിച്ച വിശ്വാസ്യത' പ്രകടിപ്പിക്കുന്നു എന്നതും, ആഭ്യന്തര AI ഡെവലപ്പറുടെ from scratch സ്വന്തം മോഡൽ അധിഷ്ഠിത നേട്ടമാണെന്നതും, ബാഹ്യ മോഡലുകളുടെ മിശ്രണമല്ലാത്ത സ്വതന്ത്ര മോഡൽ സ്റ്റാക്കിന്റെ ഫലമാണെന്നതും, ചില ചോദ്യങ്ങളിലെ വിവരനഷ്ടം പരിഗണിക്കുമ്പോൾ സ്കോറിനേക്കാൾ അപ്പുറമുള്ള വ്യാഖ്യാന മൂല്യമുണ്ടെന്നതും കാരണം ഇതിന് വലിയ പ്രാധാന്യമുണ്ട്.”
