വാർത്തകൾ

AI സ്റ്റാർട്ടപ്പായ ക്ലെവി, GAIA-യിൽ മുൻനിര 2.5%-ൽ പ്രവേശിച്ചു… സാധൂകരിക്കപ്പെട്ട വിശ്വാസ്യത തെളിയിക്കുന്നു

ഉറവിടം: ഡിജിറ്റൽ ടൈംസ്, ഗുബോൺഗ്യു റിപ്പോർട്ടർ

ഉറവിടം: ഡിജിറ്റൽ ടൈംസ്, ഗുബോൺഗ്യു റിപ്പോർട്ടർ

“AI സ്റ്റാർട്ടപ്പായ ക്ലെവി, GAIA-യിൽ മുൻനിര 2.5%-ൽ പ്രവേശിച്ചു… സാധൂകരിക്കപ്പെട്ട വിശ്വാസ്യത തെളിയിക്കുന്നു” എന്ന ലേഖനത്തിന്റെ പൂർണ്ണ ഉള്ളടക്കത്തിൽ നിന്നുള്ള ഉദ്ധരണം

പ്രസിദ്ധീകരിച്ച തീയതി 2026-04-08

ലിങ്ക് : https://n.news.naver.com/article/029/0003020511?sid=105

ദക്ഷിണ കൊറിയൻ AI സ്റ്റാർട്ടപ്പായ ‘ക്ലെവി(Clevi)’ from scratch ആയി വികസിപ്പിച്ച സ്വന്തം മോഡലും സ്വന്തം ഏജന്റ് സൊല്യൂഷനും നിർമ്മിച്ച സാഹചര്യത്തിൽ, ദക്ഷിണ കൊറിയയിൽ ആദ്യമായി GAIA ബെഞ്ച്മാർക്കിൽ രജിസ്റ്റർ ചെയ്ത ആകെ 3,090 മോഡലുകളിൽ മുൻനിര 2.5%-ൽ പ്രവേശിച്ചതായി അറിയിച്ചു.

വ്യവസായ രംഗത്തെ വിശദീകരണമനുസരിച്ച്, Meta AI രൂപകൽപ്പന ചെയ്ത് Hugging Face പ്രവർത്തിപ്പിക്കുന്ന GAIA, AI-യോട് ‘ഒരൊറ്റ കാര്യത്തിൽ മികവ്’ മാത്രമല്ല, ‘നിരവധി കഴിവുകൾ സംയോജിപ്പിച്ച് യഥാർത്ഥ പ്രശ്നങ്ങൾ പരിഹരിക്കാനുള്ള കഴിവും’ ആവശ്യപ്പെടുന്നു. വെബിൽ നിന്ന് വിവരങ്ങൾ കണ്ടെത്തുകയും, PDF-ലുള്ള പട്ടികകൾ വായിക്കുകയും, ചിത്രങ്ങൾ വിശകലനം ചെയ്യുകയും, കോഡ് പ്രവർത്തിപ്പിച്ച് കണക്കുകൂട്ടുകയും, ആ ഫലങ്ങൾ സംയോജിപ്പിച്ച് ഒരു അന്തിമ ഉത്തരം നൽകുകയും വേണം. 301 രഹസ്യ ചോദ്യങ്ങൾ, മൂന്ന് തലത്തിലുള്ള ബുദ്ധിമുട്ട്, ഉത്തരങ്ങൾ വെളിപ്പെടുത്താത്ത തത്വം എന്നിവ കാരണം ഓവർഫിറ്റിങ്ങോ ചീറ്റിങ്ങോ അസാധ്യമാകുന്ന ഘടനയാണിത്.

ഈ പരീക്ഷയിൽ ഉയർന്ന സ്കോർ നേടാൻ രണ്ട് കാര്യങ്ങൾ ആവശ്യമാണ്. അടിസ്ഥാനമായ ഭാഷാ മോഡലിന്റെ യുക്തിചിന്താ കഴിവും, ആ മോഡലിനെ യഥാർത്ഥ ലോകത്തിലെ ഉപകരണങ്ങളുമായി ബന്ധിപ്പിച്ച് സ്വയം പ്രവർത്തനങ്ങൾ നിർവഹിക്കാൻ പ്രാപ്തമാക്കുന്ന ഏജന്റ് സൊല്യൂഷനും. മോഡൽ എത്ര മികച്ചതായാലും ഏജന്റ് ദുർബലമാണെങ്കിൽ Level 3 പരിഹരിക്കാനാകില്ല; ഏജന്റ് എത്ര സങ്കീർണ്ണമായാലും മോഡലിന്റെ യുക്തിചിന്താ കഴിവ് അപര്യാപ്തമാണെങ്കിൽ ഇടത്തരം ഘട്ടത്തിൽ തന്നെ തെറ്റായ ഉത്തരങ്ങൾ തുടർന്നുപോകും.

GAIA ലീഡർബോർഡിന്റെ നിലവിലെ ഘടന പരിശോധിക്കുമ്പോൾ രസകരമായൊരു മാതൃക കാണാം. മുൻനിര ഏജന്റുകളിൽ ഭൂരിഭാഗവും GPT, Claude, Gemini തുടങ്ങിയ വിവിധ ബിഗ് ടെക് മോഡലുകളെ സംയോജിപ്പിക്കുന്ന ‘മൾട്ടി-മോഡൽ മിക്സ്’ തന്ത്രമാണ് സ്വീകരിച്ചിരിക്കുന്നത്. ഓരോ മോഡലിന്റെയും ശക്തികൾ സംയോജിപ്പിക്കുകയും വിവരനഷ്ടം മൂലമുള്ള സ്കോർ കുറയുന്നത് പ്രതിരോധിക്കുകയും ചെയ്യുന്ന യുക്തിസഹമായ സമീപനമാണിത്.

എന്നാൽ ക്ലെവി ആ നിരയിൽ ചേർന്നില്ല. from scratch രീതിയിൽ വികസിപ്പിച്ച cip-5.5-agent(ഏജെന്റിക് AI) സങ്കീർണ്ണമായ പ്രവർത്തനങ്ങളുടെ ആസൂത്രണം, നിർവഹണം, പരിശോധന എന്നിവ സ്വയം നടത്തുന്നു; cip-5.5-mm(ഉയർന്ന പ്രകടനമുള്ള പൊതുവായ മൾട്ടിമോഡൽ) ശബ്ദം, ചിത്രങ്ങൾ, വീഡിയോകൾ തുടങ്ങി വിവിധ ഫയൽ ഫോർമാറ്റുകൾ മനസ്സിലാക്കി യുക്തിചിന്ത നടത്തുന്നു. ഈ രണ്ട് മോഡലുകളും ക്ലെവിക്കുള്ളിൽ സ്വതന്ത്രമായി വികസിപ്പിച്ചതാണ്; ബാഹ്യ LLM API-കൾ യാതൊന്നും ഉപയോഗിച്ചിട്ടില്ല.

ഈ സ്വതന്ത്ര മോഡൽ സ്റ്റാക്ക് ഉപയോഗിച്ച് GAIA-യിൽ 5 ഏജന്റുമാരെ മത്സരിപ്പിക്കുകയും, എല്ലാവരും 70-ലധികം സ്കോർ നേടുകയും ചെയ്തു. ഏറ്റവും ഉയർന്ന 79.07% മുതൽ 70.76% വരെ, ഇത് ഒറ്റ ഫലത്തിന്റെ ഭാഗ്യം മാത്രമല്ല, മുഴുവൻ സ്റ്റാക്കിന്റെയും സ്ഥിരത തെളിയിക്കുന്നതാണ്.

പ്രധാനഭാഗത്തിലെ ചിത്രം

സ്ഥാപനം നൽകിയ വിശദീകരണമനുസരിച്ച്, ഔദ്യോഗികമായ 79.07% സ്കോറിന് പിന്നിൽ മറ്റൊരു കണക്കും ഉണ്ട്. CLEVI-യുടെ ആഭ്യന്തര പോസ്റ്റ്-റിവ്യൂവിൽ, 301 ചോദ്യങ്ങളിൽ നിലവിൽ പൊതുവായി ലഭ്യമായ വെബിൽ ശരിയുത്തരത്തിനുള്ള തെളിവുകൾ നഷ്ടപ്പെട്ട നിരവധി ചോദ്യങ്ങൾ കണ്ടെത്തി. ശരിയുത്തരങ്ങൾ ഇപ്പോഴും വെബിൽ ലഭ്യമായ ചോദ്യങ്ങളെ മാത്രം അടിസ്ഥാനമാക്കി പുനർമൂല്യനിർണയം നടത്തിയപ്പോൾ, CLEVI-യുടെ ശരിയുത്തര നിരക്ക് 98%-ത്തിലധികമായിരുന്നു. ഇത് മനുഷ്യരുടെ ശരാശരിയായ 92%-നെ ഇതിനകം മറികടന്ന കണക്കാണ്.

തീർച്ചയായും, മറ്റ് കമ്പനികളുടെ ശക്തമായ പൊതുവായ മോഡലുകൾ സംയോജിപ്പിച്ചിരുന്നെങ്കിൽ ഔദ്യോഗിക സ്കോർ ഇനിയും ഉയർത്താനാകുമായിരുന്നു. എന്നാൽ CLEVI ആ തന്ത്രം മനഃപൂർവം സ്വീകരിച്ചില്ല. ഈ ബെഞ്ച്മാർക്കിന്റെ ലക്ഷ്യം ഏറ്റവും ഉയർന്ന സ്കോറിനായുള്ള മത്സരം ആയിരുന്നില്ല; from scratch സ്വതന്ത്ര മോഡൽ ആഗോള വേദിയിൽ മത്സരിക്കാവുന്ന നിലവാരത്തിലെത്തിയോയെന്ന് പരിശോധിക്കുകയെന്നതായിരുന്നു.

GAIA ലീഡർബോർഡിൽ പേര് ഇടംനേടുന്നത്, മൂന്നാം കക്ഷിയുടെ സ്വതന്ത്ര വിലയിരുത്തലിലൂടെ ലഭിച്ച സ്ഥിരീകരിക്കപ്പെട്ട വിശ്വാസ്യത കൈവരിച്ചതിന്റെ കാര്യത്തിൽ വലിയ പ്രാധാന്യമുള്ളതാണ്. നിക്ഷേപ സമാഹരണം, വിദേശ വിപുലീകരണം, B2B വിൽപ്പന എന്നിവയുൾപ്പെടെ എല്ലാ ഘട്ടങ്ങളിലും ഉപയോഗിക്കാവുന്ന വസ്തുനിഷ്ഠമായ തെളിവാണിത്.

CLEVI-യുടെ ഒരു പ്രതിനിധി പറഞ്ഞു: “ഔദ്യോഗികമായി തെറ്റായ 63 ഉത്തരങ്ങളിൽ പലതും ഔട്ട്പുട്ട് ഫോർമാറ്റിലെ പൊരുത്തക്കേട്, ദൃശ്യ വിവരങ്ങളുടെ വ്യാഖ്യാനത്തിലെ പിശക്, വിവരനഷ്ടം മൂലം ഉത്തരം നൽകാനാകാത്ത ചോദ്യങ്ങൾ എന്നിവയിൽ നിന്നാണ് ഉണ്ടായത്. ഇത് യുക്തിപരമായ നിഗമനശേഷിയുടെ അടിസ്ഥാനപരമായ പരിമിതിയേക്കാൾ, പോസ്റ്റ്-പ്രോസസ്സിംഗ് കൃത്യതയുടെയും ബാഹ്യ വിവരങ്ങളുടെ ലഭ്യതയുടെയും പ്രശ്നമാണ്. ഇത് സ്വന്തം മോഡലായതിനാൽ CLEVI-ക്ക് സ്വയം മെച്ചപ്പെടുത്താൻ കഴിയും. അതാണ് from scratch സ്വതന്ത്ര മോഡലിന്റെ ഘടനാപരമായ നേട്ടം. CLEVI-യുടെ ഈ നേട്ടം കൊറിയൻ AI വ്യവസായത്തോട് ‘നാം ഇനി എത്രകാലം “കടംകൊണ്ട ബുദ്ധി”യെ ആശ്രയിക്കും?’ എന്ന ചോദ്യം ഉന്നയിക്കുന്നു. CLEVI from scratch എന്ന കൂടുതൽ ദുഷ്കരമായ പാത തിരഞ്ഞെടുക്കുകയും ആഗോള വേദിയിൽ അതിന്റെ ഉത്തരം തെളിയിക്കാനുമാണ് ലക്ഷ്യമിടുന്നത്,” അദ്ദേഹം പറഞ്ഞു.

വാർത്താമുറിയിലേക്ക് മടങ്ങുക
CLEVI

ഭാഷയും പ്രദേശവും

മെഷീൻ വിവർത്തനം ചെയ്ത ഭാഷകൾ അടയാളപ്പെടുത്തിയിരിക്കുന്നു. ലഭ്യത പ്രസിദ്ധീകരിച്ച സൈറ്റ് ബണ്ടിലിനെ ആശ്രയിച്ചിരിക്കുന്നു.

136 ഭാഷകൾ

ശുപാർശ ചെയ്തത്

1

കിഴക്കൻ ഏഷ്യ

7

തെക്ക്-കിഴക്കൻ ഏഷ്യ

11

തെക്കേ ഏഷ്യ

18

മദ്ധ്യേഷ്യ

5

മധ്യപൂർവ ദേശവും കോക്കസസും

10

പശ്ചിമ യൂറോപ്പ് കൂടാതെ തെക്കേ യൂറോപ്പ്

16

യുണൈറ്റഡ് കിംഗ്ഡം കൂടാതെ അയർലൻഡ്

4

വടക്കേ യൂറോപ്പ്

10

മധ്യ യൂറോപ്പും ബാൽക്കണും

14

കിഴക്കൻ യൂറോപ്പ്

5

കിഴക്കൻ ആഫ്രിക്ക

8

പശ്ചിമ ആഫ്രിക്ക കൂടാതെ മദ്ധ്യ ആഫ്രിക്ക

9

തെക്കേ ആഫ്രിക്ക

8

അമേരിക്കകൾ

5

ഓഷ്യാനിയ

5
AI സ്റ്റാർട്ടപ്പായ ക്ലെവി, GAIA-യിൽ മുൻനിര 2.5%-ൽ പ്രവേശിച്ചു… സാധൂകരിക്കപ്പെട്ട വിശ്വാസ്യത തെളിയിക്കുന്നു — CLEVI