Nyheiter

AI-startupen CLEVI inn på dei øvste 2,5 prosentane i GAIA … viser dokumentert truverd

Kjelde: Digital Times, journalist Gu Bon-gyu

Kjelde: Digital Times, journalist Gu Bon-gyu

Full gjengiving av artikkelen «AI-startupen CLEVI inn på dei øvste 2,5 prosentane i GAIA … viser dokumentert truverd»

Publiseringsdato 2026-04-08

Lenkje: https://n.news.naver.com/article/029/0003020511?sid=105

Den sørkoreanske AI-startupen «CLEVI (Clevi)» har bygd eigne modellar og eigne agentløysingar from scratch, og kunngjorde at dei som dei første i Sør-Korea har kome inn blant dei øvste 2,5 prosentane i GAIA-benchmarken, basert på totalt 3 090 registrerte modellar.

Ifølgje forklaringar frå bransjen spør GAIA, som er utforma av Meta AI og driven av Hugging Face, ikkje AI om evna til å «vere god på éin ting», men om evna til å «kombinere fleire evner for å løyse verkelege problem». AI-en må finne informasjon på nettet, lese tabellar i PDF-filer, analysere bilete, køyre kode for å gjere utrekningar og samanfatte resultata til eitt korrekt svar. Strukturen, med 301 konfidensielle oppgåver, tre vanskegrader og eit prinsipp om at svara ikkje blir offentleggjorde, gjer både overtilpassing og juks umogleg.

For å få ein høg poengsum på denne testen trengst to ting. Det eine er resonneringsevna til språkmodellen som ligg til grunn, og det andre er ei agentløysing som koplar modellen til verktøy i den verkelege verda og lèt han utføre oppgåver autonomt. Sjølv om modellen er aldri så god, kan ikkje Level 3 løysast dersom agenten er svak, og sjølv om agenten er aldri så sofistikert, vil feil spreie seg på mellomnivået dersom resonneringsevna til modellen er utilstrekkeleg.

Ser ein på den noverande strukturen til GAIA-resultattavla, kjem eit interessant mønster til syne. Dei fleste agentane i toppen nyttar ein strategi med «multimodellmiks», der dei kombinerer fleire modellar frå store teknologiselskap, som GPT, Claude og Gemini. Dette er ein rasjonell framgangsmåte for å kombinere styrkane til kvar modell og motverke poengtap som følgje av informasjonstap og liknande.

CLEVI har derimot ikkje slutta seg til denne rekkja. cip-5.5-agent (agentisk AI), som er utvikla from scratch, utfører autonomt planlegging, gjennomføring og verifisering av komplekse oppgåver, medan cip-5.5-mm (høgtytande generell multimodal modell) forstår og resonnerer over ulike filformat, som tale, bilete og video. Begge modellane er utvikla sjølvstendig internt i CLEVI, og ingen eksterne LLM-API-ar er nytta.

Med denne eigenutvikla modellstakken stilte CLEVI med fem agentar i GAIA, og alle oppnådde over 70 poeng. Frå den høgaste poengsummen på 79,07 % til 70,76 % viste resultata stabiliteten i heile stakken – ikkje berre flaks med eitt enkelt resultat.

Bilete i brødteksten

Ifølgje selskapet si forklaring ligg det eit anna tal bak den offisielle poengsummen på 79,07 %. Ei intern ettervurdering i CLEVI viste at ein stor del av dei 301 oppgåvene hadde mist svargrunnlaget på det offentlege nettet. Ved ei ny vurdering basert berre på oppgåver der svaret framleis finst på nettet, var svarprosenten til CLEVI over 98 %. Dette er allereie høgare enn gjennomsnittet for menneske på 92 %.

Det ville sjølvsagt ha vore mogleg å løfte den offisielle poengsummen ytterlegare ved å blande inn sterke generelle modellar frå andre selskap. CLEVI valde likevel med vilje å ikkje følgje denne strategien. Målet med denne benchmarken var ikkje å konkurrere om den høgaste poengsummen, men å verifisere om ein eigen modell utvikla from scratch hadde nådd eit nivå der han kunne konkurrere på den globale scena.

At namnet står på GAIA-leiarlista, har stor betydning fordi det inneber dokumentert truverd tildelt gjennom ei uavhengig tredjepartsvurdering. Dette blir eit objektivt grunnlag som kan nyttast i alle fasar – frå å hente inn investeringar og ekspandere internasjonalt til B2B-sal.

Ein representant for CLEVI sa: «Ein stor del av dei 63 offisielt feilaktige svara kom av avvik i utdataformatet, feil i tolkinga av visuelt materiale og oppgåver som ikkje kunne løysast fordi informasjonen var gått tapt. Dette handlar meir om presisjonen i etterbehandlinga og tilgangen på ekstern informasjon enn om grunnleggjande avgrensingar i logisk resonnering. Fordi modellen er eigenutvikla, kan CLEVI sjølv forbetre han. Dette er nettopp den strukturelle fordelen med ein eigen modell utvikla from scratch. Resultata til CLEVI reiser spørsmålet til den koreanske AI-bransjen: «Kor lenge skal vi vere avhengige av ’lånte hjerner’?» CLEVI har valt den vanskelegare vegen med from scratch og ønskjer å bevise svaret på den globale scena.»

Tilbake til nyheitsrommet
CLEVI

Språk og region

Maskinomsette språk er merkte. Tilgjengelegheita følgjer den publiserte nettstadspakka.

136 språk

Tilrådd

1

Aust-Asia

7

Søraust-Asia

11

Sør-Asia

18

Sentral-Asia

5

Midtausten og Kaukasus

10

Vest-Europa og Sør-Europa

16

Storbritannia og Irland

4

Nord-Europa

10

Sentral-Europa og Balkan

14

Aust-Europa

5

Aust-Afrika

8

Vest-Afrika og Sentral-Afrika

9

Sørlege Afrika

8

Amerika

5

Oseania

5
AI-startupen CLEVI inn på dei øvste 2,5 prosentane i GAIA … viser dokumentert truverd — CLEVI