Kjelde: Elektronisk avis, journalist Lee Won-ji
Sitat av heile artikkelen «Klevi, med from scratch-eigenmodell på 79,07 % i GAIA ... blant dei 2,5 % beste av 3 090 modellar»
Publiseringsdato: 2026-04-07
Lenkje: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm eigen modellstakk med fem agentar, alle over 70 poeng
98 %+ korrekt svarprosent når ein tek omsyn til informasjonstap, høgare enn menneske (92 %)
AI-oppstartsverksemda «Klevi» oppnådde ein korrekt svarprosent på 79,07 % i den globale AI-agentreferansetesten «GAIA» ved å bruke from scratch-eigenmodellen sin, og plasserte seg blant dei 2,5 % beste av totalt 3 090 registrerte modellar.
Ifølgje forklaringar frå bransjen blir GAIA vurdert som ein referansetest som truverdig speglar evnene til «praktiske AI-agentar» i AI-referansetestmarknaden. Denne referansetesten, som vart utvikla i fellesskap av Meta AI, HuggingFace, universitetet Paris-Saclay og andre, vart først offentleggjord i november 2023.
Det er tre sentrale punkt som skil GAIA frå andre referansetestar. For det første er overfasiten ikkje offentleg, så overtilpassing er umogleg. For det andre krev testen samansett fleirstegs- og multimodal resonnering, slik at det ikkje er mogleg å oppnå høg poengsum med enkel mønstergjenkjenning. For det tredje konkurrerer meir enn 3 090 modellar frå heile verda på same vilkår gjennom den offisielle leiarlista på Hugging Face.
Testsettet består av totalt 301 oppgåver. Level 1 omfattar bruk av eitt enkelt verktøy og enkel resonnering, Level 2 omfattar kombinasjon av fleire verktøy og resonnering på mellomnivå, medan Level 3 omfattar oppgåver med høgaste vanskegrad, som krev agentplanlegging og gjennomføring i fem eller fleire steg. Då referansetesten vart lansert, låg GPT-modellar (med pluginar) på om lag 15 %, medan dei leiande teama no har løfta resultatet til 70–80 %.
Klevi understreka at det teknisk sett mest merksemdsverdige ved dette resultatet er at dei ikkje brukte eksterne LLM-API-ar som GPT, Claude eller Gemini i det heile. Det særmerkte Klevi var at dei brukte to modellar som var utvikla internt from scratch.
cip-5.5-agent er ein agentisk KI-modell som fungerer som den sentrale hjernen i agentpipeline-ar som autonomt planlegg (planning), utfører (execution) og verifiserer (verification) komplekse oppgåver. cip-5.5-mm er ein høgtytande generell multimodal modell som forstår og resonnerer over ulike filformat, som lyd, bilete og video. Sidan ein stor del av GAIA-oppgåvene inneheld ikkje-tekstbaserte inndata, som PDF-ar, bilete og lydfiler, vart denne multimodale evna ein avgjerande faktor for den høge poengsummen.
CLEVI stilte med fem ulike agentkonfigurasjonar i GAIA, baserte på desse to eigne modellane, og alle oppnådde over 70 poeng.
Ifølgje leverandøren avdekte CLEVI si interne ettergransking eit interessant resultat. For nokre av dei totalt 301 oppgåvene var grunnlaget for dei rette svara ikkje lenger tilgjengeleg på det offentlege nettet. Dette gjeld tilfelle der informasjon som tidlegare kunne stadfestast på nettet eller gjennom søkjemotorar, har blitt sletta eller endra og ikkje lenger kan nåast. Ved ei ny vurdering innanfor omfanget av informasjon som menneske i dag kan stadfeste offentleg, var svarprosenten til CLEVI over 98 %. Dette er allereie høgare enn menneskegjennomsnittet på 92 %.
Ein representant for CLEVI forklarte: «Utan å blande inn eksterne modellar oppnådde alle dei fem agentane til CLEVI over 70 poeng, berre ved hjelp av eigne modellar utvikla from scratch og eigne KI-agentløysingar, og kom dermed inn blant dei øvste 2,5 % i den offentlege benchmarken. Det ser ut til at den offisielle poengsummen kan betrast ytterlegare framover gjennom vidareutvikling av eigne modellar og agentløysingar. Dette resultatet er særleg viktig fordi det viser «verifisert tillit», målt i ein global offentleg benchmark, fordi det er eit resultat basert på ein KI-utviklar frå Korea sine eigne modellar utvikla from scratch, fordi det er eit resultat av ein uavhengig modellstakk utan blanding av eksterne modellar, og fordi det har større tolkingverdi enn poengsummen åleine når ein tek omsyn til at informasjonen i enkelte oppgåver har gått tapt.»
