Kilde: Digital Times, reporter Gu Bon-gyu
Full gjengivelse av artikkelen «KI-oppstartsselskapet Clevi går inn blant de øverste 2,5 % i GAIA … viser dokumentert troverdighet»
Publiseringsdato 2026-04-08
Lenke: https://n.news.naver.com/article/029/0003020511?sid=105
Det koreanske KI-oppstartsselskapet Clevi har kunngjort at det, etter å ha bygget sin egen modell og agentløsning from scratch, som det første i Korea har kommet inn blant de øverste 2,5 % på GAIA-benchmarken, basert på totalt 3 090 registrerte modeller.
Ifølge bransjen er GAIA, utformet av Meta AI og driftet av Hugging Face, ikke ute etter at KI skal «være god på én enkelt ting», men etter «evnen til å kombinere flere ferdigheter for å løse problemer fra den virkelige verden». Den må finne informasjon på nettet, lese tabeller i PDF-filer, analysere bilder, kjøre kode for å utføre beregninger og sammenstille resultatene til ett korrekt svar. Med 301 ikke-offentliggjorte oppgaver, tre vanskelighetsgrader og et prinsipp om at svarene ikke offentliggjøres, er det en struktur som gjør både overtilpasning og juks umulig.
For å oppnå en høy poengsum på denne testen kreves to ting. Det ene er resonneringsevnen til den underliggende språkmodellen, og det andre er en agentløsning som kobler modellen til verktøy i den virkelige verden og lar den utføre oppgaver autonomt. Uansett hvor god modellen er, kan den ikke løse nivå 3 hvis agenten er svak, og uansett hvor sofistikert agenten er, vil feil forplante seg på mellomnivået hvis modellens resonneringsevne er utilstrekkelig.
GAIA-ledertavlens nåværende struktur viser et interessant mønster. De fleste agentene i toppen benytter en «multimodellmiks»-strategi som kombinerer flere stordatamodeller som GPT, Claude og Gemini. Det er en fornuftig tilnærming for å kombinere styrkene til hver modell og beskytte mot poengreduksjon som følge av blant annet informasjonstap.
Clevi har imidlertid ikke sluttet seg til denne gruppen. cip-5.5-agent (agentisk KI), utviklet from scratch, utfører autonomt planlegging, gjennomføring og verifisering av komplekse oppgaver, mens cip-5.5-mm (høytytende generell multimodal modell) forstår og resonnerer over ulike filformater, inkludert tale, bilder og video. Begge modellene er utviklet internt hos Clevi, og ingen eksterne LLM-API-er er brukt.
Med denne egenutviklede modellstakken stilte CLEVI med 5 agenter i GAIA, og alle oppnådde over 70 poeng. Fra den høyeste poengsummen på 79,07 % til 70,76 % beviste resultatene stabiliteten i hele stakken, ikke bare flaks i et enkeltresultat.
Ifølge selskapets forklaring skjuler det seg et annet tall bak den offisielle poengsummen på 79,07 %. CLEVI gjennomførte en intern etteranalyse og fant at en betydelig andel av de 301 oppgavene hadde mistet grunnlaget for riktige svar på det offentlig tilgjengelige nettet. Ved en ny vurdering basert kun på oppgaver der svaret fortsatt finnes på nettet, var CLEVIs svarprosent over 98 %. Dette er allerede høyere enn menneskegjennomsnittet på 92 %.
Det ville selvsagt vært mulig å øke den offisielle poengsummen ytterligere ved å kombinere kraftige generelle modeller fra andre selskaper. CLEVI valgte imidlertid bevisst ikke denne strategien. Målet med denne benchmarken var ikke å konkurrere om den høyeste poengsummen, men å verifisere om en egen modell utviklet from scratch hadde nådd et nivå der den kunne konkurrere på den globale arenaen.
At navnet står på GAIA-ledertavlen, har stor betydning fordi det innebærer verifisert troverdighet tildelt gjennom en uavhengig tredjepartsevaluering. Dette gir et objektivt grunnlag som kan brukes i alle faser, fra kapitalinnhenting og internasjonal ekspansjon til B2B-salg.
En representant for CLEVI uttalte: «Av de 63 offisielt feilaktige svarene skyldtes en betydelig andel uoverensstemmelser i utdataformatet, feil ved tolkning av visuelt materiale og oppgaver som ikke kunne besvares på grunn av tapt informasjon. Problemet gjelder presisjonen i etterbehandlingen og tilgjengeligheten av ekstern informasjon, snarere enn grunnleggende begrensninger i logisk resonnering. Fordi det er en egen modell, kan CLEVI forbedre den selv. Dette er nettopp den strukturelle fordelen ved en egen modell utviklet from scratch. CLEVIs prestasjon denne gangen stiller den koreanske AI-bransjen spørsmålet: “Hvor lenge skal vi være avhengige av ‘lånte hjerner’?” CLEVI har valgt den vanskeligere veien med from scratch og ønsker å bevise svaret på den globale arenaen», sa han.
