Hva GAIA-poengsummen betyr – hvor langt har AI-agenter kommet?
Da GAIA-benchmarken først ble offentliggjort, oppnådde selv GPT-4, som på den tiden var en av de mest avanserte modellene, bare en poengsum på rundt 30 %. Dette betyr at AI på den tiden fortsatt var på et tidlig stadium når det gjaldt evnen til å «tenke og handle», ettersom GAIA krever mer enn enkel spørsmål-og-svar og innebærer kompleks resonnering, bruk av verktøy og problemløsning i flere trinn.
I dag har imidlertid agentene i toppsjiktet nådd 92,36 %.
Denne utviklingen er mer enn bare en forbedring i ytelse. Den viser at AI nå har gått inn i fasen med «Agentic AI», der den ikke lenger bare svarer på spørsmål, men tolker situasjoner, velger nødvendige verktøy og planlegger og gjennomfører flere trinn på egen hånd.
På bare noen få år har AI utviklet seg fra et «verktøy for kunnskapsgenerering» til en «aktør som utfører arbeidsoppgaver».
📌 Og CLEVI er blant de øverste 2,5 %
I dette globale konkurransebildet er det at CLEVI-agenten, utviklet i Korea, er oppført blant de øverste 2,5 % på GAIA-ledertavlen, et bevis på teknologisk selvstendighet og et eksempel på at en AI-agent utviklet i Korea også holder mål etter globale standarder. Dette har betydning utover bare et tall. Det betyr at teknologien er objektivt verifisert gjennom konkurranse med tusenvis av modeller på en offentlig, global benchmark – ikke i et spesifikt demomiljø.
Enda viktigere er det at dette resultatet ikke er et tilfeldig resultat fra én enkelt modell, men at agenter med ulike utforminger gjentatte ganger har oppnådd ytelse i toppsjiktet på den samme Agent Stack.
Med andre ord er CLEVI-teknologien ikke bare «et godt resultat én gang», men en strukturell konkurransefordel som kan gjenskapes, samt plattformkompetanse som kan skaleres til ulike bransjer og scenarier.
Hva betyr så denne indikatoren?
For brukeren er den største barrieren mot å ta i bruk AI spørsmålet: «Kan man virkelig stole på den og overlate oppgaver til den?»
Ytelse som gjentatte ganger er bevist på en tredjepartsarena – en global offentlig resultatliste, ikke en prangende demo eller selskapets eget presentasjonsmateriale – er det mest objektive svaret på dette spørsmålet. Konkret har dette betydning på tre områder.
For det første: redusert innføringsrisiko
For en virksomhet er det en betydelig belastning å koble uprøvd AI til interne arbeidsprosesser.
Resultater fra anerkjente referansetester som GAIA kan brukes direkte som grunnlag for tillit i den tekniske vurderingsfasen.
For det andre: realisering av automatisering av komplekse arbeidsprosesser
En plassering blant de øverste 2,5 prosentene innebærer et intelligensnivå som går utover enkle, repeterende oppgaver, og som kan forstå kontekst, vurdere flere trinn på egen hånd og fullføre dem.
Arbeidsområder som hittil har blitt ansett som «vanskelige å overlate til AI», kan bli reelle mål for automatisering.
For det tredje: samtidig sikring av datasikkerhet og ytelse
En egen Agent Stack-struktur innebærer at datastrømmen ikke forlater virksomheten.
Det gjør det mulig å komme ut av det tidligere dilemmaet der man måtte inngå kompromisser med sikkerheten for å bruke AI med høy ytelse.
Denne strukturen er særlig et avgjørende konkurransefortrinn i bransjer med høy datasensitivitet, som finans, helsevesen og juridiske tjenester.
Muligheten for å gjenskape strukturen har allerede begynt å bli bevist.
Og resultatene til hver agent som bygges på denne strukturen, vil snart føre til reelle endringer i praksis.
«Til syvende og sist fullføres teknologiens modenhet gjennom ‘overbevisning’ i praksis.»
CLEVI nøyer seg ikke med å levere AI med høy ytelse. Vår kjerne er å bygge en «handlingsorientert infrastruktur» som bryter ned sikkerhetsbarrierene virksomheter møter, og som faktisk kan fullføre komplekse arbeidsoppgaver.
Gå nå videre fra vurderingsfasen, og start et trygt og kraftfullt AI-arbeidsmiljø sammen med CLEVI.
Som en pålitelig partner dere kan overlate arbeidet til med trygghet, vil vi sammen med dere skape reell innovasjon i virksomheten deres.
