Nyheiter

Konkurransekraft dokumentert med data – den koreanskutvikla AI-agenten nådde topp 2,5 % i GAIA-benchmarken

Då GAIA-benchmarken først blei offentleggjord, klarte sjølv GPT-4, som på den tida var ein av dei mest avanserte modellane, berre ein skår på rundt 30 %. Dette viser at AI på den tida framleis var i ein tidleg fase når det gjaldt evna til å «tenkje og handle», sidan GAIA krev meir enn enkel spørsmål-og-svar og omfattar kompleks resonnering, bruk av verktøy og problemløysing i fleire steg …

Kva GAIA-skåren betyr – kor langt har AI-agentar kome?

Då GAIA-benchmarken først blei offentleggjord, klarte sjølv GPT-4, som på den tida var ein av dei mest avanserte modellane, berre ein skår på rundt 30 %. Dette viser at AI på den tida framleis var i ein tidleg fase når det gjaldt evna til å «tenkje og handle», sidan GAIA krev meir enn enkel spørsmål-og-svar og omfattar kompleks resonnering, bruk av verktøy og problemløysing i fleire steg.

I dag har derimot agentane i toppsjiktet nådd 92,36 %.

Denne utviklinga er meir enn ei enkel forbetring av ytinga. Ho viser at AI no har gått inn i fasen med «Agentic AI», der systema ikkje lenger berre svarar på spørsmål, men tolkar situasjonar, vel nødvendige verktøy og planlegg og gjennomfører fleire steg på eiga hand.

På berre nokre få år har AI utvikla seg frå eit «verktøy for kunnskapsskaping» til ein «aktør som utfører oppgåver».

Bilete i brødteksten

📌 Og blant dei øvste 2,5 % finn vi CLEVI

I dette globale konkurranselandskapet viser det at CLEVI-agenten, som er utvikla i Sør-Korea, er oppført blant dei øvste 2,5 % på GAIA-leiarlista, at teknologisk sjølvstende er oppnådd. Det er eit døme på at ein AI-agent utvikla i Korea også held mål etter globale standardar. Dette har større betydning enn berre eit enkelt tal. Det betyr at teknologien er objektivt validert gjennom konkurranse med tusenvis av modellar på ein offentleg, global benchmark – ikkje berre i eit spesifikt demomiljø.

Endå viktigare er det at dette resultatet ikkje er eit tilfeldig resultat frå éin modell, men at agentar med ulike utformingar på same Agent Stack gjentekne gonger har oppnådd yting i toppsjiktet.

Med andre ord er CLEVI-teknologien ikkje berre «eit resultat som blei bra éin gong», men strukturell konkurransekraft som kan reproduserast, og kapasitet på plattformnivå som kan utvidast til ulike bransjar og scenario.

Bilete i brødteksten

Kva betyr så denne indikatoren?

Frå brukaren sitt perspektiv er den største terskelen for å ta i bruk AI spørsmålet: «Kan ein verkeleg stole på systemet og overlate oppgåver til det?»

Yting som gjentekne gonger er dokumentert på den globale, offentlege leiarlista – ein tredjepartarena – og ikkje berre gjennom prangande demonstrasjonar eller presentasjonsmateriell frå selskapet sjølv, er det mest objektive svaret på dette spørsmålet. Konkret har dette betydning på tre område.

For det første: redusert risiko ved innføring

For verksemder er det ei betydeleg belastning å kople uprøvd AI til interne arbeidsprosessar.

Resultat frå truverdige referansepunkt som GAIA kan brukast direkte som grunnlag for tillit i den tekniske vurderingsfasen.

For det andre: realisering av automatisering av komplekse arbeidsoppgåver

Talet 2,5 % på toppnivå inneber ein grad av intelligens som går utover enkle, repetitive oppgåver, og som gjer det mogleg å forstå samanhengar, ta sjølvstendige avgjerder gjennom fleire steg og fullføre oppgåver.

Arbeidsområde som ein til no har rekna som «vanskelege å overlate til AI», kan bli reelle mål for automatisering.

For det tredje: samtidig sikring av datasikkerheit og yting

Den eigne Agent Stack-strukturen inneber at dataflyten ikkje går ut av verksemda.

De kan frigjere dykk frå det tidlegare dilemmaet der ein måtte inngå kompromiss med sikkerheita for å kunne bruke AI med høg yting.

Denne strukturen er ein avgjerande skilnad, særleg i bransjar med høg datasensitivitet, som finans, helse og juridiske tenester.

Moglegheita for å gjenskape strukturen har allereie byrja å bli dokumentert.

Og resultata til kvar agent som blir bygd på denne strukturen, vil snart føre til reelle endringar i praksis.

«Til sjuande og sist blir kvaliteten på teknologien fullført gjennom ‘overtyding’ i praksis.»

CLEVI nøyer seg ikkje med å tilby AI med høg yting. Kjernen vår er å byggje ein «infrastruktur for gjennomføring» som bryt ned sikkerheitsbarrierane verksemder møter, og som faktisk kan fullføre komplekse arbeidsoppgåver i praksis.

No kan de gå vidare frå å vurdere innføring og starte eit trygt og kraftfullt AI-arbeidsmiljø saman med CLEVI.

Som ein påliteleg partnar de kan overlate arbeidet til, vil vi saman med dykk skape reell innovasjon i verksemda dykkar.

Tilbake til nyheitsrommet
CLEVI

Språk og region

Maskinomsette språk er merkte. Tilgjengelegheita følgjer den publiserte nettstadspakka.

136 språk

Tilrådd

1

Aust-Asia

7

Søraust-Asia

11

Sør-Asia

18

Sentral-Asia

5

Midtausten og Kaukasus

10

Vest-Europa og Sør-Europa

16

Storbritannia og Irland

4

Nord-Europa

10

Sentral-Europa og Balkan

14

Aust-Europa

5

Aust-Afrika

8

Vest-Afrika og Sentral-Afrika

9

Sørlege Afrika

8

Amerika

5

Oseania

5
Konkurransekraft dokumentert med data – den koreanskutvikla AI-agenten nådde topp 2,5 % i GAIA-benchmarken — CLEVI