Nyheder

Konkurrenceevne dokumenteret med data – den indenlandske AI-agent opnår en placering blandt de øverste 2,5 % på GAIA-benchmarket

Da GAIA-benchmarket først blev offentliggjort, opnåede selv GPT-4, som på det tidspunkt var en af de mest avancerede modeller, kun en score på omkring 30 %. Det viser, at AI på det tidspunkt stadig var på et tidligt stadie, når det gjaldt evnen til at “tænke og handle”, eftersom GAIA kræver mere end simple spørgsmål og svar – herunder kompleks ræsonnering, brug af værktøjer og problemløsning i flere trin …

Hvad betyder GAIA-scoren – hvor langt er AI-agenter nået?

Da GAIA-benchmarket først blev offentliggjort, opnåede selv GPT-4, som på det tidspunkt var en af de mest avancerede modeller, kun en score på omkring 30 %. Det viser, at AI på det tidspunkt stadig var på et tidligt stadie, når det gjaldt evnen til at “tænke og handle”, eftersom GAIA kræver mere end simple spørgsmål og svar – herunder kompleks ræsonnering, brug af værktøjer og problemløsning i flere trin.

I dag har agenterne i toppen imidlertid nået 92,36 %.

Denne udvikling er mere end blot en forbedring af ydeevnen. Den viser, at AI nu er gået videre end blot at besvare spørgsmål og er trådt ind i fasen med “Agentic AI”, hvor den fortolker situationer, vælger de nødvendige værktøjer og selv planlægger og udfører flere trin.

På blot få år har AI udviklet sig fra et “værktøj til generering af viden” til en “udførende aktør, der udfører arbejdsopgaver”.

Billede i brødteksten

📌 Og blandt de øverste 2,5 % finder vi CLEVI

I dette globale konkurrenceprægede miljø er det, at CLEVI’s agent, der er udviklet i Korea, er blevet optaget blandt de øverste 2,5 % på GAIA-ledertavlen, et bevis på teknologisk selvstændighed og et eksempel på, at en AI-agent udviklet i Korea også lever op til globale standarder. Det har en betydning, der rækker ud over et enkelt tal. Det betyder, at teknologien er objektivt valideret gennem konkurrence med tusindvis af modeller på et globalt, offentligt benchmark – ikke blot i et specifikt demomiljø.

Endnu vigtigere er det, at resultatet ikke skyldes et tilfældigt udfald for én enkelt model, men at agenter med forskellige designs gentagne gange har opnået topresultater på den samme Agent Stack.

CLEVI’s teknologi er med andre ord ikke blot et “resultat, der lykkedes én gang”, men en reproducerbar, strukturel konkurrenceevne og kapacitet på platformniveau, der kan udvides til forskellige brancher og scenarier.

Billede i brødteksten

Hvad betyder denne måling så?

Fra brugerens perspektiv er den største barriere for at tage AI i brug spørgsmålet: "Kan man virkelig stole på den og overlade opgaver til den?"

Ydeevne, der gentagne gange er blevet bevist på en tredjepartsarena – en global, offentlig leaderboard – og ikke gennem prangende demoer eller virksomhedens egne præsentationsmaterialer, er det mest objektive svar på det spørgsmål. Konkret har det betydning på tre områder.

For det første: reduceret implementeringsrisiko

For virksomheder er det en betydelig belastning at forbinde uprøvet AI med interne arbejdsprocesser.

Resultater på anerkendte benchmarks som GAIA kan bruges direkte som grundlag for tillid i den tekniske evalueringsfase.

For det andet: realisering af automatisering af komplekse arbejdsopgaver

En placering blandt de øverste 2,5 % indikerer et intelligensniveau, der rækker ud over simple gentagne opgaver og omfatter forståelse af kontekst samt selvstændig vurdering og fuldførelse af flere trin.

Arbejdsområder, som man hidtil har anset for at være "svære at overlade til AI", kan blive mål for reel automatisering.

For det tredje: samtidig sikring af datasikkerhed og ydeevne

Den egenudviklede Agent Stack-struktur betyder, at dataflowet ikke forlader miljøet.

Det gør det muligt at frigøre sig fra det tidligere dilemma, hvor man måtte gå på kompromis med sikkerheden for at anvende højtydende AI.

Denne struktur er især en afgørende differentieringsfaktor i brancher med høj datasensitivitet, såsom finans, sundhedsvæsen og jura.

Strukturens reproducerbarhed er allerede begyndt at blive dokumenteret.

Og resultaterne fra de enkelte agenter, der bygges oven på denne struktur, vil snart føre til konkrete forandringer i praksis.

"I sidste ende fuldendes teknologiens kvalitet gennem 'tillid' i praksis."

CLEVI nøjes ikke med blot at levere højtydende AI. Vores kerne er at nedbryde de sikkerhedsmæssige barrierer, virksomheder står over for, og opbygge en 'handlingsorienteret infrastruktur', der rent faktisk kan fuldføre komplekse praktiske arbejdsopgaver.

Gå nu videre fra overvejelserne om implementering, og begynd sammen med CLEVI at skabe et sikkert og stærkt AI-arbejdsmiljø.

Som en pålidelig partner, som I trygt kan overlade arbejdet til, vil vi sammen med jer skabe konkrete innovationer i jeres forretningspraksis.

Tilbage til nyhedsredaktionen
CLEVI

Sprog og region

Maskinoversatte sprog er markeret. Tilgængeligheden følger den offentliggjorte webstedspakke.

136 sprog

Anbefales

1

Østasien

7

Sydøstasien

11

Sydasien

18

Centralasien

5

Mellemøsten og Kaukasus

10

Vesteuropa og Sydeuropa

16

Storbritannien og Irland

4

Nordeuropa

10

Centraleuropa og Balkan

14

Østeuropa

5

Østafrika

8

Vestafrika og Centralafrika

9

Det sydlige Afrika

8

Nord-, Mellem- og Sydamerika

5

Oceanien

5