Nieuws

Concurrentiekracht bewezen door data — een in Korea ontwikkelde AI-agent heeft de top 2,5% van GAIA Bench bereikt

Toen de GAIA-benchmark voor het eerst openbaar werd gemaakt, bleef zelfs GPT-4, destijds een model van het hoogste niveau, steken op een score van ongeveer 30%. Omdat GAIA naast eenvoudige vraag-en-antwoordtaken ook complex redeneren, het gebruik van tools en het oplossen van problemen in meerdere stappen vereist, betekent dit dat AI destijds nog in een vroeg stadium verkeerde wat betreft het vermogen om te “denken en handelen” …

De betekenis van de GAIA-score — hoe ver zijn AI-agents gevorderd?

Toen de GAIA-benchmark voor het eerst openbaar werd gemaakt, bleef zelfs GPT-4, destijds een model van het hoogste niveau, steken op een score van ongeveer 30%. Omdat GAIA naast eenvoudige vraag-en-antwoordtaken ook complex redeneren, het gebruik van tools en het oplossen van problemen in meerdere stappen vereist, betekent dit dat AI destijds nog in een vroeg stadium verkeerde wat betreft het vermogen om te “denken en handelen”.

Vandaag hebben agents in de top 92,36% bereikt.

Deze verandering is meer dan een eenvoudige prestatieverbetering. Het is een indicator dat AI nu de fase van ‘Agentic AI’ is binnengetreden: niet langer alleen vragen beantwoorden, maar situaties interpreteren, de benodigde tools selecteren en zelfstandig meerdere stappen plannen en uitvoeren.

In slechts enkele jaren is AI geëvolueerd van een “tool voor het genereren van kennis” naar een “uitvoerende actor die werkzaamheden verricht”.

Afbeelding in de hoofdtekst

📌 En CLEVI behoort tot die top 2,5%

In deze mondiale concurrentieomgeving bewijst het feit dat CLEVI’s in Korea ontwikkelde agent tot de top 2,5% van het GAIA-leaderboard behoort de technologische zelfstandigheid en toont het aan dat een in Korea ontwikkelde AI-agent ook aan mondiale maatstaven voldoet. Dit betekent meer dan alleen een getal. Het betekent dat de technologie objectief is gevalideerd door competitie met duizenden modellen op een openbaar mondiaal benchmarkplatform, en niet in een specifieke demoomgeving.

Nog belangrijker is dat deze prestatie geen toevallig resultaat van één model is, maar dat agents met verschillende ontwerpen herhaaldelijk prestaties in de top hebben geleverd op dezelfde Agent Stack.

De technologie van CLEVI is dus geen “eenmalig goed resultaat”, maar reproduceerbare structurele concurrentiekracht en platformniveau-capaciteiten die kunnen worden uitgebreid naar uiteenlopende sectoren en scenario’s.

Afbeelding in de hoofdtekst

Wat betekent deze indicator dan?

Voor gebruikers is de grootste drempel bij de invoering van AI de vraag: "Kan ik dit echt toevertrouwen?"

Prestaties die herhaaldelijk zijn bewezen op het wereldwijde openbare leaderboard, een onafhankelijk platform, en niet via indrukwekkende demo’s of bedrijfspresentaties, vormen het meest objectieve antwoord op die vraag. Concreet zijn er drie aspecten die van belang zijn.

Ten eerste: vermindering van implementatierisico’s

Voor bedrijven brengt het aanzienlijke risico’s met zich mee om niet-gevalideerde AI aan interne processen te koppelen.

Prestaties op gezaghebbende benchmarks zoals GAIA kunnen tijdens de technische evaluatiefase rechtstreeks worden gebruikt als basis voor vertrouwen.

Ten tweede: complexe procesautomatisering wordt werkelijkheid

Een score in de top 2,5% staat voor een niveau van intelligentie dat verder gaat dan eenvoudige repetitieve taken: de AI begrijpt de context, neemt zelfstandig beslissingen in meerdere stappen en rondt taken af.

Werkgebieden waarvan tot nu toe werd aangenomen dat ze "moeilijk aan AI toe te vertrouwen" waren, kunnen daadwerkelijk worden geautomatiseerd.

Ten derde: gegevensbeveiliging en prestaties tegelijkertijd waarborgen

De eigen Agent Stack-architectuur betekent dat gegevensstromen de externe omgeving niet verlaten.

Zo kunnen bedrijven ontsnappen aan het bestaande dilemma waarbij beveiliging moest worden opgeofferd om krachtige AI te gebruiken.

Vooral in sectoren met hoge gegevensgevoeligheid, zoals de financiële sector, de gezondheidszorg en de juridische sector, vormt deze architectuur een doorslaggevend onderscheidend kenmerk.

De reproduceerbaarheid van de architectuur begint al te worden bewezen.

En de prestaties van elke agent die op deze architectuur wordt gebouwd, zullen uiteindelijk leiden tot concrete veranderingen in de praktijk.

"Uiteindelijk wordt de kwaliteit van technologie voltooid door 'vertrouwen' in de praktijk."

CLEVI doet meer dan alleen krachtige AI aanbieden. Onze essentie is het bouwen van een 'uitvoeringsgerichte infrastructuur' die de beveiligingsbarrières waarmee bedrijven worden geconfronteerd doorbreekt en complexe werkprocessen daadwerkelijk kan voltooien.

Laat de fase waarin u over implementatie nadacht nu achter u en begin samen met CLEVI aan een veilige en krachtige AI-werkomgeving.

Als een betrouwbare partner aan wie u uw werk kunt toevertrouwen, creëren we samen concrete innovatie in uw bedrijfspraktijk.

Terug naar de nieuwsruimte
CLEVI

Taal en regio

Machinaal vertaalde talen zijn gemarkeerd. Beschikbaarheid volgt de gepubliceerde sitebundel.

136 talen

Aanbevolen

1

Oost-Azië

7

Zuidoost-Azië

11

Zuid-Azië

18

Centraal-Azië

5

Midden-Oosten en de Kaukasus

10

West-Europa en Zuid-Europa

16

Verenigd Koninkrijk en Ierland

4

Noord-Europa

10

Midden-Europa en de Balkan

14

Oost-Europa

5

Oost-Afrika

8

West-Afrika en Centraal-Afrika

9

Zuidelijk Afrika

8

Amerika

5

Oceanië

5
Concurrentiekracht bewezen door data — een in Korea ontwikkelde AI-agent heeft de top 2,5% van GAIA Bench bereikt — CLEVI