Nieuws

CLEVI behaalt met een eigen from-scratchmodel 79,07% op GAIA... Top 2,5% van 3.090 modellen

Bron: Electronic Times, verslaggever Lee Won-ji

Bron: Electronic Times, verslaggever Lee Won-ji

Volledige citaat uit het artikel “CLEVI behaalt met een eigen from-scratchmodel 79,07% op GAIA... Top 2,5% van 3.090 modellen”

Publicatiedatum: 2026-04-07

Link: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm eigen modelstack met vijf agents, allemaal boven de 70 punten

Bij het in aanmerking nemen van informatieverlies een nauwkeurigheid van meer dan 98%, hoger dan die van mensen (92%)

Afbeelding in de hoofdtekst

De AI-start-up ‘CLEVI’ behaalde met een eigen from-scratchmodel een nauwkeurigheid van 79,07% op de wereldwijde AI-agentbenchmark ‘GAIA’ en behoort daarmee tot de top 2,5% van alle 3.090 geregistreerde modellen.

Volgens toelichtingen uit de sector wordt GAIA in de AI-benchmarkmarkt beschouwd als een benchmark die de capaciteiten van ‘praktische AI-agents’ getrouw weerspiegelt. Deze benchmark, gezamenlijk ontwikkeld door Meta AI, HuggingFace en de Université Paris-Saclay, werd voor het eerst gepubliceerd in november 2023.

GAIA onderscheidt zich op drie belangrijke punten van andere benchmarks. Ten eerste is overfitting onmogelijk omdat de antwoorden niet openbaar zijn. Ten tweede zijn hoge scores onmogelijk met eenvoudige pattern matching, omdat GAIA multistep- en multimodale complexe redeneringen vereist. Ten derde concurreren meer dan 3.090 modellen uit de hele wereld onder dezelfde omstandigheden via het officiële leaderboard van HuggingFace.

De testset bestaat uit in totaal 301 vragen. Level 1 omvat het gebruik van één tool en eenvoudige redeneringen, Level 2 vereist een combinatie van meerdere tools en redeneringen van gemiddeld niveau, en Level 3 bestaat uit vragen van het hoogste moeilijkheidsniveau waarvoor planning en uitvoering door een agent in vijf of meer stappen nodig zijn. Ten tijde van de publicatie van de benchmark lag het resultaat bij GPT-modellen (met plug-ins) rond slechts 15%; inmiddels hebben de best presterende teams dit verhoogd naar 70 à 80%.

CLEVI benadrukte dat het technisch meest opvallende aspect van deze prestatie is dat er helemaal geen externe LLM-API’s van GPT, Claude, Gemini en dergelijke zijn gebruikt. Kenmerkend is dat CLEVI twee onafhankelijk ontwikkelde modellen gebruikt die from scratch zijn ontwikkeld.

cip-5.5-agent is een agentisch AI-model dat fungeert als het centrale brein van agentpijplijnen die complexe taken autonoom plannen (planning), uitvoeren (execution) en verifiëren (verification). cip-5.5-mm is een krachtige, algemene multimodale model dat verschillende bestandsformaten, zoals spraak, afbeeldingen en video, begrijpt en daarover kan redeneren. Omdat een aanzienlijk deel van de GAIA-vragen niet-tekstuele invoer bevat, zoals pdf-, afbeeldings- en audiobestanden, bleek deze multimodale capaciteit een belangrijke factor voor de hoge score.

Op basis van deze twee eigen modellen liet CLEVI vijf verschillende agentconfiguraties deelnemen aan GAIA, waarbij alle configuraties een score van 70 of hoger behaalden.

Volgens de uitleg van het bedrijf kwamen bij een interne evaluatie achteraf door CLEVI interessante resultaten aan het licht. Voor sommige van de in totaal 301 vragen was de onderbouwing van het juiste antwoord inmiddels niet meer beschikbaar op het openbare web. In sommige gevallen was informatie die vroeger online of via zoekmachines kon worden geraadpleegd, verwijderd of gewijzigd en daardoor niet langer toegankelijk. Bij een herbeoordeling binnen de momenteel publiekelijk door mensen verifieerbare informatie bleek het nauwkeurigheidspercentage van CLEVI hoger dan 98% te liggen. Dat is al hoger dan het menselijke gemiddelde van 92%.

Een vertegenwoordiger van CLEVI lichtte toe: “CLEVI drong met alle vijf agenten door tot de top 2,5% in een openbare benchmark, waarbij elk van hen 70+ behaalde, uitsluitend met eigen modellen die from scratch zijn ontwikkeld en eigen AI-agentoplossingen, zonder externe modellen te combineren. Naar verwachting kunnen de officiële scores in de toekomst verder worden verbeterd door de eigen modellen en agentoplossingen te verbeteren. Deze prestatie is betekenisvol omdat zij 'geverifieerd vertrouwen' laat zien, gemeten in een wereldwijde openbare benchmark; omdat het een prestatie is van een binnenlandse AI-ontwikkelaar op basis van eigen modellen die from scratch zijn ontwikkeld; omdat het resultaat afkomstig is van een onafhankelijke modelstack en niet van een combinatie met externe modellen; en omdat het, gezien het informatieverlies bij sommige vragen, interpretatieve waarde heeft die verder gaat dan de score alleen.”

Terug naar de nieuwsruimte
CLEVI

Taal en regio

Machinaal vertaalde talen zijn gemarkeerd. Beschikbaarheid volgt de gepubliceerde sitebundel.

136 talen

Aanbevolen

1

Oost-Azië

7

Zuidoost-Azië

11

Zuid-Azië

18

Centraal-Azië

5

Midden-Oosten en de Kaukasus

10

West-Europa en Zuid-Europa

16

Verenigd Koninkrijk en Ierland

4

Noord-Europa

10

Midden-Europa en de Balkan

14

Oost-Europa

5

Oost-Afrika

8

West-Afrika en Centraal-Afrika

9

Zuidelijk Afrika

8

Amerika

5

Oceanië

5
CLEVI behaalt met een eigen from-scratchmodel 79,07% op GAIA... Top 2,5% van 3.090 modellen — CLEVI