Bron: Digital Times, verslaggever Bon-gyu Gu
Volledige citaat van het artikel “AI-start-up Clevi betreedt de top 2,5% van GAIA… toont bewezen geloofwaardigheid”
Publicatiedatum 2026-04-08
Link : https://n.news.naver.com/article/029/0003020511?sid=105
De binnenlandse AI-start-up ‘Clevi’ heeft bekendgemaakt dat het, na de ontwikkeling van een eigen model en eigen agentoplossing from scratch, als eerste in Zuid-Korea is doorgedrongen tot de top 2,5% van de GAIA-benchmark, op basis van alle 3.090 geregistreerde modellen.
Volgens uitleg uit de sector vraagt GAIA, ontworpen door Meta AI en beheerd door Hugging Face, AI niet om ‘het vermogen om één ding goed te doen’, maar om ‘het vermogen om meerdere vaardigheden te combineren en echte problemen op te lossen’. Het systeem moet informatie op het web vinden, tabellen in pdf-bestanden lezen, afbeeldingen analyseren, berekeningen uitvoeren door code te draaien en de resultaten combineren tot één antwoord. Met 301 niet-openbare vragen, drie moeilijkheidsniveaus en het principe dat antwoorden niet openbaar worden gemaakt, is het zo ontworpen dat noch overfitting noch valsspelen mogelijk is.
Om een hoge score op deze test te behalen, zijn twee zaken nodig. Ten eerste het redeneervermogen van het onderliggende taalmodel en ten tweede een agentoplossing die dat model met hulpmiddelen uit de echte wereld verbindt, zodat het zelfstandig taken kan uitvoeren. Hoe goed het model ook is, als de agent zwak is, kan Level 3 niet worden opgelost. En hoe verfijnd de agent ook is, als het redeneervermogen van het model tekortschiet, worden in de tussenstappen onjuiste antwoorden doorgegeven.
De huidige structuur van het GAIA-klassement laat een interessant patroon zien. De meeste agents in de top hanteren een strategie van ‘multi-modelmix’, waarbij meerdere modellen van bigtechbedrijven zoals GPT, Claude en Gemini worden gecombineerd. Dit is een redelijke aanpak om de sterke punten van elk model te combineren en scoreverlies door informatieverlies enzovoort te voorkomen.
Clevi heeft zich daarentegen niet bij deze groep aangesloten. De from scratch ontwikkelde cip-5.5-agent (agentische AI) voert de planning, uitvoering en verificatie van complexe taken zelfstandig uit, terwijl cip-5.5-mm (hoogwaardige algemene multimodale AI) verschillende bestandsformaten, waaronder spraak, afbeeldingen en video, begrijpt en daarover redeneert. Beide modellen zijn onafhankelijk binnen Clevi ontwikkeld en er zijn helemaal geen externe LLM-API’s gebruikt.
Met deze eigen modelstack bracht CLEVI vijf agents uit in GAIA, die allemaal 70 punten of hoger behaalden. Van het hoogste resultaat van 79,07% tot 70,76%: dit bewees de stabiliteit van de volledige stack, niet het geluk van één enkel resultaat.
Volgens de uitleg van het bedrijf schuilt er achter de officiële score van 79,07% nog een ander cijfer. Uit een interne evaluatie achteraf door CLEVI bleek dat bij een aanzienlijk aantal van de 301 vragen de onderbouwing voor het juiste antwoord niet langer op het openbare web beschikbaar was. Wanneer alleen de vragen met antwoorden die nog steeds op het web te vinden waren opnieuw werden beoordeeld, bedroeg het percentage juiste antwoorden van CLEVI meer dan 98%. Dat ligt al boven het menselijke gemiddelde van 92%.
Natuurlijk had de officiële score nog verder kunnen worden verhoogd door krachtige algemene modellen van andere bedrijven te combineren. CLEVI heeft die strategie echter bewust niet gekozen. Het doel van deze benchmark was namelijk niet om te strijden om de hoogste score, maar om te verifiëren of een eigen model dat from scratch is ontwikkeld, een niveau had bereikt waarop het wereldwijd kan concurreren.
Dat de naam op het GAIA-leaderboard staat, is van grote betekenis omdat dit betekent dat het model beschikt over geverifieerde geloofwaardigheid die door een onafhankelijke beoordeling door derden is toegekend. Dit vormt objectief bewijs dat kan worden benut bij het aantrekken van investeringen, internationale expansie en B2B-verkoop.
Een vertegenwoordiger van CLEVI verklaarde: “Een aanzienlijk deel van de 63 officieel fout beantwoorde vragen was het gevolg van afwijkingen in het uitvoerformaat, fouten bij de interpretatie van visueel materiaal en vragen die door informatieverlies niet konden worden beantwoord. Het gaat eerder om de precisie van de nabewerking en de beschikbaarheid van externe informatie dan om fundamentele beperkingen van logisch redeneren. Omdat het om een eigen model gaat, kan CLEVI het zelf verbeteren. Dat is precies het structurele voordeel van een eigen model dat from scratch is ontwikkeld. De prestaties van CLEVI roepen binnen de Koreaanse AI-sector de vraag op: ‘Hoelang blijven we nog afhankelijk van geleende hersenen?’ CLEVI heeft de moeilijkere weg van from scratch gekozen en wil het antwoord daarop op het wereldtoneel bewijzen,” aldus de vertegenwoordiger.
