Kilde: Electronic Times, reporter Lee Won-ji
Citat fra hele artiklen “CLEVI opnår 79,07 % i GAIA med sin egen from scratch-model … blandt de øverste 2,5 % af 3.090 modeller”
Udgivelsesdato: 2026-04-07
Link: https://www.etnews.com/20260407000203
Fem agenter i den uafhængige cip-5.5-agent·cip-5.5-mm-modelstak opnår alle over 70 point
98 %+ korrekthed, når der tages højde for informationstab, hvilket overstiger menneskers 92 %
AI-startuppen 'CLEVI' har ved hjælp af sin egen from scratch-model opnået en korrekthedsgrad på 79,07 % i den globale AI-agentbenchmark 'GAIA' og er placeret blandt de øverste 2,5 % af de i alt 3.090 registrerede modeller.
Ifølge brancheeksperter anses GAIA på AI-benchmarkmarkedet for i høj grad at afspejle evnerne hos 'praktiske AI-agenter'. Denne benchmark blev udviklet i fællesskab af Meta AI, HuggingFace og Université Paris-Saclay og blev offentliggjort første gang i november 2023.
GAIA adskiller sig fra andre benchmarks på tre afgørende punkter. For det første er overtilpasning umulig, fordi svarene holdes fortrolige. For det andet kræver den sammensat ræsonnering i flere trin og med flere modaliteter, så det er ikke muligt at opnå en høj score gennem simpel mønstergenkendelse. For det tredje konkurrerer mere end 3.090 modeller fra hele verden på de samme betingelser via HuggingFaces officielle rangliste.
Testdatasættet består af i alt 301 spørgsmål. Level 1 omfatter brug af et enkelt værktøj og simpel ræsonnering, Level 2 kombinerer flere værktøjer og kræver ræsonnering på mellemniveau, mens Level 3 består af spørgsmål på højeste sværhedsgrad, der kræver agentplanlægning og -udførelse i mindst fem trin. Da benchmarken blev offentliggjort, lå GPT-modeller (med plugins) på omkring 15 %, mens de førende teams i dag har løftet resultatet til 70–80 %.
CLEVI fremhævede, at det teknisk mest bemærkelsesværdige ved denne præstation er, at der slet ikke blev anvendt eksterne LLM-API'er som GPT, Claude eller Gemini. Det særlige ved CLEVI er, at virksomheden anvendte to modeller, der er udviklet uafhængigt from scratch.
cip-5.5-agent er en agentisk AI-model, der fungerer som den centrale hjerne i agentpipelines, som autonomt planlægger (planning), udfører (execution) og verificerer (verification) komplekse opgaver. cip-5.5-mm er en højtydende multimodal generalistmodel, der forstår og ræsonnerer over forskellige filformater, herunder lyd, billeder og video. Da en stor del af GAIA-spørgsmålene indeholder ikke-tekstbaserede input såsom PDF-, billed- og lydfiler, blev disse multimodale evner en afgørende faktor for den høje score.
Baseret på disse to egenudviklede modeller deltog CLEVI i GAIA med fem forskellige agentkonfigurationer, som alle opnåede en score på over 70.
Ifølge virksomheden blev der identificeret interessante resultater i CLEVI's interne efterfølgende gennemgang. For nogle af de i alt 301 spørgsmål var grundlaget for de korrekte svar ikke længere tilgængeligt på det offentlige web. Det drejer sig om tilfælde, hvor oplysninger, der tidligere kunne verificeres online eller via søgemaskiner, var blevet slettet eller ændret og derfor ikke længere kunne tilgås. Ved en fornyet vurdering inden for det informationsomfang, som mennesker i øjeblikket offentligt kan verificere, viste CLEVI's svarprocent sig at være over 98 %. Det er allerede højere end menneskers gennemsnit på 92 %.
En repræsentant for CLEVI forklarede: “CLEVI opnåede en score på over 70 med alle fem agenter og placerede sig i top 2,5 % på en offentlig benchmark udelukkende ved hjælp af from scratch-egne modeller og egne AI-agentløsninger uden at blande eksterne modeller. Det forventes, at den officielle score kan forbedres yderligere gennem fremtidige forbedringer af egne modeller og agentløsninger. Resultatet er betydningsfuldt, fordi det viser 'verificeret tillid', der er målt på en global offentlig benchmark, fordi det er et resultat baseret på en AI-udviklers egen from scratch-model, fordi det er resultatet af en uafhængig modelstack frem for en blanding af eksterne modeller, og fordi det har en fortolkningsværdi, der rækker ud over scoren, når man tager tabet af information i nogle af spørgsmålene i betragtning.”
