Boarne: Electronic Times, ferslachjouwer Lee Won-ji
Folsleine oanhelling fan it artikel “CLEVI, mei in from scratch-eigen model 79,07% op GAIA... yn de top 2,5% fan 3.090 modellen”
Publikaasjedatum: 2026-04-07
Keppeling: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm eigen modelstack: alle 5 aginten boppe de 70 punten
Mei rekkening mei ynformaasjeferlies mear as 98% krektens, heger as minsken (92%)
De AI-start-up 'CLEVI' hat mei in from scratch-eigen model in krektens fan 79,07% helle op 'e globale AI-agentbenchmark 'GAIA' en heart dêrmei ta de top 2,5% fan alle 3.090 registrearre modellen.
Neffens útlis út 'e sektor wurdt GAIA yn 'e AI-benchmarkmerk beskôge as in benchmark dy't de kapasiteiten fan 'praktyske AI-aginten' trou wjerspegelet. Dizze benchmark, mienskiplik ûntwikkele troch Meta AI, HuggingFace en de Universiteit Paris-Saclay, waard yn novimber 2023 foar it earst iepenbier makke.
GAIA ûnderskiedt him fan oare benchmarks troch trije kearnpunten. Earst is oerfitten ûnmooglik, om't de goede antwurden net iepenbier binne. Twad makket de fereaske kombinearre redenearring oer meardere stappen en modaliteiten hege skoares mei ienfâldige patroanmatching ûnmooglik. Tred wurdt der fia it offisjele leaderbord fan Hugging Face konkurrearre troch mear as 3.090 modellen fan oer de hiele wrâld ûnder deselde betingsten.
De testset bestiet út yn totaal 301 fragen. Level 1 omfettet it brûken fan ien ark en ienfâldige redenearring, Level 2 kombinaasjes fan meardere ark en redenearring fan middelber nivo, en Level 3 fragen fan it heechste swierrichheidsnivo, dêr't agintplanning en -útfiering yn fiif of mear stappen foar nedich binne. By de presintaasje fan 'e benchmark bleau de skoare foar GPT-modellen (mei plugins) op sa'n 15%, wylst liedende teams dy no oant 70–80% ferhege hawwe.
Dêrby beklamme CLEVI dat it technysk meast opfallende aspekt fan dizze prestaasje is dat der hielendal gjin eksterne LLM-API's lykas GPT, Claude of Gemini brûkt binne. It bysûndere is dat CLEVI twa ûnôfhinklik ûntwikkele modellen brûkt dy't from scratch makke binne.
cip-5.5-agent is in agentyske AI-model en fungearret as it sintrale brein fan in agentpipeline dy’t komplekse taken autonoom plant (planning), útfiert (execution) en ferifiearret (verification). cip-5.5-mm is in heechprestearjend algemien multimodaal model dat ferskate bestânsformaten, lykas audio, ôfbyldingen en fideo, begrypt en dêrút redenearret. Om’t in grut part fan de GAIA-fragen net-tekstuele ynfier befettet, lykas PDF’s, ôfbyldingen en audiobestannen, waard dizze multimodale mooglikheid in krúsjale faktor foar it beheljen fan in hege skoare.
Op basis fan dizze twa eigen modellen hat CLEVI fiif ferskillende agentkonfiguraasjes oan GAIA meidwaan litten, en allegear behellen se in skoare fan 70 of heger.
Neffens de útlis fan it bedriuw kaam by in ynterne neibeoardieling fan CLEVI in nijsgjirrich resultaat oan it ljocht. Fan de yn totaal 301 fragen wie foar guon de basis foar it goede antwurd op it stuit net mear beskikber op it iepenbiere web. It gie om ynformaasje dy’t eartiids online of fia sykmasines te finen wie, mar wiske of wizige is en dêrtroch net mear tagonklik is. By in opnij beoardieling op basis fan de ynformaasje dy’t minsken op it stuit iepenbier ferifiearje kinne, blykte it persintaazje goede antwurden fan CLEVI boppe de 98% te lizzen. Dat leit al boppe it minsklik gemiddelde fan 92%.
In fertsjintwurdiger fan CLEVI ferklearre: “Sûnder it mingen fan eksterne modellen hat CLEVI mei allinnich eigen modellen en eigen AI-agentoplossingen, fan from scratch ôf ûntwikkele, foar alle fiif agents in skoare fan 70+ helle en dêrmei de top 2,5% fan de iepenbiere benchmark berikt. Troch fierdere ferbettering fan de eigen modellen en agentoplossingen liket ek de offisjele skoare yn de takomst noch fierder ferbettere te wurden. Dizze prestaasje is fan grut belang om’t se ‘ferifiearre fertrouwen’ sjen lit troch mjitber te wêzen yn in wrâldwide iepenbiere benchmark, om’t it giet om in prestaasje fan in ynlânske AI-ûntwikkelder basearre op eigen modellen dy’t from scratch ûntwikkele binne, om’t it resultaat fuortkomt út in ûnôfhinklike modelstack en net út it mingen fan eksterne modellen, en om’t it, sjoen it ferlies fan ynformaasje by guon fragen, in ynterpretaasjewearde hat dy’t fierder giet as de skoare allinnich.”
