Kelda: Lee Won-ji, ETNews
Full endurgeving av greinini „CLEVI, við egnum from scratch-modelli 79,07% í GAIA... innan ovastu 2,5% av 3.090 modellum“
Útgávudagur: 2026-04-07
Leinkja: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm sjálvstøðugur modellstakkur, allir 5 agentar yvir 70 stigum
98%+ røtt svar, tá ið hædd verður tikin fyri upplýsingarmissi, hægri enn menniskju (92%)
AI-startupfyritøkan „CLEVI“ skrásetti 79,07% røtt svar við egnum from scratch-modelli í globala AI-agent-benchmarkinum „GAIA“ og endaði innan ovastu 2,5% millum allar 3.090 skrásettar modellir.
Sambært frágreiðingum úr vinnuni verður GAIA í AI-benchmarkmarknaðinum mett at endurspegla førleikarnar hjá „praktiskum AI-agentum“ trúliga. Benchmarkið, sum Meta AI, HuggingFace og Université Paris-Saclay mentu í felag, varð fyrstu ferð almannakunngjørt í november 2023.
Kjarnin, sum skilir GAIA frá øðrum benchmarkum, er trífaldur. Í fyrsta lagi er yvirfit ómøguligt, tí røttu svarini eru ikki almannakunngjørd. Í øðrum lagi krevur tað samansettar fleirstigs- og multimodalar niðurstøður, so høg stig kunnu ikki røkkast við einari einfalda mynsturendurgávu. Í triðja lagi kappast meira enn 3.090 modellir úr øllum heiminum undir somu treytum í almennu stigatalvuni hjá HuggingFace.
Testsettini eru í alt 301 spurningar. Level 1 fevnir um nýtslu av einum einstøkum tóli og einfalda niðurstøðu, Level 2 um at sameina fleiri tól og niðurstøðu á miðalstigi, og Level 3 um spurningar á hægsta torleikastigi, sum krevja agentætlan og fremjan í fimm ella fleiri stigum. Tá benchmarkið varð kunngjørt, lá úrslitið hjá GPT-modellum (við ísettum ískoytum) umleið 15%, men fremstu liðini hava nú lyft tað upp í 70–80%.
Millum hetta legði CLEVI dent á, at tann tekniskt mest eftirtektarverdi parturin av úrslitinum er, at eingin API hjá uttanhýsis LLM-um sum GPT, Claude ella Gemini varð nýttur. Tað sermerkta við CLEVI er, at tvey modell, ment sjálvstøðugt frá grundini við from scratch-háttinum, vórðu nýtt.
cip-5.5-agent er ein agentisk AI-modell, sum virkar sum kjarnin í einari agentpipeline, ið sjálvstøðugt leggur fløkin arbeiði til rættis (planning), fremur tey (execution) og váttar úrslitini (verification). cip-5.5-mm er ein kraftmikil, almenn multimodal modell, ið skilir og grundar yvir ymiskar fílusnið, so sum talu, myndir og video. Av tí at ein stórur partur av GAIA-spurningunum inniheldur ikki-tekstbundið tilfar, so sum PDF-, mynda- og ljóðfílur, gjørdist henda multimodala førleiki ein avgerandi orsøk til høga stigatalið.
Við støði í hesum báðum egnu modellunum stillaði CLEVI upp fimm ymiskar agentauppsetingar í GAIA, og allar fimm fingu 70 stig ella meira.
Sambært upplýsingum frá fyritøkuni vísti ein áhugaverd niðurstøða seg í innanhýsis eftirmetingini hjá CLEVI. Av teimum 301 spurningunum vóru grundarløgini fyri røttum svarum í nøkrum førum ikki longur tøk á almenna vefinum. Tað snýr seg um upplýsingar, sum áður vóru tøkar á netinum ella í leitimotorum, men sum vórðu strikaðar ella broyttar og tí ikki longur eru atkomuligar. Tá spurningarnir vórðu endurmettir út frá teimum upplýsingum, sum fólk í dag kunnu vátta alment, vísti svarprosentið hjá CLEVI seg at vera yvir 98%. Hetta er longu hægri enn miðaltalið hjá menniskjum, sum er 92%.
Ein talsmaður fyri CLEVI segði: “CLEVI kom inn í ovasta 2,5% í einum almennum benchmarki við at fáa øll fimm agentini at skora 70+ uttan at blanda inn uttanhýsis modell, men einans við egnum modellum, mentum from scratch, og egnari AI-agentloysn. Við framtíðarumbótum av egnum modellum og agentloysnum verður helst eisini møguligt at hækka almenna stigatalið enn meira. Úrslitið hesa ferð hevur stóran týdning, tí tað vísir ‘váttað álit’, mált í einum altjóða almennum benchmarki; tí tað er eitt úrslit grundað á eina egna modell, ment from scratch, hjá einum AI-meníngarfyritøku í Suðurkorea; tí tað er úrslitið av einum sjálvstøðugum modellstakki og ikki av einari blanding av uttanhýsis modellum; og tí tað hevur størri tulkingarvirði enn stigatalið eitt og sær, tá hædd verður tikin fyri, at upplýsingar í nøkrum spurningum eru horvnar.”
