Allikas: elektroonikaleht, ajakirjanik Lee Won-ji
Artikli „CLEVI, 79,07% GAIA-s alates from scratch enda mudeliga... 3 090 mudeli seas 2,5% parema hulgas” täisteksti tsiteerimine
Avaldamiskuupäev: 2026-04-07
Link: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm sõltumatu mudelivirn: kõik 5 agenti saavutasid üle 70 punkti
Arvestades teabekadu, üle 98% õigeid vastuseid, ületades inimesi (92%)
AI-idufirma CLEVI saavutas from scratch enda mudeli abil globaalses AI-agentide võrdlusuuringus GAIA 79,07% õigete vastuste määra ning paigutus kõigi 3 090 registreeritud mudeli seas 2,5% parema hulka.
Valdkonna selgituste kohaselt hinnatakse GAIA-t AI-võrdlusuuringute turul kui võrdlusuuringut, mis kajastab ustavalt praktiliste AI-agentide võimekust. Meta AI, HuggingFace ja Paris-Saclay ülikooli ühiselt välja töötatud võrdlusuuring avalikustati esimest korda 2023. aasta novembris.
GAIA-t eristavad teistest võrdlusuuringutest kolm põhijoont. Esiteks on õiged vastused salastatud, mistõttu üleõppimine ei ole võimalik. Teiseks nõuab see mitmeastmelist ja multimodaalset kompleksset arutlemist, mistõttu lihtsa mustrisobitamisega kõrget tulemust saavutada ei saa. Kolmandaks võistlevad HuggingFace'i ametliku edetabeli kaudu enam kui 3 090 mudelit kogu maailmast samadel tingimustel.
Testikomplekt koosneb kokku 301 küsimusest. Level 1 hõlmab ühe tööriista kasutamist ja lihtsat arutlemist, Level 2 mitme tööriista kombineerimist ja keskmise raskusastmega arutlemist ning Level 3 on kõrgeima raskusastmega küsimuste tase, mis nõuab agendilt vähemalt viieastmelist planeerimist ja täitmist. Võrdlusuuringu avaldamise ajal jäi GPT mudelite (koos plug-in'idega) tulemus ligikaudu 15% juurde, kuid praeguseks on tipptiimid selle tõstnud 70–80% tasemele.
Selle saavutuse puhul rõhutas CLEVI, et tehniliselt on kõige tähelepanuväärsem asjaolu see, et väliseid LLM API-sid, nagu GPT, Claude ja Gemini, ei kasutatud üldse. CLEVI eripäraks on kahe from scratch sõltumatult välja töötatud mudeli kasutamine.
cip-5.5-agent on agentne tehisintellekti mudel, mis täidab keerukaid ülesandeid iseseisvalt planeeriva (planning), täitva (execution) ja kontrolliva (verification) agendipidevuse keskse ajuna. cip-5.5-mm on suure jõudlusega üldotstarbeline multimodaalne mudel, mis mõistab ja töötleb järeldusi tehes mitmesuguseid failivorminguid, nagu heli, pildid ja video. Kuna märkimisväärne osa GAIA ülesannetest sisaldab mittetekstilisi sisendeid, nagu PDF-id, pildid ja helifailid, sai see multimodaalne võimekus kõrge tulemuse saavutamisel võtmeteguriks.
CLEVI saatis nendele kahele enda mudelile tuginedes GAIA-le viis erinevat agendikonfiguratsiooni ning kõik saavutasid tulemuse üle 70 punkti.
Ettevõtte selgituse kohaselt ilmnes CLEVI sisemises järelanalüüsis huvitav tulemus. 301 ülesandest mõne puhul ei olnud praegu avalikus veebis enam õige vastuse alust. Tegemist oli juhtudega, kus varem veebis või otsingumootorites kontrollitav teave oli kustutatud või muudetud ning sellele ei olnud enam võimalik ligi pääseda. Kui tulemusi hinnati uuesti praegu inimestele avalikult kontrollitava teabe piires, oli CLEVI õigsusmäär üle 98%. See näitaja ületab juba inimeste keskmist tulemust, milleks on 92%.
CLEVI esindaja selgitas: „CLEVI jõudis avalikus võrdlusuuringus parima 2,5% hulka, saavutades kõigi viie agendiga tulemuse 70+, kasutades üksnes from scratch enda mudeleid ja enda AI-agendilahendusi, ilma väliste mudelite segamiseta. Edaspidi on enda mudelite ja agendilahenduste täiustamise kaudu tõenäoliselt võimalik ka ametlikku tulemust veel parandada. See saavutus on oluline, sest seda mõõdeti globaalses avalikus võrdlusuuringus, mis näitab „tõestatud usaldusväärsust“; tegemist on Korea AI-arendaja from scratch enda mudelitel põhineva tulemusega; see tuleneb sõltumatust mudelivirnast, mitte väliste mudelite segamisest; ning arvestades mõne ülesande puhul teabe kadumist, on selle tõlgendusväärtus suurem kui pelk punktisumma.“
