Heimild: Lee Won-ji, rafræna dagblaðið
Tilvitnun í allan greininni „CLEVI, 79,07% í GAIA með eigin from scratch-líkani... í efstu 2,5% af 3.090 líkönum“
Útgáfudagur: 2026-04-07
Tengill: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm sjálfstæður líkanastafli, allir 5 umboðsmenn yfir 70 stigum
98%+ svarréttni þegar tekið er tillit til upplýsingataps, umfram menn (92%)
AI-sprotafyrirtækið „CLEVI“ náði 79,07% svarréttni í alþjóðlega AI-umboðsmannaviðmiðinu „GAIA“ með eigin from scratch-líkani og komst þar með í efstu 2,5% miðað við öll 3.090 skráð líkön.
Samkvæmt skýringum úr greininni er GAIA metið sem viðmið sem endurspeglar vel getu „hagnýtra AI-umboðsmanna“ á markaði fyrir AI-viðmið. Þetta viðmið var þróað sameiginlega af Meta AI, HuggingFace, háskólanum í Paris-Saclay og fleiri aðilum og var fyrst birt í nóvember 2023.
Það sem aðgreinir GAIA frá öðrum viðmiðum eru einkum þrjú atriði. Í fyrsta lagi er rétt svarið ekki birt opinberlega, þannig að ofaðlögun er ómöguleg. Í öðru lagi krefst það fjölþrepa og fjölhátta samsettrar rökhugsunar, þannig að ekki er hægt að ná háum stigum með einfaldri mynsturgreiningu. Í þriðja lagi keppa meira en 3.090 líkön víðs vegar að úr heiminum við sömu skilyrði í gegnum opinbert stigatafla HuggingFace.
Prófunarsettið samanstendur alls af 301 spurningu. Level 1 felur í sér notkun á einu verkfæri og einfalda rökhugsun, Level 2 felur í sér samsetningu margra verkfæra og miðlungs erfiða rökhugsun, en Level 3 samanstendur af erfiðustu spurningunum þar sem krafist er áætlanagerðar og framkvæmdar AI-umboðsmanns í fimm eða fleiri þrepum. Þegar viðmiðið var kynnt náðu GPT-líkön (með viðbótum) aðeins um 15%, en efstu teymi hafa nú hækkað niðurstöðurnar í 70–80%.
CLEVI lagði áherslu á að tæknilega séð væri athyglisverðasti þátturinn í þessum árangri sá að engin ytri LLM-API, svo sem GPT, Claude eða Gemini, voru notuð. Sérstaða CLEVI felst í notkun tveggja sjálfstætt þróaðra líkana sem voru búin til frá grunni.
cip-5.5-agent er agentískt gervigreindarlíkan og gegnir hlutverki kjarnaheila í agentakerfisferli sem skipuleggur (planning), framkvæmir (execution) og sannreynir (verification) flókin verkefni sjálfstætt. cip-5.5-mm er afkastamikið almennt fjölþætt líkan sem skilur og leiðir ályktanir af ýmsum skráarsniðum, svo sem rödd, myndum og myndböndum. Þar sem verulegur hluti GAIA-spurninganna inniheldur inntak sem ekki er texti, svo sem PDF-skjöl, myndir og hljóðskrár, varð þessi fjölþætta geta lykilþáttur í háu stigi.
KlEVI sendi fimm mismunandi agentauppsetningar í GAIA, byggðar á þessum tveimur eigin líkönum, og náðu þær allar yfir 70 stigum.
Samkvæmt skýringum fyrirtækisins kom áhugaverð niðurstaða í ljós við innri eftirathugun CLEVI. Af alls 301 spurningu voru réttarheimildir fyrir sumum þeirra ekki lengur aðgengilegar á opnum vefnum. Í þessum tilvikum höfðu upplýsingar sem áður var hægt að staðfesta á netinu eða í leitarvélum verið fjarlægðar eða breyttar og voru því ekki lengur aðgengilegar. Þegar niðurstöðurnar voru endurmetnar á grundvelli þeirra upplýsinga sem fólk getur nú staðfest opinberlega reyndist nákvæmni CLEVI vera yfir 98%. Það er nú þegar hærra en meðaltal manna, sem er 92%.
Fulltrúi CLEVI útskýrði: „CLEVI náði því að allar fimm agentauppsetningarnar fengu 70+ stig og komst í efstu 2,5% í opinberu viðmiði, eingöngu með eigin líkönum og eigin AI-agentalausnum sem þróuð voru from scratch, án þess að blanda saman ytri líkönum. Búast má við að opinbert stig hækki enn frekar í framtíðinni með endurbótum á eigin líkönum og agentalausnum. Þessi árangur er mikilvægur vegna þess að hann sýnir „staðfest traust“ sem mælt var í alþjóðlegu opinberu viðmiði, vegna þess að hann er árangur innlends AI-þróunarfyrirtækis sem byggir á eigin líkönum þróuðum from scratch, vegna þess að hann er afrakstur sjálfstæðs líkanastafla en ekki blöndunar ytri líkana, og vegna þess að tap á upplýsingum í sumum spurningum gefur honum túlkunargildi sem nær út fyrir stigafjöldann.“
