Forrás: Digitális Times, Ku Bon-gyu újságíró
Az „A CLEVI AI-startup bekerült a GAIA legjobb 2,5%-ába… bizonyított hitelességét mutatja” című cikk teljes szövegének idézése
Megjelenés dátuma: 2026-04-08
Link: https://n.news.naver.com/article/029/0003020511?sid=105
A hazai „CLEVI (Clevi)” AI-startup bejelentette, hogy a from scratch módon fejlesztett saját modelljével és saját agentmegoldásával – elsőként Dél-Koreában – bekerült a GAIA benchmarkon a regisztrált összesen 3 090 modell alapján a legjobb 2,5%-ba.
Az iparági magyarázatok szerint a Meta AI által tervezett és a Hugging Face által üzemeltetett GAIA nem azt vizsgálja, hogy az AI „egyetlen dolgot jól tud-e”, hanem azt, hogy „több képességet kombinálva képes-e valós problémákat megoldani”. Információkat kell keresnie a weben, táblázatokat kell olvasnia PDF-ekben, képeket kell elemeznie, kódot kell futtatnia számításokhoz, majd az eredményeket összesítve egyetlen helyes választ kell adnia. A 301 nem nyilvános kérdésből, három nehézségi szintből és a válaszok titkosan tartásának elvéből álló struktúra kizárja a túlillesztést és a csalást.
A vizsgán elért magas pontszámhoz két dologra van szükség. Egyrészt az alapul szolgáló nyelvi modell következtetési képességére, másrészt egy agentmegoldásra, amely ezt a modellt a valós világ eszközeivel összekapcsolva önálló munkavégzésre képessé teszi. Bármilyen jó is a modell, ha az agent gyenge, nem lehet megoldani a 3. szintet; és bármilyen kifinomult is az agent, ha a modell következtetési képessége elégtelen, a köztes szakaszban továbbadódnak a hibás válaszok.
A GAIA ranglistájának jelenlegi struktúráját vizsgálva érdekes minta rajzolódik ki. A legtöbb élmezőnyben szereplő agent a „többmodell-keverés” stratégiáját alkalmazza, amely több nagy technológiai vállalat modelljeit – például a GPT-t, a Claude-ot és a Geminit – kombinálja. Ez ésszerű megközelítés, amely egyesíti az egyes modellek erősségeit, és védekezik az információvesztésből eredő pontszámcsökkenés ellen.
A CLEVI ezzel szemben nem csatlakozott ehhez a táborhoz. A from scratch módszerrel fejlesztett cip-5.5-agent (agentikus AI) önállóan végzi összetett feladatok tervezését, végrehajtását és ellenőrzését, míg a cip-5.5-mm (nagy teljesítményű, általános célú multimodális modell) különféle fájlformátumokat – például hangot, képeket és videókat – értelmez és következtetéseket von le. Mindkét modellt a CLEVI önállóan, házon belül fejlesztette, külső LLM API-kat pedig egyáltalán nem használt.
Ezzel a saját fejlesztésű modellstackkel öt ügynököt indítottak a GAIA versenyen, és mindegyikük 70 pont feletti eredményt ért el. A legmagasabb, 79,07%-os eredménytől a 70,76%-osig ez nem egyetlen eredmény szerencséjét, hanem a teljes stack stabilitását bizonyítja.
A vállalat tájékoztatása szerint a hivatalos 79,07%-os pontszám mögött egy másik szám is rejlik. A CLEVI belső utólagos felülvizsgálata során kiderült, hogy a 301 kérdés közül számos esetben a helyes választ alátámasztó információ jelenleg már nem érhető el a nyilvános weben. Ha csak azokat a kérdéseket vették alapul az újraértékelésnél, amelyeknél a helyes válaszhoz szükséges információ továbbra is megtalálható a weben, a CLEVI pontossága meghaladta a 98%-ot. Ez már meghaladja az emberi átlagot (92%).
Természetesen a hivatalos pontszámot tovább is növelhették volna, ha más vállalatok nagy teljesítményű, általános célú modelljeit is vegyítik. A CLEVI azonban szándékosan nem ezt a stratégiát választotta. Ennek oka, hogy a benchmark célja nem a legmagasabb pontszám elérése volt, hanem annak ellenőrzése, hogy egy from scratch saját modell eljutott-e a globális színtéren versenyképes szintre.
Az, hogy a GAIA ranglistáján szerepel a nevük, nagy jelentőséggel bír, mivel ez harmadik fél által végzett, független értékelésen alapuló, hitelesített szakmai elismertséget jelent. Ez objektív bizonyítékul szolgálhat a befektetésösztönzés, a nemzetközi terjeszkedés és a B2B értékesítés minden szakaszában.
A CLEVI egyik munkatársa elmondta: „A hivatalosan hibásnak minősített 63 válasz jelentős része a kimeneti formátum eltéréséből, a vizuális anyagok értelmezési hibáiból, valamint az információvesztés miatt megválaszolhatatlan kérdésekből származott. Ez inkább az utófeldolgozás pontosságának és a külső információk elérhetőségének problémája, mintsem a logikai következtetés alapvető korlátja. Mivel saját modellről van szó, a CLEVI önállóan képes javítani rajta. Ez a from scratch saját modellek strukturális előnye. A CLEVI mostani eredménye felveti a koreai AI-iparág számára a kérdést: „Meddig fogunk még »kölcsönkapott agyakra« támaszkodni?” A CLEVI a nehezebb, from scratch utat választotta, és ezt a választ a világ színpadán kívánja bizonyítani.”
