Hírek

A CLEVI AI-startup bekerült a GAIA legjobb 2,5%-ába… bizonyított hitelességét mutatja

Forrás: Digitális Times, Ku Bon-gyu újságíró

Forrás: Digitális Times, Ku Bon-gyu újságíró

Az „A CLEVI AI-startup bekerült a GAIA legjobb 2,5%-ába… bizonyított hitelességét mutatja” című cikk teljes szövegének idézése

Megjelenés dátuma: 2026-04-08

Link: https://n.news.naver.com/article/029/0003020511?sid=105

A hazai „CLEVI (Clevi)” AI-startup bejelentette, hogy a from scratch módon fejlesztett saját modelljével és saját agentmegoldásával – elsőként Dél-Koreában – bekerült a GAIA benchmarkon a regisztrált összesen 3 090 modell alapján a legjobb 2,5%-ba.

Az iparági magyarázatok szerint a Meta AI által tervezett és a Hugging Face által üzemeltetett GAIA nem azt vizsgálja, hogy az AI „egyetlen dolgot jól tud-e”, hanem azt, hogy „több képességet kombinálva képes-e valós problémákat megoldani”. Információkat kell keresnie a weben, táblázatokat kell olvasnia PDF-ekben, képeket kell elemeznie, kódot kell futtatnia számításokhoz, majd az eredményeket összesítve egyetlen helyes választ kell adnia. A 301 nem nyilvános kérdésből, három nehézségi szintből és a válaszok titkosan tartásának elvéből álló struktúra kizárja a túlillesztést és a csalást.

A vizsgán elért magas pontszámhoz két dologra van szükség. Egyrészt az alapul szolgáló nyelvi modell következtetési képességére, másrészt egy agentmegoldásra, amely ezt a modellt a valós világ eszközeivel összekapcsolva önálló munkavégzésre képessé teszi. Bármilyen jó is a modell, ha az agent gyenge, nem lehet megoldani a 3. szintet; és bármilyen kifinomult is az agent, ha a modell következtetési képessége elégtelen, a köztes szakaszban továbbadódnak a hibás válaszok.

A GAIA ranglistájának jelenlegi struktúráját vizsgálva érdekes minta rajzolódik ki. A legtöbb élmezőnyben szereplő agent a „többmodell-keverés” stratégiáját alkalmazza, amely több nagy technológiai vállalat modelljeit – például a GPT-t, a Claude-ot és a Geminit – kombinálja. Ez ésszerű megközelítés, amely egyesíti az egyes modellek erősségeit, és védekezik az információvesztésből eredő pontszámcsökkenés ellen.

A CLEVI ezzel szemben nem csatlakozott ehhez a táborhoz. A from scratch módszerrel fejlesztett cip-5.5-agent (agentikus AI) önállóan végzi összetett feladatok tervezését, végrehajtását és ellenőrzését, míg a cip-5.5-mm (nagy teljesítményű, általános célú multimodális modell) különféle fájlformátumokat – például hangot, képeket és videókat – értelmez és következtetéseket von le. Mindkét modellt a CLEVI önállóan, házon belül fejlesztette, külső LLM API-kat pedig egyáltalán nem használt.

Ezzel a saját fejlesztésű modellstackkel öt ügynököt indítottak a GAIA versenyen, és mindegyikük 70 pont feletti eredményt ért el. A legmagasabb, 79,07%-os eredménytől a 70,76%-osig ez nem egyetlen eredmény szerencséjét, hanem a teljes stack stabilitását bizonyítja.

A törzsszöveg képe

A vállalat tájékoztatása szerint a hivatalos 79,07%-os pontszám mögött egy másik szám is rejlik. A CLEVI belső utólagos felülvizsgálata során kiderült, hogy a 301 kérdés közül számos esetben a helyes választ alátámasztó információ jelenleg már nem érhető el a nyilvános weben. Ha csak azokat a kérdéseket vették alapul az újraértékelésnél, amelyeknél a helyes válaszhoz szükséges információ továbbra is megtalálható a weben, a CLEVI pontossága meghaladta a 98%-ot. Ez már meghaladja az emberi átlagot (92%).

Természetesen a hivatalos pontszámot tovább is növelhették volna, ha más vállalatok nagy teljesítményű, általános célú modelljeit is vegyítik. A CLEVI azonban szándékosan nem ezt a stratégiát választotta. Ennek oka, hogy a benchmark célja nem a legmagasabb pontszám elérése volt, hanem annak ellenőrzése, hogy egy from scratch saját modell eljutott-e a globális színtéren versenyképes szintre.

Az, hogy a GAIA ranglistáján szerepel a nevük, nagy jelentőséggel bír, mivel ez harmadik fél által végzett, független értékelésen alapuló, hitelesített szakmai elismertséget jelent. Ez objektív bizonyítékul szolgálhat a befektetésösztönzés, a nemzetközi terjeszkedés és a B2B értékesítés minden szakaszában.

A CLEVI egyik munkatársa elmondta: „A hivatalosan hibásnak minősített 63 válasz jelentős része a kimeneti formátum eltéréséből, a vizuális anyagok értelmezési hibáiból, valamint az információvesztés miatt megválaszolhatatlan kérdésekből származott. Ez inkább az utófeldolgozás pontosságának és a külső információk elérhetőségének problémája, mintsem a logikai következtetés alapvető korlátja. Mivel saját modellről van szó, a CLEVI önállóan képes javítani rajta. Ez a from scratch saját modellek strukturális előnye. A CLEVI mostani eredménye felveti a koreai AI-iparág számára a kérdést: „Meddig fogunk még »kölcsönkapott agyakra« támaszkodni?” A CLEVI a nehezebb, from scratch utat választotta, és ezt a választ a világ színpadán kívánja bizonyítani.”

Vissza a sajtószobába
CLEVI

Nyelv és régió

A gépi fordítással készült nyelvek meg vannak jelölve. Az elérhetőség a közzétett webhelycsomagot követi.

136 nyelv

Ajánlott

1

Kelet-Ázsia

7

Délkelet-Ázsia

11

Dél-Ázsia

18

Közép-Ázsia

5

Közel-Kelet és Kaukázus

10

Nyugat-Európa és Dél-Európa

16

Egyesült Királyság és Írország

4

Észak-Európa

10

Közép-Európa és a Balkán

14

Kelet-Európa

5

Kelet-Afrika

8

Nyugat-Afrika és Közép-Afrika

9

Afrika déli része

8

Amerika

5

Óceánia

5
A CLEVI AI-startup bekerült a GAIA legjobb 2,5%-ába… bizonyított hitelességét mutatja — CLEVI