Forrás: Elektronikus Újság, Lee Won-ji újságíró
A „CLEVI, 79,07% a from scratch saját modellel a GAIA-n... a 3 090 modell közül a felső 2,5%-ban” című cikk teljes szövegének idézése
Megjelenés dátuma: 2026-04-07
Hivatkozás: https://www.etnews.com/20260407000203
A cip-5.5-agent·cip-5.5-mm saját modellstackjének mind az 5 ügynöke 70 pont felett teljesített
Az információvesztést figyelembe véve 98% feletti pontosság, meghaladva az emberi teljesítményt (92%)
A „CLEVI” AI-startup from scratch saját modelleket használva 79,07%-os pontosságot ért el a globális AI-ügynök-benchmarkon, a GAIA-n, ezzel a 3 090 regisztrált modell közül a felső 2,5%-ban végzett.
Az iparági magyarázatok szerint a GAIA-t az AI-benchmarkok piacán olyan mércének tekintik, amely hűen tükrözi a „praktikus AI-ügynökök” képességeit. A Meta AI, a HuggingFace és a Paris-Saclay Egyetem által közösen fejlesztett benchmarkot először 2023 novemberében tették közzé.
A GAIA-t három fő jellemző különbözteti meg a többi benchmarktól. Először is, mivel a helyes válaszok nem nyilvánosak, a túltanulás lehetetlen. Másodszor, többlépéses és multimodális összetett következtetést igényel, ezért egyszerű mintafelismeréssel nem lehet magas pontszámot elérni. Harmadszor, a HuggingFace hivatalos ranglistáján világszerte több mint 3 090 modell versenyez azonos feltételek mellett.
A tesztkészlet összesen 301 kérdésből áll. Az 1. szint egyetlen eszköz használatát és egyszerű következtetést, a 2. szint több eszköz kombinációját és közepes szintű következtetést, a 3. szint pedig legalább ötlépéses ügynöki tervezést és végrehajtást igénylő, legmagasabb nehézségű kérdéseket tartalmaz. A benchmark közzétételekor a GPT-modellek (bővítményekkel) körülbelül 15%-ot értek el, a jelenlegi élmezőny csapatai pedig ezt 70–80%-ra javították.
Ezzel kapcsolatban CLEVI hangsúlyozta, hogy az eredmény technikailag leginkább figyelemre méltó része az, hogy egyáltalán nem használt külső LLM API-kat, például a GPT, Claude vagy Gemini API-ját. CLEVI két, from scratch módszerrel saját fejlesztésű modellt használt, ami az eredmény egyik különlegessége.
A cip-5.5-agent egy agentikus AI-modell, amely a komplex feladatokat autonóm módon megtervező (planning), végrehajtó (execution) és ellenőrző (verification) ügynökpipeline kulcsfontosságú agyaként működik. A cip-5.5-mm nagy teljesítményű, általános célú multimodális modell, amely képes megérteni és értelmezni a különböző fájlformátumokat, például a hangot, a képeket és a videókat. Mivel a GAIA-kérdések jelentős része nem szöveges bemeneteket, például PDF-eket, képeket és hangfájlokat tartalmaz, ez a multimodális képesség lett a magas pontszám egyik kulcsfontosságú tényezője.
A CLEVI ezt a két saját modellt alapul véve 5 különböző ügynökkonfigurációval indult a GAIA versenyen, és mindegyik 70 pont feletti eredményt ért el.
A vállalat tájékoztatása szerint a CLEVI belső utólagos felülvizsgálata során érdekes eredményre derült fény. A 301 kérdés egy része esetében a helyes válaszok bizonyítékai jelenleg már nem érhetők el a nyilvános weben. Olyan információkról van szó, amelyek korábban online vagy keresőmotorokban elérhetők voltak, de törölték vagy módosították őket, így már nem hozzáférhetők. Amikor az eredményeket a jelenleg emberek által nyilvánosan ellenőrizhető információk körében újraértékelték, a CLEVI pontossága 98% felettinek bizonyult. Ez már meghaladja az emberek 92%-os átlagát.
A CLEVI képviselője elmondta: „A CLEVI külső modellek keverése nélkül, kizárólag from scratch saját modellekkel és saját AI-ügynökmegoldásokkal érte el, hogy mind az 5 ügynöke 70+ pontot szerezzen, így a nyilvános benchmarkon a legjobb 2,5%-ba került. A saját modellek és ügynökmegoldások jövőbeli fejlesztésével várhatóan a hivatalos pontszám is tovább javítható. Ez az eredmény azért különösen jelentős, mert egy globális nyilvános benchmarkon ténylegesen mért, »igazolt megbízhatóságot« mutat; mert egy hazai AI-fejlesztő from scratch saját modelljeire épülő eredményéről van szó; mert külső modellek keverése helyett egy önálló modellstack eredménye; továbbá mert egyes kérdések információvesztését figyelembe véve a pontszámot meghaladó értelmezési értékkel bír.”
