Izvor: novinar Lee Won-ji iz Electronic Timesa
Citiranje cijelog članka „Clevi, 79,07% na GAIA-i s vlastitim modelom razvijenim from scratch... među 3.090 modela u najboljih 2,5%“
Datum objave: 2026-04-07
Link: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm vlastiti modelni stek, svih 5 agenata iznad 70 bodova
Uzimajući u obzir gubitak informacija, tačnost od 98%+, iznad ljudskih 92%
AI startup „Clevi“ zabilježio je tačnost od 79,07% na globalnom AI agentskom benchmarku „GAIA“ koristeći vlastiti model razvijen from scratch, čime se plasirao među najboljih 2,5% od ukupno 3.090 registrovanih modela.
Prema objašnjenjima iz industrije, GAIA se na tržištu AI benchmarka smatra testom koji vjerno odražava sposobnosti „praktičnih AI agenata“. Ovaj benchmark, koji su zajednički razvili Meta AI, HuggingFace i Univerzitet Paris-Saclay, prvi put je predstavljen u novembru 2023. godine.
GAIA se od drugih benchmarka razlikuje po tri ključne karakteristike. Prvo, budući da su tačni odgovori povjerljivi, overfitting nije moguć. Drugo, zahtijeva složeno zaključivanje kroz više koraka i modaliteta, pa visok rezultat nije moguće postići jednostavnim podudaranjem obrazaca. Treće, više od 3.090 modela iz cijelog svijeta takmiči se pod istim uslovima putem zvanične rang-liste HuggingFacea.
Testni skup sastoji se od ukupno 301 pitanja. Level 1 obuhvata korištenje jednog alata i jednostavno zaključivanje, Level 2 kombinaciju više alata i zaključivanje srednje složenosti, dok Level 3 obuhvata pitanja najvišeg nivoa težine koja zahtijevaju planiranje i izvršavanje agenata u pet ili više koraka. U vrijeme predstavljanja benchmarka, rezultat GPT modela (s dodacima) iznosio je oko 15%, dok su vodeći timovi trenutno podigli rezultate na 70–80%.
Među tim dostignućima, Clevi je naglasio da je tehnički najvažnija činjenica to što nisu uopće koristili eksterne LLM API-je kao što su GPT, Claude i Gemini. Posebnost Clevija je u tome što je koristio dva vlastita modela razvijena samostalno, po principu from scratch.
cip-5.5-agent je agentički AI model koji služi kao ključni mozak agentskog procesa koji autonomno planira (planning), izvršava (execution) i provjerava (verification) složene zadatke. cip-5.5-mm je visokoučinkoviti opći multimodalni model koji razumije i zaključuje na osnovu različitih formata datoteka, uključujući glas, slike i video. Budući da značajan dio GAIA pitanja uključuje netekstualne ulazne podatke poput PDF-ova, slika i audiozapisa, ova multimodalna sposobnost postala je ključni faktor za postizanje visokog rezultata.
Clevi je na osnovu ova dva vlastita modela prijavio 5 različitih konfiguracija agenata na GAIA-i, pri čemu su svi postigli rezultat iznad 70 bodova.
Prema objašnjenju kompanije, interna naknadna analiza kompanije Clevi otkrila je zanimljive rezultate. Od ukupno 301 pitanja, za neka od njih trenutno su nestali dokazi koji potvrđuju tačne odgovore na javnom webu. Riječ je o slučajevima u kojima su informacije koje su se ranije mogle provjeriti na internetu ili putem pretraživača obrisane ili izmijenjene i više im se ne može pristupiti. Kada je izvršena ponovna procjena u okviru informacija koje ljudi trenutno mogu javno provjeriti, tačnost odgovora kompanije Clevi iznosila je više od 98%. To je rezultat koji već premašuje ljudski prosjek od 92%.
Predstavnik kompanije Clevi objasnio je: “Clevi je, bez miješanja vanjskih modela i koristeći samo vlastite modele razvijene od nule i vlastita AI agentska rješenja, zabilježio rezultat 70+ za svih 5 agenata i ušao među 2,5% najboljih na javnom benchmarku. Očekuje se da će kroz buduća poboljšanja vlastitih modela i agentskih rješenja biti moguće dodatno unaprijediti i službeni rezultat. Ovaj uspjeh ima duboko značenje jer pokazuje ‘provjereno povjerenje’ izmjereno na globalnom javnom benchmarku, jer predstavlja rezultat domaće AI razvojne kompanije zasnovan na vlastitim modelima razvijenim od nule, jer je rezultat nezavisnog sklopa modela, a ne miješanja vanjskih modela, te jer, uzimajući u obzir gubitak informacija u nekim pitanjima, ima interpretativnu vrijednost koja nadilazi sam rezultat.”
