Što znači rezultat na GAIA-i — koliko su AI agenti napredovali?
Kada je GAIA benchmark prvi put objavljen, čak je i GPT-4, tadašnji vrhunski model, ostvario rezultat od tek oko 30 %. To znači da je AI u to vrijeme još bio u ranoj fazi sposobnosti „razmišljanja i djelovanja”, s obzirom na to da GAIA, osim jednostavnog odgovaranja na upite, zahtijeva složeno zaključivanje, korištenje alata i rješavanje višefaznih problema.
Međutim, danas su agenti pri vrhu ljestvice dosegnuli 92,36 %.
Ova promjena nije samo poboljšanje performansi. Ona pokazuje da je AI sada nadišao razinu odgovaranja na pitanja i ušao u fazu „Agentic AI-ja”, u kojoj tumači situaciju, odabire potrebne alate te samostalno planira i izvršava više koraka.
U samo nekoliko godina AI je evoluirao od „alata za generiranje znanja” u „izvršitelja koji obavlja zadatke”.
📌 A unutar tih 2,5 % najboljih nalazi se CLEVI
U ovakvom globalnom konkurentskom okruženju, činjenica da je agent CLEVI-ja, razvijen u Koreji, uvršten među 2,5 % najboljih na GAIA ljestvici dokazuje tehnološku samostalnost i predstavlja primjer koji potvrđuje da AI agent razvijen u Koreji može zadovoljiti i globalne standarde. To ima značenje veće od same brojke. To znači da je riječ o tehnološkoj sposobnosti objektivno potvrđenoj natjecanjem s tisućama modela na globalnom javno dostupnom benchmarku, a ne u nekom posebnom demo okruženju.
Još je važnije to što ovaj rezultat nije slučajan ishod jednog modela, već činjenica da su agenti različitih dizajna na istom Agent Stacku opetovano ostvarivali rezultate pri vrhu ljestvice.
Drugim riječima, tehnologija CLEVI-ja nije „rezultat koji je jednom dobro ispao”, već reproducibilna strukturna konkurentska prednost i sposobnost na razini platforme koja se može proširiti na različite industrije i scenarije.
Što onda ovaj pokazatelj znači?
Iz korisničke perspektive, najveća prepreka uvođenju AI-ja pitanje je: „Može li mu se doista vjerovati i povjeriti mu zadatak?”
Performanse koje su opetovano dokazane na pozornici treće strane, globalnoj javnoj ljestvici, a ne kroz atraktivne demonstracije ili vlastite prezentacijske materijale, najobjektivniji su odgovor na to pitanje. Konkretno, važne su iz tri aspekta.
Prvo, smanjenje rizika uvođenja
Povezivanje neprovjerene umjetne inteligencije s internim poslovanjem za poduzeća predstavlja znatan teret.
Rezultati na vjerodostojnim referentnim testovima poput GAIA-e mogu se izravno koristiti kao temelj povjerenja u fazi tehničke procjene.
Drugo, ostvarivanje složene automatizacije poslovanja
Rezultat među najboljih 2,5 % označava razinu inteligencije koja nadilazi jednostavne repetitivne zadatke te uključuje razumijevanje konteksta, samostalno prosuđivanje više koraka i njihovo dovršavanje.
Područja poslovanja za koja se dosad smatralo da ih je „teško povjeriti umjetnoj inteligenciji” sada mogu postati stvarni kandidati za automatizaciju.
Treće, istodobno postizanje sigurnosti podataka i visokih performansi
Vlastita struktura Agent Stack znači da tok podataka ne izlazi izvan sustava.
Možete se osloboditi postojeće dileme prema kojoj je za korištenje visokoučinkovite umjetne inteligencije potrebno ugroziti sigurnost.
Ova struktura predstavlja odlučujuću konkurentsku prednost, osobito u industrijama s visokom osjetljivošću podataka, poput financija, zdravstva i pravnih usluga.
Mogućnost reprodukcije te strukture već se počinje dokazivati.
A rezultati svakog agenta izgrađenog na toj strukturi uskoro će se pretvoriti u stvarne promjene na terenu.
„Naposljetku, tehnološka izvrsnost dovršava se kroz 'uvjerenje' na terenu.”
CLEVI ne pruža samo visokoučinkovitu umjetnu inteligenciju. Naša je bit izgradnja „infrastrukture za izvršavanje” koja ruši sigurnosne prepreke s kojima se poduzeća suočavaju i doista dovršava složene praktične zadatke.
Sada prijeđite iz faze razmatranja uvođenja i zajedno s CLEVI-jem započnite sigurno i snažno AI poslovno okruženje.
Kao pouzdan partner kojem možete povjeriti svoj posao, zajedno ćemo stvarati stvarne inovacije u vašem poslovnom okruženju.