Albisteak

AI startup CLEVI, GAIAren %2,5 onenen artean… egiaztatutako sinesgarritasuna erakutsi du

Iturria: Digital Times, Gu Bon-gyu kazetaria

Iturria: Digital Times, Gu Bon-gyu kazetaria

“AI startup CLEVI, GAIAren %2,5 onenen artean… egiaztatutako sinesgarritasuna erakutsi du” artikuluaren testu osoaren aipamena

Argitalpen-data: 2026-04-08

Esteka: https://n.news.naver.com/article/029/0003020511?sid=105

‘Clevi’ izeneko Hego Koreako AI startupak from scratch sortutako berezko eredua eta berezko agente-soluzioa garatu dituela jakinarazi du, eta GAIA erreferentzia-proban erregistratutako 3.090 eredu guztien artean %2,5 onenen artean sartzen den lehen enpresa korearra dela adierazi du.

Sektoreko azalpenen arabera, Meta AIk diseinatu eta Hugging Facek kudeatzen duen GAIAk ez dio AIari «gauza bakarra ondo egiteko gaitasuna» eskatzen, baizik eta «hainbat gaitasun konbinatuz benetako arazoak konpontzeko gaitasuna». Webean informazioa bilatu, PDF bateko taulak irakurri, irudiak aztertu, kodea exekutatuz kalkuluak egin eta emaitzak bateratu behar ditu, erantzun zuzen bakarra emateko. 301 galdera pribatu, hiru zailtasun-maila eta erantzunak ez argitaratzeko printzipioa dituenez, gehiegizko egokitzapena eta iruzurra ezinezkoak diren egitura da.

Proba horretan puntuazio altua lortzeko bi gauza behar dira. Oinarri den hizkuntza-ereduaren arrazoibide-gaitasuna, eta eredu hori mundu errealeko tresnekin lotu eta zereginak modu autonomoan gauzatzeko aukera ematen dion agente-soluzioa. Eredua zein ona izan, agentea ahula bada, ezin da Level 3 maila ebatzi; eta agentea zein sofistikatua izan, ereduaren arrazoibide-gaitasuna nahikoa ez bada, erantzun okerrak zabaltzen dira tarteko etapetan.

GAIAren sailkapen-taularen egungo egiturari erreparatuta, eredu interesgarri bat ikus daiteke. Goi-mailako agente gehienek ‘eredu anitzeko nahasketa’ estrategia erabiltzen dute, hainbat teknologia-enpresa handiren ereduak, hala nola GPT, Claude eta Gemini, konbinatuz. Ikuspegi zentzuzkoa da, eredu bakoitzaren indarguneak bateratzeko eta informazio-galerak eragindako puntuazio-jaitsierak saihesteko.

CLEVIk, ordea, ez du bide hori hartu. from scratch garatutako cip-5.5-agent-ek (AI agentikoa) zeregin konplexuen plangintza, exekuzioa eta egiaztapena modu autonomoan egiten ditu, eta cip-5.5-mm-k (errendimendu handiko erabilera orokorreko multimodala) hainbat fitxategi-formatu ulertu eta arrazoitzen du, hala nola ahotsa, irudiak eta bideoa. Bi eredu horiek CLEVIren barruan garatu dira modu independentean, eta ez da kanpoko LLM APIrik erabili.

Eta jatorrizko modeloen stack honekin GAIAra 5 agente aurkeztu zituen, eta guztiek 70 puntutik gorako emaitzak lortu zituzten. Gehienez %79,07tik gutxienez %70,76ra bitarteko emaitzek frogatu zuten ez zela emaitza bakar baten zortea, stack osoaren egonkortasuna baizik.

Testu nagusiaren irudia

Enpresaren azalpenaren arabera, %79,07ko puntuazio ofizialaren atzean beste zenbaki bat ere badago. CLEVIren barneko ondorengo berrikuspenaren arabera, 301 galderetatik askotan erantzun zuzena egiaztatzeko ebidentzia galdua zegoen une horretan web publikoan. Erantzun zuzena oraindik webgunean eskuragarri zuten galderak soilik oinarri hartuta berriro ebaluatzean, CLEVIren zuzentasun-tasa %98tik gorakoa izan zen. Giza batez bestekoa (%92) gainditzen duen zifra da dagoeneko.

Jakina, beste enpresa batzuen erabilera orokorreko modelo indartsuak nahastu izan balira, puntuazio ofiziala are gehiago igo zitekeen. Hala ere, CLEVIk nahita ez zuen estrategia hori aukeratu. Benchmark honen helburua ez baitzen puntuaziorik altuenaren lehia, baizik eta egiaztatzea ea from scratch garatutako modelo propioa mundu mailan lehiatzeko moduko mailara iritsi ote zen.

GAIAren leaderboardean izena agertzeak esanahi handia du, hirugarren independente batek egindako ebaluazioak emandako sinesgarritasun egiaztatua izatea baitakar. Inbertsioak erakartzeko, atzerrian hedatzeko eta B2B salmentetarako erabil daitekeen oinarri objektiboa da, egoera guztietan.

CLEVIko arduradun batek adierazi zuenez: “63 erantzun oker ofizialetatik asko irteera-formatuaren desadostasunek, ikusizko materialen interpretazio-akatsak eta informazioa galdu izanaren ondorioz erantzun ezin izan ziren galderak eragin zituzten. Ez da arrazoibide logikoaren oinarrizko muga baten arazoa, baizik eta postprozesamenduaren zehaztasunarena eta kanpoko informazioaren eskuragarritasunarena. Modelo propioa denez, CLEVIk berak hobetu dezake. Hori da from scratch modelo propioaren egiturazko abantaila. CLEVIren lorpenak galdera hau planteatzen dio Koreako AI industriari: «Noiz arte egongo gara ‘maileguan hartutako garunen’ mende?». CLEVIk from scratch bide zailagoa aukeratu du, eta erantzuna mundu mailan frogatu nahi du”.

Itzuli albistegira
CLEVI

Hizkuntza eta eskualdea

Makina bidez itzulitako hizkuntzak markatuta daude. Erabilgarritasuna argitaratutako gunearen paketearen araberakoa da.

136 hizkuntza

Gomendatua

1

Ekialdeko Asia

7

Hego-ekialdeko Asia

11

Hego Asia

18

Erdialdeko Asia

5

Ekialde Hurbila eta Kaukasoa

10

Mendebaldeko Europa eta Hego Europa

16

Erresuma Batua eta Irlanda

4

Ipar Europa

10

Erdialdeko Europa eta Balkanak

14

Ekialdeko Europa

5

Ekialdeko Afrika

8

Mendebaldeko Afrika eta Erdialdeko Afrika

9

Hegoaldeko Afrika

8

Amerika

5

Ozeania

5
AI startup CLEVI, GAIAren %2,5 onenen artean… egiaztatutako sinesgarritasuna erakutsi du — CLEVI