Pinagmulan: Digital Times, Reporter Gu Bon-gyu
Buong sipi ng artikulong “AI startup na CLEVI, nakapasok sa nangungunang 2.5% ng GAIA… Nagpapakita ng napatunayang kredibilidad”
Petsa ng publikasyon: 2026-04-08
Link: https://n.news.naver.com/article/029/0003020511?sid=105
Inihayag ng AI startup na ‘Clevi’ sa South Korea na, habang nagtatayo ito ng sarili nitong modelo at sariling agent solution na ginawa from scratch, nakapasok ito sa nangungunang 2.5% sa GAIA benchmark, batay sa kabuuang 3,090 rehistradong modelo—ang unang kumpanyang nakamit ito sa South Korea.
Ayon sa paliwanag ng industriya, ang GAIA, na idinisenyo ng Meta AI at pinamamahalaan ng Hugging Face, ay hindi sumusukat sa kakayahan ng AI na ‘maging mahusay sa isang bagay lamang,’ kundi sa ‘kakayahang pagsamahin ang maraming kakayahan upang lutasin ang mga aktuwal na problema.’ Kailangang maghanap ito ng impormasyon sa web, magbasa ng mga talahanayan sa loob ng PDF, magsuri ng mga larawan, magpatakbo ng code para sa pagkalkula, at pagsamahin ang mga resulta upang makapagbigay ng isang tamang sagot. Binubuo ito ng 301 kumpidensyal na tanong, tatlong antas ng kahirapan, at prinsipyong hindi inilalabas ang mga sagot, kaya imposibleng mag-overfit o mandaya.
Dalawang bagay ang kailangan upang makakuha ng mataas na marka sa pagsusulit na ito. Una, ang kakayahan sa pangangatwiran ng language model na nagsisilbing pundasyon; ikalawa, isang agent solution na nag-uugnay sa modelong iyon sa mga tool sa totoong mundo upang maisagawa nito ang mga gawain nang awtonomo. Gaano man kaganda ang modelo, kung mahina ang agent, hindi nito malulutas ang Level 3; at gaano man kapino ang agent, kung kulang ang kakayahan ng modelo sa pangangatwiran, kumakalat ang mga maling sagot mula sa mga intermediate na yugto.
Kapag tiningnan ang kasalukuyang estruktura ng leaderboard ng GAIA, makikita ang isang kawili-wiling pattern. Karamihan sa mga agent na nasa nangungunang ranggo ay gumagamit ng estratehiyang ‘multi-model mix,’ na pinagsasama ang maraming modelo mula sa malalaking tech company gaya ng GPT, Claude, at Gemini. Makatuwiran itong paraan upang pagsamahin ang mga kalakasan ng bawat modelo at maiwasan ang pagbaba ng marka dahil sa pagkawala ng impormasyon at iba pang dahilan.
Samantala, hindi sumama si Clevi sa hanay na iyon. Ang cip-5.5-agent (agentic AI), na binuo gamit ang paraang from scratch, ay awtonomong nagpaplano, nagsasagawa, at nagbe-verify ng mga kumplikadong gawain, habang ang cip-5.5-mm (high-performance general-purpose multimodal) ay nakauunawa at nakapangangatwiran gamit ang iba’t ibang format ng file gaya ng audio, larawan, at video. Parehong independiyenteng binuo ang dalawang modelong ito sa loob ng Clevi, at walang ginamit na external LLM API.
Gamit ang sariling model stack na ito, nagpasabak ang CLEVI ng 5 ahente sa GAIA, at lahat ay nakapagtala ng 70+ puntos. Mula sa pinakamataas na 79.07% hanggang 70.76%, pinatunayan nitong ang katatagan ng buong stack—hindi lamang swerte ng isang resulta—ang dahilan.
Ayon sa paliwanag ng kumpanya, may isa pang numerong nakatago sa likod ng opisyal na iskor na 79.07%. Sa resulta ng post-review ng CLEVI, natukoy na marami sa 301 tanong ang wala nang makuhang batayan ng tamang sagot sa kasalukuyang pampublikong web. Nang muling suriin batay lamang sa mga tanong na ang batayan ng tamang sagot ay kasalukuyan pa ring makikita sa web, lumampas sa 98% ang accuracy rate ng CLEVI. Mas mataas na ito sa average ng tao na 92%.
Siyempre, maaaring mas napataas pa ang opisyal na iskor kung isinama ang malalakas na pangkalahatang modelo ng ibang kumpanya. Gayunman, sadyang hindi pinili ng CLEVI ang estratehiyang iyon. Dahil ang layunin ng benchmark na ito ay hindi ang kompetisyon para sa pinakamataas na iskor, kundi ang pag-verify kung ang sariling modelo ng from scratch ay umabot na sa antas na kayang makipagkumpitensya sa pandaigdigang entablado.
Malaki ang kahulugan ng pagkakaroon ng pangalan sa GAIA leaderboard dahil nangangahulugan itong may napatunayang kredibilidad mula sa independiyenteng pagsusuri ng ikatlong partido. Isa itong obhetibong batayan na maaaring gamitin sa lahat ng yugto ng pagkuha ng pamumuhunan, pagpasok sa mga merkado sa ibang bansa, at B2B sales.
Ayon sa isang kinatawan ng CLEVI, “Marami sa 63 opisyal na maling sagot ay nagmula sa hindi pagtutugma ng output format, mga error sa interpretasyon ng visual na materyal, at mga tanong na hindi masasagutan dahil nawala ang impormasyon. Hindi ito pangunahing limitasyon ng lohikal na pangangatwiran, kundi problema ng katumpakan ng post-processing at availability ng panlabas na impormasyon. Dahil sariling modelo ito, kayang pagbutihin ito mismo ng CLEVI. Ito ang estruktural na bentahe ng sariling modelo na from scratch. Ang tagumpay ng CLEVI sa pagkakataong ito ay nagtatanong sa industriya ng AI sa Korea: “Hanggang kailan tayo aasa sa ‘hiniram na utak’?” Pinili ng CLEVI ang mas mahirap na landas na from scratch at nais nitong patunayan ang sagot sa pandaigdigang entablado,” aniya.
