Tinubdan: Eonshinmun, reporter nga si Lee Won-ji
Kompletong kinutlo sa artikulo nga “Clevi, 79.07% sa GAIA gamit ang kaugalingong modelo nga gihimo from scratch... naa sa top 2.5% sa 3,090 ka modelo”
Petsa sa pagmantala: 2026-04-07
Link: https://www.etnews.com/20260407000203
Ang cip-5.5-agent·cip-5.5-mm nga independent model stack adunay 5 ka ahente, ug silang tanan nakakuha og kapin sa 70 puntos
Kung ikonsiderar ang pagkawala sa impormasyon, 98%+ ang hustong tubag, mas taas kay sa tawo (92%)
Ang AI startup nga 'Clevi' nakarekord og 79.07% nga hustong tubag sa global nga AI agent benchmark nga 'GAIA' gamit ang kaugalingon nga modelo nga gihimo from scratch, ug nakasulod sa top 2.5% base sa tanang 3,090 ka rehistradong modelo.
Sumala sa mga pagpasabot sa industriya, giila ang GAIA sa merkado sa AI benchmarks nga matinud-anong nagpakita sa abilidad sa 'praktikal nga AI agents'. Kining benchmark, nga hiniusang gimugna sa Meta AI, HuggingFace, ug Paris-Saclay University, unang gipahibalo niadtong Nobyembre 2023.
Tulo ka butang ang nag-unang nagpalahi sa GAIA gikan sa ubang benchmarks. Una, imposible ang overfitting tungod kay pribado ang hustong mga tubag. Ikaduha, tungod kay nagkinahanglan kini og multistep ug multimodal nga komplikadong pangatarungan, imposible ang taas nga marka pinaagi lang sa simple nga pattern matching. Ikatulo, kapin sa 3,090 ka modelo gikan sa tibuok kalibotan ang nagkompetensya ubos sa parehas nga mga kondisyon pinaagi sa opisyal nga leaderboard sa Hugging Face.
Ang test set adunay kinatibuk-ang 301 ka pangutana. Ang Level 1 nagkinahanglan og paggamit sa usa ka himan ug simple nga pangatarungan, ang Level 2 nagkinahanglan og kombinasyon sa daghang himan ug tunga-tungang lebel nga pangatarungan, samtang ang Level 3 mao ang pinakalisod nga mga pangutana nga nagkinahanglan og agent planning ug execution nga lima o labaw pa ka lakang. Sa panahon nga gipahibalo ang benchmark, mga 15% lamang ang marka sa GPT models (nga adunay plugins), apan karon gipataas na kini sa mga nanguna nga team ngadto sa 70–80%.
Lakip niini, gipasiugda sa Clevi nga ang labing teknikal nga angay hatagan og pagtagad bahin sa maong resulta mao nga wala gyud kini mogamit og mga external LLM API sama sa GPT, Claude, ug Gemini. Ang kinaiya sa Clevi mao ang paggamit niini og duha ka independenteng modelo nga kaugalingong gihimo pinaagi sa pamaagi nga from scratch.
Ang cip-5.5-agent usa ka agentic AI model nga nagsilbing pangunang utok sa agent pipeline nga awtonomong nagplano (planning)·nagpatuman (execution)·nag-verify (verification) sa mga komplikadong buluhaton. Ang cip-5.5-mm usa ka high-performance general-purpose multimodal model nga makasabut ug makapangatarungan sa lainlaing file format sama sa audio, imahe, ug video. Tungod kay dakong bahin sa mga pangutana sa GAIA naglakip og non-text input sama sa PDF, mga imahe, ug audio file, kini nga multimodal nga abilidad nahimong importanteng hinungdan sa taas nga score.
Gibase sa duha ka kaugalingong modelo, gipaanlis ni Clevi ang 5 ka lain-laing konfigurasyon sa ahente sa GAIA, ug silang tanan nakarekord og labaw sa 70 puntos.
Sumala sa kompanya, usa ka makaiikag nga resulta ang nakumpirma sa internal nga post-review sa Clevi. Sa kinatibuk-ang 301 ka pangutana, ang basihanan sa hustong tubag sa pipila niini nawala na sa kasamtangang publikong web. Kini ang mga kaso diin ang impormasyon nga kaniadto mapamatud-an online o pinaagi sa search engine nabura o nabag-o ug dili na ma-access. Sa dihang gi-reassess sulod sa gidak-on sa impormasyon nga mapamatud-an pa sa publiko sa mga tawo, ang accuracy sa tubag sa Clevi nakit-ang labaw sa 98%. Kini mas taas na kay sa 92% nga average sa mga tawo.
Ang representante sa Clevi mipahayag, “Ang Clevi, nga walay pagsagol sa mga external nga modelo, nakarekord og 70+ ang tanang 5 ka ahente gamit lamang ang kaugalingong mga modelo nga gihimo from scratch ug kaugalingong mga solusyon sa AI agent, ug nakasulod sa top 2.5% sa publikong benchmark. Gilauman nga posible pa ang dugang nga pagpauswag sa opisyal nga score pinaagi sa umaabot nga pagpauswag sa kaugalingong mga modelo ug solusyon sa ahente. Lawom ang kahulogan niini nga kalampusan tungod kay nagpakita kini og ‘napamatud-ang pagsalig’ nga nasukod sa global nga publikong benchmark, usa kini ka kalampusan sa usa ka lokal nga kompanya sa AI development nga gibase sa kaugalingong mga modelo nga gihimo from scratch, resulta kini sa independenteng model stack imbis nga pagsagol sa mga external nga modelo, ug aduna kiniy bili sa paghubad nga labaw pa sa score tungod sa pagkonsiderar sa pagkawala sa impormasyon sa pipila ka mga pangutana.”
