Balita

CLEVI, 79.07% sa GAIA gamit ang sariling model na ginawa from scratch... kabilang sa nangungunang 2.5% sa 3,090 modelo

Pinagmulan: Electronic Times, Reporter Lee Won-ji

Pinagmulan: Electronic Times, Reporter Lee Won-ji

Buong artikulong sinipi: “CLEVI, 79.07% sa GAIA gamit ang sariling model na ginawa from scratch... kabilang sa nangungunang 2.5% sa 3,090 modelo”

Petsa ng publikasyon: 2026-04-07

Link: https://www.etnews.com/20260407000203

Ang limang ahente sa 독자 model stack na cip-5.5-agent·cip-5.5-mm ay pawang nakakuha ng mahigit 70 puntos

Kapag isinasaalang-alang ang pagkawala ng impormasyon, 98%+ ang accuracy rate, mas mataas kaysa sa tao (92%)

Larawan sa pangunahing teksto

Nagtala ang AI startup na 'CLEVI' ng 79.07% accuracy rate sa 'GAIA', isang pandaigdigang benchmark para sa mga AI agent, gamit ang sarili nitong model na ginawa from scratch, at napabilang sa nangungunang 2.5% batay sa kabuuang 3,090 nakarehistrong modelo.

Ayon sa paliwanag ng industriya, itinuturing ang GAIA sa merkado ng mga AI benchmark na tumpak na sumasalamin sa kakayahan ng mga 'praktikal na AI agent'. Ang benchmark na ito, na sama-samang binuo ng Meta AI, HuggingFace, at Paris-Saclay University, ay unang inilabas noong Nobyembre 2023.

May tatlong pangunahing katangian ang GAIA na nagpapaiba rito sa ibang benchmark. Una, hindi maaaring mag-overfit dahil hindi inilalabas ang mga tamang sagot. Ikalawa, dahil nangangailangan ito ng multistep at multimodal na kumplikadong pangangatwiran, imposibleng makakuha ng mataas na puntos sa simpleng pattern matching lamang. Ikatlo, mahigit 3,090 modelo mula sa buong mundo ang nakikipagkumpitensya sa ilalim ng parehong kondisyon sa pamamagitan ng opisyal na leaderboard ng HuggingFace.

Binubuo ang test set ng kabuuang 301 tanong. Ang Level 1 ay nangangailangan ng paggamit ng iisang tool at simpleng pangangatwiran, ang Level 2 ay kombinasyon ng maraming tool at katamtamang antas ng pangangatwiran, at ang Level 3 ay mga tanong na may pinakamataas na antas ng kahirapan na nangangailangan ng pagpaplano at pagsasagawa ng ahente sa lima o higit pang hakbang. Sa panahon ng paglalabas ng benchmark, nasa humigit-kumulang 15% lamang ito batay sa mga GPT model (na may mga plugin), ngunit kasalukuyang naitaas ito ng mga nangungunang team sa antas na 70–80%.

Binigyang-diin ng CLEVI na ang pinakamahalagang teknikal na bahagi ng resultang ito ay ang hindi nito paggamit ng anumang external LLM API gaya ng GPT, Claude, o Gemini. Ang natatanging katangian ng CLEVI ay gumamit ito ng dalawang modelong independiyenteng binuo from scratch.

Ang cip-5.5-agent ay isang agentic AI model na nagsisilbing pangunahing utak ng pipeline ng agent na nagsasariling nagpaplano (planning), nagsasagawa (execution), at nagbeberipika (verification) ng mga kumplikadong gawain. Ang cip-5.5-mm ay isang high-performance general-purpose multimodal model na nakauunawa at nakapangangatwiran sa iba't ibang format ng file gaya ng boses, larawan, at video. Dahil malaking bahagi ng mga tanong sa GAIA ay may kasamang mga input na hindi teksto, gaya ng PDF, larawan, at audio file, naging pangunahing salik ang kakayahang multimodal na ito sa pagkamit ng mataas na marka.

Batay sa dalawang in-house model na ito, naglahok ang CLEVI ng limang magkakaibang configuration ng agent sa GAIA, at lahat ay nakapagtala ng mahigit 70 puntos.

Ayon sa paliwanag ng kumpanya, may isang kawili-wiling resulta na nakumpirma sa internal na post-review ng CLEVI. Sa kabuuang 301 tanong, ang batayan ng tamang sagot para sa ilan ay hindi na kasalukuyang makikita sa pampublikong web. Ito ay mga impormasyong dati nang makikita online o sa mga search engine ngunit nabura o nabago na kaya hindi na ma-access. Nang muling suriin batay sa saklaw ng impormasyong kasalukuyang maaaring beripikahin ng publiko, lumabas na mahigit 98% ang accuracy rate ng CLEVI. Mas mataas na ito sa 92% na average ng tao.

Ipinaliwanag ng isang kinatawan ng CLEVI: “Nakapagtala ang lahat ng limang agent ng 70+ gamit lamang ang mga in-house model mula sa scratch at sariling AI agent solution ng CLEVI, nang walang paghahalo ng external model, kaya nakapasok kami sa top 2.5% ng pampublikong benchmark. Inaasahang maaari pang tumaas ang opisyal na marka sa hinaharap sa pamamagitan ng pagpapahusay ng aming mga in-house model at agent solution. Malaki ang kahalagahan ng resultang ito dahil ipinakita ito sa isang global public benchmark at nagpapakita ng ‘verified trust’; nakamit ito ng isang domestic AI developer gamit ang sariling model mula sa scratch; resulta ito ng isang independent model stack sa halip na paghahalo ng external model; at, kung isasaalang-alang ang pagkawala ng impormasyon sa ilang tanong, may halaga itong bigyang-kahulugan na higit pa sa ipinapakitang marka.”

Bumalik sa newsroom
CLEVI

Wika at rehiyon

Minarkahan ang mga wikang isinalin ng makina. Ang availability ay nakabatay sa inilathalang bundle ng site.

136 wika

Inirerekomenda

1

Silangang Asya

7

Timog-Silangang Asya

11

Katimugang Asya

18

Gitnang Asya

5

Gitnang Silangan at Caucasus

10

Kanlurang Europe at Katimugang Europe

16

United Kingdom at Ireland

4

Hilagang Europe

10

Gitnang Europa at Balkan

14

Silangang Europe

5

Silangang Africa

8

Kanlurang Africa at Gitnang Africa

9

Katimugang Africa

8

Americas

5

Oceania

5
CLEVI, 79.07% sa GAIA gamit ang sariling model na ginawa from scratch... kabilang sa nangungunang 2.5% sa 3,090 modelo — CLEVI