Ziņas

CLEVI, ar from scratch pašu izstrādētu modeli GAIA sasniedz 79,07%... starp 3090 modeļiem ierindojas labāko 2,5% vidū

Avots: Electronic Times, reportieris I Vondži

Avots: Electronic Times, reportieris I Vondži

Pilns raksta “CLEVI, ar from scratch pašu izstrādētu modeli GAIA sasniedz 79,07%... starp 3090 modeļiem ierindojas labāko 2,5% vidū” citāts

Publicēšanas datums: 2026-04-07

Saite: https://www.etnews.com/20260407000203

Pieci neatkarīgi cip-5.5-agent·cip-5.5-mm modeļu steka aģenti visi pārsniedz 70 punktus

Ņemot vērā informācijas zudumu, pareizo atbilžu īpatsvars pārsniedz 98%, pārspējot cilvēku rezultātu (92%)

Raksta pamatteksta attēls

AI jaunuzņēmums “CLEVI”, izmantojot from scratch pašu izstrādātu modeli, globālajā AI aģentu etalonā “GAIA” sasniedza 79,07% pareizo atbilžu īpatsvaru un ierindojās labāko 2,5% vidū, salīdzinot ar visiem 3090 reģistrētajiem modeļiem.

Pēc nozares ekspertu teiktā, AI etalonu tirgū GAIA tiek vērtēts kā etalons, kas precīzi atspoguļo “praktisku AI aģentu” spējas. Šo etalonu kopīgi izstrādāja Meta AI, HuggingFace un Parīzes-Saklē universitāte, un tas pirmo reizi tika publiskots 2023. gada novembrī.

GAIA galvenokārt no citiem etaloniem atšķiras trīs aspektos. Pirmkārt, tā kā pareizās atbildes nav publiski pieejamas, pārpielāgošana nav iespējama. Otrkārt, tā prasa daudzpakāpju un multimodālu kompleksu spriešanu, tāpēc ar vienkāršu modeļu atbilstības meklēšanu augstu rezultātu sasniegt nav iespējams. Treškārt, izmantojot HuggingFace oficiālo līderu tabulu, vairāk nekā 3090 modeļu no visas pasaules sacenšas ar vienādiem nosacījumiem.

Testa kopa kopumā sastāv no 301 jautājuma. 1. līmenī nepieciešams izmantot vienu rīku un veikt vienkāršu spriešanu, 2. līmenī — kombinēt vairākus rīkus un veikt vidējas sarežģītības spriešanu, savukārt 3. līmenī jāizstrādā un jāīsteno aģenta plāns, kas ietver piecus vai vairāk posmus, tādēļ tie ir visaugstākās sarežģītības jautājumi. Etalona publicēšanas laikā GPT modeļi (ar spraudņiem) sasniedza tikai aptuveni 15%, bet pašlaik vadošās komandas šo rādītāju ir paaugstinājušas līdz 70–80%.

CLEVI uzsvēra, ka tehniski visievērojamākais šī sasnieguma aspekts ir tas, ka netika izmantota neviena ārēja LLM API, piemēram, GPT, Claude vai Gemini. CLEVI raksturīgā iezīme ir divu neatkarīgi izstrādātu modeļu izmantošana, kas izveidoti from scratch.

cip-5.5-agent ir aģentisks MI modelis, kas kalpo kā galvenās smadzenes aģentu konveijerā, kurš autonomi plāno (planning), izpilda (execution) un pārbauda (verification) sarežģītus uzdevumus. cip-5.5-mm ir augstas veiktspējas vispārējas nozīmes multimodāls modelis, kas saprot un veic secinājumus, izmantojot dažādus failu formātus, piemēram, balss ierakstus, attēlus un video. Tā kā ievērojama daļa GAIA uzdevumu ietver neteksta ievadi, piemēram, PDF, attēlu un audio failus, šīs multimodālās spējas kļuva par galveno faktoru augsta rezultāta sasniegšanā.

CLEVI, balstoties uz šiem diviem pašu izstrādātajiem modeļiem, GAIA sacensībās piedalījās ar 5 dažādām aģentu konfigurācijām, un visas ieguva vairāk nekā 70 punktus.

Pēc uzņēmuma skaidrojuma, CLEVI iekšējā pēcpārbaudē tika atklāts interesants rezultāts. No kopumā 301 uzdevuma dažiem pašlaik publiski pieejamajā tīmeklī vairs nebija saglabājies pareizās atbildes pamatojums. Runa ir par gadījumiem, kad informācija, kas iepriekš bija pieejama tiešsaistē vai meklētājprogrammās, ir dzēsta vai mainīta un vairs nav pieejama. Veicot atkārtotu novērtēšanu, pamatojoties uz publiski pārbaudāmo informāciju, kas pašlaik pieejama cilvēkiem, CLEVI pareizo atbilžu īpatsvars pārsniedza 98%. Tas jau pārsniedz cilvēku vidējo rādītāju — 92%.

CLEVI pārstāvis skaidroja: “CLEVI, neizmantojot ārējo modeļu kombināciju un paļaujoties tikai uz from scratch pašu izstrādātiem modeļiem un pašu AI aģentu risinājumiem, ar visiem 5 aģentiem sasniedza vairāk nekā 70 punktus un iekļuva publiskā etalona 2,5% labāko rezultātu grupā. Paredzams, ka, turpinot uzlabot pašu modeļus un aģentu risinājumus, būs iespējams vēl vairāk paaugstināt arī oficiālo rezultātu. Šis sasniegums ir nozīmīgs, jo tas atspoguļo “pārbaudītu uzticamību”, kas izmērīta globālā publiskā etalonā, demonstrē vietējā AI izstrādātāja rezultātus, kas balstīti uz from scratch pašu izstrādātiem modeļiem, un ir neatkarīga modeļu steka rezultāts, nevis ārējo modeļu kombinācijas rezultāts. Turklāt, ņemot vērā informācijas zudumu dažos uzdevumos, tam ir lielāka interpretācijas vērtība nekā tikai punktu skaits.”

Atpakaļ uz ziņu telpu
CLEVI

Valoda un reģions

Mašīntulkotās valodas ir atzīmētas. Pieejamība atbilst publicētajai vietnes pakotnei.

136 valodas

Ieteicams

1

Austrumāzija

7

Centrālaustrumāzija

11

Dienvidāzija

18

Centrālāzija

5

Tuvie Austrumi un Kaukāzs

10

Rietumeiropa un Dienvideiropa

16

Apvienotā Karaliste un Īrija

4

Ziemeļeiropa

10

Centrāleiropa un Balkāni

14

Austrumeiropa

5

Austrumāfrika

8

Rietumāfrika un Vidusāfrika

9

Dienvidāfrika

8

Amerika

5

Okeānija

5
CLEVI, ar from scratch pašu izstrādētu modeli GAIA sasniedz 79,07%... starp 3090 modeļiem ierindojas labāko 2,5% vidū — CLEVI