Նորություններ

CLEVI, from scratch սեփական մոդելով GAIA-ում 79.07%... 3,090 մոդելների շարքում լավագույն 2.5%-ում

Աղբյուր՝ Էլեկտրոնային թերթ, լրագրող Լի Վոն-ջի

Աղբյուր՝ Էլեկտրոնային թերթ, լրագրող Լի Վոն-ջի

«CLEVI, from scratch սեփական մոդելով GAIA-ում 79.07%... 3,090 մոդելների շարքում լավագույն 2.5%-ում» հոդվածի ամբողջական մեջբերում

Հրապարակման ամսաթիվ՝ 2026-04-07

Հղում՝ https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm սեփական մոդելների ստեկի 5 գործակալներն էլ 70-ից բարձր միավորներ են գրանցել

Տեղեկատվության կորստի հաշվառմամբ՝ 98%+ ճշտություն, գերազանցում է մարդուն (92%)

Հոդվածի հիմնական պատկերը

AI ստարտափ CLEVI-ն from scratch սեփական մոդելի միջոցով գլոբալ AI գործակալների «GAIA» չափանիշում գրանցել է 79.07% ճշտություն և բոլոր 3,090 գրանցված մոդելների շարքում հայտնվել լավագույն 2.5%-ում։

Ոլորտի մասնագետների բացատրության համաձայն՝ AI չափանիշների շուկայում GAIA-ն գնահատվում է որպես «գործնական AI գործակալների» կարողությունները հավատարիմ կերպով արտացոլող չափանիշ։ Meta AI-ի, HuggingFace-ի և Փարիզ-Սակլեի համալսարանի համատեղ մշակած այս չափանիշն առաջին անգամ հրապարակվել է 2023 թվականի նոյեմբերին։

GAIA-ն այլ չափանիշներից տարբերող հիմնական առանձնահատկությունները երեքն են։ Առաջին՝ քանի որ ճիշտ պատասխանները գաղտնի են, գերհարմարեցումն անհնար է։ Երկրորդ՝ քանի որ պահանջվում է բազմաքայլ և բազմամոդալ բարդ դատողություն, պարզ օրինաչափությունների համապատասխանեցմամբ բարձր միավոր ստանալն անհնար է։ Երրորդ՝ HuggingFace-ի պաշտոնական առաջատարների աղյուսակի միջոցով աշխարհի ավելի քան 3,090 մոդելներ մրցում են նույն պայմաններում։

Թեստային հավաքածուն բաղկացած է ընդհանուր 301 հարցից։ Level 1-ը ներառում է մեկ գործիքի օգտագործում և պարզ դատողություն, Level 2-ը՝ մի քանի գործիքների համակցում և միջին մակարդակի դատողություն, իսկ Level 3-ը՝ 5 կամ ավելի քայլից բաղկացած գործակալական պլանավորում և իրականացում պահանջող ամենաբարդ հարցերն են։ Չափանիշի հրապարակման պահին GPT մոդելների (պլագինով) արդյունքը սահմանափակվում էր մոտ 15%-ով, իսկ ներկայում առաջատար թիմերը այն բարձրացրել են մինչև 70–80%։

Այս համատեքստում CLEVI-ն ընդգծել է, որ այդ արդյունքի տեխնիկական առումով ամենաուշագրավ մասն այն է, որ ընդհանրապես չի օգտագործվել արտաքին LLM API, ինչպիսիք են GPT-ը, Claude-ը և Gemini-ն։ CLEVI-ի առանձնահատկությունն այն է, որ օգտագործվել են from scratch ինքնուրույն մշակված երկու մոդել։

cip-5.5-agent-ը գործակալային AI մոդել է, որը բարդ առաջադրանքներն ինքնուրույն պլանավորող (planning), կատարող (execution) և ստուգող (verification) գործակալային խողովակաշարի առանցքային ուղեղն է։ cip-5.5-mm-ը բարձր արդյունավետությամբ, ընդհանուր նշանակության մուլտիմոդալ մոդել է, որը հասկանում և վերլուծում է տարբեր ֆայլերի ձևաչափեր, այդ թվում՝ ձայն, պատկեր և տեսանյութ։ Քանի որ GAIA-ի առաջադրանքների զգալի մասը ներառում է ոչ տեքստային մուտքեր՝ PDF, պատկերներ, աուդիոֆայլեր և այլն, այս մուլտիմոդալ կարողությունը բարձր միավորի հիմնական գործոնն է դարձել։

CLEVI-ն այս երկու սեփական մոդելների հիման վրա GAIA-ում ներկայացրել է 5 տարբեր գործակալային կազմաձև, և բոլորն էլ ստացել են 70 և ավելի միավոր։

Ընկերության ներկայացմամբ՝ CLEVI-ի ներքին հետվերլուծության ընթացքում հետաքրքիր արդյունք է արձանագրվել։ Ընդհանուր 301 առաջադրանքներից մի քանիսի համար ներկայում բաց համացանցում ճիշտ պատասխանը հիմնավորող տեղեկությունն այլևս հասանելի չէ։ Խոսքը այն դեպքերի մասին է, երբ նախկինում առցանց կամ որոնման համակարգերի միջոցով հասանելի տեղեկությունը ջնջվել կամ փոփոխվել է և այլևս հասանելի չէ։ Երբ վերագնահատումն իրականացվել է ներկայում մարդկանց համար հրապարակայնորեն ստուգելի տեղեկությունների շրջանակում, CLEVI-ի ճիշտ պատասխանների տոկոսը կազմել է ավելի քան 98%։ Սա արդեն գերազանցում է մարդկանց միջին ցուցանիշը՝ 92%-ը։

CLEVI-ի ներկայացուցիչը պարզաբանել է. «CLEVI-ն, առանց արտաքին մոդելների համակցման, միայն from scratch սեփական մոդելներով և սեփական AI գործակալային լուծումներով, գրանցել է 70+ արդյունք բոլոր 5 գործակալներով և հանրային բենչմարքում մտել է լավագույն 2.5%-ի մեջ։ Ակնկալվում է, որ ապագայում սեփական մոդելների և գործակալային լուծումների կատարելագործման միջոցով պաշտոնական միավորը նույնպես հնարավոր կլինի լրացուցիչ բարձրացնել։ Այս ձեռքբերումը նշանակալի է նրանով, որ գլոբալ հանրային բենչմարքում գործնականորեն չափված՝ այն ցույց է տալիս «ստուգված վստահելիություն», որ այն 국내 AI մշակողի from scratch սեփական մոդելի վրա հիմնված արդյունք է, որ այն արտաքին մոդելների համակցման փոխարեն անկախ մոդելային ստեկի արդյունք է, և որ, հաշվի առնելով որոշ առաջադրանքների վերաբերյալ տեղեկությունների կորուստը, այն ունի միավորից ավելին ընդգրկող մեկնաբանման արժեք»։

Վերադառնալ նորությունների բաժին
CLEVI

Լեզու և տարածաշրջան

Մեքենայական թարգմանությամբ լեզուները նշված են։ Հասանելիությունը համապատասխանում է հրապարակված կայքի փաթեթին։

136 լեզու

Առաջարկվում է

1

Արևելյան Ասիա

7

Հարավարևելյան Ասիա

11

Հարավային Ասիա

18

Կենտրոնական Ասիա

5

Մերձավոր Արևելք և Կովկաս

10

Արևմտյան Եվրոպա և Հարավային Եվրոպա

16

Միացյալ Թագավորություն և Իռլանդիա

4

Հյուսիսային Եվրոպա

10

Կենտրոնական Եվրոպա և Բալկաններ

14

Արևելյան Եվրոպա

5

Արևելյան Աֆրիկա

8

Արևմտյան Աֆրիկա և Կենտրոնական Աֆրիկա

9

Հարավային Աֆրիկա

8

Ամերիկա

5

Օվկիանիա

5
CLEVI, from scratch սեփական մոդելով GAIA-ում 79.07%... 3,090 մոդելների շարքում լավագույն 2.5%-ում — CLEVI