Булак: «Электрондук гезит», журналист Ли Вонжи
«CLEVI, from scratch өзүнүн модели менен GAIAда 79.07%...3,090 моделдин ичинен алдыңкы 2.5%» макаласынын толук тексти
Жарыяланган күнү: 2026-04-07
Шилтеме: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm өз алдынча модель стегиндеги 5 агенттин бардыгы 70тен жогору упай алды
Маалыматтын жоголушун эске алганда 98%+ туура жооптор, адамдардан (92%) жогору
AI стартапы «CLEVI» from scratch өзүнүн моделин колдонуп, глобалдык AI-агенттердин «GAIA» бенчмаркингинде 79.07% туура жооп көрсөткүчүнө жетишип, жалпы 3,090 катталган моделдин ичинен алдыңкы 2.5%га кирди.
Тармак өкүлдөрүнүн түшүндүрмөсүнө ылайык, AI бенчмаркинг рыногунда GAIA «практикалык AI агенттеринин» жөндөмдөрүн ишенимдүү чагылдырат деп бааланат. Meta AI, HuggingFace жана Париж-Сакле университети биргелешип иштеп чыккан бул бенчмарк биринчи жолу 2023-жылдын ноябрында жарыяланган.
GAIAны башка бенчмарктардан айырмалап турган үч негизги өзгөчөлүк бар. Биринчиден, туура жооптор купуя болгондуктан, ашыкча ылайыкташуу мүмкүн эмес. Экинчиден, көп кадамдуу жана мультимодалдуу комплекстүү ой жүгүртүүнү талап кылгандыктан, жөнөкөй үлгү дал келтирүү менен жогорку упай алуу мүмкүн эмес. Үчүнчүдөн, HuggingFace расмий лидерборду аркылуу дүйнө жүзүндөгү 3,090дан ашык модель бирдей шартта атаандашат.
Тесттик топ жалпы 301 суроодон турат. Level 1 бир куралды колдонууну жана жөнөкөй ой жүгүртүүнү, Level 2 бир нече куралды айкалыштырууну жана орто деңгээлдеги ой жүгүртүүнү, Level 3 болсо беш же андан көп баскычтуу агенттик пландоону жана аткарууну талап кылган эң жогорку татаалдыктагы суроолорду камтыйт. Бенчмарк жарыяланган учурда GPT моделдери (плагиндер менен жабдылган) боюнча көрсөткүч болжол менен 15% болгон, ал эми учурда алдыңкы командалар аны 70–80% деңгээлине чейин көтөрүштү.
Мунун ичинен CLEVI бул жетишкендиктеги техникалык жактан эң көңүл бурууга тийиш болгон жагдай GPT, Claude, Gemini сыяктуу тышкы LLM API'лери таптакыр колдонулбаганын баса белгиледи. CLEVIнин өзгөчөлүгү — from scratch ыкмасы менен өз алдынча иштеп чыккан эки моделди колдонгону.
cip-5.5-agent — агенттик AI модели болуп, татаал тапшырмаларды өз алдынча пландаган (planning), аткарган (execution) жана текшерген (verification) агенттик конвейердин негизги мээси катары кызмат кылат. cip-5.5-mm үн, сүрөт, видео сыяктуу ар түрдүү файл форматтарын түшүнүп, ой жүгүрткөн жогорку өндүрүмдүү универсалдуу мультимодалдык модель. GAIA тапшырмаларынын олуттуу бөлүгү PDF, сүрөт, аудио файлдары сыяктуу тексттик эмес киргизүүлөрдү камтыгандыктан, бул мультимодалдык мүмкүнчүлүк жогорку упайдын негизги фактору болду.
CLEVI бул эки өз моделинин негизинде GAIAга 5 түрдүү агент конфигурациясын катыштырып, алардын баары 70тен жогору упай алышты.
Компаниянын түшүндүрмөсүнө ылайык, CLEVIнин ички кийинки текшерүүсүндө кызыктуу жыйынтык аныкталды. Жалпы 301 тапшырманын айрымдарында учурда ачык интернетте туура жооптун далилдери жоголгон. Мурда онлайнда же издөө системаларында текшерүүгө мүмкүн болгон маалыматтар өчүрүлүп же өзгөртүлүп, эми жеткиликсиз болуп калган учурлар бар. Учурда адамдар ачык текшере алган маалыматтардын чегинде кайра баалаганда, CLEVIнин туура жооп берүү көрсөткүчү 98%дан жогору болду. Бул адамдын орточо көрсөткүчү болгон 92%дан мурунтан эле жогору.
CLEVI өкүлү мындай деп түшүндүрдү: “CLEVI тышкы моделдерди аралаштырбастан, from scratch өз моделдери жана өз AI агенттик чечимдери менен 5 агенттин баары 70+ упай алып, ачык бенчмарктын алдыңкы 2,5%ына кирди. Келечекте өз моделдерин жана агенттик чечимдерин өркүндөтүү аркылуу расмий упайды дагы жогорулатууга болот деп эсептейбиз. Бул жетишкендик глобалдык ачык бенчмарктын негизинде өлчөнүп, «текшерилген ишенимди» көрсөтүп турганы, ата мекендик AI иштеп чыгуучунун from scratch өз моделине негизделген натыйжасы болгону, тышкы моделдерди аралаштыруунун эмес, өз алдынча модель стегинин натыйжасы экени жана айрым тапшырмалардагы маалыматтын жоголушун эске алганда, упайдан да кеңири чечмелөө маанисине ээ экени жагынан маанилүү”.
