Дереккөз: «Электрондық газет», журналист Ли Вонджи
«CLEVI, from scratch әзірленген жеке моделімен GAIA-да 79.07%... 3 090 модельдің ішіндегі үздік 2,5%» мақаласының толық мәтінінен үзінді
Жарияланған күні: 2026-04-07
Сілтеме: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm жеке модельдер стегіндегі 5 агенттің барлығы 70-тен жоғары нәтиже көрсетті
Ақпараттың жоғалуын ескергенде, дәлдік 98%+, адам көрсеткішінен (92%) жоғары
AI стартапы «CLEVI» from scratch әзірленген жеке моделін пайдаланып, жаһандық AI агенттері бенчмаркі «GAIA»-да 79.07% дәлдік көрсетті және тіркелген 3 090 модельдің ішінде үздік 2,5%-ға кірді.
Сала мамандарының түсіндіруінше, AI бенчмарктері нарығында GAIA «практикалық AI агенттерінің» қабілетін шынайы көрсететін бенчмарк ретінде бағаланады. Meta AI, HuggingFace және Париж-Сакле университеті бірлесіп әзірлеген бұл бенчмарк алғаш рет 2023 жылғы қарашада таныстырылды.
GAIA-ны басқа бенчмарктерден ерекшелендіретін үш негізгі фактор бар. Біріншіден, дұрыс жауаптар ашық жарияланбайды, сондықтан артық бейімделу мүмкін емес. Екіншіден, көп қадамды және мультимодалды кешенді пайымдауды талап ететіндіктен, қарапайым үлгі сәйкестігі арқылы жоғары балл жинау мүмкін емес. Үшіншіден, HuggingFace ресми көшбасшылар тақтасы арқылы әлем бойынша 3 090-нан астам модель бірдей шарттарда бәсекелеседі.
Тест жиынтығы барлығы 301 сұрақтан тұрады. Level 1 деңгейінде бір құралды пайдалану және қарапайым пайымдау, Level 2 деңгейінде бірнеше құралды біріктіру және орташа деңгейдегі пайымдау, ал Level 3 деңгейінде 5 немесе одан көп қадамнан тұратын агенттік жоспарлау мен орындауды талап ететін ең күрделі сұрақтар қамтылған. Бенчмарк таныстырылған кезде GPT модельдері (плагиндермен жабдықталған) шамамен 15% нәтиже көрсеткен, ал қазір алдыңғы қатардағы командалар бұл көрсеткішті 70–80%-ға дейін көтерді.
Осы жетістікке қатысты CLEVI техникалық тұрғыдан ең назар аударарлық жайт — GPT, Claude, Gemini сияқты сыртқы LLM API интерфейстерінің мүлде пайдаланылмағанын атап өтті. CLEVI from scratch тәсілімен өз бетінше әзірлеген екі модельді пайдаланғанымен ерекшеленеді.
cip-5.5-agent — күрделі тапсырмаларды автономды түрде жоспарлайтын (planning), орындайтын (execution) және тексеретін (verification) агенттік AI модель, ол агенттер құбырының негізгі миы рөлін атқарады. cip-5.5-mm — аудио, кескін, бейне сияқты әртүрлі файл пішімдерін түсініп, пайымдайтын жоғары өнімді әмбебап мультимодальды модель. GAIA тапсырмаларының едәуір бөлігі PDF, кескін және аудио файлдары сияқты мәтіндік емес кіріс деректерін қамтитындықтан, бұл мультимодальды қабілет жоғары ұпай жинаудың негізгі факторына айналды.
CLEVI осы екі жеке моделінің негізінде GAIA байқауына 5 түрлі агент конфигурациясымен қатысып, олардың барлығы 70-тен жоғары ұпай жинады.
Компанияның түсіндіруінше, CLEVI ішкі кейінгі тексеру барысында қызықты нәтиже анықталды. Барлығы 301 тапсырманың кейбіріне қатысты дұрыс жауаптың дәлелі қазіргі таңда ашық вебте жоғалған. Бұрын интернетте немесе іздеу жүйелерінде қолжетімді болған ақпарат өшірілген не өзгертілгендіктен, оған енді қол жеткізу мүмкін емес жағдайлар кездеседі. Қазіргі таңда адамдар ашық түрде тексере алатын ақпарат көлемі негізінде қайта бағалағанда, CLEVI дәлдігінің 98%-дан жоғары болғаны анықталды. Бұл адамзаттың орташа көрсеткіші — 92%-дан әлдеқайда жоғары.
CLEVI өкілі: «CLEVI сыртқы модельдерді араластырмай, нөлден жасалған жеке модельдері мен жеке AI агент шешімдерінің көмегімен 5 агентінің барлығы 70+ ұпай жинап, ашық бенчмаркте үздік 2,5%-ға кірді. Алдағы уақытта жеке модельдер мен агент шешімдерін жетілдіру арқылы ресми ұпайды да қосымша арттыруға болады деп санаймыз. Бұл жетістіктің мәні — оның жаһандық ашық бенчмаркте нақты өлшеніп, “расталған сенімді” көрсетуінде; отандық AI әзірлеушісінің нөлден жасалған жеке модельдерге негізделген нәтижесі болуында; сыртқы модельдерді араластыру емес, дербес модельдер стегінің нәтижесі болуында; сондай-ақ кейбір тапсырмалар бойынша ақпараттың жоғалғанын ескерсек, оның ұпайдан да жоғары түсіндірмелік құндылығы бар», — деп түсіндірді.
