Çavkanî: Rojnameya Elektronîk, rojnamevan Lee Won-ji
Jêgirtina tevahiya gotara “CLEVI, bi modela xwe ya ji sifirê ve 79.07% li GAIA... di nav 3,090 modelan de di nav 2.5%a jorîn de”
Dîroka weşandinê: 2026-04-07
Girêdan: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm, stack-a modelên xwemalî û 5 ajokerên modelê, hemû ji 70 puanan zêdetir
Bi hesibandina windabûna agahiyê, rêjeya bersivên rast 98%+, ji mirovan (92%) jî zêdetir
Startapa AI ya 'CLEVI' bi karanîna modela xwe ya ji sifirê ve, di benchmarka ajokerên AI yên global 'GAIA' de rêjeya bersivên rast 79.07% tomar kir û li gorî 3,090 modelên qeydkirî yên giştî, di nav 2.5%a jorîn de cih girt.
Li gorî ravekirina pîşesaziyê, di bazara benchmarkên AI de GAIA wekî ku kapasîteya 'ajokerên AI yên pratîk' bi awayekî rast nîşan dide tê nirxandin. Ev benchmark, ku ji aliyê Meta AI, HuggingFace û Zanîngeha Paris-Saclay ve bi hev re hatiye pêşxistin, cara yekem di Mijdara 2023an de hate eşkerekirin.
Taybetmendiya bingehîn a GAIA ku wê ji benchmarkên din cuda dike sê tişt in. Yekem, ji ber ku bersivên rast nepenî ne, overfitting ne gengaz e. Duyem, ji ber ku ew pêdiviya suyêkirina tevlihev a multistep û multimodal dike, bi tenê pattern matchingê gihiştina puanên bilind ne gengaz e. Sêyem, bi rêya leaderboarda fermî ya Hugging Face, zêdetirî 3,090 modelên ji seranserê cîhanê di heman şertan de pêşbaziyê dikin.
Seta testê ji tevahî 301 pirsan pêk tê. Level 1 bikaranîna amûrekê û suyêkirina hêsan, Level 2 tevlihevkirina gelek amûran û suyêkirina asta navîn, û Level 3 pirsên bi asta herî bilind in ku plan û pêkanîna ajokerê ya ji 5 gavên zêdetir pêwîst dikin. Dema ku benchmark hate ragihandin, li gorî modelên GPT (bi plug-in ve girêdayî) ew tenê nêzîkî 15% bû, lê niha tîmên pêşeng ew gihandine asta 70-80%.
Di nav van de, CLEVI tekez kir ku di vê serkeftinê de aliyê teknîkî yê herî balkêş ev e ku tu API-yên LLM-ên derveyî yên wekî GPT, Claude û Gemini bi tevahî nehatiye bikaranîn. Taybetmendiya CLEVI ew e ku du modelên ku bi awayekî xweser bi rêbaza ji sifirê ve hatine pêşxistin, hatine bikaranîn.
cip-5.5-agent مۆدێلێکی زیرەکی دەستەییە وەک مێشکی سەرەکیی پایپڵاینی ئەجێنتێک کار دەکات کە ئەرکە ئاڵۆزەکان بە شێوەیەکی سەربەخۆ پلاندانان (planning)، جێبەجێکردن (execution) و پشتڕاستکردنەوە (verification) دەکات. cip-5.5-mm مۆدێلێکی بەرزی گشتیی چەند-مۆدێلە کە فۆرماتە جۆراوجۆرەکانی فایل، وەک دەنگ، وێنە و ڤیدیۆ، تێدەگات و لێکدانەوەیان بۆ دەکات. چونکە بەشێکی زۆری پرسیارەکانی GAIA تێکستی نەن، وەک فایلەکانی PDF، وێنە و دەنگ، ئەم توانایە چەند-مۆدێلەیە بووە هۆکاری سەرەکیی بەدەستهێنانی نمرەی بەرز.
کلێڤی بە پشتبەستن بەو دوو مۆدێلە خۆییە، 5 پێکهاتەی جیاوازی ئەجێنتی لە GAIA بەشدار کرد و هەموویان نمرەی 70 و زیاتر بەدەستهێنا.
بەپێی ڕوونکردنەوەی لایەنی کۆمپانیاکە، لە پێداچوونەوەی دوایین ناوخۆی کلێڤی ئەنجامێکی سەرنجڕاکێش پشتڕاست کرایەوە. لە کۆی 301 پرسیارەکەدا، بنەمای وەڵامی هەندێکیان لە وێبی گشتیی ئێستادا ون بووبوو. ئەمەش ئەو حاڵەتەیە کە زانیارییەکانی پێشتر لەسەر ئینتەرنێت یان بزوێنەری گەڕان بەردەست بوون، بەڵام سڕدرابوونەوە یان گۆڕدرابوون و چیتر دەستپێگەیشتن پێیان نەدەکرا. کاتێک لە سنووری ئەو زانیارییەی مرۆڤ لە ئاشکرادا دەتوانێت پشتڕاستی بکاتەوە هەڵسەنگاندنەوەیەکی نوێ کرایەوە، ڕێژەی وەڵامی ڕاستی کلێڤی زیاتر لە 98% بوو. ئەمە ژمارەیەکە کە پێشتر لە ناوەندی مرۆڤایەتی، کە 92%ە، تێپەڕیوە.
بەرپرسیارێکی کلێڤی ڕوونی کردەوە: «کلێڤی بەبێ تێکەڵکردنی مۆدێلە دەرەکییەکان، تەنها بە مۆدێلە خۆییەکانی from scratch و چارەسەرەکانی AIی ئەجێنتی خۆی، هەموو 5 ئەجێنتەکەی بە نمرەی 70+ تۆمار کرد و لە بنچینەی ئاشکراشکراودا چووە ناو 2.5%ی سەرەوە. پێدەچێت لە داهاتوودا بە باشترکردنی مۆدێلە خۆییەکان و چارەسەرەکانی ئەجێنتی، نمرەی فەرمی زیاتر بەرز بکرێتەوە. ئەم دەستکەوتە گرنگییەکی قووڵی هەیە، چونکە لە بنچینەی جیهانیی ئاشکراشکراودا بە شێوەیەکی پێوانەکراو پشتڕاستی کراوەتەوە و «متمانەی پشتڕاستکراو» پیشان دەدات؛ دەستکەوتێکە کە لەلایەن کۆمپانیایەکی پەرەپێدەری AIی ناوخۆییەوە و بە پشتبەستن بە مۆدێلی خۆیی from scratch بەدەستهاتووە؛ ئەنجامی ستاکی مۆدێلی سەربەخۆیە، نەک تێکەڵکردنی مۆدێلە دەرەکییەکان؛ و بەهۆی لەدەستچوونی زانیاریی هەندێک پرسیارەوە، لە نمرەکەی خۆی زیاتر بایەخی لێکدانەوەی هەیە».
