Навіны

Клеві, з уласнай мадэллю, распрацаванай from scratch, дасягнула 79,07% у GAIA... уваходзіць у топ-2,5% сярод 3 090 мадэляў

Крыніца: журналіст электроннай газеты Electronic Times Лі Вонджы

Крыніца: журналіст электроннай газеты Electronic Times Лі Вонджы

Поўная цытата артыкула «Клеві, з уласнай мадэллю, распрацаванай from scratch, дасягнула 79,07% у GAIA... уваходзіць у топ-2,5% сярод 3 090 мадэляў»

Дата публікацыі: 2026-04-07

Спасылка: https://www.etnews.com/20260407000203

Уласны стэк мадэляў cip-5.5-agent·cip-5.5-mm: усе 5 агентаў набралі больш за 70 балаў

З улікам страты інфармацыі дакладнасць адказаў складае больш за 98%, што перавышае паказчык людзей (92%)

Выява ў асноўным тэксце

AI-стартап «Клеві» выкарыстаў уласную мадэль, распрацаваную from scratch, і дасягнуў дакладнасці адказаў 79,07% у глабальным бенчмарку AI-агентаў «GAIA», замацаваўшыся ў межах топ-2,5% сярод 3 090 зарэгістраваных мадэляў.

Паводле тлумачэнняў прадстаўнікоў галіны, на рынку AI-бенчмаркаў GAIA лічыцца паказчыкам, які дакладна адлюстроўвае здольнасці «практычных AI-агентаў». Гэты бенчмарк, сумесна распрацаваны Meta AI, HuggingFace і ўніверсітэтам Парыж-Сакле, упершыню быў апублікаваны ў лістападзе 2023 года.

GAIA адрозніваецца ад іншых бенчмаркаў трыма ключавымі асаблівасцямі. Па-першае, паколькі правільныя адказы не раскрываюцца, перанавучанне немагчымае. Па-другое, заданні патрабуюць шматкрокавага і мультымадальнага комплекснага разважання, таму высокі бал немагчыма атрымаць простым супастаўленнем шаблонаў. Па-трэцяе, праз афіцыйную табліцу лідараў HuggingFace больш за 3 090 мадэляў з усяго свету спаборнічаюць на аднолькавых умовах.

Тэставы набор складаецца ўсяго з 301 пытання. Level 1 уключае выкарыстанне аднаго інструмента і простае разважанне, Level 2 — камбінаванне некалькіх інструментаў і разважанне сярэдняй складанасці, а Level 3 — заданні найвышэйшай складанасці, якія патрабуюць планавання і выканання агентам пяці і больш крокаў. На момант прэзентацыі бенчмарку паказчык мадэляў GPT (з убудаванымі плагінамі) складаў каля 15%, а цяпер каманды-лідэры паднялі яго да 70–80%.

Сярод гэтага Клеві падкрэсліла, што тэхнічна найбольш увагі ў гэтым дасягненні заслугоўвае той факт, што кампанія наогул не выкарыстоўвала знешнія API LLM, такія як GPT, Claude і Gemini. Асаблівасцю стала выкарыстанне дзвюх уласных мадэляў, распрацаваных Клеві самастойна from scratch.

cip-5.5-agent — гэта агентная мадэль ШІ, якая выконвае ролю асноўнага мозгу агентнага канвеера, што аўтаномна плануе (planning), выконвае (execution) і правярае (verification) складаныя задачы. cip-5.5-mm — гэта высокапрадукцыйная ўніверсальная мультымадальная мадэль, здольная разумець і аналізаваць розныя фарматы файлаў, у тым ліку аўдыё, выявы і відэа. Паколькі значная частка заданняў GAIA уключае нетэкставыя ўводныя дадзеныя, такія як PDF-файлы, выявы і аўдыяфайлы, гэтая мультымадальная здольнасць стала ключавым фактарам высокага выніку.

Клеві на аснове гэтых дзвюх уласных мадэляў выставіла ў GAIA 5 розных канфігурацый агентаў, і ўсе яны набралі больш за 70 балаў.

Згодна з тлумачэннямі кампаніі, падчас унутранага постаналізу Клеві былі выяўлены цікавыя вынікі. Сярод 301 задання некаторыя цяпер страцілі падставы для праверкі правільных адказаў у адкрытым Інтэрнэце. Гэта выпадкі, калі інфармацыя, якую раней можна было знайсці анлайн або праз пошукавыя сістэмы, была выдалена ці зменена і больш недаступная. Пры паўторнай ацэнцы ў межах інфармацыі, даступнай для публічнай праверкі людзьмі на дадзены момант, дакладнасць адказаў Клеві склала больш за 98%. Гэта ўжо перавышае сярэдні чалавечы паказчык, які складае 92%.

Прадстаўнік Клеві патлумачыў: «Клеві без змешвання знешніх мадэляў, выкарыстоўваючы толькі ўласныя мадэлі і ўласныя рашэнні для ШІ-агентаў, распрацаваныя from scratch, дамаглася выніку 70+ для ўсіх 5 агентаў і ўвайшла ў верхнія 2,5% адкрытага бенчмарку. Чакаецца, што дзякуючы далейшаму ўдасканаленню ўласных мадэляў і агентных рашэнняў афіцыйны вынік таксама можна будзе дадаткова павысіць. Гэтае дасягненне мае вялікае значэнне, бо паказвае „правераны давер“, пацверджаны рэальнымі вымярэннямі ў глабальным адкрытым бенчмарку; з’яўляецца вынікам айчыннай кампаніі па распрацоўцы ШІ на аснове ўласных мадэляў from scratch; дэманструе вынік незалежнага стэка мадэляў, а не сумесі знешніх мадэляў; а таксама мае значную інтэрпрэтацыйную каштоўнасць, якая перавышае сам бал, з улікам страты інфармацыі па некаторых заданнях».

Назад у прэс-цэнтр
CLEVI

Мова і рэгіён

Пазначаны мовы, перакладзеныя машынай. Даступнасць адпавядае апублікаванаму набору сайта.

136 моў

Рэкамендуецца

1

Усходняя Азія

7

Паўднёва-Усходняя Азія

11

Паўднёвая Азія

18

Цэнтральная Азія

5

Блізкі Усход і Каўказ

10

Заходняя Еўропа і Паўднёвая Еўропа

16

Вялікабрытанія і Ірландыя

4

Паўночная Еўропа

10

Цэнтральная Еўропа і Балканы

14

Усходняя Еўропа

5

Усходняя Афрыка

8

Заходняя Афрыка і Сярэдняя Афрыка

9

Паўднёвая Афрыка

8

Паўночная і Паўднёвая Амерыкі

5

Акіянія

5
Клеві, з уласнай мадэллю, распрацаванай from scratch, дасягнула 79,07% у GAIA... уваходзіць у топ-2,5% сярод 3 090 мадэляў — CLEVI