Навіны

Канкурэнтаздольнасць, пацверджаная данымі — айчынны AI-агент дасягнуў верхніх 2,5% у GAIA Bench

Калі бенчмарк GAIA быў упершыню апублікаваны, нават GPT-4, які на той момант лічыўся мадэллю найвышэйшага ўзроўню, набраў каля 30%. Гэта азначала, што з улікам асаблівасцяў GAIA, якая патрабуе не толькі простых адказаў на запыты, але і складанага разважання, выкарыстання інструментаў ды шматэтапнага вырашэння задач, тагачасны AI яшчэ знаходзіўся на ранняй стадыі ў здольнасці «думаць і дзейнічаць»…

Значэнне балаў GAIA — наколькі развіліся AI-агенты

Калі бенчмарк GAIA быў упершыню апублікаваны, нават GPT-4, які на той момант лічыўся мадэллю найвышэйшага ўзроўню, набраў каля 30%. Гэта азначала, што з улікам асаблівасцяў GAIA, якая патрабуе не толькі простых адказаў на запыты, але і складанага разважання, выкарыстання інструментаў ды шматэтапнага вырашэння задач, тагачасны AI яшчэ знаходзіўся на ранняй стадыі ў здольнасці «думаць і дзейнічаць».

Аднак сёння агенты, якія ўваходзяць у лік лідараў, дасягнулі 92,36%.

Гэтая змена — не проста павышэнне прадукцыйнасці. Цяпер AI выйшаў за межы адказаў на пытанні і перайшоў на этап «Agentic AI», калі ён інтэрпрэтуе сітуацыю, выбірае неабходныя інструменты, а таксама самастойна плануе і выконвае некалькі этапаў.

Усяго за некалькі гадоў AI эвалюцыянаваў з «інструмента для стварэння ведаў» у «суб’ект, які выконвае працоўныя задачы».

Выява ў асноўным тэксце

📌 І сярод гэтых верхніх 2,5% ёсць Clevi

У такім глабальным канкурэнтным асяроддзі тое, што агент Clevi, створаны ў Карэі, увайшоў у верхнія 2,5% рэйтынгу GAIA, пацвердзіла тэхналагічную самастойнасць і стала прыкладам таго, што AI-агент, створаны ў Карэі, адпавядае сусветным стандартам. Гэта мае значэнне, якое выходзіць за межы простай лічбы. Гэта азначае, што тэхналагічныя магчымасці былі аб’ектыўна пацверджаны праз канкурэнцыю з тысячамі мадэляў у глабальным адкрытым бенчмарку, а не ў асяроддзі асобнай дэманстрацыі.

Яшчэ больш важна тое, што гэты вынік не з’яўляецца выпадковым дасягненнем адной мадэлі: агенты з рознымі канструкцыямі на аснове аднаго і таго ж Agent Stack неаднаразова дэманстравалі вынікі сярод лідараў.

Іншымі словамі, тэхналогія Clevi — гэта не «аднаразова атрыманы добры вынік», а прайграваная структурная канкурэнтаздольнасць і магчымасці на ўзроўні платформы, якія можна пашыраць на розныя галіны і сцэнарыі.

Выява ў асноўным тэксце

Тады што азначае гэты паказчык?

Для карыстальніка найбольшай перашкодай пры ўкараненні AI з’яўляецца пытанне: «Ці сапраўды можна яму даверыцца і даручыць працу?»

Прадукцыйнасць, не на аснове эфектных дэманстрацый або ўласных прэзентацый кампаніі, а неаднаразова пацверджаная на сцэне глабальнага адкрытага рэйтынгу — пляцоўцы трэцяга боку, — з'яўляецца найбольш аб'ектыўным адказам на гэтае пытанне. Канкрэтна гэта мае значэнне ў трох аспектах.

Па-першае, зніжэнне рызык укаранення

Падключэнне неправеранага AI да ўнутраных працэсаў з'яўляецца значным цяжарам для прадпрыемства.

Вынікі ў аўтарытэтных бенчмарках, такіх як GAIA, могуць непасрэдна выкарыстоўвацца як падстава для даверу на этапе тэхнічнай ацэнкі.

Па-другое, рэалізацыя аўтаматызацыі складаных працэсаў

Паказчык у 2,5% лепшых азначае ўзровень інтэлекту, які выходзіць за межы простых паўтаральных задач: разуменне кантэксту, самастойнае прыняцце рашэнняў на некалькіх этапах і выкананне задачы да канца.

Сферы працы, якія да гэтага часу лічыліся «складанымі для перадачы AI», могуць стаць рэальнымі аб'ектамі аўтаматызацыі.

Па-трэцяе, адначасовае забеспячэнне бяспекі даных і прадукцыйнасці

Уласная архітэктура Agent Stack азначае, што паток даных не выходзіць за межы сістэмы.

Гэта дазваляе пазбавіцца ад ранейшай дылемы, калі для выкарыстання высокапрадукцыйнага AI даводзілася ісці на кампраміс з бяспекай.

Асабліва ў галінах з высокай адчувальнасцю даных, такіх як фінансы, медыцына і права, гэтая архітэктура становіцца вырашальнай перавагай.

Магчымасць узнаўлення гэтай архітэктуры ўжо пачынае пацвярджацца.

А вынікі работы кожнага агента, створанага на гэтай аснове, неўзабаве прывядуць да рэальных змен на практыцы.

"У рэшце рэшт, дасканаласць тэхналогіі завяршаецца «ўпэўненасцю» на практыцы."

Клеві не абмяжоўваецца прадастаўленнем высокапрадукцыйнага AI. Наша сутнасць — разбурыць сцены бяспекі, з якімі сутыкаюцца прадпрыемствы, і стварыць «інфраструктуру выканання», здольную сапраўды даводзіць складаныя працоўныя задачы да канца.

Цяпер выйдзіце за межы этапу разважанняў пра ўкараненне і разам з Клеві пачніце ствараць бяспечнае і магутнае працоўнае асяроддзе на базе AI.

Як надзейны партнёр, якому можна даверыць працу, мы разам з вамі будзем ствараць рэальныя інавацыі ў вашым бізнес-асяроддзі.

Назад у прэс-цэнтр
CLEVI

Мова і рэгіён

Пазначаны мовы, перакладзеныя машынай. Даступнасць адпавядае апублікаванаму набору сайта.

136 моў

Рэкамендуецца

1

Усходняя Азія

7

Паўднёва-Усходняя Азія

11

Паўднёвая Азія

18

Цэнтральная Азія

5

Блізкі Усход і Каўказ

10

Заходняя Еўропа і Паўднёвая Еўропа

16

Вялікабрытанія і Ірландыя

4

Паўночная Еўропа

10

Цэнтральная Еўропа і Балканы

14

Усходняя Еўропа

5

Усходняя Афрыка

8

Заходняя Афрыка і Сярэдняя Афрыка

9

Паўднёвая Афрыка

8

Паўночная і Паўднёвая Амерыкі

5

Акіянія

5