Навіны

Стартап у сферы ШІ Clevi ўвайшоў у топ-2,5% GAIA… прадэманстраваў пацверджаную аўтарытэтнасць

Крыніца: Digital Times, рэпарцёр Ку Бонгю

Крыніца: Digital Times, рэпарцёр Ку Бонгю

Цытаванне поўнага тэксту артыкула «Стартап у сферы ШІ Clevi ўвайшоў у топ-2,5% GAIA… прадэманстраваў пацверджаную аўтарытэтнасць»

Дата публікацыі: 2026-04-08

Спасылка : https://n.news.naver.com/article/029/0003020511?sid=105

Карэйскі стартап у сферы ШІ «Clevi (Clevi)» паведаміў, што, стварыўшы ўласную мадэль і ўласнае агентнае рашэнне from scratch, упершыню ў Карэі ўвайшоў у топ-2,5% паводле бенчмарку GAIA сярод усіх 3 090 зарэгістраваных мадэляў.

Паводле тлумачэнняў галіновых экспертаў, GAIA, распрацаваная Meta AI і кіраваная Hugging Face, правярае ў ШІ не «здольнасць добра выконваць толькі адну задачу», а «здольнасць камбінаваць некалькі навыкаў для вырашэння рэальных праблем». Неабходна знайсці інфармацыю ў інтэрнэце, прачытаць табліцу ў PDF, прааналізаваць выяву, запусціць код для вылічэнняў і абагульніць вынікі, каб выдаць адзін правільны адказ. Структура з 301 закрытым пытаннем, трыма ўзроўнямі складанасці і прынцыпам нераскрыцця адказаў робіць немагчымымі як пераабучэнне, так і чытэрства.

Каб атрымаць высокі бал на гэтым экзамене, патрэбны дзве рэчы. Па-першае, здольнасць да разважанняў базавай моўнай мадэлі, а па-другое, агентнае рашэнне, якое злучае гэтую мадэль з інструментамі рэальнага свету і дазваляе ёй аўтаномна выконваць задачы. Якой бы добрай ні была мадэль, калі агент слабы, ён не зможа вырашаць задачы ўзроўню 3; і якой бы дасканалай ні была агентная сістэма, калі мадэлі не хапае здольнасці да разважанняў, памылковы адказ будзе распаўсюджвацца ўжо на прамежкавым этапе.

Калі паглядзець на бягучую структуру табліцы лідараў GAIA, можна заўважыць цікавы заканамерны малюнак. Большасць агентаў, якія займаюць верхнія пазіцыі, выкарыстоўваюць стратэгію «міксавання некалькіх мадэляў», камбінуючы розныя буйныя тэхналагічныя мадэлі, такія як GPT, Claude і Gemini. Гэта рацыянальны падыход, які аб'ядноўвае моцныя бакі кожнай мадэлі і абараняе ад зніжэння балаў з-за страты інфармацыі і іншых прычын.

Аднак Clevi не далучылася да гэтага шэрагу. Распрацаваная from scratch мадэль cip-5.5-agent (агентычны ШІ) аўтаномна плануе, выконвае і правярае складаныя задачы, а cip-5.5-mm (высокапрадукцыйная ўніверсальная мультымадальная мадэль) разумее і аналізуе розныя фарматы файлаў, у тым ліку аўдыё, выявы і відэа. Абедзве мадэлі былі незалежна распрацаваныя ўнутры Clevi, і знешнія LLM API зусім не выкарыстоўваліся.

І з гэтым уласным стэкам мадэляў выставілі 5 агентаў на GAIA, і ўсе яны набралі больш за 70 балаў. Ад найвышэйшага выніку 79,07% да 70,76% — гэта даказала стабільнасць усяго стэка, а не выпадковую ўдачу аднаго выніку.

Выява ў асноўным тэксце

Паводле тлумачэння кампаніі, за афіцыйным паказчыкам 79,07% стаіць яшчэ адна лічба. У выніку ўнутранага паслятэставага аналізу Clevi было выяўлена, што для значнай колькасці з 301 пытання ў цяперашнім адкрытым вэбе зніклі падставы для правільных адказаў. Пры паўторнай ацэнцы толькі пытанняў, адказы на якія па-ранейшаму можна пацвердзіць у вэбе, дакладнасць Clevi склала больш за 98%. Гэта ўжо вышэй за сярэдні чалавечы паказчык (92%).

Вядома, калі б былі аб’яднаныя магутныя ўніверсальныя мадэлі іншых кампаній, афіцыйны вынік можна было б яшчэ павысіць. Аднак Clevi свядома не абрала такую стратэгію. Мэтай гэтага бенчмарку было не спаборніцтва за найвышэйшы бал, а праверка таго, ці дасягнула ўласная мадэль, створаная from scratch, узроўню, на якім яна можа канкурыраваць на сусветнай арэне.

Тое, што імя з’яўляецца ў табліцы лідараў GAIA, мае вялікае значэнне, бо сведчыць аб пацверджанай рэпутацыі, атрыманай у выніку незалежнай ацэнкі трэцяга боку. Гэта аб’ектыўная падстава, якую можна выкарыстоўваць на ўсіх этапах — ад прыцягнення інвестыцый і выхаду на замежныя рынкі да B2B-продажаў.

Прадстаўнік Clevi заявіў: «З 63 афіцыйна памылковых адказаў значная частка ўзнікла праз неадпаведнасць фармату вываду, памылкі ў інтэрпрэтацыі візуальных матэрыялаў, а таксама пытанні, на якія немагчыма было адказаць з-за страты інфармацыі. Гэта праблема дакладнасці постапрацоўкі і даступнасці знешняй інфармацыі, а не фундаментальнае абмежаванне лагічнага разважання. Паколькі гэта ўласная мадэль, Clevi можа самастойна яе ўдасканальваць. У гэтым і заключаецца структурная перавага ўласнай мадэлі, створанай from scratch. Дасягненне Clevi на гэты раз задае карэйскай індустрыі AI пытанне: “Як доўга мы будзем залежаць ад «пазычаных мазгоў»?” Clevi абрала больш складаны шлях from scratch і імкнецца даказаць гэты адказ на сусветнай арэне», — дадаў ён.

Назад у прэс-цэнтр
CLEVI

Мова і рэгіён

Пазначаны мовы, перакладзеныя машынай. Даступнасць адпавядае апублікаванаму набору сайта.

136 моў

Рэкамендуецца

1

Усходняя Азія

7

Паўднёва-Усходняя Азія

11

Паўднёвая Азія

18

Цэнтральная Азія

5

Блізкі Усход і Каўказ

10

Заходняя Еўропа і Паўднёвая Еўропа

16

Вялікабрытанія і Ірландыя

4

Паўночная Еўропа

10

Цэнтральная Еўропа і Балканы

14

Усходняя Еўропа

5

Усходняя Афрыка

8

Заходняя Афрыка і Сярэдняя Афрыка

9

Паўднёвая Афрыка

8

Паўночная і Паўднёвая Амерыкі

5

Акіянія

5