Вести

CLEVI, со сопствени модели развиени from scratch постигна 79.07% на GAIA... во топ 2,5% меѓу 3.090 модели

Извор: Електронски весник, новинар Ли Вонџи

Извор: Електронски весник, новинар Ли Вонџи

Целосен цитат од написот „CLEVI, со сопствени модели развиени from scratch постигна 79.07% на GAIA... во топ 2,5% меѓу 3.090 модели“

Датум на објавување: 2026-04-07

Линк: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm независен моделски стек, сите 5 агенти со резултат над 70 поени

Со оглед на загубата на информации, точност од 98%+, надминувајќи ги луѓето (92%)

Слика во главниот текст

AI стартапот „CLEVI“ постигна точност од 79.07% на глобалниот AI агентски бенчмарк „GAIA“ користејќи сопствени модели развиени from scratch, со што се пласираше во топ 2,5% според вкупно 3.090 регистрирани модели.

Според објаснувањата од индустријата, GAIA се оценува дека верно ги одразува способностите на „практичните AI агенти“ на пазарот на AI бенчмаркови. Овој бенчмарк, заеднички развиен од Meta AI, HuggingFace и Универзитетот Париз-Сакле, првпат беше објавен во ноември 2023 година.

Постојат три клучни карактеристики по кои GAIA се разликува од другите бенчмаркови. Прво, бидејќи точните одговори не се јавни, невозможно е преадаптирање. Второ, бидејќи бара сложено мултистепено и мултимодално расудување, не е можно да се постигне висок резултат само со едноставно препознавање на обрасци. Трето, повеќе од 3.090 модели од целиот свет се натпреваруваат под исти услови преку официјалната табела на HuggingFace.

Тест-сетот се состои од вкупно 301 прашање. Level 1 опфаќа користење на една алатка и едноставно расудување, Level 2 бара комбинирање повеќе алатки и расудување на средно ниво, а Level 3 опфаќа прашања со највисока тежина, кои бараат планирање и извршување од страна на агентот во пет или повеќе чекори. Во времето на објавувањето на бенчмаркот, резултатот беше околу 15% според GPT моделите (со додатоци), додека водечките тимови денес го зголемија на 70–80%.

Меѓутоа, CLEVI нагласи дека технички најзначајниот аспект на овој успех е тоа што воопшто не користел надворешни LLM API-ја, како GPT, Claude и Gemini. Карактеристично е што CLEVI користел два независно развиени модели создадени using from scratch пристап.

cip-5.5-agent е агентски AI-модел кој служи како клучен „мозок“ на агентската конвеерска линија што автономно планира (planning), извршува (execution) и проверува (verification) сложени задачи. cip-5.5-mm е високоперформансен општ мултимодален модел кој разбира и врши расудување со различни формати на датотеки, како што се гласовни, сликовни и видео-датотеки. Бидејќи значителен дел од прашањата во GAIA вклучуваат нетекстуални влезови, како што се PDF, слики и аудиодатотеки, оваа мултимодална способност беше клучен фактор за постигнување висок резултат.

CLEVI ги пријави овие два сопствени модели во GAIA во пет различни конфигурации на агенти, при што сите постигнаа резултат над 70.

Според објаснувањето на компанијата, во интерниот последователен преглед на CLEVI беа потврдени интересни резултати. Кај дел од вкупно 301 прашање, изворите за точните одговори во моментов веќе не се достапни на јавниот веб. Станува збор за случаи во кои информациите што порано можеле да се проверат онлајн или преку пребарувачите биле избришани или изменети и повеќе не можат да се пристапат. При повторна евалуација во рамките на информациите што луѓето можат јавно да ги проверат во моментов, точноста на CLEVI изнесувала над 98%. Тоа е резултат кој веќе го надминува човечкиот просек од 92%.

Претставник на CLEVI објасни: „CLEVI, без мешање на надворешни модели и користејќи ги само сопствените модели from scratch и сопствените AI-агентски решенија, со сите пет агенти постигна 70+ и влезе во топ 2,5% на јавниот бенчмарк. Се очекува официјалниот резултат дополнително да се подобри преку унапредување на сопствените модели и агентски решенија. Овој успех има големо значење бидејќи е реално измерен на глобален јавен бенчмарк и покажува „проверена доверливост“, претставува резултат на домашна AI-компанија за развој врз основа на сопствени модели from scratch, е постигнат со независен стек на модели наместо со мешање на надворешни модели и, имајќи го предвид губењето на информациите кај дел од прашањата, има поголема интерпретативна вредност од самиот резултат.“

Назад во редакцијата
CLEVI

Јазик и регион

Јазиците преведени машински се означени. Достапноста следи според објавениот пакет на сајтот.

136 јазици

Препорачано

1

Источна Азија

7

Југоисточна Азија

11

Јужна Азија

18

Централна Азија

5

Блискиот Исток и Кавказ

10

Западна Европа и Јужна Европа

16

Обединето Кралство и Ирска

4

Северна Европа

10

Централна Европа и Балканот

14

Источна Европа

5

Источна Африка

8

Западна Африка и Средна Африка

9

Јужна Африка

8

Америки

5

Океанија

5
CLEVI, со сопствени модели развиени from scratch постигна 79.07% на GAIA... во топ 2,5% меѓу 3.090 модели — CLEVI