Източник: електронният вестник, журналист И Уонджи
Пълно цитиране на статията „Клеви, със собствен модел, разработен от нулата, 79,07% в GAIA... в топ 2,5% сред 3 090 модела“
Дата на публикуване: 2026-04-07
Връзка: https://www.etnews.com/20260407000203
Независим стек от 5 модела cip-5.5-agent·cip-5.5-mm; всички агенти с резултат над 70 точки
98%+ точност, като се отчита загубата на информация, надминаваща човешката (92%)
Корейският AI стартъп „Клеви“ използва собствен модел, разработен от нулата, и постигна точност от 79,07% в глобалния бенчмарк за AI агенти „GAIA“, като се класира в топ 2,5% сред общо 3 090 регистрирани модела.
Според обяснения от индустрията GAIA се оценява като бенчмарк, който вярно отразява способностите на „практичните AI агенти“ на пазара за AI бенчмаркове. Този бенчмарк, разработен съвместно от Meta AI, HuggingFace и Университета Париж-Сакле, беше представен за първи път през ноември 2023 г.
GAIA се отличава от другите бенчмаркове по три ключови начина. Първо, тъй като верните отговори не са публични, преобучаването е невъзможно. Второ, тъй като изисква многостъпково и мултимодално комплексно разсъждение, висок резултат не може да бъде постигнат чрез просто съпоставяне на шаблони. Трето, чрез официалната класация на Hugging Face над 3 090 модела от цял свят се състезават при еднакви условия.
Тестовият набор се състои от общо 301 въпроса. Level 1 включва използване на един инструмент и просто разсъждение, Level 2 изисква комбиниране на множество инструменти и разсъждение на средно ниво, а Level 3 съдържа въпроси с най-висока трудност, изискващи планиране и изпълнение от агент в пет или повече стъпки. При представянето на бенчмарка резултатът на GPT моделите (с активирани плъгини) беше около 15%, а в момента водещите екипи са го повишили до 70–80%.
Сред всичко това Клеви подчерта, че технически най-забележителният аспект на постижението е фактът, че изобщо не са използвани външни LLM API, като GPT, Claude или Gemini. Отличителната черта на Клеви е използването на два независимо разработени модела, създадени от нулата.
cip-5.5-agent е агентен AI модел, който играе ролята на основен мозък в агентен конвейер, способен автономно да планира (planning), изпълнява (execution) и проверява (verification) сложни задачи. cip-5.5-mm е високопроизводителен универсален мултимодален модел, който разбира и прави изводи от различни файлови формати, включително аудио, изображения и видео. Тъй като значителна част от въпросите в GAIA включват нетекстови входове като PDF файлове, изображения и аудиофайлове, тази мултимодална способност се превърна в ключов фактор за високия резултат.
Въз основа на тези два собствени модела Clevi представи пет различни конфигурации на агенти в GAIA, като всички те постигнаха резултат над 70 точки.
Според обяснението на компанията при вътрешния последващ преглед на Clevi са били установени интересни резултати. При някои от общо 301 въпроса доказателствата за верните отговори вече са изчезнали от публичната мрежа. Това са случаи, при които информация, която в миналото е била достъпна онлайн или чрез търсачки, е била изтрита или променена и вече не може да бъде достъпна. При повторна оценка в рамките на информацията, която хората могат публично да проверят в момента, точността на Clevi е над 98%. Това вече надхвърля средния човешки резултат от 92%.
Представител на Clevi обясни: „Clevi постигна резултат 70+ с всичките пет агента и влезе в топ 2,5% на публичния бенчмарк, използвайки само собствени модели, разработени от нулата, и собствени AI агентни решения, без смесване на външни модели. Очаква се официалният резултат да може да бъде допълнително подобрен чрез бъдещо усъвършенстване на собствените модели и агентни решения. Това постижение има дълбоко значение, тъй като показва „проверено доверие“, измерено в глобален публичен бенчмарк; представлява резултат на местна AI компания за разработка, базиран на собствен модел, разработен от нулата; е резултат от независим стек от модели, а не от смесване на външни модели; и има стойност за интерпретация, надхвърляща самия резултат, като се вземе предвид загубата на информация по някои въпроси.“
