Извор: Дигитал Тајмс, новинар Гу Бонгју
Целосен цитат од написот „Вештачката интелигенција стартап CLEVI влезе во најдобрите 2,5% на GAIA… докажа проверена кредибилност“
Датум на објавување 2026-04-08
Линк: https://n.news.naver.com/article/029/0003020511?sid=105
Домашниот AI стартап „Clevi (Clevi)“ објави дека, откако изгради сопствен модел и сопствено агентско решение создадени from scratch, како прв во Јужна Кореја влегол во најдобрите 2,5% на GAIA-бенчмаркот, според вкупно 3.090 регистрирани модели.
Според објаснувањата од индустријата, GAIA, дизајнирана од Meta AI и управувана од Hugging Face, од AI бара не „способност да прави добро само една работа“, туку „способност да комбинира повеќе способности за решавање реални проблеми“. Треба да пронајде информации на веб, да прочита табела во PDF, да анализира слика, да изврши код за пресметка и да ги обедини резултатите за да даде еден точен одговор. Структурата, заснована на 301 доверливo прашање, три нивоа на тежина и принципот на необјавување на точните одговори, оневозможува и преадаптирање и мамење.
За да се постигне висок резултат на овој тест, потребни се две работи. Тоа се способноста за расудување на јазичниот модел што ја обезбедува основата и агентското решение што го поврзува моделот со алатките од реалниот свет и му овозможува автономно да извршува задачи. Колку и да е добар моделот, ако агентот е слаб, не може да се решава Level 3; колку и да е софистициран агентот, ако способноста за расудување на моделот е недоволна, неточните одговори се пренесуваат уште во средните фази.
Ако се погледне моменталната структура на GAIA-лидербордот, се забележува интересен образец. Повеќето агенти на врвот применуваат стратегија на „мултимоделски микс“, комбинирајќи повеќе модели на големите технолошки компании, како што се GPT, Claude и Gemini. Тоа е рационален пристап за комбинирање на силните страни на секој модел и за заштита од намалување на резултатот поради загуба на информации и слично.
Од друга страна, Clevi не се приклучи кон тој тренд. cip-5.5-agent (агентска AI), развиен преку пристапот from scratch, автономно го извршува планирањето, реализацијата и проверката на сложени задачи, додека cip-5.5-mm (високоперформансен општ мултимодален модел) разбира и расудува со различни формати на датотеки, вклучувајќи аудио, слики и видеа. И двата модела се независно развиени во рамките на Clevi, без никакво користење надворешни LLM API.
И со овој сопствен моделски стек, CLEVI испрати 5 агенти на GAIA, при што сите постигнаа над 70 поени. Од највисоките 79.07% до 70.76%, ова ја докажува стабилноста на целиот стек, а не среќата на еден резултат.
Според објаснувањето на компанијата, зад официјалниот резултат од 79.07% стои уште една бројка. Според интерниот постериорен преглед на CLEVI, кај значителен број од 301 прашање било утврдено дека доказите за точниот одговор повеќе не се достапни на јавно достапната веб-мрежа. При повторното оценување само на прашањата чиј точен одговор сè уште постои на веб-мрежата, стапката на точни одговори на CLEVI била над 98%. Тоа е бројка што веќе го надминува човечкиот просек од 92%.
Секако, официјалниот резултат можел дополнително да се зголеми со комбинирање на моќни општи модели од други компании. Сепак, CLEVI намерно не ја избрал таа стратегија. Причината е што целта на овој бенчмарк не била натпревар за највисок резултат, туку проверка дали сопствениот модел развиен from scratch достигнал ниво на кое може да се натпреварува на глобалната сцена.
Тоа што името се појавува на GAIA-лидербордот има големо значење, бидејќи означува дека моделот поседува проверен кредибилитет доделен преку независна евалуација од трета страна. Тоа е објективен доказ што може да се искористи во сите фази — од привлекување инвестиции и меѓународна експанзија до B2B продажба.
Претставник на CLEVI изјави: „Значителен дел од 63-те официјално неточни одговори произлегоа од несовпаѓање на излезниот формат, грешки во толкувањето на визуелните материјали и прашања на кои не можело да се одговори поради загуба на информации. Тоа не е суштинско ограничување на логичкото расудување, туку проблем со прецизноста на постпроцесирањето и достапноста на надворешни информации. Бидејќи станува збор за сопствен модел, CLEVI може самостојно да го подобрува. Тоа е токму структурната предност на сопствениот модел развиен from scratch. Остварувањето на CLEVI го поставува прашањето пред корејската AI-индустрија: „До кога ќе се потпираме на ‘позајмени мозоци’?“ CLEVI го избра потешкиот пат, from scratch, и сака да го докаже одговорот на светската сцена“, соопшти тој.
