Новини

Корейският AI стартъп Clevi влиза в топ 2,5% на GAIA… демонстрира доказана надеждност

Източник: вестник Digital Times, репортер Гу Бонгю

Източник: вестник Digital Times, репортер Гу Бонгю

Пълно цитиране на статията „Корейският AI стартъп Clevi влиза в топ 2,5% на GAIA… демонстрира доказана надеждност“

Дата на публикуване: 2026-04-08

Връзка: https://n.news.naver.com/article/029/0003020511?sid=105

Корейският AI стартъп „Clevi“ обяви, че след изграждането на собствен модел и собствено агентско решение, създадени from scratch, за първи път в Корея е влязъл в топ 2,5% според бенчмарка GAIA, сред общо 3 090 регистрирани модела.

Според обяснения от индустрията, GAIA, проектирана от Meta AI и управлявана от Hugging Face, не проверява дали AI притежава „способността да прави добре само едно нещо“, а „способността да комбинира множество умения, за да решава реални проблеми“. Той трябва да намира информация в интернет, да чете таблици в PDF файлове, да анализира изображения, да изпълнява код за извършване на изчисления и да обобщава резултатите, за да даде един окончателен отговор. Структурата се състои от 301 непублични въпроса, три нива на трудност и принцип на непубличност на отговорите, което прави невъзможни както преобучаването, така и измамата.

За получаването на висок резултат на този изпит са необходими две неща. Едното е способността за разсъждение на езиковия модел, който служи за основа, а другото е агентско решение, което свързва този модел с инструментите от реалния свят и му позволява автономно да изпълнява задачи. Колкото и добър да е моделът, ако агентът е слаб, той няма да може да решава Level 3, а колкото и усъвършенстван да е агентът, ако способността на модела за разсъждение е недостатъчна, грешните отговори ще се разпространяват още на междинния етап.

При разглеждане на настоящата структура на класацията на GAIA се вижда интересен модел. Повечето агенти на челните позиции са възприели стратегия „смесване на множество модели“, която комбинира различни големи технологични модели като GPT, Claude и Gemini. Това е разумен подход за съчетаване на силните страни на всеки модел и за предотвратяване на намаляването на резултата вследствие на загуба на информация и други подобни фактори.

За разлика от тях, Clevi не се присъедини към тази група. Разработеният чрез подхода from scratch cip-5.5-agent (агентски AI) автономно планира, изпълнява и проверява сложни задачи, а cip-5.5-mm (високопроизводителен универсален мултимодален модел) разбира и разсъждава върху различни файлови формати, включително аудио, изображения и видео. И двата модела са разработени независимо вътре в Clevi, като изобщо не са използвани външни LLM API.

И като изпрати 5 агента на GAIA с този собствен моделeн стек, всички постигнаха резултат над 70 точки. От най-високите 79,07% до 70,76% това доказа стабилността на целия стек, а не късмета на единичен резултат.

Изображение в основния текст

Според обяснението на компанията зад официалния резултат от 79,07% стои още едно число. При последващ вътрешен преглед на Clevi беше установено, че сред 301-те въпроса има значителен брой, за които доказателствата за правилния отговор вече са изчезнали от публичната мрежа. При повторна оценка, основана само на въпросите, чиито отговори все още съществуват в мрежата, точността на Clevi е била над 98%. Това е стойност, която вече надхвърля човешката средна стойност от 92%.

Разбира се, ако беше комбинирал мощни универсални модели на други компании, можеше да повиши официалния резултат още повече. Clevi обаче умишлено не избра тази стратегия. Причината е, че целта на този бенчмарк не беше надпревара за най-висок резултат, а да се провери дали собствен модел, разработен from scratch, е достигнал ниво, на което може да се конкурира на световната сцена.

Това, че името му е включено в класацията на GAIA, има голямо значение, тъй като означава, че разполага с потвърдена надеждност, предоставена от независима оценка на трета страна. Това се превръща в обективно доказателство, което може да бъде използвано във всички етапи — от привличането на инвестиции и навлизането на чужди пазари до B2B продажбите.

Представител на Clevi заяви: „Значителна част от 63-те официално отчетени грешни отговора произтича от несъответствие във формата на изхода, грешки при интерпретирането на визуални материали и въпроси, на които не може да бъде отговорено поради загуба на информация. Това не е основно ограничение на логическото разсъждение, а проблем с прецизността на последващата обработка и достъпността на външната информация. Тъй като моделът е собствен, Clevi може сама да го подобрява. Именно това е структурното предимство на собствения модел, разработен from scratch. Постижението на Clevi този път поставя пред корейската AI индустрия въпроса: „Докога ще зависим от „заемни мозъци“?“ Clevi избра по-трудния път на разработката from scratch и иска да докаже отговора на световната сцена.“

Обратно към пресцентъра
CLEVI

Език и регион

Езиците, преведени машинно, са обозначени. Наличността следва публикувания пакет на сайта.

136 езика

Препоръчано

1

Източна Азия

7

Югоизточна Азия

11

Южна Азия

18

Централна Азия

5

Близък изток и Кавказ

10

Западна Европа и Южна Европа

16

Обединеното кралство и Ирландия

4

Северна Европа

10

Централна Европа и Балканите

14

Източна Европа

5

Източна Африка

8

Западна Афирка и Централна Африка

9

Южноафрикански регион

8

Америка

5

Океания

5
Корейският AI стартъп Clevi влиза в топ 2,5% на GAIA… демонстрира доказана надеждност — CLEVI