Źródło: Lee Won-ji, Electronic Times
Pełny cytat z artykułu „CLEVI, z własnym modelem opracowanym from scratch osiąga 79,07% w GAIA… wśród 3 090 modeli znajduje się w czołowych 2,5%”
Data publikacji: 2026-04-07
Link: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm: 5 agentów w autorskim stosie modeli, wszyscy powyżej 70 punktów
Przy uwzględnieniu utraty informacji wskaźnik poprawnych odpowiedzi wynosi ponad 98%, przewyższając wynik ludzi (92%)
Koreański startup AI „CLEVI” odnotował 79,07% poprawnych odpowiedzi w globalnym benchmarku agentów AI „GAIA”, wykorzystując własny model opracowany from scratch, i znalazł się w czołowych 2,5% spośród 3 090 zarejestrowanych modeli.
Według przedstawicieli branży GAIA jest oceniany jako benchmark, który wiernie odzwierciedla możliwości „praktycznych agentów AI” na rynku benchmarków AI. Benchmark ten, opracowany wspólnie przez Meta AI, HuggingFace oraz Uniwersytet Paris-Saclay, został po raz pierwszy udostępniony w listopadzie 2023 roku.
GAIA wyróżnia się na tle innych benchmarków trzema kluczowymi cechami. Po pierwsze, ponieważ poprawne odpowiedzi nie są ujawniane, nie można dopasować modelu do danych testowych. Po drugie, wymaga złożonego rozumowania wieloetapowego i multimodalnego, dlatego samo dopasowywanie wzorców nie pozwala uzyskać wysokiego wyniku. Po trzecie, ponad 3 090 modeli z całego świata konkuruje na tych samych warunkach za pośrednictwem oficjalnej tabeli wyników HuggingFace.
Zestaw testowy składa się łącznie z 301 pytań. Level 1 obejmuje użycie pojedynczego narzędzia i proste rozumowanie, Level 2 — łączenie wielu narzędzi i rozumowanie na średnim poziomie, a Level 3 — pytania o najwyższym stopniu trudności, wymagające planowania i wykonania przez agenta co najmniej 5 etapów. W momencie publikacji benchmarku wynik modeli GPT (z wtyczkami) wynosił około 15%, natomiast obecnie czołowe zespoły podniosły go do poziomu 70–80%.
W tym kontekście CLEVI podkreśliło, że najważniejszym technicznie aspektem tego osiągnięcia jest fakt, iż w ogóle nie wykorzystano zewnętrznych API LLM, takich jak GPT, Claude czy Gemini. Cechą charakterystyczną jest użycie dwóch modeli opracowanych niezależnie przez CLEVI metodą from scratch.
cip-5.5-agent to agentowy model AI, który pełni rolę kluczowego mózgu potoku agentowego autonomicznie planującego (planning), wykonującego (execution) i weryfikującego (verification) złożone zadania. cip-5.5-mm to wysokowydajny, ogólnego przeznaczenia multimodalny model rozumiejący i wnioskujący na podstawie różnych formatów plików, takich jak dźwięk, obrazy i wideo. Ponieważ znaczna część pytań GAIA zawiera nietekstowe dane wejściowe, takie jak pliki PDF, obrazy i pliki audio, zdolności multimodalne stały się kluczowym czynnikiem osiągnięcia wysokiego wyniku.
CLEVI zgłosiło do GAIA 5 różnych konfiguracji agentów opartych na tych dwóch własnych modelach, a wszystkie uzyskały wynik powyżej 70 punktów.
Według wyjaśnień firmy wewnętrzny przegląd przeprowadzony po zakończeniu testu przez CLEVI ujawnił interesujące wyniki. W przypadku części z łącznie 301 pytań podstawa odpowiedzi nie jest obecnie dostępna w publicznej sieci. Chodzi o informacje, które wcześniej można było znaleźć online lub w wyszukiwarkach, lecz zostały usunięte lub zmienione i nie są już dostępne. Po ponownej ocenie w zakresie informacji, które ludzie mogą obecnie publicznie zweryfikować, wskaźnik poprawnych odpowiedzi CLEVI wyniósł ponad 98%. To wynik już przewyższający ludzką średnią wynoszącą 92%.
Przedstawiciel CLEVI wyjaśnił: „CLEVI, bez mieszania zewnętrznych modeli, osiągnęło wynik 70+ we wszystkich 5 agentach, wykorzystując wyłącznie własne modele from scratch i własne rozwiązania agentowe AI, dzięki czemu znalazło się w czołowych 2,5% publicznego benchmarku. W przyszłości oficjalny wynik prawdopodobnie będzie można dodatkowo poprawić poprzez udoskonalanie własnych modeli i rozwiązań agentowych. To osiągnięcie ma duże znaczenie, ponieważ pokazuje «zweryfikowaną wiarygodność» potwierdzoną pomiarem w globalnym publicznym benchmarku, stanowi osiągnięcie krajowej firmy zajmującej się rozwojem AI oparte na własnym modelu from scratch, jest rezultatem niezależnego stosu modeli, a nie mieszania modeli zewnętrznych, a także — z uwzględnieniem utraty informacji dotyczących części pytań — ma wartość interpretacyjną wykraczającą poza sam wynik”.”
