Źródło: Digital Times, reporter Gu Bon-gyu
Pełny cytat z artykułu „Startup AI CLEVI wchodzi do ścisłej czołówki 2,5% GAIA… potwierdzona wiarygodność”
Data publikacji: 2026-04-08
Link: https://n.news.naver.com/article/029/0003020511?sid=105
Krajowy startup AI „Clevi” poinformował, że po zbudowaniu własnego modelu stworzonego from scratch oraz własnego rozwiązania agentowego jako pierwszy w Korei Południowej znalazł się wśród 2,5% najlepszych modeli w benchmarku GAIA, na podstawie wszystkich 3 090 zarejestrowanych modeli.
Według wyjaśnień przedstawicieli branży GAIA, zaprojektowana przez Meta AI i prowadzona przez Hugging Face, nie sprawdza, czy AI „dobrze radzi sobie z jedną rzeczą”, lecz czy „potrafi łączyć wiele umiejętności, aby rozwiązywać rzeczywiste problemy”. AI musi znaleźć informacje w sieci, odczytać tabelę w pliku PDF, przeanalizować obraz, uruchomić kod w celu wykonania obliczeń, a następnie połączyć wyniki i podać jedną prawidłową odpowiedź. Dzięki 301 niepublicznym pytaniom, trzem poziomom trudności oraz zasadzie nieujawniania odpowiedzi struktura ta uniemożliwia zarówno przeuczenie, jak i oszukiwanie.
Aby uzyskać wysoki wynik w tym teście, potrzebne są dwie rzeczy: zdolność rozumowania bazowego modelu językowego oraz rozwiązanie agentowe, które łączy ten model z narzędziami świata rzeczywistego i umożliwia mu autonomiczne wykonywanie zadań. Nawet jeśli model jest doskonały, słaby agent nie poradzi sobie z poziomem 3, a nawet najbardziej zaawansowany agent będzie generował kolejne błędne odpowiedzi na poziomach pośrednich, jeśli modelowi zabraknie zdolności rozumowania.
Obecna struktura rankingu GAIA ujawnia interesujący wzorzec. Większość agentów z czołówki przyjmuje strategię „miksu wielu modeli”, łącząc różne modele big tech, takie jak GPT, Claude i Gemini. Jest to racjonalne podejście, które łączy mocne strony poszczególnych modeli i chroni przed spadkiem wyników spowodowanym między innymi utratą informacji.
CLEVI nie dołączyło jednak do tego grona. Opracowany metodą from scratch cip-5.5-agent (agentowa AI) autonomicznie planuje, wykonuje i weryfikuje złożone zadania, a cip-5.5-mm (wysokowydajny ogólny model multimodalny) rozumie i analizuje różne formaty plików, w tym dźwięk, obrazy i wideo. Oba modele zostały niezależnie opracowane wewnątrz CLEVI i nie wykorzystują żadnych zewnętrznych API LLM.
Ponadto, wystawiając pięciu agentów opartych na tym autorskim stosie modeli w konkursie GAIA, wszystkie uzyskały wyniki powyżej 70 punktów. Od najwyższego wyniku 79,07% do 70,76% — dowodzi to stabilności całego stosu, a nie szczęśliwego pojedynczego rezultatu.
Według wyjaśnień firmy za oficjalnym wynikiem 79,07% kryje się jeszcze jedna liczba. W wyniku wewnętrznego przeglądu przeprowadzonego przez CLEVI stwierdzono, że w przypadku znacznej liczby spośród 301 pytań dowody potwierdzające prawidłowe odpowiedzi zniknęły z obecnie dostępnej publicznie sieci. Po ponownej ocenie uwzględniającej wyłącznie pytania, na które odpowiedzi nadal są dostępne w sieci, wskaźnik poprawnych odpowiedzi CLEVI przekroczył 98%. To wynik, który już przewyższa średnią dla ludzi (92%).
Oczywiście połączenie zaawansowanych modeli ogólnego przeznaczenia innych firm mogłoby jeszcze bardziej podnieść oficjalny wynik. CLEVI celowo nie wybrało jednak tej strategii. Celem tego benchmarku nie była rywalizacja o najwyższy wynik, lecz sprawdzenie, czy autorski model stworzony from scratch osiągnął poziom pozwalający mu konkurować na globalnej scenie.
Samo pojawienie się nazwy na tablicy wyników GAIA ma duże znaczenie, ponieważ oznacza posiadanie zweryfikowanej wiarygodności przyznanej przez niezależną ocenę strony trzeciej. Stanowi to obiektywną podstawę, którą można wykorzystać na każdym etapie — pozyskiwania inwestycji, ekspansji zagranicznej i sprzedaży B2B.
Przedstawiciel CLEVI powiedział: „Znaczna część spośród 63 oficjalnie błędnych odpowiedzi wynikała z niezgodności formatu wyjściowego, błędów w interpretacji materiałów wizualnych oraz pytań, na które nie można było udzielić poprawnej odpowiedzi z powodu utraty informacji. Nie jest to problem fundamentalnych ograniczeń rozumowania logicznego, lecz precyzji przetwarzania końcowego i dostępności informacji zewnętrznych. Ponieważ jest to autorski model, CLEVI może samodzielnie go ulepszać. To właśnie strukturalna zaleta autorskiego modelu stworzonego from scratch. Osiągnięcie CLEVI stawia przed koreańską branżą AI pytanie: „Jak długo jeszcze będziemy polegać na «pożyczonych mózgach»?”. CLEVI wybrało trudniejszą drogę from scratch i zamierza udowodnić odpowiedź na globalnej scenie”.
