Šaltinis: „Digital Times“, žurnalistas Gu Bon-gyu
Visas straipsnio „DI startuolis Clevi pateko į 2,5 % geriausių GAIA rezultatų… įrodytas patikimumas“ citatos tekstas
Paskelbimo data: 2026-04-08
Nuoroda: https://n.news.naver.com/article/029/0003020511?sid=105
Pietų Korėjos DI startuolis „Clevi“ (Clevi), sukūręs savo modelį ir agento sprendimą nuo nulio (from scratch), paskelbė, kad pirmasis šalyje pateko į 2,5 % geriausių GAIA etaloninio testo rezultatų tarp visų 3 090 užregistruotų modelių.
Pramonės atstovų teigimu, GAIA, sukurta „Meta AI“ ir valdoma „Hugging Face“, vertina ne DI gebėjimą „gerai atlikti vieną dalyką“, o „gebėjimą derinti įvairius gebėjimus ir spręsti realias problemas“. Reikia rasti informaciją internete, perskaityti lentelę PDF faile, išanalizuoti vaizdą, paleisti kodą skaičiavimams ir apibendrinti rezultatus, kad būtų pateiktas vienas teisingas atsakymas. Testą sudaro 301 neviešas klausimas ir trys sudėtingumo lygiai, o dėl neviešinamos teisingų atsakymų taisyklės neįmanomas nei persimokymas, nei sukčiavimas.
Norint gauti aukštą rezultatą šiame teste, reikia dviejų dalykų: pagrindinio kalbos modelio gebėjimo samprotauti ir agento sprendimo, kuris susieja modelį su realaus pasaulio įrankiais bei leidžia jam savarankiškai atlikti užduotis. Kad ir koks geras būtų modelis, jei agentas silpnas, jis negalės išspręsti 3 lygio užduočių, o kad ir koks ištobulintas būtų agentas, jei modeliui trūksta gebėjimo samprotauti, klaidingi atsakymai bus perduodami jau tarpiniuose etapuose.
Dabartinė GAIA lyderių lentelės struktūra atskleidžia įdomų dėsningumą. Dauguma pirmaujančių agentų taiko „daugelio modelių mišinio“ strategiją, derindami kelis didžiųjų technologijų įmonių modelius, tokius kaip GPT, Claude ir Gemini. Tai racionalus būdas sujungti kiekvieno modelio stipriąsias puses ir apsisaugoti nuo rezultatų prastėjimo dėl informacijos praradimo bei kitų priežasčių.
Tačiau Clevi prie šios grupės neprisijungė. Nuo nulio (from scratch) sukurtas cip-5.5-agent (agentinis DI) savarankiškai planuoja, vykdo ir tikrina sudėtingas užduotis, o cip-5.5-mm (didelio našumo universalus multimodalinis modelis) supranta ir analizuoja įvairius failų formatus, įskaitant garso, vaizdo ir vaizdo įrašų failus. Abu šie modeliai buvo savarankiškai sukurti Clevi viduje, o išorinės LLM API išvis nebuvo naudojamos.
Naudodama šį nuosavų modelių steką, CLEVI GAIA varžybose pristatė 5 agentus ir visi jie surinko daugiau nei 70 balų. Rezultatai nuo aukščiausio 79,07 % iki 70,76 % įrodė ne vieno rezultato sėkmę, o viso steko stabilumą.
Pasak bendrovės, už oficialaus 79,07 % balo slypi dar vienas skaičius. Atlikus vidinę CLEVI analizę paaiškėjo, kad iš 301 klausimo nemažai buvo tokių, kurių teisingo atsakymo pagrindimas šiuo metu viešajame žiniatinklyje yra išnykęs. Iš naujo įvertinus tik tuos klausimus, kurių teisingi atsakymai vis dar egzistuoja žiniatinklyje, CLEVI tikslumas viršijo 98 %. Tai rodiklis, jau pranokstantis žmogaus vidurkį (92 %).
Žinoma, sumaišius galingus kitų įmonių universaliuosius modelius, oficialų balą būtų buvę galima dar labiau padidinti. Tačiau CLEVI sąmoningai nepasirinko šios strategijos. Taip yra todėl, kad šio etalono tikslas buvo ne varžytis dėl aukščiausio balo, o patikrinti, ar from scratch nuosavas modelis pasiekė lygį, leidžiantį konkuruoti pasaulinėje arenoje.
Tai, kad GAIA lyderių lentelėje atsirado pavadinimas, yra reikšminga, nes tai reiškia nepriklausomo trečiosios šalies vertinimo suteiktą patvirtintą patikimumą. Tai objektyvus pagrindas, kurį galima panaudoti visais etapais: pritraukiant investicijas, plečiantis į užsienio rinkas ir vykdant B2B pardavimus.
CLEVI atstovas teigė: „Iš 63 oficialiai neteisingų atsakymų nemaža dalis atsirado dėl išvesties formato neatitikimų, vaizdinės medžiagos interpretavimo klaidų ir klausimų, į kuriuos nebuvo galima atsakyti dėl informacijos praradimo. Tai ne esminių loginio samprotavimo ribų, o tolesnio apdorojimo tikslumo ir išorinės informacijos prieinamumo problema. Kadangi tai yra nuosavas modelis, CLEVI gali pati jį tobulinti. Tai ir yra struktūrinis from scratch nuosavo modelio pranašumas. Šis CLEVI pasiekimas Korėjos AI pramonei kelia klausimą: „Kiek dar priklausysime nuo „pasiskolintų smegenų“?“ CLEVI pasirinko sunkesnį from scratch kelią ir siekia pasaulinėje arenoje įrodyti atsakymą į šį klausimą.“
