Naujienos

DI startuolis Clevi pateko į 2,5 % geriausių GAIA rezultatų… įrodytas patikimumas

Šaltinis: „Digital Times“, žurnalistas Gu Bon-gyu

Šaltinis: „Digital Times“, žurnalistas Gu Bon-gyu

Visas straipsnio „DI startuolis Clevi pateko į 2,5 % geriausių GAIA rezultatų… įrodytas patikimumas“ citatos tekstas

Paskelbimo data: 2026-04-08

Nuoroda: https://n.news.naver.com/article/029/0003020511?sid=105

Pietų Korėjos DI startuolis „Clevi“ (Clevi), sukūręs savo modelį ir agento sprendimą nuo nulio (from scratch), paskelbė, kad pirmasis šalyje pateko į 2,5 % geriausių GAIA etaloninio testo rezultatų tarp visų 3 090 užregistruotų modelių.

Pramonės atstovų teigimu, GAIA, sukurta „Meta AI“ ir valdoma „Hugging Face“, vertina ne DI gebėjimą „gerai atlikti vieną dalyką“, o „gebėjimą derinti įvairius gebėjimus ir spręsti realias problemas“. Reikia rasti informaciją internete, perskaityti lentelę PDF faile, išanalizuoti vaizdą, paleisti kodą skaičiavimams ir apibendrinti rezultatus, kad būtų pateiktas vienas teisingas atsakymas. Testą sudaro 301 neviešas klausimas ir trys sudėtingumo lygiai, o dėl neviešinamos teisingų atsakymų taisyklės neįmanomas nei persimokymas, nei sukčiavimas.

Norint gauti aukštą rezultatą šiame teste, reikia dviejų dalykų: pagrindinio kalbos modelio gebėjimo samprotauti ir agento sprendimo, kuris susieja modelį su realaus pasaulio įrankiais bei leidžia jam savarankiškai atlikti užduotis. Kad ir koks geras būtų modelis, jei agentas silpnas, jis negalės išspręsti 3 lygio užduočių, o kad ir koks ištobulintas būtų agentas, jei modeliui trūksta gebėjimo samprotauti, klaidingi atsakymai bus perduodami jau tarpiniuose etapuose.

Dabartinė GAIA lyderių lentelės struktūra atskleidžia įdomų dėsningumą. Dauguma pirmaujančių agentų taiko „daugelio modelių mišinio“ strategiją, derindami kelis didžiųjų technologijų įmonių modelius, tokius kaip GPT, Claude ir Gemini. Tai racionalus būdas sujungti kiekvieno modelio stipriąsias puses ir apsisaugoti nuo rezultatų prastėjimo dėl informacijos praradimo bei kitų priežasčių.

Tačiau Clevi prie šios grupės neprisijungė. Nuo nulio (from scratch) sukurtas cip-5.5-agent (agentinis DI) savarankiškai planuoja, vykdo ir tikrina sudėtingas užduotis, o cip-5.5-mm (didelio našumo universalus multimodalinis modelis) supranta ir analizuoja įvairius failų formatus, įskaitant garso, vaizdo ir vaizdo įrašų failus. Abu šie modeliai buvo savarankiškai sukurti Clevi viduje, o išorinės LLM API išvis nebuvo naudojamos.

Naudodama šį nuosavų modelių steką, CLEVI GAIA varžybose pristatė 5 agentus ir visi jie surinko daugiau nei 70 balų. Rezultatai nuo aukščiausio 79,07 % iki 70,76 % įrodė ne vieno rezultato sėkmę, o viso steko stabilumą.

Pagrindinio teksto vaizdas

Pasak bendrovės, už oficialaus 79,07 % balo slypi dar vienas skaičius. Atlikus vidinę CLEVI analizę paaiškėjo, kad iš 301 klausimo nemažai buvo tokių, kurių teisingo atsakymo pagrindimas šiuo metu viešajame žiniatinklyje yra išnykęs. Iš naujo įvertinus tik tuos klausimus, kurių teisingi atsakymai vis dar egzistuoja žiniatinklyje, CLEVI tikslumas viršijo 98 %. Tai rodiklis, jau pranokstantis žmogaus vidurkį (92 %).

Žinoma, sumaišius galingus kitų įmonių universaliuosius modelius, oficialų balą būtų buvę galima dar labiau padidinti. Tačiau CLEVI sąmoningai nepasirinko šios strategijos. Taip yra todėl, kad šio etalono tikslas buvo ne varžytis dėl aukščiausio balo, o patikrinti, ar from scratch nuosavas modelis pasiekė lygį, leidžiantį konkuruoti pasaulinėje arenoje.

Tai, kad GAIA lyderių lentelėje atsirado pavadinimas, yra reikšminga, nes tai reiškia nepriklausomo trečiosios šalies vertinimo suteiktą patvirtintą patikimumą. Tai objektyvus pagrindas, kurį galima panaudoti visais etapais: pritraukiant investicijas, plečiantis į užsienio rinkas ir vykdant B2B pardavimus.

CLEVI atstovas teigė: „Iš 63 oficialiai neteisingų atsakymų nemaža dalis atsirado dėl išvesties formato neatitikimų, vaizdinės medžiagos interpretavimo klaidų ir klausimų, į kuriuos nebuvo galima atsakyti dėl informacijos praradimo. Tai ne esminių loginio samprotavimo ribų, o tolesnio apdorojimo tikslumo ir išorinės informacijos prieinamumo problema. Kadangi tai yra nuosavas modelis, CLEVI gali pati jį tobulinti. Tai ir yra struktūrinis from scratch nuosavo modelio pranašumas. Šis CLEVI pasiekimas Korėjos AI pramonei kelia klausimą: „Kiek dar priklausysime nuo „pasiskolintų smegenų“?“ CLEVI pasirinko sunkesnį from scratch kelią ir siekia pasaulinėje arenoje įrodyti atsakymą į šį klausimą.“

Grįžti į naujienų kambarį
CLEVI

Kalba ir regionas

Mašininio vertimo kalbos yra pažymėtos. Prieinamumas priklauso nuo paskelbto svetainės paketo.

136 kalbos

Rekomenduojama

1

Rytų Azija

7

Pietryčių Azija

11

Pietų Azija

18

Centrinė Azija

5

Artimieji Rytai ir Kaukazas

10

Vakarų Europa ir Pietų Europa

16

Jungtinė Karalystė ir Airija

4

Šiaurės Europa

10

Vidurio Europa ir Balkanai

14

Rytų Europa

5

Rytų Afrika

8

Vakarų Afrika ir Vidurio Afrika

9

Pietinė Afrika

8

Amerika

5

Okeanija

5
DI startuolis Clevi pateko į 2,5 % geriausių GAIA rezultatų… įrodytas patikimumas — CLEVI