Naujienos

CLEVI, su from scratch sukurtu nuosavu modeliu GAIA pasiekė 79,07 %... Patenka į 2,5 % geriausių iš 3 090 modelių

Šaltinis: „Electronic Times“, žurnalistas Lee Won-ji

Šaltinis: „Electronic Times“, žurnalistas Lee Won-ji

Visas straipsnio „CLEVI, su from scratch sukurtu nuosavu modeliu GAIA pasiekė 79,07 %... Patenka į 2,5 % geriausių iš 3 090 modelių“ citavimas

Paskelbimo data: 2026-04-07

Nuoroda: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm nuosavų modelių stekas: visi 5 agentai surinko daugiau nei 70 taškų

Atsižvelgiant į informacijos praradimą, teisingų atsakymų rodiklis viršija 98 % ir pranoksta žmonių rezultatą (92 %)

Pagrindinio teksto vaizdas

AI startuolis „CLEVI“, naudodamas from scratch sukurtą nuosavą modelį, pasauliniame AI agentų etalone „GAIA“ pasiekė 79,07 % teisingų atsakymų rodiklį ir pateko į 2,5 % geriausių modelių, vertinant pagal visus 3 090 registruotų modelių.

Pramonės atstovų teigimu, AI etalonų rinkoje GAIA vertinama kaip tiksliai atspindinti „praktinių AI agentų“ gebėjimus. Šį etaloną, kurį kartu sukūrė „Meta AI“, „HuggingFace“ ir Paryžiaus-Saklė universitetas, pirmą kartą paskelbė 2023 m. lapkritį.

GAIA nuo kitų etalonų išskiria trys pagrindiniai aspektai. Pirma, kadangi teisingi atsakymai neviešinami, persimokymas neįmanomas. Antra, kadangi reikia daugiapakopio ir multimodalinio kompleksinio samprotavimo, aukšto rezultato neįmanoma pasiekti vien paprastu šablonų sutapatinimu. Trečia, oficialioje „HuggingFace“ lyderių lentelėje daugiau nei 3 090 modelių iš viso pasaulio varžosi vienodomis sąlygomis.

Testų rinkinį iš viso sudaro 301 klausimas. 1 lygis apima vieno įrankio naudojimą ir paprastą samprotavimą, 2 lygis – kelių įrankių derinimą ir vidutinio sudėtingumo samprotavimą, o 3 lygio, aukščiausio sudėtingumo, klausimams reikia agento plano ir vykdymo per 5 ar daugiau etapų. Etalono paskelbimo metu GPT modeliai (su įskiepiais) pasiekė tik apie 15 %, o šiuo metu pirmaujančios komandos šį rodiklį padidino iki 70–80 %.

CLEVI pabrėžė, kad techniškai svarbiausias šio pasiekimo aspektas yra tai, jog nebuvo naudojamos jokios išorinės LLM API, tokios kaip GPT, Claude ar Gemini. Išskirtinis bruožas – naudoti du from scratch būdu savarankiškai sukurti modeliai.

cip-5.5-agent yra agentinis DI modelis, atliekantis pagrindinio branduolio vaidmenį agentų konvejeryje, kuris savarankiškai planuoja (planning), vykdo (execution) ir tikrina (verification) sudėtingas užduotis. cip-5.5-mm yra didelio našumo universalus daugiarūšis modelis, suprantantis ir analizuojantis įvairius failų formatus, įskaitant garso, vaizdo ir vaizdo įrašų failus. Kadangi didelėje dalyje GAIA užduočių pateikiami netekstiniai įvesties duomenys, tokie kaip PDF, vaizdai ir garso failai, šios daugiarūšės galimybės tapo pagrindiniu veiksniu siekiant aukšto rezultato.

CLEVI, remdamasi šiais dviem nuosavais modeliais, GAIA konkurse pateikė 5 skirtingas agentų konfigūracijas, ir visos jos surinko daugiau nei 70 taškų.

Pasak bendrovės, atliekant CLEVI vidinę peržiūrą po vertinimo buvo nustatytas įdomus rezultatas. Iš visų 301 užduoties kai kurių atsakymų pagrindimo šiuo metu nebėra viešajame žiniatinklyje. Tai atvejai, kai anksčiau internete ar paieškos sistemose prieinama informacija buvo ištrinta arba pakeista ir todėl tapo nebeprieinama. Iš naujo įvertinus pagal šiuo metu žmonėms viešai patikrinamos informacijos apimtį, CLEVI atsakymų tikslumas siekė daugiau nei 98 %. Šis rodiklis jau viršija žmonių vidurkį – 92 %.

CLEVI atstovas paaiškino: „CLEVI, nenaudodama išorinių modelių derinio, vien tik su nuo nulio sukurtais nuosavais modeliais ir nuosavais DI agentų sprendimais pasiekė daugiau nei 70 taškų su visais 5 agentais ir pateko tarp 2,5 % geriausių rezultatų viešajame etalone. Tikimasi, kad ateityje tobulinant nuosavus modelius ir agentų sprendimus bus galima dar labiau pagerinti ir oficialų rezultatą. Šis pasiekimas yra reikšmingas tuo, kad realiai išmatuotas pasauliniame viešajame etalone ir rodo „patikrintą pasitikėjimą“, kad tai yra vietos DI kūrėjo pasiekimas, pagrįstas nuo nulio sukurtais nuosavais modeliais, kad tai yra nepriklausomo modelių steko, o ne išorinių modelių derinio, rezultatas, ir kad, atsižvelgiant į kai kurių užduočių informacijos praradimą, jis turi didesnę interpretacinę vertę nei vien tik balas.“

Grįžti į naujienų kambarį
CLEVI

Kalba ir regionas

Mašininio vertimo kalbos yra pažymėtos. Prieinamumas priklauso nuo paskelbto svetainės paketo.

136 kalbos

Rekomenduojama

1

Rytų Azija

7

Pietryčių Azija

11

Pietų Azija

18

Centrinė Azija

5

Artimieji Rytai ir Kaukazas

10

Vakarų Europa ir Pietų Europa

16

Jungtinė Karalystė ir Airija

4

Šiaurės Europa

10

Vidurio Europa ir Balkanai

14

Rytų Europa

5

Rytų Afrika

8

Vakarų Afrika ir Vidurio Afrika

9

Pietinė Afrika

8

Amerika

5

Okeanija

5
CLEVI, su from scratch sukurtu nuosavu modeliu GAIA pasiekė 79,07 %... Patenka į 2,5 % geriausių iš 3 090 modelių — CLEVI