Albisteak

CLEVI, from scratch berezko ereduarekin GAIAren %79,07... 3.090 ereduren artean %2,5 onenen artean

Iturria: ETNews, Lee Won-ji kazetaria

Iturria: ETNews, Lee Won-ji kazetaria

“CLEVI, from scratch berezko ereduarekin GAIAren %79,07... 3.090 ereduren artean %2,5 onenen artean” artikuluaren testu osoaren aipamena

Argitalpen-data: 2026-04-07

Esteka: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm eredu-jabeen stack-eko 5 agenteek 70 puntutik gorako emaitzak lortu dituzte

Informazio-galera kontuan hartuta, %98tik gorako zuzentasun-tasa, gizakiena (%92) gaindituz

Artikuluaren irudia

CLEVI AI startupak %79,07ko zuzentasun-tasa lortu du ‘GAIA’ AI agente globalen benchmarkean, from scratch berezko eredua erabiliz, eta erregistratutako 3.090 eredu guztien artean %2,5 onenen barruan kokatu da.

Sektoreko azalpenen arabera, AI benchmarken merkatuan GAIAk ‘AI agente praktikoen’ gaitasunak zintzoki islatzen dituela uste da. Meta AIk, HuggingFacek eta Paris-Saclay Unibertsitateak batera garatutako benchmark hau 2023ko azaroan argitaratu zen lehen aldiz.

GAIA beste benchmarketatik bereizten duten hiru funtsezko ezaugarri ditu. Lehenik, erantzun zuzenak ezkutuan daudenez, ezinezkoa da gehiegizko doikuntza. Bigarrenik, urrats anitzeko eta modalitate anitzeko arrazoibide konplexua eskatzen duenez, ezin da puntuazio alturik lortu eredu-patroien parekatze soilarekin. Hirugarrenik, HuggingFace-ren sailkapen-taula ofizialaren bidez, mundu osoko 3.090 eredu baino gehiago baldintza berberetan lehiatzen dira.

Probako multzoak 301 galdera ditu guztira. Level 1 mailan, tresna bakarra erabiltzea eta arrazoibide sinplea eskatzen dira; Level 2 mailan, hainbat tresnaren konbinazioa eta maila ertaineko arrazoibidea; eta Level 3 mailan, berriz, bost urrats edo gehiagoko agentearen plangintza eta exekuzioa, hau da, zailtasun-maila handieneko galderak. Benchmarka aurkeztu zenean, GPT ereduek (pluginak zituztenek) %15 inguruko emaitza baino ez zuten lortu; gaur egun, puntako taldeek %70-%80ko mailara igo dute.

Testuinguru horretan, CLEVIk azpimarratu du lorpen horren alderdi teknikoan arreta gehien merezi duena dela GPT, Claude, Gemini eta kanpoko beste LLM batzuen APIak batere ez erabiltzea. CLEVIren bereizgarria da from scratch garatutako bi eredu propio erabili izana.

cip-5.5-agent eragile bidezko IA eredua da, eta zeregin konplexuak modu autonomoan planifikatu (planning), gauzatu (execution) eta egiaztatzen (verification) dituzten agenteen kanalizazioen funtsezko garun gisa jarduten du. cip-5.5-mm errendimendu handiko multimodalitate orokorreko eredua da, hainbat fitxategi-formatu ulertu eta arrazoitzeko gai dena, hala nola ahotsa, irudiak eta bideoa. GAIAko galderen zati handi batek testua ez diren sarrerak ditu, hala nola PDFak, irudiak eta audio-fitxategiak; beraz, multimodalitate-gaitasun hori puntuazio altuaren funtsezko faktorea izan zen.

CLEVIk bere bi eredu propioetan oinarrituta bost agente-konfigurazio desberdin aurkeztu zituen GAIAren lehiaketan, eta guztiek 70etik gorako puntuazioa lortu zuten.

Enpresaren azalpenaren arabera, CLEVIren barneko ondorengo berrikuspenak emaitza interesgarriak agerian utzi zituen. Guztira 301 galderetatik, batzuen erantzunen oinarriak jada galduak zeuden une horretan publikoki eskuragarri zegoen webean. Iraganean linean edo bilatzaileen bidez egiazta zitekeen informazioa ezabatu edo aldatu egin zen, eta jada ezin zen eskuratu zenbait kasutan. Gaur egun gizakiek publikoki egiazta dezaketen informazioaren esparruan berriz ebaluatzean, CLEVIren zehaztasun-tasa %98tik gorakoa izan zen. Gizakien batez bestekoa, %92koa, gainditzen duen kopurua da jada.

CLEVIren ordezkariak honako hau azaldu zuen: “CLEVIk, kanpoko eredurik nahastu gabe, from scratch egindako eredu propioekin eta AI agenteentzako soluzio propioekin soilik, bost agenteek 70+ puntu lortzea erdietsi du, eta erreferentziazko benchmark publikoan munduko %2,5 onenen artean sartu da. Aurrerantzean, eredu eta agenteentzako soluzio propioak hobetuz, puntuazio ofiziala gehiago hobetzea ere posible izango dela dirudi. Emaitza honek garrantzi handia du hainbat arrazoirengatik: mundu mailako benchmark publiko batean neurtu izanak ‘egiaztatutako konfiantza’ erakusten duelako; Koreako AI garatzaile baten from scratch egindako eredu propioetan oinarritutako lorpena delako; kanpoko ereduen nahasketa izan beharrean eredu-pila independente baten emaitza delako; eta, galdera batzuetako informazio-galera kontuan hartuta, puntuazioak berak adierazten duena baino interpretazio-balio handiagoa duelako.”

Itzuli albistegira
CLEVI

Hizkuntza eta eskualdea

Makina bidez itzulitako hizkuntzak markatuta daude. Erabilgarritasuna argitaratutako gunearen paketearen araberakoa da.

136 hizkuntza

Gomendatua

1

Ekialdeko Asia

7

Hego-ekialdeko Asia

11

Hego Asia

18

Erdialdeko Asia

5

Ekialde Hurbila eta Kaukasoa

10

Mendebaldeko Europa eta Hego Europa

16

Erresuma Batua eta Irlanda

4

Ipar Europa

10

Erdialdeko Europa eta Balkanak

14

Ekialdeko Europa

5

Ekialdeko Afrika

8

Mendebaldeko Afrika eta Erdialdeko Afrika

9

Hegoaldeko Afrika

8

Amerika

5

Ozeania

5
CLEVI, from scratch berezko ereduarekin GAIAren %79,07... 3.090 ereduren artean %2,5 onenen artean — CLEVI