Albisteak

Datuek frogatutako lehiakortasuna — etxeko AI agentea, GAIA Bench-en lehenengo %2,5ean

GAIA erreferentzia-marka lehen aldiz argitaratu zenean, GPT-4k ere —orduko punta-puntako ereduak— %30 inguruko puntuazioa baino ez zuen lortu. Izan ere, galdera-erantzun soilaz harago, arrazoibide konplexua, tresnen erabilera eta hainbat urratseko arazoen ebazpena eskatzen dituenez, GAIAren ezaugarriek erakusten zuten garai hartako AIa oraindik hasierako fasean zegoela “pentsatzeko eta gauzatzeko gaitasunari” dagokionez …

GAIAren puntuazioaren esanahia — Zenbateraino garatu dira AI agenteak?

GAIA erreferentzia-marka lehen aldiz argitaratu zenean, GPT-4k ere —orduko punta-puntako ereduak— %30 inguruko puntuazioa baino ez zuen lortu. Izan ere, galdera-erantzun soilaz harago, arrazoibide konplexua, tresnen erabilera eta hainbat urratseko arazoen ebazpena eskatzen dituenez, GAIAren ezaugarriek erakusten zuten garai hartako AIa oraindik hasierako fasean zegoela “pentsatzeko eta gauzatzeko gaitasunari” dagokionez.

Hala ere, gaur egun, goi-mailako agenteek %92,36ra iritsi dira.

Aldaketa hori ez da errendimenduaren hobekuntza hutsa. Orain, AIa galderak erantzuteko mailaz harago doa: egoerak interpretatzen ditu, beharrezko tresnak hautatzen ditu eta hainbat urrats modu autonomoan planifikatu eta gauzatzen ditu. Horrek erakusten du ‘Agentic AI’ fasera igaro dela.

Urte gutxiren buruan, AIa “ezagutza sortzeko tresna” izatetik “zereginak gauzatzen dituen eragile” izatera eboluzionatu da.

Artikuluaren irudia

📌 Eta lehenengo %2,5 horren barruan, CLEVI dago

Lehia globaleko ingurune honetan, Korean garatutako CLEVIren agentea GAIAren sailkapen-taularen lehenengo %2,5ean agertzeak independentzia teknologikoa frogatu du, eta Korean sortutako AI agenteek mundu mailako estandarretan ere errendimendu ona eman dezaketela erakusten duen adibidea da. Horrek zenbaki soil batek baino esanahi handiagoa du. Hau da, gaitasun teknologikoa objektiboki balioztatu da erreferentzia-marka publiko global batean, milaka modeloren aurka lehiatuta, ez demo-ingurune jakin batean soilik.

Are garrantzitsuagoa dena da lorpen hori ez izatea eredu bakar baten ustekabeko emaitza, baizik eta Agent Stack beraren gaineko diseinu desberdineko agenteek behin eta berriz goi-mailako errendimendua lortu izana.

Hau da, CLEVIren teknologia ez da “behin ondo ateratako emaitza” bat, baizik eta lehiakortasun estruktural erreproduzigarria eta hainbat industria eta eszenariotara heda daitekeen plataforma-mailako gaitasuna.

Artikuluaren irudia

Orduan, zer esan nahi du adierazle horrek?

Erabiltzailearen ikuspegitik, AIa ezartzeko oztoporik handiena galdera hau da: "Benetan fida al gaitezke eta utz diezaiokegu ardura?"

Errendimendua, demo ikusgarrietan edo norberaren aurkezpen-materialetan ez ezik, mundu mailako sailkapen-taula publiko batek eskaintzen duen hirugarrenen eszenatokian behin eta berriz frogatua, da galdera horren erantzunik objektiboena. Zehazki, hiru alderditan du garrantzia.

Lehenik, inplementazio-arriskuaren murrizketa

Egiaztatu gabeko AI bat barneko lanekin konektatzea zama handia da enpresentzat.

GAIA bezalako erreferentziazko benchmarketan lortutako emaitzak zuzenean erabil daitezke konfiantzaren oinarri gisa, teknologiaren ebaluazio-fasean.

Bigarrenik, lan konplexuen automatizazioa errealitate bihurtzea

%2,5 onenen artean egoteak adierazten du adimen-maila bat: zeregin errepikakor soiletatik harago, testuingurua ulertu eta hainbat urrats modu autonomoan erabaki eta burutzeko gai izatea.

Orain arte "AI bati uzteko zailak" zirela uste izan diren lan-arloak automatizazio praktikoaren xede bihur daitezke.

Hirugarrenik, datuen segurtasuna eta errendimendua aldi berean bermatzea

Norberaren Agent Stack egiturak esan nahi du datu-fluxua ez dela kanpora ateratzen.

Errendimendu handiko AI erabiltzeko segurtasunari uko egin behar izaten zitzaion aurreko dilematik askatu gaitezke.

Bereziki, datuen sentikortasun handiko sektoreetan, hala nola finantzetan, osasungintzan eta zuzenbidean, egitura honek bereizgarri erabakigarria eskaintzen du.

Egituraren erreproduzigarritasuna frogatzen hasia da dagoeneko.

Eta egitura horren gainean eraikitzen diren agente bakoitzaren emaitzek, laster, benetako aldaketak ekarriko dituzte lantokietan.

"Azken batean, teknologiaren heldutasuna lantokian lortutako 'konfiantzarekin' osatzen da."

CLEVI ez da errendimendu handiko AI eskaintzera mugatzen. Enpresek aurrez aurre dituzten segurtasun-oztopoak gainditzea eta lan praktiko konplexuak benetan amaitzeko gai den 'exekuzio-azpiegitura' eraikitzea da gure funtsa.

Orain, inplementazioa aztertzen ari zineten fasetik harago joan, eta hasi CLEVIrekin AI lan-ingurune seguru eta indartsu bat.

Lana konfiantzaz 맡atu ahal zaion bazkide sendo gisa, zuen negozio-ingurunean benetako berrikuntza elkarrekin sortuko dugu.

Itzuli albistegira
CLEVI

Hizkuntza eta eskualdea

Makina bidez itzulitako hizkuntzak markatuta daude. Erabilgarritasuna argitaratutako gunearen paketearen araberakoa da.

136 hizkuntza

Gomendatua

1

Ekialdeko Asia

7

Hego-ekialdeko Asia

11

Hego Asia

18

Erdialdeko Asia

5

Ekialde Hurbila eta Kaukasoa

10

Mendebaldeko Europa eta Hego Europa

16

Erresuma Batua eta Irlanda

4

Ipar Europa

10

Erdialdeko Europa eta Balkanak

14

Ekialdeko Europa

5

Ekialdeko Afrika

8

Mendebaldeko Afrika eta Erdialdeko Afrika

9

Hegoaldeko Afrika

8

Amerika

5

Ozeania

5
Datuek frogatutako lehiakortasuna — etxeko AI agentea, GAIA Bench-en lehenengo %2,5ean — CLEVI