Notícies

Competitivitat demostrada amb dades: l’agent d’IA desenvolupat a Corea assoleix el 2,5% superior del benchmark GAIA

Quan el benchmark GAIA es va fer públic per primera vegada, fins i tot GPT-4, que aleshores era un model de màxim nivell, només va obtenir una puntuació d’aproximadament el 30%. Això significa que, a causa de les característiques de GAIA, que exigeix raonament complex, ús d’eines i resolució de problemes en diversos passos més enllà de les simples preguntes i respostes, la IA d’aleshores encara es trobava en una fase inicial pel que fa a la capacitat de “pensar i executar” …

El significat de la puntuació GAIA — Fins a quin punt han avançat els agents d’IA?

Quan el benchmark GAIA es va fer públic per primera vegada, fins i tot GPT-4, que aleshores era un model de màxim nivell, només va obtenir una puntuació d’aproximadament el 30%. Això significa que, a causa de les característiques de GAIA, que exigeix raonament complex, ús d’eines i resolució de problemes en diversos passos més enllà de les simples preguntes i respostes, la IA d’aleshores encara es trobava en una fase inicial pel que fa a la capacitat de “pensar i executar”.

Tanmateix, actualment, els agents capdavanters han assolit el 92,36%.

Aquest canvi no és una simple millora del rendiment. És un indicador que ara la IA ha anat més enllà del nivell de respondre preguntes i ha entrat en l’etapa de la “IA agèntica” (Agentic AI), en què interpreta la situació, selecciona les eines necessàries i planifica i executa diverses etapes de manera autònoma.

En només uns quants anys, la IA ha evolucionat de ser una “eina de generació de coneixement” a convertir-se en un “agent executor que realitza tasques”.

Imatge principal

📌 I Clevi es troba dins d’aquest 2,5% superior

En aquest entorn de competència global, el fet que l’agent de Clevi, desenvolupat a Corea, s’hagi situat dins del 2,5% superior de la classificació de GAIA demostra la independència tecnològica i constitueix un exemple que prova que un agent d’IA creat a Corea també pot complir els estàndards globals. Això té un significat que va més enllà d’una simple xifra. Vol dir que es tracta d’una capacitat tecnològica validada objectivament mitjançant la competició amb milers de models en un benchmark global i públic, no pas en un entorn de demostració específic.

Més important encara, aquest assoliment no és el resultat casual d’un únic model, sinó que agents amb dissenys diferents han produït repetidament un rendiment capdavanter sobre el mateix Agent Stack.

És a dir, la tecnologia de Clevi no és un “resultat que ha sortit bé una vegada”, sinó una competitivitat estructural reproduïble i una capacitat a escala de plataforma, ampliable a diverses indústries i escenaris.

Imatge principal

Aleshores, què significa aquest indicador?

Des de la perspectiva de l’usuari, la barrera més gran per adoptar la IA és la pregunta: "Realment hi podem confiar i delegar-li la feina?"

El rendiment demostrat repetidament en un escenari de tercers, el rànquing públic global, i no pas en demostracions espectaculars ni en materials de presentació propis, és la resposta més objectiva a aquesta pregunta. Concretament, té importància en tres aspectes.

En primer lloc, reducció del risc d’adopció

Connectar una IA no verificada amb les operacions internes suposa una càrrega considerable per a les empreses.

Els resultats obtinguts en referents de prestigi com GAIA es poden utilitzar directament com a base de confiança durant la fase d’avaluació tecnològica.

En segon lloc, fer realitat l’automatització de tasques complexes

La xifra del 2,5 % superior indica un nivell d’intel·ligència que va més enllà de les tasques simplement repetitives: comprendre el context, prendre decisions autònomes en diverses etapes i completar-les.

Els àmbits de treball que fins ara es consideraven «difícils de confiar a una IA» poden convertir-se en objecte d’una automatització real.

En tercer lloc, garantir simultàniament la seguretat de les dades i el rendiment

L’estructura pròpia d’Agent Stack significa que el flux de dades no surt a l’exterior.

Això permet superar el dilema tradicional d’haver de comprometre la seguretat per utilitzar una IA d’alt rendiment.

Especialment en sectors amb una alta sensibilitat de les dades, com les finances, la sanitat i els serveis jurídics, aquesta estructura constitueix un factor diferencial decisiu.

La possibilitat de reproduir l’estructura ja ha començat a quedar demostrada.

I el rendiment de cada agent que es construeix sobre aquesta estructura aviat es traduirà en canvis reals sobre el terreny.

"En definitiva, el grau de perfecció de la tecnologia es completa amb la «convicció» en el lloc de treball."

Clevi no es limita a oferir una IA d’alt rendiment. La nostra essència és construir una «infraestructura orientada a l’execució» que derroqui les barreres de seguretat a què s’enfronten les empreses i permeti completar realment tasques professionals complexes.

Ara, deixeu enrere l’etapa de plantejar-vos l’adopció i comenceu, amb Clevi, un entorn de treball d’IA segur i potent.

Com a soci sòlid en qui podeu confiar per delegar la feina, crearem plegats una innovació real en el vostre entorn empresarial.

Torna a la sala de premsa
CLEVI

Llengua i regió

Les llengües traduïdes automàticament estan marcades. La disponibilitat segueix el paquet del lloc publicat.

136 llengües

Recomanat

1

Àsia oriental

7

Àsia sud-oriental

11

Àsia meridional

18

Àsia central

5

Orient Mitjà i el Caucas

10

Europa occidental i Europa meridional

16

Regne Unit i Irlanda

4

Europa septentrional

10

Europa Central i els Balcans

14

Europa oriental

5

Àfrica oriental

8

Àfrica occidental i Àfrica central

9

Àfrica meridional

8

Amèrica

5

Oceania

5