Font: periodista Lee Won-ji d’Electronic Times
Citació íntegra de l’article «Clevi, amb un model propi desenvolupat des de zero, 79,07% a GAIA... entre els 3.090 models, dins del 2,5% superior»
Data de publicació: 2026-04-07
Enllaç: https://www.etnews.com/20260407000203
Cinc agents de la pila de models propis cip-5.5-agent·cip-5.5-mm, tots per sobre dels 70 punts
Precisió superior al 98% tenint en compte la pèrdua d’informació, per sobre de la humana (92%)
La startup d’IA «Clevi» ha assolit una precisió del 79,07% en el benchmark global d’agents d’IA «GAIA» mitjançant un model propi desenvolupat des de zero, i s’ha situat dins del 2,5% superior dels 3.090 models registrats en total.
Segons les explicacions del sector, en el mercat dels benchmarks d’IA, GAIA és valorat perquè reflecteix fidelment les capacitats dels «agents d’IA pràctica». Desenvolupat conjuntament per Meta AI, HuggingFace i la Universitat Paris-Saclay, entre d’altres, aquest benchmark es va presentar per primera vegada el novembre de 2023.
Hi ha tres aspectes clau que distingeixen GAIA d’altres benchmarks. En primer lloc, com que les respostes correctes no són públiques, no és possible el sobreajustament. En segon lloc, com que exigeix raonament complex de diversos passos i multimodal, no és possible obtenir una puntuació alta amb una simple concordança de patrons. En tercer lloc, més de 3.090 models de tot el món competeixen en les mateixes condicions a través de la taula de classificació oficial de HuggingFace.
El conjunt de proves consta d’un total de 301 preguntes. El nivell 1 consisteix en l’ús d’una sola eina i raonament simple; el nivell 2, en la combinació de diverses eines i raonament de nivell intermedi; i el nivell 3, en preguntes de màxima dificultat que exigeixen planificació i execució per part de l’agent en cinc passos o més. En el moment de la presentació del benchmark, els models GPT (amb connectors) només assolien aproximadament un 15%, mentre que actualment els equips capdavanters ho han elevat fins al 70-80%.
En aquest context, Clevi va remarcar que el punt tècnicament més destacable d’aquest assoliment és que no es va utilitzar en absolut cap API de LLM extern, com GPT, Claude o Gemini. La característica distintiva és que Clevi va utilitzar dos models desenvolupats internament de manera independent i des de zero.
cip-5.5-agent és un model d’IA agentiva que actua com el cervell central de la cadena de processos d’agents que planifica (planning), executa (execution) i verifica (verification) de manera autònoma tasques complexes. cip-5.5-mm és un model multimodal general d’alt rendiment que comprèn i raona sobre diversos formats de fitxer, com ara àudio, imatges i vídeo. Atès que una part considerable de les preguntes de GAIA inclou entrades no textuals, com ara fitxers PDF, imatges i àudio, aquesta capacitat multimodal es va convertir en un factor clau per obtenir una puntuació elevada.
A partir d’aquests dos models propis, Clevi va presentar cinc configuracions d’agents diferents a GAIA, i totes van obtenir una puntuació superior als 70 punts.
Segons l’explicació de l’empresa, en la revisió posterior interna de Clevi es van confirmar resultats interessants. D’un total de 301 preguntes, en alguns casos les proves que fonamentaven les respostes correctes ja no estaven disponibles al web públic actual. Es tracta de casos en què informació que abans es podia consultar en línia o mitjançant motors de cerca va ser eliminada o modificada i ja no és accessible. Quan es va tornar a avaluar dins de l’abast de la informació que les persones poden verificar públicament actualment, la taxa de respostes correctes de Clevi va superar el 98%. Aquesta xifra ja supera la mitjana humana, que és del 92%.
