Font: Gu Bon-gyu, periodista de Digital Times
Citació íntegra de l’article «La startup d’IA Clevi entra al 2,5% superior de GAIA… demostrant una credibilitat verificada»
Data de publicació: 2026-04-08
Enllaç: https://n.news.naver.com/article/029/0003020511?sid=105
La startup d’IA sud-coreana ‘Clevi (Clevi)’ ha anunciat que, mentre construïa un model propi i una solució d’agents pròpia creats from scratch, ha entrat per primera vegada a Corea del Sud al 2,5% superior del benchmark GAIA, sobre la base dels 3.090 models registrats en total.
Segons l’explicació del sector, GAIA, dissenyat per Meta AI i operat per Hugging Face, no pregunta a la IA per la «capacitat de fer bé una sola cosa», sinó per la «capacitat de combinar diverses habilitats per resoldre problemes reals». Ha de cercar informació al web, llegir taules dins de PDF, analitzar imatges, executar codi per fer càlculs i sintetitzar-ne els resultats per oferir una única resposta correcta. Amb 301 preguntes no públiques, tres nivells de dificultat i el principi de no divulgar les respostes correctes, té una estructura que fa impossibles tant el sobreajustament com les trampes.
Per obtenir una puntuació alta en aquesta prova calen dues coses. La capacitat de raonament del model lingüístic que serveix de base i una solució d’agents que connecti aquest model amb les eines del món real perquè pugui executar tasques de manera autònoma. Per molt bo que sigui el model, si l’agent és feble no pot resoldre el Level 3; i per molt sofisticat que sigui l’agent, si la capacitat de raonament del model és insuficient, les respostes incorrectes es propaguen en les etapes intermèdies.
Si observem l’estructura actual de la classificació de GAIA, hi apareix un patró interessant. La majoria dels agents de les primeres posicions han adoptat una estratègia de «mescla de múltiples models» que combina diversos models de grans empreses tecnològiques, com GPT, Claude i Gemini. És un enfocament raonable que combina els punts forts de cada model i defensa contra la reducció de puntuació causada, entre altres factors, per la pèrdua d’informació.
En canvi, Clevi no s’ha incorporat a aquesta línia. El cip-5.5-agent (IA agèntica), desenvolupat mitjançant un enfocament from scratch, planifica, executa i verifica autònomament tasques complexes, mentre que el cip-5.5-mm (multimodal general d’alt rendiment) comprèn i raona sobre diversos formats d’arxiu, com ara àudio, imatges i vídeo. Tots dos models es van desenvolupar de manera independent dins de Clevi, i no es va utilitzar cap API de LLM externa.
I, amb aquesta pila de models pròpia, va presentar 5 agents a GAIA, i tots van obtenir més de 70 punts. Des del màxim del 79,07% fins al 70,76%, això demostra l’estabilitat de tota la pila, no pas la sort d’un únic resultat.
Segons l’explicació de l’empresa, darrere de la puntuació oficial del 79,07% hi ha una altra xifra. La revisió posterior interna de Clevi va confirmar que, de les 301 preguntes, n’hi havia un nombre considerable per a les quals la base que permetia determinar la resposta correcta havia desaparegut del web públic actual. Quan es va fer una nova avaluació basant-se únicament en les preguntes la resposta correcta de les quals encara és present al web, la taxa de respostes correctes de Clevi va superar el 98%. Aquesta xifra ja supera la mitjana humana (92%).
Per descomptat, si hagués combinat potents models generalistes d’altres empreses, hauria pogut augmentar encara més la puntuació oficial. Tanmateix, Clevi va decidir deliberadament no adoptar aquesta estratègia. Això es deu al fet que l’objectiu d’aquest benchmark no era competir per obtenir la puntuació més alta, sinó verificar si un model propi desenvolupat from scratch havia assolit un nivell competitiu a l’escenari mundial.
Que el nom aparegui a la classificació de GAIA té una gran importància, ja que significa disposar d’una credibilitat verificada atorgada per una avaluació independent de tercers. Això es converteix en una base objectiva utilitzable en totes les fases: la captació d’inversions, l’expansió internacional i les vendes B2B.
Un representant de Clevi va declarar: “De les 63 respostes oficialment incorrectes, una part considerable es va deure a discrepàncies en el format de sortida, errors en la interpretació de materials visuals i preguntes impossibles de respondre per la pèrdua d’informació. El problema rau més en la precisió del postprocessament i en la disponibilitat d’informació externa que no pas en una limitació fonamental del raonament lògic. Com que és un model propi, Clevi pot millorar-lo per si mateixa. Aquest és precisament l’avantatge estructural d’un model propi desenvolupat from scratch. El resultat d’aquesta ocasió de Clevi planteja al sector de la IA coreana la pregunta: «Fins quan dependrem de cervells manllevats?». Clevi ha triat el camí més difícil, el del desenvolupament from scratch, i vol demostrar-ne la resposta a l’escenari mundial”.
