Font : jornal điệnronic, jornalista Lee Won-ji
Citacion del tèxte integral de l’article « CLEVI, amb un modèl pròpri desvolopat from scratch, 79,07 % a GAIA... dins los 2,5 % superiors dels 3 090 modèls »
Data de publicacion : 2026-04-07
Ligam : https://www.etnews.com/20260407000203
Lo stack de modèls exclusius cip-5.5-agent·cip-5.5-mm compta 5 agents, totes amb una puntuacion superiora a 70
Un taus de responsas corrèctas superior a 98 % en tenent compte de las pèrdas d’informacion, superior als umans (92 %)
La start-up d’IA « CLEVI » a obtengut un taus de responsas corrèctas de 79,07 % a « GAIA », lo benchmark mondial dels agents d’IA, en utilizant un modèl pròpri desvolopat from scratch, e s’es classada dins los 2,5 % superiors dels 3 090 modèls enregistrats.
Segon las explicacions del sector, GAIA es considerat coma un benchmark que reflècta fidèlament las capacitats dels « agents d’IA practics » sul mercat dels benchmarks d’IA. Desvolopat conjuntament per Meta AI, HuggingFace e l’Universitat de París-Saclay, aqueste benchmark foguèt publicat pel primièr còp en novembre de 2023.
GAIA se distinguís dels autres benchmarks per tres elements principals. Primièrament, las responsas corrèctas essent secretas, lo surajustament es impossible. Segondament, coma exigís un rasonament complex multietapa e multimodal, es impossible d’obténer una puntuacion elevada amb un simple aparelhament de patrons. Tresenament, mai de 3 090 modèls del mond entièr concorron dins las meteissas condicions via lo classament oficial d’HuggingFace.
Lo jòc de tèsts se compausa de 301 questions al total. Lo nivèl 1 compren l’utilizacion d’una aisina unica e lo rasonament simple, lo nivèl 2 exigís la combinason de mantuna aisina e un rasonament de nivèl intermediari, e lo nivèl 3 compren de questions de dificultat maximala que demandan la planificacion e l’execucion d’agents en 5 etapas o mai. Al moment de la publicacion del benchmark, lo taus èra d’aperaquí 15 % amb los modèls GPT (dotats de plugins), e las equipas de cap de classament lo fan ara montar dins la forqueta de 70 a 80 %.
Dins aqueste contèxt, CLEVI a insistit sus lo fach que, tecnicament, lo punt mai remirable d’aqueste resultat es qu’a pas utilizat cap d’API de LLM extèrne coma GPT, Claude o Gemini. La particularitat de CLEVI es d’aver utilizat dos modèls desvolopats internament from scratch.
cip-5.5-agent es un modèl d’IA agentica que fa de cervèl central del pipeline d’agents que planifica (planning), executa (execution) e verifica (verification) de manièra autonòma de prètzfaches complèxes. cip-5.5-mm es un modèl multimodal generalista de nauta performança que compren e rasona sus divèrses formats de fichièrs, coma la votz, las imatges e las vidèos. Coma una part importanta de las questions de GAIA conten d’entradas non textualas, coma de fichièrs PDF, d’imatges o d’àudio, aquesta capacitat multimodala es venguda un factor clau per obténer una nauta puntuacion.
CLEVI a presentat aquestes dos modèls intèrnes dins 5 configuracions d’agents diferentas a GAIA, e totas an obtengut una puntuacion superiora a 70.
Segon las explicacions de l’entrepresa, una revision posteriora intèrna de CLEVI a revelat un resultat interessant. D’entre las 301 questions al total, las basas justificativas de las responsas d’unas d’entre elas avián desaparegut de la Web publica actuala. Dins d’unes cases, d’informacions que podián èsser verificadas en linha o amb de motors de recèrca dins lo passat avián estat suprimidas o modificadas e èran pas mai accessiblas. Quand las responsas foguèron reavaloradas dins lo limit de las informacions que las personas pòdon verificar publicament actualament, lo taus de responsas corrèctas de CLEVI s’es revelat superior a 98 %. Es una chifra que depassa ja la mejana umana de 92 %.
Un responsable de CLEVI a explicat: “Sens mesclar de modèls extèrnes, CLEVI a fach obténer una puntuacion superiora a 70 als 5 agents, sonque amb de modèls pròpris from scratch e de solucions d’agents d’IA pròprias, e a dintrat dins los primièrs 2,5 % del benchmark public. Se pòt pensar que la puntuacion oficiala poirà encara melhorar gràcias a las melhoras futuras dels modèls e de las solucions d’agents pròpris. Aquesta capitada es significativa perque a mostrat una «fisança verificada» mesurada dins un benchmark public mondial, perque representa una capitada basada sus de modèls pròpris from scratch d’un desvolopaire d’IA corean, perque es lo resultat d’una pila de modèls independenta e non d’una mescla de modèls extèrnes, e perque, en tenent compte de la pèrda d’informacions per unas questions, presenta una valor d’interpretacion superiora a la simpla puntuacion.”
