Fonte: o xornal electrónico Electronic Times, o xornalista Lee Won-ji
Cita completa do artigo «CLEVI, co seu propio modelo desenvolvido from scratch, logra un 79,07% en GAIA... dentro do 2,5% superior entre 3.090 modelos»
Data de publicación: 2026-04-07
Ligazón: https://www.etnews.com/20260407000203
Os cinco axentes do stack de modelos propios cip-5.5-agent·cip-5.5-mm logran todos máis de 70 puntos
Taxa de respostas correctas superior ao 98% tendo en conta a perda de información, por riba do 92% humano
A startup de IA «CLEVI» rexistrou unha taxa de respostas correctas do 79,07% no benchmark global de axentes de IA «GAIA», utilizando o seu propio modelo desenvolvido from scratch, e situouse dentro do 2,5% superior entre os 3.090 modelos rexistrados en total.
Segundo as explicacións do sector, no mercado dos benchmarks de IA considérase que GAIA reflicte fielmente as capacidades dos «axentes de IA práctica». Este benchmark, desenvolvido conxuntamente por Meta AI, HuggingFace e a Universidade Paris-Saclay, presentouse por primeira vez en novembro de 2023.
GAIA distínguese doutros benchmarks por tres aspectos fundamentais. En primeiro lugar, como as respostas correctas non son públicas, non é posible o sobreaxuste. En segundo lugar, como require razoamento complexo en varios pasos e con múltiples modalidades, non é posible obter unha puntuación alta mediante unha simple correspondencia de patróns. En terceiro lugar, máis de 3.090 modelos de todo o mundo compiten nas mesmas condicións a través da táboa de clasificación oficial de HuggingFace.
O conxunto de proba consta de 301 preguntas en total. O nivel 1 implica o uso dunha única ferramenta e razoamento sinxelo; o nivel 2 require combinar varias ferramentas e razoamento de nivel intermedio; e o nivel 3, o de maior dificultade, esixe a planificación e execución dun axente en cinco ou máis pasos. No momento da presentación do benchmark, a puntuación dos modelos GPT con complementos situábase arredor do 15%, mentres que actualmente os equipos líderes lograron elevala ata o intervalo do 70–80%.
Neste contexto, CLEVI salientou que o aspecto tecnicamente máis salientable deste logro é que non utilizou en absoluto APIs de LLM externos como GPT, Claude ou Gemini. A característica distintiva de CLEVI é que utilizou dous modelos propios desenvolvidos mediante o método from scratch.
cip-5.5-agent é un modelo de IA axentiva que actúa como o cerebro central das canalizacións de axentes que planifican (planning), executan (execution) e verifican (verification) de forma autónoma tarefas complexas. cip-5.5-mm é un modelo multimodal xeral de alto rendemento que comprende e razoa sobre diversos formatos de ficheiro, como voz, imaxes e vídeo. Dado que unha parte considerable das preguntas de GAIA inclúe entradas non textuais, como PDF, imaxes e ficheiros de audio, esta capacidade multimodal converteuse nun factor clave para obter unha puntuación elevada.
Baseándose nestes dous modelos propios, CLEVI presentou cinco configuracións de axentes diferentes en GAIA, e todos obtiveron máis de 70 puntos.
Segundo explicou a empresa, unha revisión posterior interna de CLEVI revelou resultados interesantes. De entre as 301 preguntas en total, nalgunhas xa non era posible atopar actualmente na web pública fontes que fundamentasen a resposta correcta. Trátase de casos nos que información que antes se podía consultar en liña ou nos motores de busca foi eliminada ou modificada e xa non está accesible. Ao reavaliar as preguntas dentro do ámbito da información que as persoas poden verificar publicamente na actualidade, a taxa de respostas correctas de CLEVI foi superior ao 98 %. Esta cifra xa supera a media humana do 92 %.
Un responsable de CLEVI explicou: «CLEVI situou os seus cinco axentes, todos con máis de 70 puntos, entre o 2,5 % superior do benchmark público, utilizando unicamente modelos propios desenvolvidos from scratch e solucións propias de axentes de IA, sen combinar modelos externos. Prevese que, mediante a mellora futura dos modelos propios e das solucións de axentes, a puntuación oficial tamén poida mellorar aínda máis. Este logro é especialmente significativo porque demostra unha “confianza verificada” medida nun benchmark público global; porque representa un resultado baseado en modelos propios desenvolvidos from scratch por unha empresa coreana de desenvolvemento de IA; porque é o resultado dunha pila de modelos independente, non dunha combinación de modelos externos; e porque, tendo en conta a perda de información nalgunhas preguntas, ofrece un valor interpretativo superior ao que indica a puntuación por si soa».
