Fuente: Lee Won-ji, Electronic Newspaper
Cita íntegra del artículo «CLEVI, 79,07 % en GAIA con un modelo propio desarrollado from scratch... dentro del 2,5 % superior entre 3.090 modelos»
Fecha de publicación: 2026-04-07
Enlace: https://www.etnews.com/20260407000203
Los cinco agentes del stack de modelos propios cip-5.5-agent·cip-5.5-mm obtienen todos más de 70 puntos
Tasa de respuestas correctas superior al 98 % teniendo en cuenta la pérdida de información, por encima de la humana (92 %)
La startup de IA «CLEVI» registró una tasa de respuestas correctas del 79,07 % en «GAIA», el benchmark global de agentes de IA, utilizando un modelo propio desarrollado from scratch, y se situó dentro del 2,5 % superior entre los 3.090 modelos registrados en total.
Según explican fuentes del sector, en el mercado de benchmarks de IA, GAIA es valorado por reflejar fielmente las capacidades de los «agentes de IA prácticos». Desarrollado conjuntamente por Meta AI, HuggingFace y la Universidad Paris-Saclay, entre otros, este benchmark se presentó por primera vez en noviembre de 2023.
GAIA se distingue de otros benchmarks por tres aspectos fundamentales. En primer lugar, como las respuestas correctas no son públicas, no es posible el sobreajuste. En segundo lugar, como requiere un razonamiento complejo, multietapa y multimodal, no es posible obtener una puntuación alta mediante una simple coincidencia de patrones. En tercer lugar, más de 3.090 modelos de todo el mundo compiten en las mismas condiciones a través de la tabla de clasificación oficial de HuggingFace.
El conjunto de prueba consta de un total de 301 preguntas. El nivel 1 comprende el uso de una sola herramienta y el razonamiento simple; el nivel 2, la combinación de varias herramientas y el razonamiento de nivel intermedio; y el nivel 3, las preguntas de mayor dificultad, que requieren la planificación y ejecución de agentes en cinco o más etapas. En el momento de la presentación del benchmark, la tasa era de aproximadamente el 15 % para los modelos GPT (con plugins), mientras que actualmente los equipos líderes la han elevado hasta el 70-80 %.
En este contexto, CLEVI destacó que el aspecto técnicamente más relevante de este logro es que no utilizó en absoluto API de LLM externos como GPT, Claude o Gemini. Una característica distintiva de CLEVI es que utilizó dos modelos propios desarrollados de forma independiente mediante el método from scratch.
cip-5.5-agent es un modelo de IA agéntica que desempeña el papel de cerebro central de una canalización de agentes que planifica (planning), ejecuta (execution) y verifica (verification) de forma autónoma tareas complejas. cip-5.5-mm es un modelo multimodal generalista de alto rendimiento que comprende y razona sobre diversos formatos de archivo, como voz, imágenes y vídeo. Dado que una parte considerable de las preguntas de GAIA incluye entradas no textuales, como archivos PDF, imágenes y audio, esta capacidad multimodal se convirtió en un factor clave para obtener una puntuación alta.
CLEVI presentó estos dos modelos propios en GAIA mediante 5 configuraciones de agentes diferentes, y todos ellos obtuvieron una puntuación superior a 70.
Según explicó la empresa, una revisión posterior interna de CLEVI reveló resultados interesantes. De las 301 preguntas en total, en algunas se había perdido la base de evidencia de las respuestas en la web pública actual. Se trataba de casos en los que información que antes podía consultarse en línea o mediante motores de búsqueda había sido eliminada o modificada y ya no era accesible. Al reevaluarlas dentro del alcance de la información que las personas pueden verificar públicamente en la actualidad, la tasa de respuestas correctas de CLEVI superó el 98 %. Esta cifra ya supera el promedio humano del 92 %.
Un representante de CLEVI explicó: “CLEVI entró en el 2,5 % superior de los benchmarks públicos al registrar más de 70 puntos con los 5 agentes, utilizando únicamente modelos propios desarrollados from scratch y soluciones de agentes de IA propias, sin combinar modelos externos. Se prevé que la puntuación oficial pueda mejorar aún más en el futuro mediante la mejora de los modelos y las soluciones de agentes propios. Este logro es significativo porque demuestra una 'confianza verificada' medida en un benchmark público global; porque representa un resultado de una empresa de desarrollo de IA nacional basado en modelos propios desarrollados from scratch; porque es el resultado de un stack de modelos independiente, no de una combinación de modelos externos; y porque, teniendo en cuenta la pérdida de información en algunas preguntas, tiene un valor interpretativo superior al de la puntuación por sí sola”.
