Fuente: Lee Won-ji, Electronic Times
Cita completa del artículo “CLEVI, con un modelo propio desarrollado from scratch, alcanza 79.07% en GAIA... dentro del 2.5% superior entre 3,090 modelos”
Fecha de publicación: 2026-04-07
Enlace: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm, cinco agentes del stack de modelos propios, todos por encima de 70 puntos
Más del 98% de precisión considerando la pérdida de información, por encima de la humana (92%)
La startup de IA 'CLEVI' registró una precisión del 79.07% en 'GAIA', un benchmark global de agentes de IA, utilizando un modelo propio desarrollado from scratch, y se ubicó dentro del 2.5% superior entre los 3,090 modelos registrados en total.
Según explicaciones de la industria, en el mercado de benchmarks de IA, GAIA es evaluado por reflejar fielmente las capacidades de los 'agentes de IA prácticos'. Este benchmark, desarrollado conjuntamente por Meta AI, HuggingFace y la Universidad Paris-Saclay, se presentó por primera vez en noviembre de 2023.
GAIA se distingue de otros benchmarks por tres aspectos principales. Primero, como las respuestas correctas no son públicas, no es posible el sobreajuste. Segundo, como requiere razonamiento complejo de múltiples pasos y modalidades, no es posible obtener una puntuación alta mediante una simple coincidencia de patrones. Tercero, más de 3,090 modelos de todo el mundo compiten bajo las mismas condiciones a través de la tabla de posiciones oficial de Hugging Face.
El conjunto de pruebas consta de un total de 301 preguntas. El Nivel 1 requiere el uso de una sola herramienta y razonamiento simple; el Nivel 2, la combinación de múltiples herramientas y razonamiento de nivel intermedio; y el Nivel 3, planificación y ejecución por parte de agentes en preguntas de máxima dificultad que requieren cinco pasos o más. En el momento de la presentación del benchmark, la puntuación era de aproximadamente 15% para los modelos GPT (con plugins), y actualmente los equipos líderes la han elevado al rango de 70-80%.
En este contexto, CLEVI enfatizó que el aspecto técnicamente más destacado de este logro es que no utilizó en absoluto API de LLM externos como GPT, Claude o Gemini. Una característica distintiva es que CLEVI utilizó dos modelos desarrollados internamente from scratch.
cip-5.5-agent es un modelo de IA agéntica que actúa como el cerebro central de las canalizaciones de agentes que planifican (planning), ejecutan (execution) y verifican (verification) de forma autónoma tareas complejas. cip-5.5-mm es un modelo multimodal general de alto rendimiento que comprende y razona sobre diversos formatos de archivo, como voz, imágenes y video. Debido a que una parte considerable de las preguntas de GAIA incluye entradas no textuales, como archivos PDF, imágenes y audio, esta capacidad multimodal se convirtió en un factor clave para obtener una puntuación alta.
CLEVI presentó en GAIA cinco configuraciones de agentes diferentes basadas en estos dos modelos propios, y todas obtuvieron puntuaciones superiores a 70.
Según la explicación de la empresa, una revisión posterior interna de CLEVI reveló resultados interesantes. De las 301 preguntas en total, en algunas se había perdido la evidencia de las respuestas correctas en la web pública actual. Se trata de casos en los que información que antes podía consultarse en línea o mediante motores de búsqueda fue eliminada o modificada y ya no está disponible. Al reevaluarlas dentro del alcance de la información que las personas pueden verificar públicamente en la actualidad, la tasa de respuestas correctas de CLEVI superó el 98 %. Esta cifra ya está por encima del promedio humano del 92 %.
Un representante de CLEVI explicó: “CLEVI entró en el 2.5 % superior de un benchmark público al lograr una puntuación de 70+ con los cinco agentes, utilizando únicamente modelos propios from scratch y soluciones propias de agentes de IA, sin combinar modelos externos. Se prevé que la puntuación oficial también pueda mejorar aún más mediante el perfeccionamiento de los modelos y las soluciones propias de agentes. Este logro es significativo porque demuestra una 'confianza validada' medida en un benchmark público global; porque representa un logro de una empresa coreana de desarrollo de IA basado en modelos propios from scratch; porque es el resultado de un stack de modelos independiente, no de una combinación de modelos externos; y porque, considerando la pérdida de información en algunas preguntas, tiene un valor interpretativo superior a la puntuación misma”.
