Fuente: Digital Times, reportero Gu Bon-gyu
Cita del artículo completo “La startup de IA CLEVI entra en el 2.5 % superior de GAIA… demuestra una credibilidad comprobada”
Fecha de publicación: 2026-04-08
Enlace: https://n.news.naver.com/article/029/0003020511?sid=105
La startup de IA surcoreana ‘CLEVI (Clevi)’ anunció que, mientras construía su propio modelo y sus propias soluciones de agentes desarrollados from scratch, ingresó por primera vez en Corea del Sur al 2.5 % superior del benchmark GAIA, con base en los 3,090 modelos registrados en total.
Según explicaciones de la industria, GAIA, diseñado por Meta AI y operado por Hugging Face, no evalúa si una IA es ‘buena en una sola cosa’, sino su ‘capacidad para combinar varias habilidades y resolver problemas reales’. Debe encontrar información en la web, leer tablas dentro de PDF, analizar imágenes, ejecutar código para realizar cálculos y combinar los resultados para ofrecer una única respuesta correcta. Con 301 preguntas privadas, tres niveles de dificultad y el principio de no divulgar las respuestas, su estructura hace imposible tanto el sobreajuste como las trampas.
Para obtener una puntuación alta en esta prueba se necesitan dos cosas. La capacidad de razonamiento del modelo de lenguaje que sirve como base y una solución de agente que conecte ese modelo con herramientas del mundo real para que realice tareas de forma autónoma. Por muy bueno que sea el modelo, si el agente es débil no puede resolver el Level 3; y por muy sofisticado que sea el agente, si la capacidad de razonamiento del modelo es insuficiente, las respuestas incorrectas se propagan desde las etapas intermedias.
La estructura actual de la tabla de posiciones de GAIA muestra un patrón interesante. La mayoría de los agentes mejor posicionados adoptan una estrategia de ‘mezcla de múltiples modelos’ que combina varios modelos de grandes empresas tecnológicas, como GPT, Claude y Gemini. Es un enfoque razonable que combina las fortalezas de cada modelo y evita la disminución de puntuación causada por la pérdida de información, entre otros factores.
CLEVI, en cambio, no se sumó a esa tendencia. cip-5.5-agent (IA agéntica), desarrollado mediante un enfoque from scratch, planifica, ejecuta y verifica de forma autónoma tareas complejas, mientras que cip-5.5-mm (multimodal general de alto rendimiento) comprende y razona sobre diversos formatos de archivo, como audio, imágenes y video. Ambos modelos fueron desarrollados de manera independiente dentro de CLEVI, y no se utilizaron API de LLM externas en absoluto.
Y con este stack de modelos propios, presentó 5 agentes en GAIA, y todos obtuvieron más de 70 puntos. Desde el máximo de 79.07% hasta 70.76%, esto demostró la estabilidad de todo el stack, no la suerte de un solo resultado.
Según explicó la empresa, detrás de la puntuación oficial de 79.07% hay otra cifra. Una revisión posterior interna de CLEVI confirmó que, de las 301 preguntas, un número considerable había perdido en la web pública actual la evidencia de la respuesta correcta. Al reevaluar únicamente las preguntas cuya evidencia de respuesta correcta aún existe en la web, la tasa de respuestas correctas de CLEVI superó el 98%. Esta cifra ya supera el promedio humano (92%).
Por supuesto, si hubiera combinado potentes modelos generalistas de otras empresas, podría haber elevado aún más la puntuación oficial. Sin embargo, CLEVI decidió deliberadamente no adoptar esa estrategia. Esto se debe a que el objetivo de este benchmark no era competir por la puntuación más alta, sino verificar si un modelo propio from scratch había alcanzado un nivel competitivo en el escenario global.
Que el nombre figure en la tabla de clasificación de GAIA tiene un gran significado, ya que implica contar con una credibilidad verificada otorgada por una evaluación independiente de terceros. Esto constituye una evidencia objetiva que puede aprovecharse en todas las etapas: captación de inversión, expansión internacional y ventas B2B.
Un representante de CLEVI declaró: “De las 63 respuestas oficiales incorrectas, una parte considerable se debió a discrepancias en el formato de salida, errores en la interpretación de materiales visuales y preguntas que no podían responderse debido a la pérdida de información. Más que una limitación fundamental del razonamiento lógico, se trata de un problema de precisión del procesamiento posterior y de disponibilidad de información externa. Al ser un modelo propio, CLEVI puede mejorarlo por sí misma. Esta es precisamente la ventaja estructural de un modelo propio from scratch. El desempeño de CLEVI en esta ocasión plantea a la industria de la IA coreana la pregunta: ‘¿Hasta cuándo dependeremos de cerebros prestados?’. CLEVI ha elegido el camino más difícil, from scratch, y busca demostrar la respuesta en el escenario mundial”.
