Fuente: Digital Times, periodista Gubon-gyu
Cita íntegra del artículo «La startup de IA Clevi entra en el 2,5 % superior de GAIA… demuestra una credibilidad verificada»
Fecha de publicación: 2026-04-08
Enlace: https://n.news.naver.com/article/029/0003020511?sid=105
La startup surcoreana de IA «Clevi» anunció que, tras desarrollar desde cero sus propios modelos y soluciones de agentes, se convirtió en la primera empresa surcoreana en entrar en el 2,5 % superior del benchmark GAIA, de un total de 3.090 modelos registrados.
Según explican fuentes del sector, GAIA, diseñado por Meta AI y operado por Hugging Face, no evalúa si una IA «hace bien una sola cosa», sino si «puede combinar varias capacidades para resolver problemas reales». Debe buscar información en la web, leer tablas dentro de archivos PDF, analizar imágenes, ejecutar código para realizar cálculos y combinar los resultados para dar una única respuesta correcta. Con 301 preguntas privadas, tres niveles de dificultad y el principio de no revelar las respuestas, su estructura hace imposible tanto el sobreajuste como las trampas.
Para obtener una puntuación alta en esta prueba se necesitan dos elementos. Por un lado, la capacidad de razonamiento del modelo de lenguaje subyacente; por otro, una solución de agentes que conecte ese modelo con herramientas del mundo real y le permita realizar tareas de forma autónoma. Por muy bueno que sea el modelo, si el agente es débil no puede resolver el Nivel 3; y por muy sofisticado que sea el agente, si el modelo carece de capacidad de razonamiento, los errores se propagan en las etapas intermedias.
La estructura actual de la tabla de clasificación de GAIA muestra un patrón interesante. La mayoría de los agentes mejor posicionados han adoptado una estrategia de «mezcla de múltiples modelos», combinando varios modelos de grandes empresas tecnológicas, como GPT, Claude y Gemini. Es un enfoque razonable que combina los puntos fuertes de cada modelo y protege contra la reducción de puntuaciones causada por la pérdida de información, entre otros factores.
En cambio, Clevi no se ha unido a esa tendencia. cip-5.5-agent (IA agéntica), desarrollado desde cero, planifica, ejecuta y verifica de forma autónoma tareas complejas, mientras que cip-5.5-mm (multimodal generalista de alto rendimiento) comprende y razona sobre diversos formatos de archivo, como audio, imágenes y vídeo. Ambos modelos fueron desarrollados de forma independiente dentro de Clevi y no se utilizaron API de LLM externas en absoluto.
Y con este stack de modelos propio, presentó 5 agentes en GAIA, y todos registraron puntuaciones superiores a 70. Desde el máximo de 79,07 % hasta 70,76 %, se demostró la estabilidad de todo el stack, no la suerte de un único resultado.
Según la explicación de la empresa, detrás de la puntuación oficial del 79,07 % hay otra cifra. En la revisión posterior interna de CLEVI, se confirmó que, entre las 301 preguntas, había un número considerable cuyos fundamentos para las respuestas correctas se habían perdido en la web pública actual. Al reevaluar únicamente las preguntas cuya respuesta correcta aún estaba disponible en la web, la tasa de respuestas correctas de CLEVI superó el 98 %. Esta cifra ya supera la media humana (92 %).
Por supuesto, si hubiera combinado potentes modelos generalistas de otras empresas, podría haber elevado aún más la puntuación oficial. Sin embargo, CLEVI decidió deliberadamente no adoptar esa estrategia. Esto se debe a que el objetivo de este benchmark no era competir por la puntuación más alta, sino verificar si un modelo propio desarrollado from scratch había alcanzado un nivel capaz de competir en el escenario global.
Que el nombre aparezca en la tabla de clasificación de GAIA tiene un gran significado, ya que demuestra que cuenta con una credibilidad verificada otorgada por una evaluación independiente de terceros. Esto se convierte en una base objetiva que puede utilizarse en todas las etapas, desde la captación de inversiones y la expansión internacional hasta las ventas B2B.
Un representante de CLEVI declaró: “Una parte considerable de las 63 respuestas oficialmente incorrectas se debió a discrepancias en el formato de salida, errores en la interpretación de materiales visuales y preguntas imposibles de responder debido a la pérdida de información. No se trata tanto de una limitación fundamental del razonamiento lógico como de un problema de precisión del procesamiento posterior y de disponibilidad de información externa. Al ser un modelo propio, CLEVI puede mejorarlo por sí misma. Esta es precisamente la ventaja estructural de un modelo propio desarrollado from scratch. El logro de CLEVI plantea a la industria coreana de la IA la pregunta: “¿Hasta cuándo dependeremos de ‘cerebros prestados’?”. CLEVI ha elegido el camino más difícil de desarrollar un modelo from scratch y pretende demostrar la respuesta en el escenario global”.
