Source : Digital Times, journaliste Gu Bon-gyu
Citation intégrale de l’article « La start-up d’IA CLEVI entre dans le top 2,5 % de GAIA… une crédibilité reconnue et démontrée »
Date de publication : 2026-04-08
Lien : https://n.news.naver.com/article/029/0003020511?sid=105
La start-up d’IA coréenne « CLEVI (Clevi) » a annoncé avoir intégré, pour la première fois en Corée du Sud, le top 2,5 % du classement de référence GAIA, qui compte 3 090 modèles enregistrés, après avoir construit son propre modèle et sa propre solution d’agent à partir de zéro.
Selon les explications du secteur, GAIA, conçu par Meta AI et exploité par Hugging Face, n’évalue pas seulement la capacité de l’IA à « bien faire une seule chose », mais plutôt sa capacité à « combiner plusieurs aptitudes pour résoudre des problèmes concrets ». Elle doit trouver de l’information sur le Web, lire des tableaux dans des PDF, analyser des images, exécuter du code pour effectuer des calculs, puis combiner les résultats afin de fournir une réponse unique. Avec 301 questions confidentielles, trois niveaux de difficulté et une règle de non-divulgation des réponses, sa structure empêche à la fois le surapprentissage et la triche.
Pour obtenir un score élevé à cette évaluation, deux éléments sont nécessaires : la capacité de raisonnement du modèle de langage sous-jacent et une solution d’agent qui connecte ce modèle aux outils du monde réel afin qu’il puisse effectuer des tâches de manière autonome. Même si le modèle est excellent, un agent faible ne peut pas résoudre le niveau 3; inversement, même si l’agent est très sophistiqué, une capacité de raisonnement insuffisante du modèle entraîne la propagation de réponses incorrectes dès les niveaux intermédiaires.
La structure actuelle du classement de GAIA révèle une tendance intéressante. La plupart des agents les mieux classés adoptent une stratégie de « combinaison de plusieurs modèles », qui associe différents modèles de grandes entreprises technologiques comme GPT, Claude et Gemini. Il s’agit d’une approche raisonnable qui combine les forces de chaque modèle et se prémunit contre une baisse des scores causée notamment par la perte d’information.
CLEVI, pour sa part, n’a pas suivi cette tendance. Développé à partir de zéro, cip-5.5-agent (IA agentique) planifie, exécute et vérifie de manière autonome des tâches complexes, tandis que cip-5.5-mm (modèle multimodal généraliste haute performance) comprend et raisonne sur divers formats de fichiers, notamment la voix, les images et les vidéos. Ces deux modèles ont été développés exclusivement à l’interne par CLEVI, sans utiliser la moindre API LLM externe.
Et avec cette pile de modèles développés à l’interne, cinq agents ont participé à GAIA et ont tous obtenu plus de 70 points. De 79,07 % pour le meilleur résultat à 70,76 %, cela démontre la stabilité de l’ensemble de la pile, et non la chance d’un résultat unique.
Selon l’explication de l’entreprise, un autre chiffre se cache derrière le score officiel de 79,07 %. L’examen rétrospectif interne de CLEVI a révélé qu’un nombre important de réponses parmi les 301 questions ne pouvaient plus être étayées par des sources de réponses disponibles sur le Web public actuel. Lors d’une réévaluation fondée uniquement sur les questions dont les réponses existent toujours sur le Web, le taux de bonnes réponses de CLEVI dépassait 98 %. Ce résultat est déjà supérieur à la moyenne humaine (92 %).
Bien qu’un mélange de puissants modèles généralistes d’autres entreprises aurait pu faire encore augmenter le score officiel, CLEVI a délibérément choisi de ne pas adopter cette stratégie. L’objectif de cette évaluation comparative était de vérifier si un modèle développé from scratch pouvait atteindre un niveau lui permettant de rivaliser sur la scène mondiale, et non de participer à une compétition visant le score le plus élevé.
Le fait que le nom de CLEVI figure au classement de GAIA revêt une grande importance, car cela signifie qu’elle possède une crédibilité vérifiée attribuée par une évaluation indépendante de tiers. Il s’agit d’un fondement objectif pouvant être exploité à toutes les étapes, qu’il s’agisse d’obtenir des investissements, de se développer à l’international ou de mener des ventes B2B.
Un représentant de CLEVI a déclaré : « Parmi les 63 réponses officiellement incorrectes, un grand nombre résultaient d’un format de sortie non conforme, d’erreurs d’interprétation de contenus visuels et de questions impossibles à résoudre en raison de la perte d’informations. Il s’agit davantage de problèmes liés à la précision du post-traitement et à la disponibilité des informations externes que de limites fondamentales du raisonnement logique. Comme il s’agit d’un modèle développé en interne, CLEVI peut l’améliorer elle-même. C’est précisément l’avantage structurel d’un modèle développé from scratch. La performance de CLEVI soulève cette question dans le secteur coréen de l’IA : “Jusqu’à quand dépendrons-nous de cerveaux empruntés ?” CLEVI a choisi la voie plus difficile du développement from scratch et souhaite en démontrer la réponse sur la scène mondiale. »
