Nouvelles

CLEVI, 79,07 % avec son propre modèle développé from scratch… dans le top 2,5 % des 3 090 modèles

Source : Lee Won-ji, Electronic Times

Source : Lee Won-ji, Electronic Times

Citation intégrale de l’article « CLEVI, 79,07 % avec son propre modèle développé from scratch… dans le top 2,5 % des 3 090 modèles »

Date de publication : 2026-04-07

Lien : https://www.etnews.com/20260407000203

Stack de modèles exclusifs cip-5.5-agent·cip-5.5-mm : les 5 agents obtiennent tous plus de 70 points

Taux de réponses correctes de plus de 98 % en tenant compte de la perte d’information, supérieur à celui des humains (92 %)

Image de l’article

La jeune pousse d’IA « CLEVI » a obtenu un taux de réponses correctes de 79,07 % au benchmark mondial d’agents d’IA « GAIA » en utilisant son propre modèle développé from scratch, se classant ainsi dans le top 2,5 % des 3 090 modèles enregistrés au total.

Selon les explications du secteur, GAIA est considéré comme un benchmark qui reflète fidèlement les capacités des « agents d’IA pratiques » sur le marché des benchmarks d’IA. Développé conjointement par Meta AI, HuggingFace et l’Université Paris-Saclay, entre autres, ce benchmark a été rendu public pour la première fois en novembre 2023.

GAIA se distingue des autres benchmarks par trois éléments essentiels. Premièrement, les réponses étant confidentielles, le surapprentissage est impossible. Deuxièmement, comme il exige un raisonnement complexe en plusieurs étapes et multimodal, il est impossible d’obtenir un score élevé par simple appariement de motifs. Troisièmement, plus de 3 090 modèles du monde entier s’affrontent dans les mêmes conditions par l’intermédiaire du classement officiel de HuggingFace.

L’ensemble de test comprend au total 301 questions. Le niveau 1 porte sur l’utilisation d’un seul outil et le raisonnement simple; le niveau 2 exige la combinaison de plusieurs outils et un raisonnement de niveau intermédiaire; le niveau 3 comprend les questions les plus difficiles, qui nécessitent la planification et l’exécution par un agent en au moins cinq étapes. Lors de la présentation du benchmark, le taux était d’environ 15 % pour les modèles GPT équipés de plug-ins; les équipes de tête l’ont actuellement fait progresser jusqu’à 70–80 %.

Dans ce contexte, CLEVI a souligné que l’aspect le plus important sur le plan technique de cette performance est de n’avoir utilisé aucune API de LLM externe, comme GPT, Claude ou Gemini. La particularité de CLEVI est d’avoir utilisé deux modèles développés en interne selon une approche from scratch.

cip-5.5-agent est un modèle d’IA agentique qui joue le rôle de cerveau central du pipeline d’agents, planifiant (planning), exécutant (execution) et vérifiant (verification) de manière autonome des tâches complexes. cip-5.5-mm est un modèle multimodal généraliste haute performance qui comprend et interprète divers formats de fichiers, notamment la voix, les images et les vidéos. Comme une grande partie des questions de GAIA comprend des entrées non textuelles telles que des fichiers PDF, des images et des fichiers audio, cette capacité multimodale est devenue un facteur essentiel pour obtenir un score élevé.

À partir de ces deux modèles développés en interne, CLEVI a inscrit cinq configurations d’agents différentes à GAIA, et toutes ont obtenu un score supérieur à 70.

Selon l’entreprise, un résultat intéressant a été confirmé lors d’un examen rétrospectif interne de CLEVI. Pour certaines des 301 questions au total, les éléments justifiant les réponses exactes avaient disparu du Web public actuel. Il s’agissait de renseignements qui étaient auparavant accessibles en ligne ou dans les moteurs de recherche, mais qui avaient été supprimés ou modifiés et n’étaient plus accessibles. Lors d’une réévaluation fondée sur l’information actuellement vérifiable publiquement par des humains, le taux de réponses exactes de CLEVI s’est révélé supérieur à 98 %. Il s’agit d’un résultat qui dépasse déjà la moyenne humaine de 92 %.

Un représentant de CLEVI a expliqué : « Sans combiner de modèles externes, CLEVI a obtenu un score de plus de 70 avec ses cinq agents, en utilisant uniquement ses propres modèles développés from scratch et ses propres solutions d’agents d’IA, se classant ainsi parmi les 2,5 % supérieurs d’un benchmark public. Il semble possible d’améliorer davantage le score officiel à l’avenir en perfectionnant nos propres modèles et solutions d’agents. Cette réalisation est particulièrement significative parce qu’elle démontre une “confiance vérifiée” mesurée dans un benchmark public mondial, qu’elle constitue une réussite fondée sur des modèles développés from scratch par une entreprise coréenne de développement de l’IA, qu’elle résulte d’une pile de modèles indépendante plutôt que d’une combinaison de modèles externes et que, compte tenu de la perte d’information concernant certaines questions, elle offre une valeur d’interprétation supérieure à celle du score lui-même. »

Retour à la salle de presse
CLEVI

Langue et région

Les langues traduites automatiquement sont indiquées. La disponibilité suit la version publiée du site.

136 langues

Recommandé

1

Asie orientale

7

Asie du Sud-Est

11

Asie du Sud

18

Asie centrale

5

Moyen-Orient et Caucase

10

Europe occidentale et Europe méridionale

16

Royaume-Uni et Irlande

4

Europe septentrionale

10

Europe centrale et Balkans

14

Europe orientale

5

Afrique orientale

8

Afrique occidentale et Afrique centrale

9

Afrique australe

8

Amériques

5

Océanie

5
CLEVI, 79,07 % avec son propre modèle développé from scratch… dans le top 2,5 % des 3 090 modèles — CLEVI