Actualités

Clevi, 79,07 % avec son propre modèle développé from scratch... parmi les 3 090 modèles, dans le top 2,5 %

Source : Lee Won-ji, journaliste à Electronic Times

Source : Lee Won-ji, journaliste à Electronic Times

Citation intégrale de l’article « Clevi, 79,07 % avec son propre modèle développé from scratch... parmi les 3 090 modèles, dans le top 2,5 % »

Date de publication : 2026-04-07

Lien : https://www.etnews.com/20260407000203

Les cinq agents de la pile de modèles propriétaires cip-5.5-agent·cip-5.5-mm obtiennent tous plus de 70 points

Un taux de réponses correctes supérieur à 98 % en tenant compte des pertes d’information, dépassant celui des humains (92 %)

Image du corps de l’article

La start-up d’IA « Clevi » a obtenu un taux de réponses correctes de 79,07 % dans « GAIA », le benchmark mondial des agents d’IA, en utilisant son propre modèle développé from scratch, se classant ainsi dans le top 2,5 % des 3 090 modèles enregistrés au total.

Selon les explications du secteur, GAIA est considéré comme reflétant fidèlement les capacités des « agents d’IA pratiques » sur le marché des benchmarks d’IA. Développé conjointement par Meta AI, Hugging Face et l’Université Paris-Saclay, entre autres, ce benchmark a été dévoilé pour la première fois en novembre 2023.

GAIA se distingue des autres benchmarks par trois caractéristiques essentielles. Premièrement, les réponses étant confidentielles, le surapprentissage est impossible. Deuxièmement, comme il exige un raisonnement complexe en plusieurs étapes et multimodal, il est impossible d’obtenir un score élevé par une simple mise en correspondance de motifs. Troisièmement, plus de 3 090 modèles du monde entier s’affrontent dans les mêmes conditions via le classement officiel de Hugging Face.

Le jeu de test se compose de 301 questions au total. Le niveau 1 porte sur l’utilisation d’un outil unique et un raisonnement simple, le niveau 2 sur la combinaison de plusieurs outils et un raisonnement de niveau intermédiaire, tandis que le niveau 3 comprend les questions les plus difficiles, qui exigent la planification et l’exécution par un agent en cinq étapes ou plus. Lors de la présentation du benchmark, le score des modèles GPT (équipés de plugins) n’était que d’environ 15 %, tandis que les équipes les mieux classées l’ont actuellement porté à 70–80 %.

Dans ce contexte, Clevi a souligné que l’aspect techniquement le plus remarquable de cette performance est de n’avoir utilisé aucune API de LLM externes telles que GPT, Claude ou Gemini. La particularité de Clevi est d’avoir utilisé deux modèles propriétaires développés en interne selon une approche from scratch.

cip-5.5-agent est un modèle d’IA agentique qui joue le rôle de cerveau central d’un pipeline d’agents planifiant (planning), exécutant (execution) et vérifiant (verification) de manière autonome des tâches complexes. cip-5.5-mm est un modèle multimodal généraliste haute performance capable de comprendre et de raisonner sur divers formats de fichiers, notamment la voix, les images et les vidéos. Comme une grande partie des questions de GAIA inclut des entrées non textuelles telles que des PDF, des images et des fichiers audio, cette capacité multimodale est devenue un facteur clé des scores élevés.

À partir de ces deux modèles propriétaires, Clevi a inscrit cinq configurations d’agents différentes à GAIA, qui ont toutes obtenu un score supérieur à 70.

Selon l’entreprise, un résultat intéressant a été constaté lors d’un examen rétrospectif interne de Clevi. Parmi les 301 questions au total, certaines ne disposent plus actuellement de sources publiques permettant d’étayer leurs réponses sur le Web. Il s’agit de cas où des informations autrefois accessibles en ligne ou via des moteurs de recherche ont été supprimées ou modifiées et ne sont plus accessibles. Lors d’une réévaluation fondée sur les informations actuellement vérifiables publiquement par les humains, le taux de réponses correctes de Clevi s’est révélé supérieur à 98 %. Ce chiffre dépasse déjà la moyenne humaine, qui est de 92 %.

Un responsable de Clevi a expliqué : « Clevi a fait entrer ses cinq agents dans le top 2,5 % du benchmark public, chacun obtenant plus de 70 points, uniquement grâce à ses modèles propriétaires from scratch et à ses propres solutions d’agents IA, sans mélange de modèles externes. Il semble que l’amélioration future de ses modèles et solutions d’agents propriétaires permettra également d’augmenter encore le score officiel. Cette performance est particulièrement significative à plusieurs égards : elle démontre une “confiance vérifiée” mesurée sur un benchmark public mondial ; elle constitue une réussite d’un développeur d’IA national fondée sur des modèles propriétaires from scratch ; elle résulte d’une pile de modèles indépendante et non d’un mélange de modèles externes ; et, compte tenu de la perte d’informations pour certaines questions, elle présente une valeur interprétative supérieure au simple score. »

Retour à la salle de presse
CLEVI

Langue et région

Les langues traduites automatiquement sont signalées. La disponibilité suit le module publié du site.

136 langues

Recommandé

1

Asie de l’Est

7

Asie du Sud-Est

11

Asie du Sud

18

Asie centrale

5

Moyen-Orient et Caucase

10

Europe de l’Ouest et Europe du Sud

16

Royaume-Uni et Irlande

4

Europe du Nord

10

Europe centrale et Balkans

14

Europe de l’Est

5

Afrique orientale

8

Afrique occidentale et Afrique centrale

9

Afrique australe

8

Amériques

5

Océanie

5
Clevi, 79,07 % avec son propre modèle développé from scratch... parmi les 3 090 modèles, dans le top 2,5 % — CLEVI