Recherche

Modèle de fondation développé à partir de zéro — CLEVI AI(ivy)

« Comment une petite entreprise a-t-elle pu créer un modèle de langage d’IA de très grande taille de calibre mondial? »

Image du corps du texte

« Comment une petite entreprise a-t-elle pu créer un modèle de langage d’IA de très grande taille de calibre mondial? »

Comment une petite start-up a-t-elle créé un modèle de langage de très grande taille?

C’est la question que l’on nous a le plus souvent posée depuis que CLEVI a dévoilé son modèle de fondation de 1,4 billion de paramètres.

Contrairement à de nombreuses entreprises qui se contentent d’effectuer un réglage fin de modèles open source, CLEVI a réalisé de manière indépendante toutes les étapes, de la collecte des données à la conception du modèle, en passant par l’apprentissage distribué à grande échelle et la validation de la qualité.

Nous présentons en détail ci-dessous les secrets de cette réussite et nos avantages concurrentiels.

1. Une petite entreprise peut-elle créer un modèle de langage de très grande taille?

Image du corps du texte

En juillet 2025, lorsque CLEVI a lancé sur le marché son propre modèle de langage de très grande taille, d’innombrables clients (utilisateurs) ont réagi avec étonnement et scepticisme. « S’agit-il vraiment d’un développement interne? » « N’est-ce pas simplement une version légèrement modifiée d’un modèle open source? »

En réalité, de nombreuses entreprises en Corée et à l’étranger se contentent d’effectuer un apprentissage par transfert (fine-tuning) sur des modèles open source, puis les présentent comme leurs propres modèles.

Cependant, CLEVI a mis de l’avant un **« modèle de fondation développé à partir de zéro »**.

Autrement dit, CLEVI a conçu et exécuté directement toutes les étapes, de la collecte des données à la conception du modèle, en passant par l’apprentissage distribué à grande échelle et la validation de la qualité.

2. Pourquoi est-il difficile de développer un modèle de langage de très grande taille?

Pour entraîner un modèle de fondation développé à partir de zéro, il faut maîtriser l’ensemble des éléments ci-dessous.

Un jeu de données de grande taille et de haute qualité est nécessaire

  • Diversité : assurer la diversité des langues, des domaines et des formats (texte, images, etc.)
  • Nettoyage : éliminer le bruit, assurer la qualité et filtrer les données en double ou nuisibles
  • Licences : clarifier les droits d’auteur et les droits d’utilisation des données

Une infrastructure informatique de grande échelle

  • Grappes de GPU/TPU haute performance : intégrer des équipements comptant de milliers à des dizaines de milliers de nœuds afin de prendre en charge l’apprentissage distribué de grands volumes de données
  • Cadres d’apprentissage distribué efficaces : DeepSpeed, Megatron-LM, Ray, etc.
  • Stockage/réseau : assurer l’entrée et la sortie de grands volumes de données ainsi qu’un environnement réseau rapide

Conception de l’architecture du modèle

  • Prise en compte des architectures récentes : Transformer, MoE (Mixture of Experts), multimodalité, etc.
  • Scalabilité : prise en compte de l’évolutivité du nombre de paramètres, du nombre de couches, de la longueur des entrées, etc.
  • Efficacité : optimisation de la vitesse d’entraînement et d’inférence, ainsi que de l’utilisation de la mémoire

Stratégies et algorithmes d’entraînement

  • Objectifs du préentraînement : modèles de langage (p. ex. next token prediction), modèles multimodaux (p. ex. contrastive learning), etc.
  • Techniques d’optimisation : mixed precision, gradient accumulation, learning rate schedule, etc.
  • Normalisation et stabilisation : dropout, layer norm, weight decay, etc.

Système d’évaluation et de validation

  • Ensembles de référence : utilisation de jeux de données standard (Benchmarks)
  • Évaluation interne : évaluation fondée sur des scénarios d’utilisation réels
  • Surveillance continue : vérification de la qualité, des biais et de la sécurité pendant et après l’entraînement

Compétences du personnel et de l’organisation

  • Chercheurs en IA/ML : conception de modèles et développement d’algorithmes
  • Ingénieurs de données : collecte, nettoyage et gestion des données
  • Ingénieurs en infrastructure : systèmes distribués et gestion de l’infrastructure infonuagique/sur site
  • Gestionnaires de projet : gestion des échéanciers, du budget et de la qualité

Considérations éthiques, juridiques et de sécurité

  • Éthique de l’IA : biais, sécurité, transparence et responsabilisation
  • Conformité juridique : renseignements personnels, droits d’auteur et souveraineté des données
  • Sécurité : prévention des fuites de données et de modèles, contrôle des accès

À l’échelle mondiale, les effectifs de recherche en IA comptent actuellement environ 2 000 personnes, dont la grande majorité est concentrée dans de grandes entreprises technologiques comme META, Google et XAI. En Corée du Sud, les équipes capables de concevoir directement un modèle de fondation, de la collecte des données jusqu’à l’infrastructure d’entraînement à grande échelle, sont extrêmement rares.

3. Créer un modèle de langage géant avec une équipe réduite.

Cependant, le PDG de CLEVI, Hwan-ho Lee, a décidé de créer la meilleure IA au monde chez CLEVI.

Fort de plus de 10 ans d’expérience en recherche sur l’apprentissage profond et l’apprentissage automatique, le PDG Hwan-ho Lee a fondé l’entreprise (CLEVI) il y a trois ans avec l’objectif de « créer la meilleure IA au monde ».

L’entreprise a conçu directement tous les processus nécessaires au développement d’un modèle de fondation, notamment la mise en place de son propre pipeline de données, la conception d’une infrastructure d’apprentissage profond distribué à grande échelle, le développement de l’architecture du modèle et la validation de la qualité, acquérant ainsi les compétences requises.

Après avoir entraîné plusieurs modèles, l’entreprise dispose maintenant du modèle Clevi-5-x, qui peut rivaliser avec les modèles de meilleur niveau au monde.

Image dans le corps du texte

Pour entraîner efficacement les modèles de langage de très grande taille, il faut une infrastructure qui relie de centaines à des milliers de GPU en grappe afin de traiter simultanément des dizaines de quadrillions d’opérations par seconde. Dans ce processus, les technologies qui minimisent la synchronisation des calculs et les délais de communication dans les environnements distribués à grande échelle sont essentielles. Jusqu’à présent, en Corée du Sud, la plupart des entreprises ne pouvaient pas entraîner correctement les modèles en raison de l’absence d’« algorithmes de contrôle précis ». M. Hwan-ho Lee, PDG de Clevi, a développé en interne un algorithme exclusif de contrôle des calculs distribués, ce qui lui a permis de réussir, pour la première fois en Corée du Sud, l’entraînement d’un modèle de langage de très grande taille comportant 1,4 billion (1.4 Trillion) de paramètres.

4. Pourquoi il a été possible de développer divers modèles avec une petite équipe de développeurs

La plupart des entreprises de haute technologie disposent également de technologies de contrôle des infrastructures à grande échelle et de traitement des données.

La gestion de ces éléments nécessite des centaines, voire des milliers de chercheurs.

Cependant, Clevi développe et possède divers modèles avec une petite équipe de chercheurs.

Comment cela a-t-il été possible?

Image du contenu principal

Grâce à la technologie Teacher-Student (Knowledge Distilation), Clevi développe et possède divers modèles avec une petite équipe de chercheurs.

Examinons maintenant la technologie Teacher-Student.

Teacher-Student (distillation des connaissances)

La technologie Teacher-Student permet, en termes simples, de développer rapidement divers modèles avec une petite équipe en évaluant et en fournissant des commentaires sur le modèle enfant (Student Model) au moyen d’un modèle de langage de très grande taille (Teacher Model), remplaçant ainsi des centaines de chercheurs.

Image du contenu principal
  • Le Mother Model (modèle de très grande taille) évalue divers modèles dans différents domaines et leur fournit des commentaires, remplaçant ainsi des centaines de chercheurs.
  • En procédant à l’entraînement de cette manière au moyen de Clevi-x-platform, il est possible d’entraîner et de déployer des modèles haute performance tels que Reasoning, VLM, Physical AI et Coding Agent en seulement 10 à 15 jours.

Clevi Coding Agent

Image du contenu principal

Clevi Phsycal AI Learning Platform

Image du contenu principal

VLM-Vision Language Model

Image du contenu principal

Agent de sécurité

Image du contenu principal

5. Différenciation de Clevi-x-platform en matière de technologie et de qualité

Performance et évolutivité des modèles

  • Supériorité en matière de raisonnement (CoT/Reasoning) : cip-5-x intègre le raisonnement logique étape par étape et la présentation des fondements à sa philosophie de conception, démontrant une grande fiabilité en calcul et en interprétation pour la résolution de problèmes scientifiques, mathématiques et d’ingénierie. Selon les critères de référence internes, il est conçu et exploité avec l’objectif d’atteindre un niveau de performance équivalent ou supérieur à celui de GPT-5, tandis que la reproductibilité et la vérifiabilité dans les mêmes conditions d’invite sont gérées comme des indicateurs clés de qualité.
Image principale
  • Spectre multimodal complet : la production et la combinaison, sur une même plateforme, d’un VLM axé sur les objectifs (cip-5-vision), d’un modèle de traitement multimodal à grande capacité (ivy-4-mm) et d’un modèle léger sur appareil (ivy-3-text) permettent de sélectionner la combinaison optimale en fonction des caractéristiques de la tâche (recherche/classification/résumé ou raisonnement/explication/exécution).

Applicabilité en entreprise

  • Sécurité et disponibilité sur site : l’exploitation sur l’ensemble du réseau fermé (entrée, apprentissage, service et sauvegarde), une conception haute disponibilité, une évolutivité modulaire et SVCE (environnement d’exécution sécurisé isolé) assurent une protection séparée des données et des paramètres des modèles.
  • Déploiement et évolutivité rapides : Ivy Chat (conversation et agents multimodaux axés sur les tâches professionnelles) et API Platform (SaaS conforme aux normes mondiales) permettent une mise en œuvre et une exploitation rapides.
Image principale

Différenciation de l’IA physique (Physical AI)

  • La combinaison de simulations fondées sur NVIDIA Isaac et de l’apprentissage par renforcement évolutionnaire (Evolutionary RL), ainsi que l’apprentissage parallèle par transfert Sim2Real et données synthétiques, ont amélioré l’efficacité de l’apprentissage et l’adaptation sur le terrain. Les solutions de rechange couvrant l’ensemble du cycle, de l’apprentissage numérique et robotique au déploiement, sont rares.

Qualité des services et gouvernance

  • La gestion des versions des modèles, des invites et des outils, la suite d’évaluation (connaissances en coréen et en anglais, tâches par secteur, indicateurs d’hallucination et de sécurité), la gestion des changements (SLO/SLA) et l’observabilité opérationnelle (latence, taux de réussite et TCO) sont gérées selon des procédures propres à une plateforme unique.

Il existe actuellement plus de 300 entreprises de services de modèles d’IA en Corée du Sud, mais

CLEVI est la seule entreprise capable de fournir simultanément des services sur site et infonuagiques grâce à ses modèles fondamentaux propriétaires haute performance.

6. Comment utiliser les modèles de langage dans l’industrie

Comme l’adoption de l’IA nécessite des investissements considérables et une validation rigoureuse, il est essentiel de comparer et d’essayer directement les solutions afin de vérifier si elles apportent une réelle valeur à l’entreprise.

  • CLEVI ne se contente pas de créer des modèles; elle fournit des solutions d’IA applicables dans des environnements industriels réels.
  • Par exemple, elle dispose de canaux d’entreprise complets, notamment Ivy Chat Platform, Clevi API Platform, la personnalisation par secteur et la conformité aux exigences de sécurité.
  • Elle possède des capacités technologiques difficiles à trouver au pays comme à l’étranger, notamment en IA physique, en robotique et en traitement de données multimodales.

CLEVI fournit des solutions d’IA concrètes qui contribuent à l’efficacité réelle du travail et à l’innovation industrielle, en utilisant l’IA comme un «moyen» plutôt que comme une «fin». Découvrez directement la différence des véritables modèles Foundation From-scratch.

Demandes de renseignements et de démonstration : [email protected]

Copyright© 2025 Clevi Inc. Tous droits réservés.

Retour à la salle de presse
CLEVI

Langue et région

Les langues traduites automatiquement sont indiquées. La disponibilité suit la version publiée du site.

136 langues

Recommandé

1

Asie orientale

7

Asie du Sud-Est

11

Asie du Sud

18

Asie centrale

5

Moyen-Orient et Caucase

10

Europe occidentale et Europe méridionale

16

Royaume-Uni et Irlande

4

Europe septentrionale

10

Europe centrale et Balkans

14

Europe orientale

5

Afrique orientale

8

Afrique occidentale et Afrique centrale

9

Afrique australe

8

Amériques

5

Océanie

5
Modèle de fondation développé à partir de zéro — CLEVI AI(ivy) — CLEVI