« Comment une petite entreprise a-t-elle pu créer un modèle de langage d’IA géant de niveau mondial ? »
Comment une petite start-up a-t-elle créé un modèle de langage géant ?
C’est la question qui nous a été le plus souvent posée depuis que Clevi a dévoilé son modèle Foundation de 1,4 billion de paramètres.
Contrairement à de nombreuses entreprises qui se contentent d’affiner des modèles open source, Clevi a réalisé de manière indépendante l’ensemble du processus, de la collecte des données à la conception du modèle, en passant par l’apprentissage distribué à grande échelle et la vérification de la qualité.
Nous présentons en détail ci-dessous ses secrets et ses avantages concurrentiels.
1. Une petite entreprise crée-t-elle un modèle de langage géant ?
En juillet 2025, lorsque Clevi a dévoilé au marché son propre modèle de langage géant, d’innombrables clients (utilisateurs) ont été stupéfaits et perplexes. « Est-il vraiment développé en interne ? » « N’est-ce pas simplement une version légèrement modifiée d’un modèle open source ? »
En réalité, de nombreuses entreprises nationales et internationales se contentent souvent d’effectuer un simple apprentissage par transfert (fine-tuning) sur des modèles open source, avant de les présenter comme leurs propres modèles.
Cependant, Clevi a mis en avant le **‘From-scratch Foundation Model’**.
Autrement dit, Clevi a directement conçu et exécuté l’ensemble du processus, de la collecte des données à la conception du modèle, en passant par l’apprentissage distribué à grande échelle et la vérification de la qualité.
2. Pourquoi le développement d’un modèle de langage géant est-il difficile ?
Pour entraîner un From-Scratch Foundation Model, il est nécessaire de maîtriser tous les éléments ci-dessous.
Un jeu de données de grande qualité et de grande ampleur est nécessaire
- Diversité : garantir la diversité des langues, des domaines et des formats (texte, images, etc.)
- Nettoyage : suppression du bruit, contrôle de la qualité, filtrage des données en double ou nuisibles
- Licences : clarification des droits d’auteur et des droits d’utilisation des données
Une infrastructure informatique à grande échelle
- Clusters de GPU/TPU haute performance : technologies permettant d’intégrer des équipements comptant de milliers à dizaines de milliers de nœuds afin de prendre en charge l’apprentissage distribué de grands volumes
- Cadres d’apprentissage distribué efficaces : DeepSpeed, Megatron-LM, Ray, etc.
- Stockage/réseau : entrées-sorties de grandes quantités de données et environnement réseau rapide
Conception de l’architecture du modèle
- Prise en compte des architectures récentes : Transformer, MoE (Mixture of Experts), multimodalité, etc.
- Évolutivité : prise en compte de la capacité d’extension du nombre de paramètres, du nombre de couches, de la longueur des entrées, etc.
- Efficacité : optimisation de la vitesse d’apprentissage et d’inférence, ainsi que de l’utilisation de la mémoire
Stratégies et algorithmes d’apprentissage
- Objectifs du pré-entraînement : modèles de langage (p. ex. next token prediction), multimodalité (p. ex. contrastive learning), etc.
- Techniques d’optimisation : mixed precision, gradient accumulation, learning rate schedule, etc.
- Normalisation/stabilisation : dropout, layer norm, weight decay, etc.
Système d’évaluation et de validation
- Jeux de benchmarks : utilisation de jeux de données standard (Benchmarks)
- Évaluation interne : évaluation fondée sur des scénarios d’utilisation réels
- Suivi continu : contrôle de la qualité, des biais et de la sécurité pendant et après l’apprentissage
Compétences humaines et organisationnelles
- Chercheurs en IA/ML : conception de modèles, développement d’algorithmes
- Ingénieurs data : collecte, nettoyage et gestion des données
- Ingénieurs infrastructure : systèmes distribués, gestion du cloud et des infrastructures sur site
- Chefs de projet : gestion des délais, du budget et de la qualité
Considérations éthiques, juridiques et de sécurité
- Éthique de l’IA : biais, sécurité, transparence et responsabilité
- Conformité juridique : données personnelles, droits d’auteur et souveraineté des données
- Sécurité : prévention des fuites de données et de modèles, contrôle des accès
À l’heure actuelle, les effectifs mondiaux de recherche en IA comptent environ 2 000 personnes, dont la plupart sont concentrées dans de grandes entreprises technologiques telles que META, Google et XAI. En Corée du Sud, les équipes capables de concevoir directement un modèle de fondation, de la collecte des données à l’infrastructure d’apprentissage à grande échelle, sont extrêmement rares.
3. Créer un modèle de langage géant avec peu de personnel.
Cependant, le PDG de Clevi, Lee Hwan-ho, a décidé de créer la meilleure IA au monde chez « Clevi ».
Fort de plus de 10 ans d’expérience dans la recherche en apprentissage profond et en apprentissage automatique, le PDG Lee Hwan-ho a fondé l’entreprise (Clevi) il y a 3 ans avec pour objectif de « créer la meilleure IA au monde ».
En concevant directement chaque étape — de la mise en place de son propre pipeline de données à la conception d’une infrastructure distribuée d’apprentissage profond à grande échelle, en passant par le développement de l’architecture du modèle et la validation de la qualité — l’entreprise a acquis les compétences nécessaires au développement d’un modèle de fondation.
Après avoir entraîné le modèle à plusieurs reprises, l’entreprise dispose désormais du modèle Clevi-5-x, capable de rivaliser avec les modèles les plus performants au monde.
Pour entraîner efficacement les modèles de langage de très grande taille, il est nécessaire de connecter des centaines à plusieurs milliers de GPU en cluster afin de disposer d’une infrastructure capable de traiter simultanément des opérations se comptant en centaines de quadrillions par seconde. Dans ce processus, les technologies permettant de minimiser la synchronisation des calculs et les délais de communication dans les environnements distribués à grande échelle sont essentielles. Jusqu’à présent, en Corée du Sud, la plupart des entreprises ne pouvaient pas entraîner correctement leurs modèles en raison de l’absence d’« algorithmes de contrôle précis ». M. Hwan-ho Lee, PDG de Clevi, a développé en interne cet algorithme exclusif de contrôle des calculs distribués, permettant ainsi à Clevi de réussir, pour la première fois en Corée du Sud, l’entraînement d’un modèle de langage de très grande taille doté de 1,4 billion (1.4 Trillion) de paramètres.
4. La raison pour laquelle il était possible de développer différents modèles avec une petite équipe de développeurs
La plupart des entreprises de la Big Tech disposent également de technologies de contrôle des infrastructures à grande échelle et de traitement des données.
Pour les gérer, il faut plusieurs centaines à plusieurs milliers de chercheurs.
Cependant, Clevi développe et détient différents modèles avec une équipe de recherche réduite.
Comment cela a-t-il été possible ?
Grâce à la technologie Teacher-Student Model (Knowledge Distilation), Clevi développe et détient différents modèles avec une petite équipe.
Examinons maintenant la technologie Teacher-Student.
Teacher-Student (distillation des connaissances)
La technologie Teacher-Student consiste, en termes simples, à évaluer et à fournir des retours sur un modèle enfant (Student Model) au moyen d’un modèle de langage de très grande taille (Teacher Model), permettant ainsi de remplacer plusieurs centaines de chercheurs par une petite équipe et de développer rapidement différents modèles.
- Le Mother Model (modèle de très grande taille) évalue et fournit des retours sur des modèles dans différents domaines, remplaçant ainsi plusieurs centaines de chercheurs.
- En menant l’entraînement de cette manière via Clevi-x-platform, il est possible d’entraîner et de déployer en seulement 10 à 15 jours des modèles haute performance tels que Reasoning, VLM, Physical AI et Coding Agent.
Clevi Coding Agent
Clevi Phsycal AI Learning Platform
VLM-Vision Language Model
Agent de sécurité
5. Les éléments différenciateurs de Clevi-x-platform en matière de technologie et de qualité
Performances et évolutivité des modèles
- Supériorité en matière de raisonnement (CoT/Reasoning) : cip-5-x intègre le développement logique étape par étape et la présentation des fondements à sa philosophie de conception, et démontre des capacités de calcul et d’interprétation hautement fiables dans la résolution de problèmes scientifiques, mathématiques et d’ingénierie. Selon les critères des benchmarks internes, il est conçu et exploité avec pour objectif d’atteindre des performances de niveau GPT-5 ou supérieur, tout en gérant la reproductibilité et la vérifiabilité dans les mêmes conditions de prompt comme indicateurs clés de qualité.
- Spectre multimodal complet : en produisant et en combinant sur une même plateforme le VLM orienté objectifs (cip-5-vision), le modèle de traitement multimodal à grande capacité (ivy-4-mm) et le modèle léger on-device (ivy-3-text), il est possible de sélectionner la combinaison optimale en fonction des caractéristiques de la tâche (recherche/classification/résumé vs. raisonnement/explication/exécution).
Applicabilité en entreprise
- Sécurité et disponibilité on-premise : exploitation sur l’ensemble du réseau fermé (entrée-apprentissage-service-sauvegarde), conception HA, extension modulaire et protection séparée des données et des paramètres des modèles grâce à SVCE (environnement d’exécution sécurisé isolé).
- Déploiement et extension rapides : Ivy Chat (conversation/agent multimodal orienté métier) et API Platform (SaaS conforme aux standards mondiaux) permettent une mise en œuvre et une exploitation rapides.
Différenciation de l’IA physique (Physical AI)
- L’association de simulations basées sur NVIDIA Isaac et de l’apprentissage par renforcement évolutionnaire (Evolutionary RL), ainsi que l’apprentissage parallèle par transfert Sim2Real et données synthétiques, a amélioré l’efficacité de l’apprentissage et l’adaptation sur le terrain. La couverture de l’ensemble du processus, de l’apprentissage numérique et robotique au déploiement, constitue un domaine où les solutions de remplacement sont rares.
Qualité de service et gouvernance
- La gestion des versions des modèles/prompts/outils, la suite d’évaluation (connaissances en coréen et en anglais, tâches par secteur, indicateurs d’hallucination et de sécurité), la gestion des changements (SLO/SLA) et l’observabilité opérationnelle (latence, taux de réussite, TCO) sont administrées selon une procédure intégrée à une plateforme unique.
Il existe actuellement en Corée du Sud plus de 300 entreprises proposant des services de modèles d’IA, mais
Clevi est la seule entreprise capable de fournir simultanément des services on-premise et cloud grâce à son modèle de fondation propriétaire haute performance.
6. Méthodes d’utilisation des modèles de langage dans l’industrie
L’adoption de l’IA nécessitant des investissements considérables et une validation rigoureuse, il est indispensable de comparer et d’expérimenter directement les solutions afin de vérifier qu’elles apportent réellement une valeur ajoutée à l’entreprise.
- Clevi ne se contente pas de créer des modèles : nous proposons des solutions d’IA applicables dans des environnements industriels réels.
- Nous disposons notamment de canaux dédiés aux entreprises, avec Ivy Chat Platform, Clevi API Platform, la personnalisation par secteur et la conformité aux exigences de sécurité.
- Nous possédons des capacités technologiques rares en Corée comme à l’international, notamment en IA physique, en robotique et dans le traitement de données multimodales.
Clevi considère l’IA non pas comme une « fin », mais comme un « moyen », et propose des solutions d’IA concrètes qui contribuent à l’efficacité réelle du travail et à l’innovation industrielle. Découvrez directement la différence d’un véritable modèle Foundation conçu from scratch.
Demandes d’information et de démonstration : [email protected]
Copyright© 2025 Clevi Inc. Tous droits réservés.
