“Como puido unha empresa pequena crear un modelo de linguaxe de IA xigante de nivel mundial?”
Como creou unha pequena startup un modelo de linguaxe xigante?
Esta é a pregunta que máis recibiu CLEVI desde que presentou o seu modelo fundacional de 1,4 billóns de parámetros.
A diferenza de moitas empresas, que simplemente afinan modelos de código aberto, CLEVI levou a cabo de forma independente todo o proceso, desde a recompilación de datos e o deseño do modelo ata o adestramento distribuído a grande escala e a verificación da calidade.
A continuación, presentamos en detalle o segredo e a competitividade que hai detrás.
1. Unha empresa pequena crea un modelo de linguaxe xigante?
En xullo de 2025, cando CLEVI presentou no mercado o seu propio modelo de linguaxe xigante desenvolvido internamente, numerosos clientes (usuarios) reaccionaron con sorpresa e dúbidas. “É realmente un desenvolvemento propio?” “Non será simplemente unha versión lixeiramente modificada dun modelo de código aberto?”
Na práctica, moitas empresas nacionais e estranxeiras limítanse a aplicar a aprendizaxe por transferencia (fine-tuning) a modelos de código aberto e promocionan o resultado como o seu propio modelo.
Porén, CLEVI presentou un **«Modelo fundacional creado desde cero»**.
É dicir, deseñou e executou directamente todo o proceso, desde a recompilación de datos e o deseño do modelo ata o adestramento distribuído a grande escala e a verificación da calidade.
2. Por que é difícil desenvolver un modelo de linguaxe xigante
Para adestrar un modelo fundacional creado desde cero, é necesario aprender todos os elementos seguintes.
É necesario un conxunto de datos de alta calidade e a grande escala
- Diversidade: garantir a diversidade de linguas, dominios e formatos (texto, imaxes, etc.)
- Depuración: eliminación do ruído, control da calidade e filtrado de datos duplicados ou prexudiciais
- Licenzas: clarificar os dereitos de autor e os dereitos de uso dos datos
Infraestrutura informática a grande escala
- Clúster de GPU/TPU de alto rendemento: tecnoloxía para integrar equipos de miles ou decenas de miles de nodos e permitir o adestramento distribuído de grandes volumes
- Marco de traballo para o adestramento distribuído eficiente: DeepSpeed, Megatron-LM, Ray, etc.
- Almacenamento/rede: entrada e saída de grandes volumes de datos e un contorno de rede de alta velocidade
Deseño da arquitectura do modelo
- Reflicte a arquitectura máis recente: Transformer, MoE (Mixture of Experts), multimodalidade, etc.
- Escalabilidade: consideración da capacidade de expansión en función do número de parámetros, capas, lonxitude da entrada, etc.
- Eficiencia: optimización da velocidade de adestramento/inferencia e do uso da memoria
Estratexias e algoritmos de adestramento
- Obxectivos do preadestramento: modelos de linguaxe (por exemplo, next token prediction), multimodalidade (por exemplo, contrastive learning), etc.
- Técnicas de optimización: mixed precision, gradient accumulation, learning rate schedule, etc.
- Normalización/estabilización: dropout, layer norm, weight decay, etc.
Sistema de avaliación e validación
- Conxuntos de referencia: uso de conxuntos de datos estándar (Benchmarks)
- Avaliación interna: avaliación baseada en escenarios de uso reais
- Monitorización continua: comprobación da calidade, os nesgos e a seguridade durante e despois do adestramento
Capacidade do persoal e da organización
- Investigadores de IA/ML: deseño de modelos e desenvolvemento de algoritmos
- Enxeñeiros de datos: recompilación, depuración e xestión de datos
- Enxeñeiros de infraestrutura: xestión de sistemas distribuídos e contornas na nube ou locais
- Xestores de proxectos: xestión de prazos, orzamento e calidade
Consideracións éticas, legais e de seguridade
- Ética da IA: nesgos, seguridade, transparencia e responsabilidade
- Cumprimento legal: privacidade, dereitos de autor e soberanía dos datos
- Seguridade: prevención da filtración de datos/modelos e control de acceso
Actualmente, o persoal investigador de IA en todo o mundo rolda as 2.000 persoas, e a maioría concéntrase en grandes empresas tecnolóxicas como META, Google e XAI. En Corea do Sur son moi poucos os equipos capaces de deseñar directamente todo, desde a recompilación de datos ata a infraestrutura de adestramento a grande escala, para crear un modelo Foundation.
3. Crear un modelo de linguaxe xigante con pouco persoal.
Con todo, o CEO de Clevi, Lee Hwan-ho, decidiu crear a mellor IA do mundo en “Clevi”.
Baseándose en máis de 10 anos de experiencia na investigación de aprendizaxe profunda e aprendizaxe automática, hai 3 anos o CEO Lee Hwan-ho fundou a empresa (Clevi) co obxectivo de “crear a mellor IA do mundo”.
Ao deseñar directamente todos os procesos, incluída a creación da propia canalización de datos da empresa, o deseño da infraestrutura de aprendizaxe profunda distribuída a grande escala, o desenvolvemento da arquitectura do modelo e a validación da calidade, adquiriu as capacidades necesarias para desenvolver un Foundation Model.
Tras adestrar o modelo en varias ocasións, agora conta cun modelo Clevi-5-x capaz de competir cos modelos de primeiro nivel mundial.
Para adestrar eficazmente modelos de linguaxe a grande escala, é necesaria unha infraestrutura que conecte centos ou miles de GPU nun clúster e poida procesar simultaneamente operacións da orde de decenas de cuatrillóns por segundo. Neste proceso, son fundamentais as tecnoloxías que minimizan a sincronización dos cálculos e a latencia das comunicacións en contornos distribuídos a grande escala. Ata o de agora, en Corea do Sur, a maioría das empresas non podía adestrar correctamente os modelos debido á ausencia de «algoritmos de control de precisión». O CEO de Clevi, Lee Hwan-ho, desenvolveu internamente este algoritmo propio de control do cálculo distribuído e logrou, por primeira vez en Corea do Sur, adestrar con éxito un modelo de linguaxe a grande escala con 1,4 billóns (1.4 Trillion) de parámetros.
4. Razón pola que foi posible desenvolver diversos modelos cun pequeno número de desenvolvedores
A maioría das empresas de alta tecnoloxía tamén conta con tecnoloxías de control de infraestruturas a grande escala e de depuración de datos.
Para xestionalas, son necesarios centos ou miles de investigadores.
Porén, Clevi desenvolve e dispón de diversos modelos cun pequeno número de investigadores.
Como foi posible?
Clevi desenvolve e dispón de diversos modelos cun pequeno número de persoas mediante a tecnoloxía Teacher-Student Model(Knowledge Distilation).
Vexamos entón a tecnoloxía Teacher-Student.
Teacher-Student(destilación de coñecemento)
A tecnoloxía Teacher-Student é, en termos sinxelos, unha tecnoloxía que permite desenvolver rapidamente diversos modelos cun pequeno número de persoas, substituíndo centos de investigadores, mediante a avaliación e a retroalimentación do modelo fillo (Student Model) a través dun modelo de linguaxe a grande escala (Teacher Model).
- O Mother Model(modelo a grande escala) avalía e proporciona retroalimentación sobre modelos de diversos ámbitos, substituíndo centos de investigadores.
- Se o adestramento se realiza mediante Clevi-x-platform deste xeito, é posible adestrar e despregar modelos de alto rendemento como Reasoning, VLM, Physical AI e Coding Agent en só 10–15 días.
Clevi Coding Agent
Clevi Phsycal AI Learning Platform
VLM-Vision Language Model
Axente de seguridade
5. Diferenciación tecnolóxica e de calidade de Clevi-x-platform
Rendemento e escalabilidade do modelo
- Vantaxe no razoamento (CoT/Reasoning): cip-5-x incorpora na súa filosofía de deseño o desenvolvemento lóxico por etapas e a presentación de fundamentos, e amosa capacidades de cálculo e interpretación de alta fiabilidade na resolución de problemas científicos, matemáticos e de enxeñaría. Segundo os parámetros de referencia internos, está deseñado e operado co obxectivo de acadar capacidades de rendemento de nivel GPT-5 ou superior, e xestiona a reproducibilidade e verificabilidade baixo as mesmas condicións de solicitude como indicadores clave de calidade.
- Espectro multimodal completo: ao producir e combinar nunha única plataforma o VLM orientado a obxectivos (cip-5-vision), o modelo de procesamento multimodal de gran capacidade (ivy-4-mm) e o modelo lixeiro no dispositivo (ivy-3-text), é posible optimizar a combinación segundo as características da tarefa (procura/clasificación/resumo fronte a razoamento/explicación/execución).
Aplicabilidade empresarial
- Seguridade e dispoñibilidade on-premises: operación en todo o percorrido da rede illada (entrada-aprendizaxe-servizo-copia de seguridade), deseño HA, ampliación modular e protección separada dos datos e dos parámetros do modelo mediante SVCE (contorno de execución seguro illado).
- Implantación e ampliación rápidas: Ivy Chat (conversas/axentes multimodais orientados ao traballo) e API Platform (SaaS estándar global) permiten unha aplicación e operación rápidas.
Diferenzas da IA física (Physical AI)
- A combinación de simulación baseada en NVIDIA Isaac e aprendizaxe por reforzo baseada na evolución (Evolutionary RL), xunto coa transferencia Sim2Real e a aprendizaxe paralela con datos sintéticos, mellorou a eficiencia da aprendizaxe e a adaptación ao contorno real. É pouco habitual atopar alternativas que cubran desde a aprendizaxe dixital e robótica ata a súa implantación.
Calidade do servizo e gobernanza
- A xestión de versións de modelos/prompts/ferramentas, a suite de avaliación (coñecemento en coreano e inglés, tarefas por industria, indicadores de alucinación e seguridade), a xestión de cambios (SLO/SLA) e a observabilidade operativa (latencia, taxa de éxito e TCO) xestiónanse mediante procedementos dunha única plataforma.
Actualmente existen en Corea do Sur máis de 300 empresas de servizos de modelos de IA, pero
CLEVI é a única empresa que pode ofrecer simultaneamente servizos on-premises e na nube mediante modelos fundacionais propios de alto rendemento.
6. Como utilizar os modelos de linguaxe na industria
Dado que a adopción da IA require un investimento considerable e unha validación rigorosa, é esencial comparar e probar directamente se se trata dunha solución que realmente axuda á empresa.
- CLEVI non se limita a crear modelos, senón que ofrece solucións de IA aplicables a contornas industriais reais.
- Por exemplo, conta con canles empresariais completas, como Ivy Chat Platform, Clevi API Platform, personalización por sectores e resposta aos requisitos de seguridade.
- Posúe capacidades tecnolóxicas difíciles de atopar tanto no ámbito nacional como internacional, incluíndo IA física, robótica e procesamento de datos multimodais.
CLEVI ofrece solucións de IA tanxibles que contribúen á eficiencia real do traballo e á innovación industrial, utilizando a IA como un «medio» e non como un «fin». Experimente directamente a diferenciación dos modelos From-scratch Foundation.
Consultas e solicitudes de demostración: [email protected]
Copyright© 2025 Clevi Inc. Todos os dereitos reservados.
