Investigación

Modelo fundacional creado desde cero de CLEVI AI (ivy)

“Como puido unha empresa pequena crear un modelo de linguaxe de IA xigante de nivel mundial?”

Imaxe do corpo

“Como puido unha empresa pequena crear un modelo de linguaxe de IA xigante de nivel mundial?”

Como creou unha pequena startup un modelo de linguaxe xigante?

Esta é a pregunta que máis recibiu CLEVI desde que presentou o seu modelo fundacional de 1,4 billóns de parámetros.

A diferenza de moitas empresas, que simplemente afinan modelos de código aberto, CLEVI levou a cabo de forma independente todo o proceso, desde a recompilación de datos e o deseño do modelo ata o adestramento distribuído a grande escala e a verificación da calidade.

A continuación, presentamos en detalle o segredo e a competitividade que hai detrás.

1. Unha empresa pequena crea un modelo de linguaxe xigante?

Imaxe do corpo

En xullo de 2025, cando CLEVI presentou no mercado o seu propio modelo de linguaxe xigante desenvolvido internamente, numerosos clientes (usuarios) reaccionaron con sorpresa e dúbidas. “É realmente un desenvolvemento propio?” “Non será simplemente unha versión lixeiramente modificada dun modelo de código aberto?”

Na práctica, moitas empresas nacionais e estranxeiras limítanse a aplicar a aprendizaxe por transferencia (fine-tuning) a modelos de código aberto e promocionan o resultado como o seu propio modelo.

Porén, CLEVI presentou un **«Modelo fundacional creado desde cero»**.

É dicir, deseñou e executou directamente todo o proceso, desde a recompilación de datos e o deseño do modelo ata o adestramento distribuído a grande escala e a verificación da calidade.

2. Por que é difícil desenvolver un modelo de linguaxe xigante

Para adestrar un modelo fundacional creado desde cero, é necesario aprender todos os elementos seguintes.

É necesario un conxunto de datos de alta calidade e a grande escala

  • Diversidade: garantir a diversidade de linguas, dominios e formatos (texto, imaxes, etc.)
  • Depuración: eliminación do ruído, control da calidade e filtrado de datos duplicados ou prexudiciais
  • Licenzas: clarificar os dereitos de autor e os dereitos de uso dos datos

Infraestrutura informática a grande escala

  • Clúster de GPU/TPU de alto rendemento: tecnoloxía para integrar equipos de miles ou decenas de miles de nodos e permitir o adestramento distribuído de grandes volumes
  • Marco de traballo para o adestramento distribuído eficiente: DeepSpeed, Megatron-LM, Ray, etc.
  • Almacenamento/rede: entrada e saída de grandes volumes de datos e un contorno de rede de alta velocidade

Deseño da arquitectura do modelo

  • Reflicte a arquitectura máis recente: Transformer, MoE (Mixture of Experts), multimodalidade, etc.
  • Escalabilidade: consideración da capacidade de expansión en función do número de parámetros, capas, lonxitude da entrada, etc.
  • Eficiencia: optimización da velocidade de adestramento/inferencia e do uso da memoria

Estratexias e algoritmos de adestramento

  • Obxectivos do preadestramento: modelos de linguaxe (por exemplo, next token prediction), multimodalidade (por exemplo, contrastive learning), etc.
  • Técnicas de optimización: mixed precision, gradient accumulation, learning rate schedule, etc.
  • Normalización/estabilización: dropout, layer norm, weight decay, etc.

Sistema de avaliación e validación

  • Conxuntos de referencia: uso de conxuntos de datos estándar (Benchmarks)
  • Avaliación interna: avaliación baseada en escenarios de uso reais
  • Monitorización continua: comprobación da calidade, os nesgos e a seguridade durante e despois do adestramento

Capacidade do persoal e da organización

  • Investigadores de IA/ML: deseño de modelos e desenvolvemento de algoritmos
  • Enxeñeiros de datos: recompilación, depuración e xestión de datos
  • Enxeñeiros de infraestrutura: xestión de sistemas distribuídos e contornas na nube ou locais
  • Xestores de proxectos: xestión de prazos, orzamento e calidade

Consideracións éticas, legais e de seguridade

  • Ética da IA: nesgos, seguridade, transparencia e responsabilidade
  • Cumprimento legal: privacidade, dereitos de autor e soberanía dos datos
  • Seguridade: prevención da filtración de datos/modelos e control de acceso

Actualmente, o persoal investigador de IA en todo o mundo rolda as 2.000 persoas, e a maioría concéntrase en grandes empresas tecnolóxicas como META, Google e XAI. En Corea do Sur son moi poucos os equipos capaces de deseñar directamente todo, desde a recompilación de datos ata a infraestrutura de adestramento a grande escala, para crear un modelo Foundation.

3. Crear un modelo de linguaxe xigante con pouco persoal.

Con todo, o CEO de Clevi, Lee Hwan-ho, decidiu crear a mellor IA do mundo en “Clevi”.

Baseándose en máis de 10 anos de experiencia na investigación de aprendizaxe profunda e aprendizaxe automática, hai 3 anos o CEO Lee Hwan-ho fundou a empresa (Clevi) co obxectivo de “crear a mellor IA do mundo”.

Ao deseñar directamente todos os procesos, incluída a creación da propia canalización de datos da empresa, o deseño da infraestrutura de aprendizaxe profunda distribuída a grande escala, o desenvolvemento da arquitectura do modelo e a validación da calidade, adquiriu as capacidades necesarias para desenvolver un Foundation Model.

Tras adestrar o modelo en varias ocasións, agora conta cun modelo Clevi-5-x capaz de competir cos modelos de primeiro nivel mundial.

Imaxe do corpo

Para adestrar eficazmente modelos de linguaxe a grande escala, é necesaria unha infraestrutura que conecte centos ou miles de GPU nun clúster e poida procesar simultaneamente operacións da orde de decenas de cuatrillóns por segundo. Neste proceso, son fundamentais as tecnoloxías que minimizan a sincronización dos cálculos e a latencia das comunicacións en contornos distribuídos a grande escala. Ata o de agora, en Corea do Sur, a maioría das empresas non podía adestrar correctamente os modelos debido á ausencia de «algoritmos de control de precisión». O CEO de Clevi, Lee Hwan-ho, desenvolveu internamente este algoritmo propio de control do cálculo distribuído e logrou, por primeira vez en Corea do Sur, adestrar con éxito un modelo de linguaxe a grande escala con 1,4 billóns (1.4 Trillion) de parámetros.

4. Razón pola que foi posible desenvolver diversos modelos cun pequeno número de desenvolvedores

A maioría das empresas de alta tecnoloxía tamén conta con tecnoloxías de control de infraestruturas a grande escala e de depuración de datos.

Para xestionalas, son necesarios centos ou miles de investigadores.

Porén, Clevi desenvolve e dispón de diversos modelos cun pequeno número de investigadores.

Como foi posible?

Imaxe do corpo

Clevi desenvolve e dispón de diversos modelos cun pequeno número de persoas mediante a tecnoloxía Teacher-Student Model(Knowledge Distilation).

Vexamos entón a tecnoloxía Teacher-Student.

Teacher-Student(destilación de coñecemento)

A tecnoloxía Teacher-Student é, en termos sinxelos, unha tecnoloxía que permite desenvolver rapidamente diversos modelos cun pequeno número de persoas, substituíndo centos de investigadores, mediante a avaliación e a retroalimentación do modelo fillo (Student Model) a través dun modelo de linguaxe a grande escala (Teacher Model).

Imaxe do corpo
  • O Mother Model(modelo a grande escala) avalía e proporciona retroalimentación sobre modelos de diversos ámbitos, substituíndo centos de investigadores.
  • Se o adestramento se realiza mediante Clevi-x-platform deste xeito, é posible adestrar e despregar modelos de alto rendemento como Reasoning, VLM, Physical AI e Coding Agent en só 10–15 días.

Clevi Coding Agent

Imaxe do corpo

Clevi Phsycal AI Learning Platform

Imaxe do corpo

VLM-Vision Language Model

Imaxe do corpo

Axente de seguridade

Imaxe do corpo

5. Diferenciación tecnolóxica e de calidade de Clevi-x-platform

Rendemento e escalabilidade do modelo

  • Vantaxe no razoamento (CoT/Reasoning): cip-5-x incorpora na súa filosofía de deseño o desenvolvemento lóxico por etapas e a presentación de fundamentos, e amosa capacidades de cálculo e interpretación de alta fiabilidade na resolución de problemas científicos, matemáticos e de enxeñaría. Segundo os parámetros de referencia internos, está deseñado e operado co obxectivo de acadar capacidades de rendemento de nivel GPT-5 ou superior, e xestiona a reproducibilidade e verificabilidade baixo as mesmas condicións de solicitude como indicadores clave de calidade.
Imaxe do corpo
  • Espectro multimodal completo: ao producir e combinar nunha única plataforma o VLM orientado a obxectivos (cip-5-vision), o modelo de procesamento multimodal de gran capacidade (ivy-4-mm) e o modelo lixeiro no dispositivo (ivy-3-text), é posible optimizar a combinación segundo as características da tarefa (procura/clasificación/resumo fronte a razoamento/explicación/execución).

Aplicabilidade empresarial

  • Seguridade e dispoñibilidade on-premises: operación en todo o percorrido da rede illada (entrada-aprendizaxe-servizo-copia de seguridade), deseño HA, ampliación modular e protección separada dos datos e dos parámetros do modelo mediante SVCE (contorno de execución seguro illado).
  • Implantación e ampliación rápidas: Ivy Chat (conversas/axentes multimodais orientados ao traballo) e API Platform (SaaS estándar global) permiten unha aplicación e operación rápidas.
Imaxe do corpo

Diferenzas da IA física (Physical AI)

  • A combinación de simulación baseada en NVIDIA Isaac e aprendizaxe por reforzo baseada na evolución (Evolutionary RL), xunto coa transferencia Sim2Real e a aprendizaxe paralela con datos sintéticos, mellorou a eficiencia da aprendizaxe e a adaptación ao contorno real. É pouco habitual atopar alternativas que cubran desde a aprendizaxe dixital e robótica ata a súa implantación.

Calidade do servizo e gobernanza

  • A xestión de versións de modelos/prompts/ferramentas, a suite de avaliación (coñecemento en coreano e inglés, tarefas por industria, indicadores de alucinación e seguridade), a xestión de cambios (SLO/SLA) e a observabilidade operativa (latencia, taxa de éxito e TCO) xestiónanse mediante procedementos dunha única plataforma.

Actualmente existen en Corea do Sur máis de 300 empresas de servizos de modelos de IA, pero

CLEVI é a única empresa que pode ofrecer simultaneamente servizos on-premises e na nube mediante modelos fundacionais propios de alto rendemento.

6. Como utilizar os modelos de linguaxe na industria

Dado que a adopción da IA require un investimento considerable e unha validación rigorosa, é esencial comparar e probar directamente se se trata dunha solución que realmente axuda á empresa.

  • CLEVI non se limita a crear modelos, senón que ofrece solucións de IA aplicables a contornas industriais reais.
  • Por exemplo, conta con canles empresariais completas, como Ivy Chat Platform, Clevi API Platform, personalización por sectores e resposta aos requisitos de seguridade.
  • Posúe capacidades tecnolóxicas difíciles de atopar tanto no ámbito nacional como internacional, incluíndo IA física, robótica e procesamento de datos multimodais.

CLEVI ofrece solucións de IA tanxibles que contribúen á eficiencia real do traballo e á innovación industrial, utilizando a IA como un «medio» e non como un «fin». Experimente directamente a diferenciación dos modelos From-scratch Foundation.

Consultas e solicitudes de demostración: [email protected]

Copyright© 2025 Clevi Inc. Todos os dereitos reservados.

Volver á sala de prensa
CLEVI

Idioma e rexión

As linguas traducidas automaticamente están marcadas. A dispoñibilidade segue o paquete do sitio publicado.

136 idiomas

Recomendado

1

Asia Oriental

7

Sueste Asiático

11

Asia Meridional

18

Asia Central

5

Oriente Medio e o Cáucaso

10

Europa Occidental e Europa Meridional

16

Reino Unido e Irlanda

4

Europa Setentrional

10

Europa Central e os Balcáns

14

Europa do Leste

5

África Oriental

8

África Occidental e África Central

9

África Meridional

8

América

5

Oceanía

5
Modelo fundacional creado desde cero de CLEVI AI (ivy) — CLEVI