Pesquisa

Modelo fundamental criado do zero pela 클레비 AI(ivy)

“Como uma pequena empresa conseguiu criar um modelo de linguagem de IA de escala gigantesca de nível mundial?”

Imagem do corpo do texto

“Como uma pequena empresa conseguiu criar um modelo de linguagem de IA de escala gigantesca de nível mundial?”

Como uma startup de pequeno porte criou um modelo de linguagem de escala gigantesca?

Essa é a pergunta que a 클레비 recebeu com mais frequência desde que anunciou seu modelo fundamental, com 1,4 trilhão de parâmetros.

Ao contrário de muitas empresas, que apenas ajustam modelos de código aberto, a 클레비 realizou de forma independente todo o processo, desde a coleta de dados, o projeto do modelo e o treinamento distribuído em larga escala até a verificação de qualidade.

A seguir, apresentamos em detalhes os segredos e as vantagens competitivas desse feito.

1. Uma pequena empresa cria um modelo de linguagem de escala gigantesca?

Imagem do corpo do texto

Em julho de 2025, quando a 클레비 lançou no mercado seu modelo de linguagem de escala gigantesca desenvolvido internamente, inúmeros clientes (usuários) ficaram agitados, entre surpresa e dúvida. “É realmente um desenvolvimento próprio?” “Não seria apenas uma pequena alteração em um modelo de código aberto?”

Na prática, muitas empresas nacionais e internacionais realizam apenas o aprendizado por transferência (fine-tuning) de modelos de código aberto e os promovem como modelos próprios.

No entanto, a 클레비 apresentou um **‘From-scratch Foundation Model’**.

Ou seja, projetou e executou diretamente todo o processo, desde a coleta de dados, o projeto do modelo e o treinamento distribuído em larga escala até a verificação de qualidade.

2. Por que é difícil desenvolver um modelo de linguagem de escala gigantesca

Para treinar um From-Scratch Foundation Model, é necessário preparar e treinar todos os itens abaixo.

É necessário um conjunto de dados de alta qualidade e grande escala

  • Diversidade: garantir diversidade de idiomas, domínios e formatos (texto, imagens etc.)
  • Refinamento: remover ruídos, controlar a qualidade e filtrar dados duplicados/prejudiciais
  • Licenças: esclarecer os direitos autorais e as permissões de uso dos dados

Infraestrutura computacional de grande escala

  • Cluster de GPUs/TPUs de alto desempenho: integrar equipamentos de milhares a dezenas de milhares de nós para oferecer suporte ao treinamento distribuído de grandes volumes
  • Framework eficiente de treinamento distribuído: DeepSpeed, Megatron-LM, Ray etc.
  • Armazenamento/rede: entrada e saída de grandes volumes de dados e ambiente de rede de alta velocidade

Projeto da arquitetura do modelo

  • Reflexo das arquiteturas mais recentes: Transformer, MoE (Mixture of Experts), multimodalidade etc.
  • Escalabilidade: consideração da capacidade de expansão, como número de parâmetros, número de camadas e comprimento da entrada
  • Eficiência: otimização da velocidade de treinamento/inferência e do uso de memória

Estratégias e algoritmos de treinamento

  • Objetivos do pré-treinamento: modelos de linguagem (por exemplo, next token prediction), multimodalidade (por exemplo, contrastive learning) etc.
  • Técnicas de otimização: mixed precision, gradient accumulation, learning rate schedule etc.
  • Normalização/estabilização: dropout, layer norm, weight decay etc.

Sistema de avaliação e validação

  • Conjuntos de benchmarks: utilização de conjuntos de dados padrão (Benchmarks)
  • Avaliação interna: avaliação baseada em cenários reais de uso
  • Monitoramento contínuo: verificação da qualidade, dos vieses e da segurança durante e após o treinamento

Competências de pessoal e da organização

  • Pesquisadores de AI/ML: projeto de modelos e desenvolvimento de algoritmos
  • Engenheiros de dados: coleta, refinamento e gerenciamento de dados
  • Engenheiros de infraestrutura: gerenciamento de sistemas distribuídos e ambientes de nuvem/on-premises
  • Gerentes de projeto: gerenciamento de cronograma, orçamento e qualidade

Considerações éticas, jurídicas e de segurança

  • Ética em AI: vieses, segurança, transparência e responsabilidade
  • Conformidade legal: privacidade, direitos autorais e soberania de dados
  • Segurança: prevenção contra vazamento de dados/modelos e controle de acesso

Atualmente, o número de profissionais de pesquisa em AI em todo o mundo é de aproximadamente 2.000 pessoas, e a maioria está concentrada em grandes empresas de tecnologia como META, Google e XAI. Na Coreia do Sul, são extremamente raras as equipes capazes de criar diretamente um modelo Foundation, projetando desde a coleta de dados até a infraestrutura de treinamento em larga escala.

3. Criar um modelo de linguagem de grande escala com poucos profissionais.

No entanto, o CEO da Clevi, Lee Hwan-ho, decidiu criar a melhor AI do mundo na “Clevi”.

Com base em mais de 10 anos de experiência em pesquisa de deep learning e machine learning, o CEO Lee Hwan-ho fundou a empresa (Clevi) há 3 anos com o objetivo de “criar a melhor AI do mundo”.

A empresa adquiriu as competências necessárias para o desenvolvimento de um Foundation Model ao projetar diretamente todos os processos, incluindo a construção do próprio pipeline de dados, o projeto de uma infraestrutura distribuída de deep learning em larga escala, o desenvolvimento da arquitetura do modelo e a validação da qualidade.

Como resultado de várias rodadas de treinamento de modelos, a empresa agora possui o modelo Clevi-5-x, capaz de competir com os modelos de mais alto nível do mundo.

Imagem do corpo do texto

Para treinar modelos de linguagem ultragrandes de forma eficaz, é necessária uma infraestrutura que conecte de centenas a milhares de GPUs em um cluster, capaz de processar simultaneamente operações na ordem de quatrilhões por segundo. Nesse processo, tecnologias que minimizem a sincronização de operações e os atrasos de comunicação em ambientes distribuídos de grande escala são fundamentais. Até agora, na Coreia do Sul, a maioria das empresas não conseguia treinar modelos adequadamente por não dispor de “algoritmos de controle preciso”. Ao desenvolver internamente esse algoritmo proprietário de controle de computação distribuída, o CEO da Clevi, Lee Hwan-ho, tornou-se o primeiro na Coreia do Sul a obter sucesso no treinamento de um modelo de linguagem ultragrande com 1,4 trilhão (1.4 Trillion) de parâmetros.

4. O motivo pelo qual foi possível desenvolver diversos modelos com uma pequena equipe de desenvolvimento

A maioria das empresas de big tech também possui tecnologias de controle de infraestrutura em grande escala e de refinamento de dados.

Para gerenciá-las, são necessários de centenas a milhares de pesquisadores.

No entanto, a Clevi desenvolve e mantém diversos modelos com uma pequena equipe de pesquisadores.

Como isso foi possível?

Imagem do corpo do texto

A Clevi desenvolve e mantém diversos modelos com uma pequena equipe por meio da tecnologia Teacher-Student Model (Knowledge Distilation).

Vamos então analisar a tecnologia Teacher-Student.

Teacher-Student (destilação de conhecimento)

A tecnologia Teacher-Student é, em termos simples, uma tecnologia que avalia e fornece feedback ao modelo filho (Student Model) por meio de um modelo de linguagem ultragrande (Teacher Model), substituindo centenas de pesquisadores e permitindo desenvolver rapidamente diversos modelos mesmo com uma pequena equipe.

Imagem do corpo do texto
  • O Mother Model (modelo ultragrande) avalia e fornece feedback a modelos de diversas áreas, substituindo centenas de pesquisadores.
  • Se o treinamento for realizado dessa forma por meio da Clevi-x-platform, será possível treinar e implantar, em apenas 10 a 15 dias, modelos de alto desempenho como Reasoning, VLM, Physical AI e Coding Agent.

Clevi Coding Agent

Imagem do corpo do texto

Clevi Phsycal AI Learning Platform

Imagem do corpo do texto

VLM-Vision Language Model

Imagem do corpo do texto

Agente de segurança

Imagem do corpo do texto

5. Diferenciais tecnológicos e de qualidade da Clevi-x-platform

Desempenho e escalabilidade do modelo

  • Superioridade em raciocínio (CoT/Reasoning): o cip-5-x inclui o desenvolvimento lógico passo a passo e a apresentação de fundamentação em sua filosofia de design, demonstrando alta confiabilidade em cálculo e interpretação na resolução de problemas científicos, matemáticos e de engenharia. Com base em benchmarks internos, está sendo projetado e operado com o objetivo de alcançar capacidades de desempenho iguais ou superiores às do GPT-5, gerenciando a reprodutibilidade e a verificabilidade sob condições de prompt idênticas como principais indicadores de qualidade.
Imagem no corpo do texto
  • Espectro completo multimodal: é possível produzir e combinar, em uma única plataforma, o VLM orientado a objetivos (cip-5-vision), o modelo de processamento multimodal de grande escala (ivy-4-mm) e o modelo leve no dispositivo (ivy-3-text), permitindo a combinação ideal de acordo com as características da tarefa (busca/classificação/resumo vs. raciocínio/explicação/execução).

Aplicabilidade empresarial

  • Segurança e disponibilidade on-premises: operação em toda a rede isolada (entrada-treinamento-serviço-backup), design de alta disponibilidade (HA), expansão modular e proteção separada de dados e parâmetros do modelo por meio do SVCE (ambiente seguro de execução isolado).
  • Implementação e expansão rápidas: oferece suporte à aplicação e à operação ágeis por meio do Ivy Chat (conversação multimodal/agentiva para tarefas empresariais) e da API Platform (SaaS padrão global).
Imagem no corpo do texto

Diferenciação em IA física (Physical AI)

  • A combinação de simulação baseada no NVIDIA Isaac com aprendizado por reforço evolutivo (Evolutionary RL), a transferência Sim2Real e o treinamento paralelo com dados sintéticos aumentaram a eficiência do aprendizado e a capacidade de adaptação em campo. São raras as alternativas que abrangem todo o processo, do aprendizado digital e robótico à implantação.

Qualidade de serviço e governança

  • O controle de versões de modelos/prompts/ferramentas, a suíte de avaliação (conhecimento em coreano e inglês, tarefas por setor, métricas de alucinação e segurança), o gerenciamento de mudanças (SLO/SLA) e a observabilidade operacional (latência, taxa de sucesso e TCO) são gerenciados por meio de procedimentos de uma única plataforma.

Atualmente, existem mais de 300 empresas de serviços de modelos de IA na Coreia do Sul, mas

a Clevi é a única empresa capaz de oferecer simultaneamente serviços on-premises e em nuvem por meio de modelos fundacionais próprios de alto desempenho.

6. Como utilizar modelos de linguagem na indústria

Como a adoção de IA exige investimentos significativos e uma validação rigorosa, é essencial comparar e experimentar diretamente as soluções para verificar se elas realmente ajudam a empresa.

  • A Clevi não se limita a criar modelos; ela oferece soluções de IA aplicáveis a ambientes industriais reais.
  • Por exemplo, conta com canais empresariais completos, incluindo a Ivy Chat Platform, a Clevi API Platform, personalização por setor e atendimento aos requisitos de segurança.
  • Possui capacidades tecnológicas difíceis de encontrar, tanto no país quanto no exterior, em áreas como IA física, robótica e processamento de dados multimodais.

A Clevi oferece soluções concretas de IA que contribuem para a eficiência do trabalho real e a inovação industrial, tratando a IA como um ‘meio’, e não como um ‘fim’. Experimente diretamente a diferenciação de um verdadeiro modelo From-scratch Foundation.

Dúvidas e solicitações de demonstração: [email protected]

Copyright© 2025 Clevi Inc. Todos os direitos reservados.

Voltar para a redação
CLEVI

Yezh ha rannvro

Os idiomas traduzidos automaticamente estão marcados. A disponibilidade segue o pacote do site publicado.

136 yezh

Erbedet

1

Azia ar Reter

7

Azia ar Gevred

11

Azia ar Su

18

Azia ar Cʼhreiz

5

Reter-Kreiz ha Kaokaz

10

Europa ar Cʼhornôg ha Europa ar Su

16

Rouantelezh-Unanet ha Iwerzhon

4

Europa an Norzh

10

Kreiz-Europa hag ar Balkanoù

14

Europa ar Reter

5

Afrika ar Reter

8

Afrika ar Cʼhornôg ha Afrika ar Cʼhreiz

9

Afrika ar Su

8

Amerikaoù

5

Oseania

5