Tyrimai

From-scratch Foundation Model CLEVI AI(ivy)

„Kaip maža įmonė galėjo sukurti pasaulinio lygio didelį kalbos modelį?“

Pagrindinio teksto vaizdas

„Kaip maža įmonė galėjo sukurti pasaulinio lygio didelį kalbos modelį?“

Kaip maža startuolio įmonė sukūrė didelį kalbos modelį?

Tai dažniausiai užduodamas klausimas po to, kai CLEVI pristatė 1,4 trilijono parametrų Foundation modelį.

Skirtingai nei daugelis įmonių, kurios tiesiog taiko parengtų atvirojo kodo modelių tikslinį derinimą, CLEVI savarankiškai vykdė visą procesą – nuo duomenų rinkimo ir modelio projektavimo iki didelio masto paskirstytojo mokymo bei kokybės tikrinimo.

Toliau išsamiai pristatome šios sėkmės paslaptis ir konkurencinius pranašumus.

1. Maža įmonė kuria didelį kalbos modelį?

Pagrindinio teksto vaizdas

2025 m. liepos mėn., kai CLEVI pristatė savo sukurtą didelį kalbos modelį rinkai, daugybė klientų (naudotojų) reagavo nustebę ir skeptiškai. „Ar jis tikrai sukurtas savarankiškai?“ „Gal tai tik šiek tiek pakeistas atvirojo kodo modelis?“

Iš tiesų daugelis įmonių Pietų Korėjoje ir užsienyje tiesiog taiko atvirojo kodo modeliams perėjimo mokymą (fine-tuning) ir reklamuoja juos kaip savo modelius.

Tačiau CLEVI pabrėžė **„From-scratch Foundation Model“**.

Kitaip tariant, visą procesą – nuo duomenų rinkimo ir modelio projektavimo iki didelio masto paskirstytojo mokymo bei kokybės tikrinimo – suprojektavo ir įgyvendino savarankiškai.

2. Kodėl didelio kalbos modelio kūrimas yra sudėtingas

Norint išmokyti From-Scratch Foundation Model, reikia išmokyti visus toliau nurodytus elementus.

Reikalingas didelio masto aukštos kokybės duomenų rinkinys

  • Įvairovė: kalbų, sričių ir formatų (teksto, vaizdų ir kt.) įvairovės užtikrinimas
  • Valymas: triukšmo šalinimas, kokybės valdymas, pasikartojančių / žalingų duomenų filtravimas
  • Licencijos: aiškus autorių teisių ir duomenų naudojimo teisių nustatymas

Didelio masto skaičiavimo infrastruktūra

  • Didelio našumo GPU/TPU klasteris: tūkstančių ar dešimčių tūkstančių mazgų įrangos integravimas, siekiant palaikyti didelio masto paskirstytojo mokymo technologiją
  • Veiksminga paskirstytojo mokymo sistema: DeepSpeed, Megatron-LM, Ray ir kt.
  • Saugykla / tinklas: didelio kiekio duomenų įvestis ir išvestis, didelės spartos tinklo aplinka

Modelio architektūros projektavimas

  • Atspindi naujausias architektūras: Transformer, MoE (Mixture of Experts), daugiarūšį režimą ir kt.
  • Mastelio keitimas: atsižvelgiama į parametrų skaičiaus, sluoksnių skaičiaus, įvesties ilgio ir kt. didinimą
  • Efektyvumas: mokymo ir išvadų generavimo greičio bei atminties naudojimo optimizavimas

Mokymo strategijos ir algoritmai

  • Išankstinio mokymo tikslai: kalbos modeliavimas (pvz., next token prediction), daugiarūšis režimas (pvz., contrastive learning) ir kt.
  • Optimizavimo metodai: mixed precision, gradient accumulation, learning rate schedule ir kt.
  • Normalizavimas ir stabilizavimas: dropout, layer norm, weight decay ir kt.

Vertinimo ir validavimo sistema

  • Etaloninių testų rinkiniai: naudojami standartiniai duomenų rinkiniai (Benchmarks)
  • Vidinis vertinimas: vertinimas pagal realaus naudojimo scenarijus
  • Nuolatinė stebėsena: kokybės, šališkumo ir saugumo tikrinimas mokymo metu ir jam pasibaigus

Žmogiškieji ištekliai ir organizaciniai gebėjimai

  • AI/ML tyrėjai: modelių projektavimas, algoritmų kūrimas
  • Duomenų inžinieriai: duomenų rinkimas, valymas ir valdymas
  • Infrastruktūros inžinieriai: paskirstytųjų sistemų, debesijos ir vietinės infrastruktūros valdymas
  • Projektų vadovai: terminų, biudžeto ir kokybės valdymas

Etikos, teisės ir saugumo aspektai

  • AI etika: šališkumas, saugumas, skaidrumas ir atskaitomybė
  • Teisinė atitiktis: privatumas, autorių teisės ir duomenų suverenitetas
  • Saugumas: duomenų ir modelių nutekėjimo prevencija, prieigos kontrolė

Šiuo metu visame pasaulyje yra apie 2 000 AI tyrėjų, be to, dauguma jų yra susitelkę tokiose didžiosiose technologijų įmonėse kaip META, Google ir XAI. Pietų Korėjoje itin nedaug komandų gali savarankiškai sukurti Foundation modelį – nuo duomenų rinkimo iki didelio masto mokymo infrastruktūros projektavimo.

3. Sukurti itin didelį kalbos modelį su nedidele komanda.

Tačiau CLEVI vadovas Lee Hwan-ho nusprendė CLEVI sukurti geriausią AI pasaulyje

Remdamasis daugiau nei 10 metų gilaus mokymosi ir mašininio mokymosi tyrimų patirtimi, prieš trejus metus Lee Hwan-ho įkūrė įmonę (CLEVI), išsikėlęs tikslą „sukurti geriausią AI pasaulyje“.

Pati įmonė suprojektavo visus procesus – nuo duomenų perdavimo grandinės sukūrimo, didelio masto paskirstytosios giliojo mokymosi infrastruktūros projektavimo, modelio architektūros kūrimo iki kokybės validavimo – ir įgijo Foundation Model kūrimui reikalingus gebėjimus.

Po kelių modelio mokymo etapų dabar turime Clevi-5-x modelį, galintį konkuruoti su geriausiais pasaulio modeliais.

Pagrindinio teksto vaizdas

Norint veiksmingai apmokyti itin didelius kalbos modelius, reikalinga infrastruktūra, kurioje šimtai ar net tūkstančiai GPU sujungti į klasterį ir vienu metu gali atlikti dešimtis kvadrilijonų skaičiavimų per sekundę. Šiame procese itin svarbios technologijos, mažinančios skaičiavimų sinchronizavimo ir ryšio delsą didelės apimties paskirstytoje aplinkoje. Iki šiol Pietų Korėjoje dauguma įmonių negalėjo tinkamai apmokyti modelių, nes nebuvo „tikslaus valdymo algoritmo“. Clevi generalinis direktorius Lee Hwan-ho, savarankiškai sukūręs šį unikalų paskirstytų skaičiavimų valdymo algoritmą, tapo pirmuoju Pietų Korėjoje, sėkmingai apmokiusiu itin didelį kalbos modelį, turintį 1,4 trilijono (1.4 Trillion) parametrų.

4. Kodėl nedidelė kūrėjų komanda galėjo kurti įvairius modelius

Dauguma didžiųjų technologijų įmonių taip pat turi didelės apimties infrastruktūros valdymo ir duomenų valymo technologijas.

Joms valdyti reikia šimtų ar tūkstančių tyrėjų.

Tačiau Clevi, turėdama nedidelę tyrėjų komandą, kuria ir valdo įvairius modelius.

Kaip tai buvo įmanoma?

Pagrindinio teksto vaizdas

Naudodama Teacher-Student Model(Knowledge Distilation) technologiją, Clevi, pasitelkdama nedidelę komandą, kuria ir valdo įvairius modelius.

Apžvelkime Teacher-Student technologiją.

Teacher-Student (žinių distiliavimas)

Teacher-Student technologija, paprastai tariant, leidžia per itin didelį kalbos modelį (Teacher Model) vertinti ir teikti grįžtamąjį ryšį antriniam modeliui (Student Model), todėl nedidelė komanda gali pakeisti šimtus tyrėjų ir greitai kurti įvairius modelius.

Pagrindinio teksto vaizdas
  • Mother Model(itin didelis modelis) vertina įvairių sričių modelius ir teikia jiems grįžtamąjį ryšį, taip pakeisdamas šimtus tyrėjų.
  • Jei mokymas tokiu būdu būtų vykdomas per Clevi-x-platform, didelio našumo modelius, tokius kaip Reasoning, VLM, Physical AI ir Coding Agent, būtų galima apmokyti bei įdiegti vos per 10–15 dienų.

Clevi Coding Agent

Pagrindinio teksto vaizdas

Clevi Phsycal AI Learning Platform

Pagrindinio teksto vaizdas

VLM-Vision Language Model

Pagrindinio teksto vaizdas

Saugumo agentas

Pagrindinio teksto vaizdas

5. Clevi-x-platform technologijų ir kokybės išskirtinumas

Modelio našumas ir mastelio keitimas

  • Išvadų (CoT/Reasoning) pranašumas: cip-5-x į savo projektavimo filosofiją įtraukia nuoseklų loginį išvedimą ir pagrindimą, todėl sprendžiant mokslo, matematikos ir inžinerijos uždavinius pasižymi patikimomis skaičiavimo ir interpretavimo galimybėmis. Remiantis vidiniais etaloniniais testais, sistema projektuojama ir eksploatuojama siekiant GPT-5 lygio ar aukštesnio našumo, o rezultatų atkuriamumas ir patikrinamumas tomis pačiomis raginimo sąlygomis valdomi kaip pagrindiniai kokybės rodikliai.
Pagrindinio teksto vaizdas
  • Visas multimodalumo spektras: vienoje platformoje galima kurti ir derinti paskirčiai pritaikytą VLM (cip-5-vision), didelės apimties multimodalinio apdorojimo modelį (ivy-4-mm) ir lengvą įrenginiuose veikiantį modelį (ivy-3-text), parenkant optimalų derinį pagal užduoties pobūdį (paieška / klasifikavimas / santrauka arba išvadų darymas / paaiškinimas / vykdymas).

Pritaikomumas įmonėse

  • Saugumas ir prieinamumas vietinėje infrastruktūroje: veikimas visame uždaro tinklo cikle (įvestis–mokymas–paslauga–atsarginė kopija), HA projektavimas, modulinis mastelio didinimas ir duomenų bei modelio parametrų atskira apsauga naudojant SVCE (izoliuotą saugią vykdymo aplinką).
  • Greitas diegimas ir plėtra: Ivy Chat (darbui skirtas multimodalinis pokalbis / agentas) ir API Platform (visuotinį standartą atitinkanti SaaS) suteikia galimybę greitai pritaikyti ir eksploatuoti sprendimus.
Pagrindinio teksto vaizdas

Fizinio DI (Physical AI) išskirtinumas

  • Sujungus NVIDIA Isaac pagrindu atliekamą simuliaciją ir evoliucija pagrįstą pastiprinamąjį mokymąsi (Evolutionary RL), taip pat taikant Sim2Real perkėlimą ir lygiagretų mokymąsi naudojant sintetinius duomenis, padidinamas mokymosi efektyvumas ir pritaikomumas realiomis sąlygomis. Galimybė aprėpti visą procesą nuo skaitmeninio ir robotikos mokymo iki diegimo yra retai sutinkama tarp alternatyvų.

Paslaugų kokybė ir valdymas

  • Modelių, raginimų ir įrankių versijų valdymas, vertinimo rinkiniai (žinios korėjiečių ir anglų kalbomis, konkrečių pramonės šakų užduotys, haliucinacijų ir saugumo rodikliai), pakeitimų valdymas (SLO/SLA) ir veiklos stebėsena (delsa, sėkmės rodiklis, TCO) valdomi pagal vieningos platformos procedūras.

Šiuo metu Pietų Korėjoje veikia daugiau kaip 300 DI modelių paslaugų įmonių, tačiau

CLEVI yra vienintelė įmonė, galinti teikti vietinės infrastruktūros ir debesijos paslaugas vienu metu, naudodama didelio našumo nuosavą pamatinį modelį.

6. Kaip pritaikyti kalbos modelius pramonėje

Kadangi DI diegimui reikia didelių investicijų ir kruopštaus patikrinimo, būtina tiesiogiai palyginti ir išbandyti, ar sprendimas iš tiesų naudingas įmonei.

  • CLEVI neapsiriboja vien modelių kūrimu – ji teikia AI sprendimus, kuriuos galima pritaikyti realioms pramonės reikmėms.
  • Pavyzdžiui, ji turi visapusišką įmonėms skirtų paslaugų paketą: Ivy Chat Platform, Clevi API Platform, pritaikymą konkrečioms pramonės šakoms, saugumo reikalavimų užtikrinimą ir kt.
  • CLEVI pasižymi techninėmis kompetencijomis tokiose srityse kaip fizinis AI, robotika ir daugiarūšių duomenų apdorojimas – tai gebėjimai, kuriuos sunku rasti tiek šalies viduje, tiek užsienyje.

CLEVI teikia konkrečius AI sprendimus, kurie AI laiko ne „tikslu“, o „priemone“, prisidedančia prie realaus darbo efektyvumo ir pramonės inovacijų. Tiesiogiai patirkite tikro From-scratch Foundation modelio išskirtinumą.

Užklausos ir demonstracijos užsakymas: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Grįžti į naujienų kambarį
CLEVI

Kalba ir regionas

Mašininio vertimo kalbos yra pažymėtos. Prieinamumas priklauso nuo paskelbto svetainės paketo.

136 kalbos

Rekomenduojama

1

Rytų Azija

7

Pietryčių Azija

11

Pietų Azija

18

Centrinė Azija

5

Artimieji Rytai ir Kaukazas

10

Vakarų Europa ir Pietų Europa

16

Jungtinė Karalystė ir Airija

4

Šiaurės Europa

10

Vidurio Europa ir Balkanai

14

Rytų Europa

5

Rytų Afrika

8

Vakarų Afrika ir Vidurio Afrika

9

Pietinė Afrika

8

Amerika

5

Okeanija

5
From-scratch Foundation Model CLEVI AI(ivy) — CLEVI