Uurimistöö

From-scratch Foundation Model CLEVI AI(ivy)

„Kuidas suutis väike ettevõte luua maailma tipptasemel ülisuurte parameetrimahuga tehisintellekti keelemudeli?”

Põhiteksti pilt

„Kuidas suutis väike ettevõte luua maailma tipptasemel ülisuurte parameetrimahuga tehisintellekti keelemudeli?”

Kuidas lõi väike idufirma ülisuurte parameetrimahuga keelemudeli?

See on küsimus, mida on kõige rohkem esitatud pärast seda, kui CLEVI avalikustas 1,4 triljoni parameetri suuruse Foundation-mudeli.

Erinevalt paljudest ettevõtetest, kes lihtsalt peenhäälestavad avatud lähtekoodiga mudeleid, viis CLEVI kõik protsessid – alates andmete kogumisest kuni mudeli kavandamise, suuremahulise hajutatud õppe ja kvaliteedi valideerimiseni – iseseisvalt läbi.

Allpool tutvustame üksikasjalikult selle saladust ja konkurentsivõimet.

1. Väike ettevõte loob ülisuurte parameetrimahuga keelemudeli?

Põhiteksti pilt

2025. aasta juulis, kui CLEVI avalikustas turul omaenda väljatöötatud ülisuurte parameetrimahuga keelemudeli, tekitas see paljudes klientides (kasutajates) üllatust ja kahtlusi. „Kas see on tõesti nende enda arendus?” „Kas nad ei muutnud lihtsalt veidi avatud lähtekoodiga mudelit?”

Tegelikult piirdusid paljud ettevõtted nii Lõuna-Koreas kui ka välismaal lihtsalt avatud lähtekoodiga mudelite ülekandeõppega (fine-tuning) ning reklaamisid neid enda mudelitena.

Kuid CLEVI rõhutas **„From-scratch Foundation Model”**-i.

Teisisõnu kavandas ja teostas CLEVI kõik protsessid ise – alates andmete kogumisest kuni mudeli kavandamise, suuremahulise hajutatud õppe ja kvaliteedi valideerimiseni.

2. Miks on ülisuurte parameetrimahuga keelemudeli arendamine keeruline?

From-Scratch Foundation Modeli treenimiseks tuleb õppida kõiki allpool loetletud valdkondi.

Vajalik on suuremahuline kvaliteetne andmestik

  • Mitmekesisus: tagada keelte, domeenide ja vormingute (tekst, pildid jne) mitmekesisus
  • Puhastamine: eemaldada müra, hallata kvaliteeti ning filtreerida duplikaatseid ja kahjulikke andmeid
  • Litsentsid: selgelt määratleda autoriõigused ja andmete kasutusõigused

Suuremahuline arvutusinfrastruktuur

  • Suure jõudlusega GPU/TPU-klastrid: integreerida tuhanded kuni kümned tuhanded sõlmed, et toetada suuremahulist hajutatud õpet
  • Tõhus hajutatud õppe raamistik: DeepSpeed, Megatron-LM, Ray jne
  • Salvestusruum/võrk: suuremahuline andmesisend ja -väljund ning kiire võrgukeskkond

Mudeli arhitektuuri kavandamine

  • Uusima struktuuri arvestamine: Transformer, MoE (Mixture of Experts), multimodaalsus jne
  • Skaleeritavus: laiendatavuse arvestamine, sealhulgas parameetrite arv, kihtide arv, sisendi pikkus jne
  • Tõhusus: treenimis- ja järelduskiiruse ning mälukasutuse optimeerimine

Treeningustrateegiad ja algoritmid

  • Eeltreenimise eesmärgid: keelemudelid (nt next token prediction), multimodaalsus (nt contrastive learning) jne
  • Optimeerimismeetodid: mixed precision, gradient accumulation, learning rate schedule jne
  • Normaliseerimine/stabiliseerimine: dropout, layer norm, weight decay jne

Hindamis- ja valideerimissüsteem

  • Võrdlusandmestikud: standardsete andmestike (Benchmarks) kasutamine
  • Sisemine hindamine: tegelikel kasutusstsenaariumidel põhinev hindamine
  • Pidev monitooring: kvaliteedi, kallutatuse ja ohutuse kontroll treenimise ajal ja pärast seda

Tööjõud ja organisatsiooni võimekus

  • AI/ML-i teadlased: mudelite kavandamine, algoritmide arendamine
  • Andmeinsenerid: andmete kogumine/puhastamine/haldamine
  • Taristuinsenerid: hajussüsteemide ning pilve-/kohapealse taristu haldamine
  • Projektijuhid: ajakava, eelarve ja kvaliteedi haldamine

Eetilised, õiguslikud ja turvalisusega seotud kaalutlused

  • AI eetika: kallutatus, ohutus, läbipaistvus, vastutavus
  • Õigusnõuete järgimine: isikuandmed, autoriõigused, andmesuveräänsus
  • Turvalisus: andmete/mudelite lekete ennetamine, juurdepääsu kontroll

Praegu on kogu maailmas AI-uuringutega tegelevaid töötajaid ligikaudu 2 000 ning enamik neist on koondunud suurtesse tehnoloogiaettevõtetesse, nagu META, Google ja XAI. Riigisiseselt on äärmiselt vähe meeskondi, kes suudaksid Foundation-mudeli loomiseks ise kavandada kogu protsessi alates andmete kogumisest kuni suuremahulise treenimistaristuni.

3. Hiiglasliku keelemudeli loomine väheste töötajatega.

Kuid Clevi tegevjuht Lee Hwan-ho otsustas luua „Clevi” juures maailma parima AI

Tegevjuht Lee Hwan-ho asutas kolm aastat tagasi ettevõtte (Clevi), seades eesmärgiks „luua maailma parim AI”, tuginedes enam kui kümneaastasele süvaõppe ja masinõppe uurimise kogemusele.

Ettevõte on omandanud Foundation Modeli arendamiseks vajalikud võimekused, kavandades iseseisvalt kogu protsessi: ettevõtte enda andmetorustiku loomise, suuremahulise hajutatud süvaõppe taristu kavandamise, mudeliarhitektuuri arendamise ja kvaliteedi valideerimise.

Pärast mudeli mitmekordset treenimist on meil nüüd Clevi-5-x mudel, mis suudab konkureerida maailma parimate mudelitega.

Põhiteksti pilt

Suurte keelemudelite tõhusaks treenimiseks on vaja infrastruktuuri, mis ühendab klastriks sadu kuni tuhandeid GPU-sid ning suudab samaaegselt töödelda kümneid kvadriljoneid arvutusi sekundis. Selles protsessis on võtmetähtsusega tehnoloogiad, mis minimeerivad arvutuste sünkroonimise ja sideviivituse ulatuslikus hajutatud keskkonnas. Seni ei ole Lõuna-Koreas olnud „täppisjuhtimise algoritmi“ ning enamik ettevõtteid ei ole suutnud mudeleid korralikult treenida. Clevi tegevjuht Lee Hwan-ho töötas sellise ainulaadse hajutatud arvutuste juhtimise algoritmi iseseisvalt välja ning saavutas Lõuna-Koreas esimesena 1,4 triljoni (1.4 Trillion) parameetriga suure keelemudeli treenimise.

4. Kuidas oli võimalik väheste arendajatega arendada erinevaid mudeleid

Enamikul suurtehnoloogiaettevõtetel on samuti ulatusliku infrastruktuuri juhtimise ja andmete puhastamise tehnoloogiad.

Nende haldamiseks on vaja sadu kuni tuhandeid teadustöötajaid.

Clevi arendab ja haldab aga väheste teadustöötajatega erinevaid mudeleid.

Kuidas see võimalik oli?

Põhiteksti pilt

Clevi arendab ja haldab väheste töötajatega erinevaid mudeleid Teacher-Student Modeli (Knowledge Distilation) tehnoloogia abil.

Vaatleme nüüd Teacher-Studenti tehnoloogiat.

Teacher-Student (teadmiste destilleerimine)

Teacher-Studenti tehnoloogia tähendab lihtsustatult tehnoloogiat, mille abil hinnatakse ja antakse ülisuurte keelemudelite (Teacher Model) kaudu tagasisidet alamudelile (Student Model), asendades nii väheste töötajatega sadu teadustöötajaid ning arendades kiiresti erinevaid mudeleid.

Põhiteksti pilt
  • Mother Model (ülisuur mudel) hindab erinevate valdkondade mudeleid ja annab neile tagasisidet, asendades sadu teadustöötajaid.
  • Kui treenimine toimub sel viisil Clevi-x-platformi kaudu, saab suure jõudlusega mudeleid, nagu Reasoning, VLM, Physical AI ja Coding Agent, treenida ning juurutada 10–15 päevaga.

Clevi Coding Agent

Põhiteksti pilt

Clevi Phsycal AI Learning Platform

Põhiteksti pilt

VLM-Vision Language Model

Põhiteksti pilt

Turvaagent

Põhiteksti pilt

5. Clevi-x-platformi tehnoloogia ja kvaliteedi eristavad omadused

Mudeli jõudlus ja skaleeritavus

  • Järeldusvõime (CoT/Reasoning) eelis: cip-5-x hõlmab oma disainifilosoofias samm-sammulist loogilist arutelu ja põhjenduste esitamist ning näitab teadus-, matemaatika- ja inseneriprobleemide lahendamisel suure usaldusväärsusega arvutus- ja tõlgendusvõimekust. Sisemiste võrdlustestide põhjal on see kavandamisel ja kasutamisel eesmärgiga saavutada GPT-5 tasemel või sellest kõrgem jõudlus ning sama viiba tingimustes juhitakse reprodutseeritavust ja verifitseeritavust peamiste kvaliteedinäitajatena.
Põhiteksti pilt
  • Multimodaalsuse kogu spekter: eesmärgipõhist VLM-i (cip-5-vision), suuremahulist multimodaalset töötlusmudelit (ivy-4-mm) ja kerget seadmesisest mudelit (ivy-3-text) saab ühel platvormil toota ja kombineerida, võimaldades ülesande omadustele (otsing/klassifitseerimine/kokkuvõte vs. järeldamine/selgitamine/teostamine) sobivat optimaalset kombinatsiooni.

Ettevõtetele rakendatavus

  • Kohapealse juurutuse turvalisus ja käideldavus: töö suletud võrgus kogu ahela ulatuses (sisend–õpe–teenus–varundus), HA-disain, modulaarne laiendatavus ning SVCE (isoleeritud turvaline käituskeskkond) tagavad andmete ja mudeli parameetrite eraldatud kaitse.
  • Kiire kasutuselevõtt ja laiendamine: Ivy Chat (tööalane multimodaalne vestlus/agent) ja API Platform (globaalne standardne SaaS) toetavad kiiret rakendamist ja käitamist.
Põhiteksti pilt

Füüsilise tehisintellekti (Physical AI) eristuvus

  • NVIDIA Isaacil põhineva simulatsiooni ja evolutsioonipõhise tugevdusõppe (Evolutionary RL) kombineerimine ning Sim2Real-siire ja sünteetiliste andmete paralleelõpe suurendasid õppe tõhusust ja kohapealset kohanemisvõimet. Digitaalse ja robootikaõppe ning juurutuse katmine on valdkond, kus alternatiive on vähe.

Teenuse kvaliteet ja juhtimine

  • Mudeleid, viipasid ja tööriistade versioone hallatakse koos hindamiskomplektiga (Korea- ja ingliskeelsed teadmised, valdkonnapõhised ülesanded, hallutsinatsioonide ja turvalisuse näitajad), muudatuste haldusega (SLO/SLA) ning käitamise seirega (latentsus, edukuse määr, TCO) ühtse platvormiprotseduuri kaudu.

Praegu tegutseb Lõuna-Koreas üle 300 tehisintellekti mudelite teenuseid pakkuva ettevõtte, kuid

CLEVI on ainus ettevõte, mis suudab tänu suure jõudlusega sõltumatutele alusmudelitele pakkuda samaaegselt nii kohapealseid kui ka pilveteenuseid.

6. Kuidas kasutada keelemudeleid tööstuses

Kuna tehisintellekti kasutuselevõtt nõuab suuri investeeringuid ja põhjalikku valideerimist, on oluline lahendusi ise võrrelda ja proovida, et hinnata, kas need ettevõttele tegelikult kasu toovad.

  • CLEVI ei piirdu üksnes mudelite loomisega, vaid pakub tehisintellektilahendusi, mida saab rakendada ka tegelikus tööstuskeskkonnas.
  • Näiteks on meil täielik ettevõtetele suunatud lahenduste valik, sealhulgas Ivy Chat Platform, Clevi API Platform, tööstusharupõhine kohandamine ja turvanõuetele vastavus.
  • Meil on tehnoloogilised võimekused, mida on nii Koreas kui ka mujal maailmas harva leida, sealhulgas füüsiline tehisintellekt, robootika ja multimodaalsete andmete töötlemine.

CLEVI pakub tehisintellektilahendusi, mis käsitlevad tehisintellekti mitte eesmärgi, vaid vahendina ning aitavad parandada tegelikku töö tõhusust ja edendada tööstusinnovatsiooni. Kogege vahetult tõelise From-scratch Foundation mudeli eripära.

Päringud ja demotaotlused: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Tagasi uudistetoimetusse
CLEVI

Keel ja piirkond

Masintõlgitud keeled on märgitud. Saadavus järgib avaldatud saidipaketti.

136 keelt

Soovitatav

1

Ida-Aasia

7

Kagu-Aasia

11

Lõuna-Aasia

18

Kesk-Aasia

5

Lähis-Ida ja Kaukaasia

10

Lääne-Euroopa ja Lõuna-Euroopa

16

Ühendkuningriik ja Iirimaa

4

Põhja-Euroopa

10

Kesk-Euroopa ja Balkan

14

Ida-Euroopa

5

Ida-Aafrika

8

Lääne-Aafrika ja Kesk-Aafrika

9

Lõuna-Aafrika

8

Ameerika

5

Okeaania

5