„Kuidas suutis väike ettevõte luua maailma tipptasemel ülisuurte parameetritega tehisintellekti keelemudeli?”
Kuidas lõi väike idufirma ülisuurte parameetritega keelemudeli?
See on küsimus, mida on kõige sagedamini esitatud pärast seda, kui CLEVI avalikustas 1,4 triljoni parameetri suuruse Foundation-mudeli.
Erinevalt paljudest ettevõtetest, kes lihtsalt peenhäälestavad avatud lähtekoodiga mudeleid, viis CLEVI kogu protsessi iseseisvalt läbi alates andmete kogumisest ja mudeli kavandamisest kuni suuremahulise hajutatud õppe ning kvaliteedi kontrollimiseni.
Allpool tutvustame üksikasjalikult selle saladust ja konkurentsivõimet.
1. Väike ettevõte loob ülisuurte parameetritega keelemudeli?
2025. aasta juulis, kui CLEVI avalikustas turul enda välja töötatud ülisuurte parameetritega keelemudeli, reageerisid paljud kliendid (kasutajad) üllatuse ja kahtlustega. „Kas see on tõesti iseseisvalt välja töötatud?” „Kas te ei muutnud lihtsalt veidi avatud lähtekoodiga mudelit?”
Tegelikult piirdusid paljud Korea ja välismaised ettevõtted sageli avatud lähtekoodiga mudelite lihtsa ülekandeõppega (fine-tuning) ning reklaamisid neid seejärel enda mudelitena.
CLEVI rõhutas aga **„From-scratch Foundation Model”**-i.
Teisisõnu kavandas ja viis CLEVI kogu protsessi ise läbi alates andmete kogumisest ja mudeli kavandamisest kuni suuremahulise hajutatud õppe ning kvaliteedi kontrollimiseni.
2. Miks on ülisuurte parameetritega keelemudeli arendamine keeruline?
From-Scratch Foundation Modeli õpetamiseks tuleb läbida kõik allpool loetletud õppeetapid.
Vaja on suuremahulist kvaliteetset andmekogumit
- Mitmekesisus: keelte, valdkondade ja vormingute (tekst, pildid jne) mitmekesisuse tagamine
- Puhastamine: müra eemaldamine, kvaliteedi haldamine ning dubleerivate ja kahjulike andmete filtreerimine
- Litsentsid: autoriõiguste ja andmete kasutusõiguste selge määratlemine
Suuremahuline arvutusinfrastruktuur
- Suure jõudlusega GPU/TPU-klastrid: tehnoloogia tuhandete kuni kümnete tuhandete sõlmede integreerimiseks ja suuremahulise hajutatud õppe toetamiseks
- Tõhusad hajutatud õppe raamistikud: DeepSpeed, Megatron-LM, Ray jne
- Salvestusruum/võrk: suuremahuline andmesisestus ja -väljund ning kiire võrgukeskkond
Mudeli arhitektuuri kavandamine
- Uusima arhitektuuri rakendamine: Transformer, MoE (Mixture of Experts), multimodaalsus jne
- Skaleeritavus: skaleeritavuse arvestamine, sealhulgas parameetrite arv, kihtide arv, sisendi pikkus jne
- Tõhusus: treeningu ja järeldamise kiiruse ning mälukasutuse optimeerimine
Treeningustrateegiad ja algoritmid
- Eeltreeningu eesmärgid: keelemudelid (nt järgmise märgi ennustamine), multimodaalsus (nt kontrastiivne õppimine) jne
- Optimeerimismeetodid: mixed precision, gradient accumulation, learning rate schedule jne
- Normaliseerimine ja stabiliseerimine: dropout, layer norm, weight decay jne
Hindamis- ja valideerimissüsteem
- Võrdlusandmestikud: standardsete andmestike (Benchmarks) kasutamine
- Sisehindamine: tegelikel kasutusstsenaariumidel põhinev hindamine
- Pidev seire: kvaliteedi, kallutatuse ja ohutuse kontroll treeningu ajal ja pärast seda
Tööjõud ja organisatsiooni võimekus
- AI/ML-teadlased: mudelite kavandamine, algoritmide arendamine
- Andmeinsenerid: andmete kogumine, puhastamine ja haldamine
- Infrastruktuuriinsenerid: hajussüsteemide ning pilve- ja kohapealsete lahenduste haldamine
- Projektijuhid: ajakava, eelarve ja kvaliteedi haldamine
Eetilised, õiguslikud ja turvalisusega seotud kaalutlused
- AI-eetika: kallutatus, ohutus, läbipaistvus ja vastutus
- Õigusnõuete järgimine: isikuandmed, autoriõigus ja andmesuveräänsus
- Turvalisus: andmete ja mudelite lekke vältimine ning juurdepääsu kontroll
Praegu on kogu maailmas AI-uuringutega tegelevaid töötajaid ligikaudu 2000 ning enamik neist on koondunud sellistesse suurettevõtetesse nagu META, Google ja XAI. Meeskondi, kes suudaksid riigisiseselt ise kavandada kõike alates andmete kogumisest kuni suuremahulise treeningutaristuni ja luua Foundation-mudeli, on äärmiselt vähe.
3. Hiiglasliku keelemudeli loomine vähese arvu töötajatega.
Kuid CLEVI tegevjuht Lee Hwan-ho otsustas luua CLEVI-s maailma parima AI
Tegevjuht Lee Hwan-ho asutas kolm aastat tagasi ettevõtte (CLEVI), seades eesmärgiks „luua maailma parim AI”, tuginedes enam kui kümneaastasele süvaõppe ja masinõppe uurimise kogemusele.
Ettevõte on kõik protsessid, sealhulgas oma andmekonveieri rajamise, suuremahulise hajutatud süvaõppe taristu kavandamise, mudeliarhitektuuri arendamise ja kvaliteedi valideerimise, ise kavandanud ning omandanud Foundation Modeli arendamiseks vajalikud võimekused.
Pärast mudeli mitmekordset treenimist on meil nüüd Clevi-5-x mudel, mis suudab konkureerida maailma tipptasemel mudelitega.
Suurte keelemudelite tõhusaks treenimiseks on vaja infrastruktuuri, mis ühendab sadu kuni tuhandeid GPU-sid klastriks ning suudab töödelda samaaegselt septiljardite arvutuste ulatuses tehtavaid operatsioone sekundis. Selle protsessi juures on võtmetähtsusega tehnoloogiad, mis minimeerivad arvutuste sünkroonimise ja sideviivituse ulatuslikus hajutatud keskkonnas. Seni ei suutnud enamik kodumaiseid ettevõtteid mudeleid korralikult treenida, kuna puudus „täppisjuhtimise algoritm“. Clevi tegevjuht Lee Hwan-ho töötas sellise sõltumatu hajutatud arvutuste juhtimise algoritmi ise välja ning saavutas esimesena Koreas 1,4 triljoni (1.4 Trillion) parameetriga suure keelemudeli treenimise.
4. Miks suutsime väikese arendajate arvuga arendada erinevaid mudeleid
Ka enamikul suurtehnoloogiaettevõtetel on ulatusliku infrastruktuuri juhtimise ja andmete puhastamise tehnoloogiad.
Nende haldamiseks on vaja sadu kuni tuhandeid teadustöötajaid.
Clevi aga arendab ja omab väikese teadustöötajate arvuga erinevaid mudeleid.
Kuidas see võimalik oli?
Clevi kasutab Teacher-Student Model(Knowledge Distilation) tehnoloogiat, et arendada ja omada väikese töötajate arvuga erinevaid mudeleid.
Vaatame lähemalt Teacher-Student tehnoloogiat.
Teacher-Student(teadmiste destilleerimine)
Teacher-Student tehnoloogia tähendab lihtsustatult seda, et suure keelemudeli (Teacher Model) abil hinnatakse ja tagasisidestatakse alamudelit (Student Model), võimaldades väikese töötajate arvuga asendada sadu teadustöötajaid ning arendada kiiresti erinevaid mudeleid.
- Mother Model(suur mudel) hindab ja annab tagasisidet eri valdkondade mudelitele, asendades sadu teadustöötajaid.
- Kui treenimine toimub sel viisil Clevi-x-platformi kaudu, saab suure jõudlusega mudeleid, nagu Reasoning, VLM, Physical AI ja Coding Agent, treenida ning juurutada 10–15 päevaga.
Clevi Coding Agent
Clevi Phsycal AI Learning Platform
VLM-Vision Language Model
Turvaagent
5. Clevi-x-platformi tehnoloogia ja kvaliteedi eristavad omadused
Mudeli jõudlus ja skaleeritavus
- Järeldusvõime (CoT/Reasoning) eelis: cip-5-x hõlmab samm-sammulist loogilist arutluskäiku ja põhjenduste esitamist oma disainifilosoofias, näidates teadus-, matemaatika- ja inseneriprobleemide lahendamisel suure usaldusväärsusega arvutus- ja tõlgendusvõimet. Sisemiste võrdlustestide põhjal on see projekteeritud ja kasutusel eesmärgiga saavutada GPT-5 tasemel või sellest kõrgem jõudlus ning sama viiba tingimustes korduvus ja kontrollitavus on peamised kvaliteedinäitajad.
- Multimodaalsuse kogu spekter: eesmärgipõhist VLM-i (cip-5-vision), suure mahuga multimodaalset töötlusmudelit (ivy-4-mm) ja kerget seadmesisest mudelit (ivy-3-text) saab ühel platvormil tootmiseks kombineerida, võimaldades valida ülesande omadustele (otsing/klassifitseerimine/kokkuvõte vs. järeldamine/selgitamine/teostamine) sobivaima kombinatsiooni.
Ettevõtete rakendatavus
- Kohapealse juurutuse turvalisus ja kättesaadavus: toimimine kogu suletud võrgu ulatuses (sisend–õpe–teenus–varundus), HA-disain, modulaarne laiendatavus ning SVCE (isoleeritud turvaline käivituskeskkond) tagavad andmete ja mudeli parameetrite eraldatud kaitse.
- Kiire kasutuselevõtt ja laiendamine: Ivy Chat (tööalane multimodaalne vestlus/agent) ja API Platform (üleilmne standardne SaaS) toetavad kiiret rakendamist ja käitamist.
Füüsilise tehisintellekti (Physical AI) eristuvus
- NVIDIA Isaacil põhineva simulatsiooni ja evolutsioonipõhise tugevdusõppe (Evolutionary RL) ühendamine, Sim2Real-ülekanne ning sünteetilistel andmetel paralleelne õppimine suurendavad õppimise tõhusust ja kohapealset kohanemisvõimet. Digitaalsest õppest robootika õppimise ja juurutamiseni ulatumine muudab alternatiivid haruldaseks.
Teenuse kvaliteet ja valitsemine
- Mudelite, viipade ja tööriistade versioonihaldust, hindamiskomplekti (korea- ja ingliskeelsed teadmised, valdkonnapõhised ülesanded, hallutsinatsioonide ja ohutuse näitajad), muudatuste haldust (SLO/SLA) ning töökorralduse jälgimist (latentsus, edukuse määr, TCO) hallatakse ühe platvormi protseduuride kaudu.
Praegu tegutseb Lõuna-Koreas üle 300 tehisintellekti mudelite teenuseid pakkuva ettevõtte, kuid
CLEVI on ainus ettevõte, mis suudab oma suure jõudlusega sõltumatute alusmudelite kaudu pakkuda samaaegselt nii kohapealseid kui ka pilveteenuseid.
6. Keelemudelite tööstuses rakendamise viisid
Kuna tehisintellekti kasutuselevõtt nõuab suuri investeeringuid ja põhjalikku valideerimist, on hädavajalik lahendusi ise võrrelda ja proovida, et veenduda, kas need ettevõttele tegelikult kasulikud on.
- CLEVI ei piirdu pelgalt mudelite loomisega, vaid pakub AI-lahendusi, mida saab rakendada tegelikus tööstuskeskkonnas.
- Näiteks on meil täielik ettevõtetele suunatud lahenduste valik, sealhulgas Ivy Chat Platform, Clevi API Platform, tööstusharupõhine kohandamine ja turvanõuete täitmine.
- Meil on tehnoloogilised võimekused, mida on nii kodu- kui ka välismaal raske leida, sealhulgas füüsiline AI, robootika ja multimodaalsete andmete töötlemine.
CLEVI pakub AI-d mitte „eesmärgi“, vaid „vahendina“ – praktilisi AI-lahendusi, mis aitavad parandada tegelikku töö tõhusust ja edendada tööstuslikku innovatsiooni. Kogege vahetult tõelise From-scratch Foundation mudeli eripära.
Päringud ja demo taotlused: [email protected]
Copyright© 2025 Clevi Inc. All rights reserved.
