“Kā neliels uzņēmums spēja izveidot pasaules līmeņa īpaši liela mēroga MI valodas modeli?”
Kā mazs jaunuzņēmums izveidoja īpaši liela mēroga valodas modeli?
Šis ir visbiežāk uzdotais jautājums kopš brīža, kad CLEVI publiskoja Foundation modeli ar 1,4 triljoniem parametru.
Atšķirībā no daudziem uzņēmumiem, kas vienkārši precīzi pielāgo atvērtā pirmkoda modeļus, CLEVI patstāvīgi veica visu procesu — no datu apkopošanas un modeļa izstrādes līdz liela mēroga sadalītajai apmācībai un kvalitātes pārbaudei.
Tālāk mēs detalizēti iepazīstinām ar šī panākuma noslēpumu un konkurētspēju.
1. Vai neliels uzņēmums var izveidot īpaši liela mēroga valodas modeli?
2025. gada jūlijā, kad CLEVI publiskoja pašu izstrādāto īpaši liela mēroga valodas modeli, daudzi klienti (lietotāji) reaģēja ar pārsteigumu un skepsi. “Vai tas tiešām ir izstrādāts pašu spēkiem?” “Vai tas nav tikai nedaudz pārveidots atvērtā pirmkoda modelis?”
Patiesībā daudzi uzņēmumi gan Dienvidkorejā, gan ārvalstīs tikai veic atvērtā pirmkoda modeļu vienkāršu pārneses apmācību (fine-tuning) un reklamē tos kā pašu modeļus.
Tomēr CLEVI izvirzīja **“From-scratch Foundation Model”**.
Tas nozīmē, ka viss process — no datu apkopošanas un modeļa izstrādes līdz liela mēroga sadalītajai apmācībai un kvalitātes pārbaudei — tika izstrādāts un īstenots pašu spēkiem.
2. Kāpēc īpaši liela mēroga valodas modeļa izstrāde ir sarežģīta
Lai apmācītu From-Scratch Foundation Model, ir jāapgūst visi tālāk minētie elementi.
Nepieciešama liela mēroga augstas kvalitātes datu kopa
- Daudzveidība: jānodrošina valodu, jomu un formātu (teksta, attēlu u. c.) daudzveidība
- Attīrīšana: trokšņa novēršana, kvalitātes kontrole, dublētu/kaitīgu datu filtrēšana
- Licencēšana: skaidri jānosaka autortiesības un datu izmantošanas tiesības
Liela mēroga skaitļošanas infrastruktūra
- Augstas veiktspējas GPU/TPU klasteris: tehnoloģija, kas apvieno tūkstošiem līdz desmitiem tūkstošu mezglu, lai atbalstītu liela apjoma sadalīto apmācību
- Efektīvs sadalītās apmācības ietvars: DeepSpeed, Megatron-LM, Ray u. c.
- Krātuve/tīkls: liela apjoma datu ievade un izvade, ātras tīkla vides nodrošināšana
Modeļa arhitektūras izstrāde
- Jaunākās arhitektūras: Transformer, MoE(Mixture of Experts), multimodalitāte u. c.
- Mērogojamība: mērogojamības apsvērumi, piemēram, parametru skaits, slāņu skaits un ievades garums
- Efektivitāte: mācīšanās un secināšanas ātruma, kā arī atmiņas izmantošanas optimizācija
Mācīšanās stratēģijas un algoritmi
- Iepriekšējās apmācības mērķi: valodas modelēšana (piemēram, next token prediction), multimodalitāte (piemēram, contrastive learning) u. c.
- Optimizācijas metodes: mixed precision, gradient accumulation, learning rate schedule u. c.
- Normalizācija/stabilizācija: dropout, layer norm, weight decay u. c.
Novērtēšanas un validācijas sistēma
- Etalonu kopas: standarta datu kopu (Benchmarks) izmantošana
- Iekšējā novērtēšana: novērtēšana, balstoties uz faktiskajiem lietošanas scenārijiem
- Nepārtraukta uzraudzība: kvalitātes, aizspriedumu un drošības pārbaude mācīšanās laikā un pēc tās
Cilvēkresursi un organizācijas kompetence
- AI/ML pētnieki: modeļu izstrāde, algoritmu izstrāde
- Datu inženieri: datu vākšana, attīrīšana un pārvaldība
- Infrastruktūras inženieri: izkliedēto sistēmu, mākoņa un lokālās infrastruktūras pārvaldība
- Projektu vadītāji: grafika, budžeta un kvalitātes pārvaldība
Ētiskie, juridiskie un drošības apsvērumi
- AI ētika: aizspriedumi, drošība, pārredzamība un atbildība
- Atbilstība tiesību aktiem: personas dati, autortiesības un datu suverenitāte
- Drošība: datu un modeļu noplūdes novēršana, piekļuves kontrole
Pašlaik visā pasaulē ir aptuveni 2 000 AI pētnieku, un pat viņi lielākoties ir koncentrēti tādos lielo tehnoloģiju uzņēmumos kā META, Google un XAI. Dienvidkorejā ir ārkārtīgi maz komandu, kas spētu patstāvīgi izstrādāt Foundation modeli, sākot ar datu vākšanu un beidzot ar liela mēroga mācīšanās infrastruktūru.
3. Izveidot ļoti lielu valodas modeli ar nelielu komandu.
Tomēr Clevi izpilddirektors I Hvanho nolēma uzņēmumā “Clevi” izveidot pasaulē labāko AI
Izmantojot vairāk nekā 10 gadu pieredzi dziļās mācīšanās un mašīnmācīšanās pētniecībā, izpilddirektors I Hvanho pirms trim gadiem nodibināja uzņēmumu (Clevi) ar mērķi “izveidot pasaulē labāko AI”.
Viņš pats izstrādāja visus procesus — uzņēmuma datu konveijera izveidi, liela mēroga izkliedētās dziļās mācīšanās infrastruktūras projektēšanu, modeļa arhitektūras izstrādi, kvalitātes validāciju u. c. — un tādējādi apguva Foundation Model izstrādei nepieciešamās kompetences.
Pēc modeļa apmācīšanas vairākas reizes uzņēmuma rīcībā tagad ir Clevi-5-x modelis, kas spēj mēroties ar pasaules augstākā līmeņa modeļiem.
Lai efektīvi apmācītu īpaši liela mēroga valodas modeļus, ir nepieciešama infrastruktūra, kurā simtiem līdz tūkstošiem GPU ir savienoti klasterī un vienlaikus var apstrādāt līdz pat kvadriljoniem operāciju sekundē. Šajā procesā būtiska nozīme ir tehnoloģijām, kas samazina aprēķinu sinhronizācijas un sakaru aizkaves liela mēroga sadalītā vidē. Līdz šim Korejā, tā kā nebija “precīzas vadības algoritma”, vairums uzņēmumu nespēja pienācīgi apmācīt modeļus. Clevi izpilddirektors Lee Hwan-ho, pats izstrādājot šo unikālo sadalīto aprēķinu vadības algoritmu, kļuva par pirmo Korejā, kurš veiksmīgi apmācīja īpaši liela mēroga valodas modeli ar 1,4 triljonu (1.4 Trillion) parametru.
4. Iemesls, kāpēc ar nelielu izstrādātāju skaitu varējām izstrādāt dažādus modeļus
Arī lielākajai daļai lielo tehnoloģiju uzņēmumu ir liela mēroga infrastruktūras pārvaldības un datu attīrīšanas tehnoloģijas.
Lai to pārvaldītu, ir nepieciešami simtiem līdz tūkstošiem pētnieku.
Tomēr CLEVI ar nelielu pētnieku skaitu izstrādā un uztur dažādus modeļus.
Kā tas bija iespējams?
CLEVI, izmantojot Teacher-Student Model(Knowledge Distilation) tehnoloģiju, ar nelielu darbinieku skaitu izstrādā un uztur dažādus modeļus.
Aplūkosim Teacher-Student tehnoloģiju.
Teacher-Student (zināšanu distilācija)
Teacher-Student tehnoloģija, vienkārši sakot, ir tehnoloģija, kas, izmantojot īpaši liela mēroga valodas modeli (Teacher Model), novērtē un sniedz atgriezenisko saiti bērna modelim (Student Model), tādējādi ar nelielu darbinieku skaitu aizstājot simtiem pētnieku un ātri izstrādājot dažādus modeļus.
- Mother Model(īpaši liela mēroga modelis) novērtē un sniedz atgriezenisko saiti dažādu jomu modeļiem, aizstājot simtiem pētnieku.
- Ja apmācība tiek veikta šādā veidā, izmantojot Clevi-x-platform, augstas veiktspējas modeļus, piemēram, Reasoning, VLM, Physical AI un Coding Agent, var apmācīt un ieviest 10–15 dienu laikā.
Clevi Coding Agent
Clevi Phsycal AI Learning Platform
VLM-Vision Language Model
Drošības aģents
5. Clevi-x-platform tehnoloģiskā un kvalitātes diferenciācija
Modeļa veiktspēja un mērogojamība
- Pārākums secināšanā (CoT/Reasoning): cip-5-x savā izstrādes filozofijā ietver pakāpenisku loģisko izklāstu un pamatojuma sniegšanu, demonstrējot augstas uzticamības aprēķinu un interpretācijas spējas zinātnes, matemātikas un inženierijas problēmu risināšanā. Pamatojoties uz iekšējo etalonu rezultātiem, tas tiek izstrādāts un darbināts ar mērķi sasniegt GPT-5 līmeņa vai augstāku veiktspēju, savukārt reproducējamība un pārbaudāmība identisku uzvedņu apstākļos tiek pārvaldīta kā galvenie kvalitātes rādītāji.
- Pilns multimodalitātes spektrs: vienā platformā iespējams ražošanā izmantot un kombinēt uz mērķi orientētu VLM (cip-5-vision), liela apjoma multimodālu apstrādes modeli (ivy-4-mm) un vieglu ierīcē darbināmu modeli (ivy-3-text), tādējādi izvēloties optimālu kombināciju atbilstoši uzdevuma raksturam (meklēšana/klasifikācija/kopsavilkums vai secināšana/skaidrojums/izpilde).
Piemērotība uzņēmumu vajadzībām
- Drošība un pieejamība lokālajā infrastruktūrā: darbība visā slēgtā tīkla ciklā (ievade–apmācība–pakalpojums–dublēšana), HA izstrāde, modulāra paplašināšana un datu un modeļa parametru atsevišķa aizsardzība ar SVCE (izolētu drošas izpildes vidi).
- Ātra ieviešana un paplašināšana: Ivy Chat (uzdevumiem paredzēta multimodāla saruna/aģents) un API Platform (globāls standarta SaaS) nodrošina ātru ieviešanu un darbību.
Fiziskā AI (Physical AI) atšķirīgās priekšrocības
- NVIDIA Isaac simulācijas apvienojumā ar evolūcijā balstītu pastiprināto mācīšanos (Evolutionary RL), Sim2Real pārnese un paralēla apmācība ar sintētiskajiem datiem ir palielinājusi apmācības efektivitāti un pielāgošanās spēju reālās vides apstākļos. Risinājumu, kas aptver visu ciklu no digitālās vides līdz robotikas apmācībai un ieviešanai, ir maz.
Pakalpojumu kvalitāte un pārvaldība
- Modeļu, uzvedņu un rīku versiju pārvaldība, novērtēšanas komplekts (zināšanas korejiešu un angļu valodā, nozaru uzdevumi, halucināciju un drošības rādītāji), izmaiņu pārvaldība (SLO/SLA) un darbības uzraudzība (latentums, sekmju rādītājs, TCO) tiek pārvaldīta kā vienota platformas procedūra.
Pašlaik Dienvidkorejā ir vairāk nekā aptuveni 300 AI modeļu pakalpojumu uzņēmumu, taču
CLEVI ir vienīgais uzņēmums, kas ar augstas veiktspējas, pašu izstrādāta pamata modeļa palīdzību var vienlaikus nodrošināt lokālās infrastruktūras un mākoņa pakalpojumus.
6. Kā izmantot valodu modeļus nozarē
Tā kā AI ieviešanai nepieciešamas ievērojamas investīcijas un rūpīga validācija, ir būtiski tieši salīdzināt un izmēģināt, vai risinājums patiešām sniedz uzņēmumam praktisku labumu.
- CLEVI neaprobežojas tikai ar modeļu izstrādi, bet nodrošina AI risinājumus, ko iespējams izmantot reālajā rūpniecības vidē.
- Piemēram, CLEVI ir izveidojusi pilnvērtīgus uzņēmumu kanālus, tostarp Ivy Chat Platform, Clevi API Platform, nozarei pielāgotus risinājumus un atbilstību drošības prasībām.
- CLEVI piemīt tehnoloģiskās spējas tādās jomās kā fizikālais AI, robotika un multimodālu datu apstrāde — jomas, kurās līdzvērtīgas iespējas gan Korejā, gan ārvalstīs ir grūti atrast.
CLEVI nodrošina praktiskus AI risinājumus, kuros AI nav “mērķis”, bet gan “līdzeklis”, kas veicina reālu darba efektivitāti un nozares inovācijas. Izbaudiet īsta From-scratch Foundation modeļa atšķirību paši.
Jautājumi un demonstrācijas pieprasījumi: [email protected]
Autortiesības© 2025 Clevi Inc. Visas tiesības aizsargātas.
