Истражување

From-scratch Foundation Model CLEVI AI (ivy)

„Како мала компанија успеа да создаде јазичен модел со огромен број параметри на светско ниво?“

Слика во текстот

„Како мала компанија успеа да создаде јазичен модел со огромен број параметри на светско ниво?“

Како мал стартап создаде јазичен модел со огромен број параметри?

Ова е прашањето што најчесто го добивме откако CLEVI го претстави својот Foundation модел со 1,4 трилиони параметри.

За разлика од многу компании кои едноставно прават фино дообучување на модели со отворен код, CLEVI самостојно го спроведе целиот процес — од собирање податоци, дизајнирање на моделот и големомащинско дистрибуирано обучување, до проверка на квалитетот.

Подолу детално ги претставуваме тајните на овој успех и конкурентските предности.

1. Може ли мала компанија да создаде јазичен модел со огромен број параметри?

Слика во текстот

Во јули 2025 година, кога CLEVI го претстави на пазарот својот јазичен модел со огромен број параметри, развиен самостојно, бројни клиенти (корисници) беа изненадени и скептични. „Дали навистина е развиен самостојно?“ „Зарем не е само малку изменет модел со отворен код?“

Всушност, многу компании во земјата и странство само применуваат трансферно учење (fine-tuning) на модели со отворен код и често ги промовираат како сопствени модели.

Но CLEVI го истакна **„From-scratch Foundation Model“**.

Односно, самостојно ги дизајнираше и изведе сите процеси — од собирање податоци, дизајнирање на моделот и големомащинско дистрибуирано обучување, до проверка на квалитетот.

2. Зошто е тешко да се развие јазичен модел со огромен број параметри

За обучување на From-Scratch Foundation Model, потребно е да се совладаат сите ставки наведени подолу.

Потребен е голем и висококвалитетен сет на податоци

  • Разновидност: обезбедување разновидност на јазици, домени и формати (текст, слики итн.)
  • Прочистување: отстранување шум, управување со квалитетот, филтрирање дупликати/штетни податоци
  • Лиценцирање: јасно дефинирање на авторските права и правата за користење на податоците

Обемна компјутерска инфраструктура

  • Кластери со високоперформансни GPU/TPU: технологија за интегрирање опрема со илјадници до десетици илјади јазли за поддршка на големомащинско дистрибуирано обучување
  • Рамки за ефикасно дистрибуирано обучување: DeepSpeed, Megatron-LM, Ray итн.
  • Складирање/мрежа: обработка на влезни и излезни податоци со голем обем и брза мрежна средина

Дизајнирање на архитектурата на моделот

  • Одразување на најновите архитектури: Transformer, MoE (Mixture of Experts), мултимодалност и друго
  • Скалабилност: земање предвид на можноста за проширување на бројот на параметри, бројот на слоеви, должината на влезот и друго
  • Ефикасност: оптимизација на брзината на тренирање/инференција и користењето меморија

Стратегии и алгоритми за тренирање

  • Цел на предтренирањето: јазични модели (на пр., next token prediction), мултимодалност (на пр., contrastive learning) и друго
  • Техники за оптимизација: mixed precision, gradient accumulation, learning rate schedule и друго
  • Нормализација/стабилизација: dropout, layer norm, weight decay и друго

Систем за евалуација и верификација

  • Бенчмарк-сетови: користење стандардни сетови на податоци (Benchmarks)
  • Внатрешна евалуација: евалуација врз основа на реални сценарија на употреба
  • Континуирано следење: проверка на квалитетот, пристрасноста и безбедноста за време и по тренирањето

Човечки ресурси и организациски капацитети

  • AI/ML истражувачи: дизајн на модели, развој на алгоритми
  • Дата-инженери: собирање/прочистување/управување со податоци
  • Инфраструктурни инженери: управување со дистрибуирани системи, облачна/локална инфраструктура
  • Проектни менаџери: управување со рокови, буџет и квалитет

Етички, правни и безбедносни аспекти

  • Етика на AI: пристрасност, безбедност, транспарентност и одговорност
  • Правна усогласеност: приватност, авторски права и суверенитет на податоците
  • Безбедност: спречување истекување на податоци/модели и контрола на пристапот

Во моментов, бројот на AI истражувачи ширум светот е околу 2.000, а повеќето од нив се концентрирани во големи технолошки компании како META, Google и XAI. Во Јужна Кореја, тимови што можат самостојно да дизајнираат сè — од собирање податоци до инфраструктура за обемно тренирање — и да создадат Foundation модел се исклучително ретки.

3. Создавање суперголем јазичен модел со мал број луѓе.

Сепак, извршниот директор на CLEVI, И Хван-хо, одлучи во „CLEVI“ да создаде најдобар AI во светот

Врз основа на повеќе од 10 години искуство во истражување на deep learning и machine learning, извршниот директор И Хван-хо пред 3 години ја основа компанијата (CLEVI) со цел „да создаде најдобар AI во светот“.

Со самостојно дизајнирање на целиот процес — изградба на сопствен pipeline за податоци, дизајн на инфраструктура за обемно дистрибуирано deep learning, развој на архитектура на модели и верификација на квалитетот — ги изгради потребните капацитети за развој на Foundation Model.

Како резултат на повеќекратното обучување на моделот, сега го имаме моделот Clevi-5-x, кој може да се мери со најдобрите модели во светот.

Слика во текстот

За ефикасно обучување на големи јазични модели, потребна е инфраструктура која поврзува стотици до илјадници GPU единици во кластер и може истовремено да обработува десетици квадрилиони операции во секунда. Во овој процес, технологијата за синхронизација на пресметките и минимизирање на комуникациското доцнење во големи дистрибуирани средини е од клучно значење. Досега, во Јужна Кореја, повеќето компании не можеа правилно да обучуваат модели поради непостоењето на „алгоритам за прецизна контрола“. Со самостојното развивање на овој сопствен алгоритам за контрола на дистрибуирани пресметки, извршниот директор на Clevi, Ли Хван-хо, беше првиот во Јужна Кореја кој успешно обучи голем јазичен модел со 1,4 трилиони (1.4 Trillion) параметри.

4. Причината поради која можевме да развиваме различни модели со мал број програмери

Повеќето бигтек компании исто така поседуваат технологии за контрола на големи инфраструктури и прочистување на податоци.

За нивно управување се потребни стотици до илјадници истражувачи.

Сепак, Clevi развива и поседува различни модели со мал број истражувачи.

Како беше тоа можно?

Слика во текстот

Clevi развива и поседува различни модели со мал број вработени преку технологијата Teacher-Student Model(Knowledge Distilation).

Тогаш, да ја разгледаме технологијата Teacher-Student.

Teacher-Student(дестилација на знаење)

Технологијата Teacher-Student, едноставно кажано, овозможува преку големиот јазичен модел (Teacher Model) да се врши проценка и давање повратни информации за детскиот модел (Student Model), со што мал број вработени може да замени стотици истражувачи и брзо да развива различни модели.

Слика во текстот
  • Mother Model(големиот модел) врши проценка и дава повратни информации за модели од различни области, заменувајќи стотици истражувачи.
  • Ако обучувањето се спроведува на овој начин преку Clevi-x-platform, моделите со високи перформанси, како што се Reasoning, VLM, Physical AI и Coding Agent, може да се обучат и распоредат за само 10–15 дена.

Clevi Coding Agent

Слика во текстот

Clevi Phsycal AI Learning Platform

Слика во текстот

VLM-Визуелен јазичен модел

Слика во телото на текстот

Безбедносен агент

Слика во телото на текстот

5. Диференцијација на Clevi-x-platform во технологијата и квалитетот

Перформанси и скалабилност на моделот

  • Предност во расудувањето (CoT/Reasoning): cip-5-x го вклучува чекор-по-чекор логичкото развивање и наведувањето образложенија во својата дизајнерска филозофија, покажувајќи пресметковни и интерпретативни способности со висока сигурност при решавање научни, математички и инженерски проблеми. Врз основа на интерни бенчмаркови, се дизајнира и работи со цел да постигне перформанси на ниво на GPT-5 или повисоки, при што репродуктивноста и проверливоста под исти услови на промпт се управуваат како клучни индикатори за квалитет.
Слика во телото на текстот
  • Целосен спектар на мултимодалност: со производство и комбинирање на наменскиот VLM (cip-5-vision), моделот за обработка на големи мултимодални податоци (ivy-4-mm) и лесниот модел за уреди (ivy-3-text) на една платформа, можно е оптимално комбинирање според карактеристиките на задачата (пребарување/класификација/сумирање наспроти расудување/објаснување/извршување).

Применливост во претпријатија

  • Безбедност и достапност во on-premises средина: работење во сите фази во затворена мрежа (внесување-обука-услуга-резервна копија), HA дизајн, модуларно проширување и SVCE (изолирана безбедна средина за извршување) овозможуваат одделна заштита на податоците и параметрите на моделот.
  • Брзо воведување и проширување: Ivy Chat (мултимодален разговор/агент за деловни задачи) и API Platform (глобален стандарден SaaS) овозможуваат брза примена и работа.
Слика во телото на текстот

Диференцијација во физичката AI (Physical AI)

  • Со комбинирање симулации базирани на NVIDIA Isaac и еволутивно засилено учење (Evolutionary RL), како и со паралелно учење преку пренос Sim2Real и синтетички податоци, се зголемуваат ефикасноста на учењето и приспособливоста во реални услови. Ретко постои алтернатива што го опфаќа целиот процес од дигитално-роботичко учење до распоредување.

Квалитет на услугата и управување

  • Управувањето со верзиите на моделите/промптовите/алатките, пакетот за евалуација (знаење на корејски и англиски јазик, задачи по индустрии, метрики за халуцинации и безбедност), управувањето со промените (SLO/SLA) и оперативното набљудување (латентност/стапка на успешност/TCO) се спроведуваат преку единствена процедура на платформата.

Во Јужна Кореја моментално постојат повеќе од приближно 300 компании кои нудат услуги со AI модели, но

Клеви е единствената компанија што преку сопствен фундаментален модел со високи перформанси може истовремено да обезбеди on-premises и cloud услуги.

6. Начини за примена на јазичните модели во индустријата

Бидејќи воведувањето на AI бара огромни инвестиции и темелна проверка, неопходен е процес на директно споредување и испробување за да се утврди дали решението навистина ѝ помага на компанијата.

  • CLEVI не се ограничува само на создавање модели, туку обезбедува AI решенија применливи во реални индустриски средини.
  • На пример, располага со целосен пакет за ентерпрајз-канали, вклучувајќи ги Ivy Chat Platform, Clevi API Platform, прилагодување според индустријата и одговор на безбедносните барања.
  • Поседува технолошки капацитети што ретко се среќаваат во земјата и во странство, како што се физички AI, роботика и мултимодална обработка на податоци.

CLEVI обезбедува суштински AI решенија што придонесуваат кон реалната работна ефикасност и индустриските иновации, користејќи го AI не како „цел“, туку како „средство“. Директно искусете ја различноста на вистинскиот From-scratch Foundation модел.

Прашања и барања за демо: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Назад во редакцијата
CLEVI

Јазик и регион

Јазиците преведени машински се означени. Достапноста следи според објавениот пакет на сајтот.

136 јазици

Препорачано

1

Источна Азија

7

Југоисточна Азија

11

Јужна Азија

18

Централна Азија

5

Блискиот Исток и Кавказ

10

Западна Европа и Јужна Европа

16

Обединето Кралство и Ирска

4

Северна Европа

10

Централна Европа и Балканот

14

Источна Европа

5

Источна Африка

8

Западна Африка и Средна Африка

9

Јужна Африка

8

Америки

5

Океанија

5
From-scratch Foundation Model CLEVI AI (ivy) — CLEVI