„Как една малка компания успя да създаде езиков модел с изкуствен интелект от свръхголям мащаб на световно ниво?“
Как една малка стартъп компания създаде езиков модел от свръхголям мащаб?
Това е най-често задаваният въпрос, откакто Clevi представи своя Foundation модел с 1,4 трилиона параметъра.
За разлика от много компании, които просто фино настройват модели с отворен код, Clevi самостоятелно извърши всички процеси — от събирането на данни, през проектирането на модела и мащабното разпределено обучение, до проверката на качеството.
По-долу представяме подробно тайната на този успех и конкурентоспособността на компанията.
1. Малка компания създава езиков модел от свръхголям мащаб?
През юли 2025 г., когато Clevi представи на пазара своя самостоятелно разработен езиков модел от свръхголям мащаб, множество клиенти (потребители) реагираха с изненада и съмнение. „Наистина ли е разработен самостоятелно?“ „Да не би просто леко да са променили модел с отворен код?“
На практика много компании в страната и чужбина само извършват трансферно обучение (fine-tuning) на модели с отворен код и ги рекламират като свои собствени модели.
Clevi обаче представи **‘From-scratch Foundation Model’**.
Тоест всички процеси — от събирането на данни, през проектирането на модела и мащабното разпределено обучение, до проверката на качеството — са проектирани и изпълнени самостоятелно.
2. Защо разработването на езиков модел от свръхголям мащаб е трудно
За да се обучи From-Scratch Foundation Model, е необходимо да се усвоят всички изброени по-долу елементи.
Необходим е широкомащабен набор от висококачествени данни
- Разнообразие: осигуряване на разнообразие от езици, домейни и формати (текст, изображения и др.)
- Пречистване: премахване на шум, контрол на качеството, филтриране на дублиращи се/вредни данни
- Лицензиране: ясно определяне на авторските права и правата за използване на данните
Широкомащабна изчислителна инфраструктура
- Високопроизводителен GPU/TPU клъстер: технология за интегриране на оборудване от хиляди до десетки хиляди възли в подкрепа на широкомащабно разпределено обучение
- Ефективна рамка за разпределено обучение: DeepSpeed, Megatron-LM, Ray и др.
- Сторидж/мрежа: входно-изходни операции с големи обеми данни и високоскоростна мрежова среда
Проектиране на архитектурата на модела
- Отразяване на най-новите архитектури: Transformer, MoE (Mixture of Experts), мултимодалност и др.
- Мащабируемост: отчитане на разширяемостта по отношение на броя параметри, броя слоеве, дължината на входа и др.
- Ефективност: оптимизиране на скоростта на обучение/инференция и използването на паметта
Стратегии и алгоритми за обучение
- Цели на предварителното обучение: езикови модели (напр. предсказване на следващия токен), мултимодалност (напр. contrastive learning) и др.
- Методи за оптимизация: mixed precision, gradient accumulation, learning rate schedule и др.
- Нормализация/стабилизация: dropout, layer norm, weight decay и др.
Система за оценяване и валидиране
- Бенчмарк набори: използване на стандартни набори от данни (Benchmarks)
- Вътрешна оценка: оценяване въз основа на реални сценарии на употреба
- Непрекъснат мониторинг: проверка на качеството, предубедеността и безопасността по време и след обучението
Човешки ресурси и организационен капацитет
- AI/ML изследователи: проектиране на модели, разработване на алгоритми
- Инженери по данни: събиране/почистване/управление на данни
- Инфраструктурни инженери: разпределени системи, управление на облачна/локална инфраструктура
- Проектни мениджъри: управление на графици, бюджет и качество
Етични, правни и свързани със сигурността съображения
- Етика на AI: предубеденост, безопасност, прозрачност, отговорност
- Правно съответствие: лични данни, авторски права, суверенитет на данните
- Сигурност: предотвратяване на изтичане на данни/модели, контрол на достъпа
В момента броят на изследователите в областта на AI по света е около 2 000, като повечето от тях са концентрирани в големи технологични компании като META, Google, XAI и др. В Южна Корея са изключително редки екипите, които могат сами да проектират и създадат Foundation модел — от събирането на данни до инфраструктурата за мащабно обучение.
3. Създаване на свръхголям езиков модел с малък екип.
Но главният изпълнителен директор на Clevi, И Хуан-хо, реши да създаде най-добрия AI в света в „Clevi“.
Въз основа на повече от 10 години опит в изследванията на дълбокото и машинното обучение, преди 3 години главният изпълнителен директор И Хуан-хо основа компанията (Clevi) с целта „да създаде най-добрия AI в света“.
Чрез самостоятелно проектиране на всички процеси — изграждане на собствен конвейер за данни, проектиране на мащабна разпределена инфраструктура за дълбоко обучение, разработване на архитектура на модела, проверка на качеството и др. — компанията придоби необходимите за разработването на Foundation Model умения.
В резултат на многократно обучение на модели, днес компанията разполага с модела Clevi-5-x, който може да се сравнява с моделите на най-високо световно ниво.
За ефективното обучение на огромни езикови модели е необходима инфраструктура, която свързва от стотици до хиляди GPU в клъстер, за да може едновременно да обработва изчисления в размер на стотици квадрилиони операции в секунда. В този процес ключови са технологиите за синхронизиране на изчисленията и минимизиране на комуникационните закъснения в мащабна разпределена среда. Досега в Южна Корея повечето компании не можеха да обучават моделите си правилно поради липсата на „алгоритъм за прецизен контрол“. Чрез самостоятелното разработване на такъв уникален алгоритъм за контрол на разпределените изчисления, главният изпълнителен директор на Clevi И Хуанхо успешно обучи първия в страната огромен езиков модел с мащаб от 1,4 трилиона (1.4 Trillion) параметъра.
4. Причината, поради която с малък брой разработчици успяхме да разработим разнообразни модели
Повечето високотехнологични компании също разполагат с технологии за контрол на мащабна инфраструктура и пречистване на данни.
За управлението им са необходими стотици до хиляди изследователи.
Въпреки това Clevi разработва и притежава разнообразни модели с малък брой изследователи.
Как беше възможно това?
Чрез технологията Teacher-Student Model (Knowledge Distilation) Clevi разработва и притежава разнообразни модели с малък брой служители.
Нека тогава разгледаме технологията Teacher-Student.
Teacher-Student (дестилация на знания)
Технологията Teacher-Student, казано просто, е технология, която чрез оценяване и предоставяне на обратна връзка към дъщерния модел (Student Model) от огромен езиков модел (Teacher Model) позволява на малък брой служители да заменят стотици изследователи и бързо да разработват разнообразни модели.
- Mother Model (огромният модел) оценява и предоставя обратна връзка за модели в различни области, като заменя стотици изследователи.
- Ако обучението се извършва по този начин чрез Clevi-x-platform, високопроизводителни модели като Reasoning, VLM, Physical AI и Coding Agent могат да бъдат обучени и внедрени само за 10–15 дни.
Clevi Coding Agent
Clevi Phsycal AI Learning Platform
VLM-Vision Language Model
Агент за сигурност
5. Отличителни характеристики на технологията и качеството на Clevi-x-platform
Производителност и мащабируемост на модела
- Превъзходство в разсъжденията (CoT/Reasoning): cip-5-x включва поетапното логическо развитие и представянето на обосновка във философията си на проектиране, демонстрирайки високонадеждни изчислителни и интерпретационни способности при решаването на научни, математически и инженерни задачи. Проектиран и експлоатиран е с цел да постигне производителност на ниво GPT-5 или по-висока според вътрешни бенчмаркове, като възпроизводимостта и проверимостта при еднакви условия на подканване се управляват като ключови показатели за качество.
- Пълен спектър от мултимодалност: чрез производството и комбинирането на целево ориентиран VLM (cip-5-vision), мащабен мултимодален модел за обработка (ivy-4-mm) и лек модел за работа на крайни устройства (ivy-3-text) в една платформа е възможна оптимална комбинация, съобразена с характеристиките на задачата (търсене/класификация/обобщаване спрямо разсъждение/обяснение/изпълнение).
Приложимост в предприятията
- Сигурност и наличност при локално разгръщане: работа в цялата затворена мрежа (въвеждане—обучение—услуга—архивиране), проектиране на HA, модулно разширяване и разделена защита на данните и параметрите на модела чрез SVCE (изолирана безопасна среда за изпълнение).
- Бързо внедряване и разширяване: Ivy Chat (мултимодален разговор/агент за работни задачи) и API Platform (глобален стандартен SaaS) подпомагат бързото прилагане и експлоатация.
Отличителни характеристики на физическия AI (Physical AI)
- Чрез комбиниране на симулации, базирани на NVIDIA Isaac, и еволюционно обучение с подсилване (Evolutionary RL), както и чрез паралелно обучение с пренос Sim2Real и синтетични данни, бяха повишени ефективността на обучението и адаптивността на място. Рядко се среща алтернатива, която обхваща целия процес от цифровото обучение и роботиката до внедряването.
Качество на услугата и управление
- Управлението на версиите на моделите/подканванията/инструментите, наборите за оценка (знания на корейски и английски, специфични за индустрията задачи, показатели за халюцинации и безопасност), управлението на промените (SLO/SLA) и оперативното наблюдение (латентност, успеваемост, TCO) се извършват чрез единна платформена процедура.
В момента в Южна Корея съществуват над 300 компании, предоставящи услуги с AI модели, но
Клеви е единствената компания, която чрез собствени високопроизводителни фундаментални модели може едновременно да предоставя локални и облачни услуги.
6. Начини за използване на езикови модели в индустрията
Тъй като внедряването на AI изисква огромни инвестиции и задълбочена проверка, от съществено значение е директно да се сравни и изпробва дали решението действително ще бъде полезно за предприятието.
- Clevi не се ограничава само до създаването на модели, а предоставя AI решения, приложими в реални индустриални среди.
- Например, компанията разполага с пълен набор от корпоративни канали, включително Ivy Chat Platform, Clevi API Platform, персонализиране за различни индустрии и съответствие с изискванията за сигурност.
- Компанията притежава технически възможности, които трудно могат да бъдат открити в страната и чужбина, включително физически AI, роботика и мултимодална обработка на данни.
Clevi предоставя реални AI решения, които допринасят за ефективността на действителната работа и индустриалните иновации, като използват AI не като „цел“, а като „средство“.Изпитайте лично отличителните характеристики на истинския From-scratch Foundation модел.
Запитвания и заявки за демонстрация: [email protected]
Copyright© 2025 Clevi Inc. All rights reserved.
