Даследаванні

Фундаментальная мадэль, створаная з нуля, — Клеві AI(ivy)

«Як невялікая кампанія змагла стварыць моўную мадэль звышвялікага маштабу сусветнага ўзроўню?»

Выява ў артыкуле

«Як невялікая кампанія змагла стварыць моўную мадэль звышвялікага маштабу сусветнага ўзроўню?»

Як невялікі стартап стварыў моўную мадэль звышвялікага маштабу?

Гэта пытанне, якое Клеві атрымлівала часцей за ўсё пасля публікацыі фундаментальнай мадэлі памерам 1,4 трыльёна параметраў.

У адрозненне ад многіх кампаній, якія проста дапрацоўваюць мадэлі з адкрытым зыходным кодам, Клеві самастойна выканала ўвесь працэс — ад збору даных і праектавання мадэлі да буйнамаштабнага размеркаванага навучання і праверкі якасці.

Ніжэй мы падрабязна раскажам пра гэты сакрэт і канкурэнтныя перавагі.

1. Невялікая кампанія стварае моўную мадэль звышвялікага маштабу?

Выява ў артыкуле

У ліпені 2025 года, калі Клеві прадставіла рынку ўласнаручна распрацаваную моўную мадэль звышвялікага маштабу, незлічоная колькасць кліентаў (карыстальнікаў) была ахоплена здзіўленнем і сумневамі. «Няўжо яна сапраўды распрацаваная самастойна?» «Ці не была гэта проста нязначна змененая мадэль з адкрытым зыходным кодам?»

Насамрэч многія кампаніі ў краіне і за мяжой проста выконвалі пераноснае навучанне (fine-tuning) мадэляў з адкрытым зыходным кодам, а затым рэкламавалі іх як уласныя мадэлі.

Аднак Клеві зрабіла акцэнт на **«фундаментальнай мадэлі, створанай з нуля»**.

Іншымі словамі, яна самастойна спраектавала і рэалізавала ўвесь працэс — ад збору даных і праектавання мадэлі да буйнамаштабнага размеркаванага навучання і праверкі якасці.

2. Чаму распрацоўка моўнай мадэлі звышвялікага маштабу складаная

Каб навучыць фундаментальную мадэль, створаную з нуля, неабходна навучыць усе пералічаныя ніжэй кампаненты.

Патрэбны буйнамаштабны высакаякасны набор даных

  • Разнастайнасць: забеспячэнне разнастайнасці моў, даменаў і фарматаў (тэкст, выявы і г.д.)
  • Ачыстка: выдаленне шуму, кантроль якасці, фільтрацыя дублікатаў/шкодных даных
  • Ліцэнзаванне: дакладнае вызначэнне аўтарскіх правоў і правоў на выкарыстанне даных

Буйнамаштабная вылічальная інфраструктура

  • Высокапрадукцыйны кластар GPU/TPU: тэхналогіі інтэграцыі абсталявання з тысячамі і дзясяткамі тысяч вузлоў для падтрымкі буйнамаштабнага размеркаванага навучання
  • Эфектыўны фрэймворк размеркаванага навучання: DeepSpeed, Megatron-LM, Ray і інш.
  • Сховішча/сетка: увод і вывад вялікіх аб'ёмаў даных, хуткае сеткавае асяроддзе

Праектаванне архітэктуры мадэлі

  • Улічванне найноўшай архітэктуры: Transformer, MoE (Mixture of Experts), мультымадальнасць і інш.
  • Маштабаванасць: улічванне магчымасці пашырэння колькасці параметраў, слаёў, даўжыні ўваходных дадзеных і інш.
  • Эфектыўнасць: аптымізацыя хуткасці навучання/вываду і выкарыстання памяці

Стратэгіі навучання і алгарытмы

  • Мэты папярэдняга навучання: моўная мадэль (напрыклад, next token prediction), мультымадальнасць (напрыклад, contrastive learning) і інш.
  • Метады аптымізацыі: mixed precision, gradient accumulation, learning rate schedule і інш.
  • Нармалізацыя/стабілізацыя: dropout, layer norm, weight decay і інш.

Сістэма ацэнкі і праверкі

  • Наборы бенчмаркаў: выкарыстанне стандартных набораў дадзеных (Benchmarks)
  • Унутраная ацэнка: ацэнка на аснове рэальных сцэнарыяў выкарыстання
  • Бесперапынны маніторынг: праверка якасці, прадузятасці і бяспекі падчас і пасля навучання

Кадравы і арганізацыйны патэнцыял

  • Даследчыкі AI/ML: праектаванне мадэляў, распрацоўка алгарытмаў
  • Інжынеры дадзеных: збор/ачыстка/кіраванне дадзенымі
  • Інжынеры інфраструктуры: размеркаваныя сістэмы, кіраванне воблачнай/лакальнай інфраструктурай
  • Кіраўнікі праектаў: кіраванне тэрмінамі, бюджэтам і якасцю

Этычныя, прававыя і бяспекавыя аспекты

  • Этыка AI: прадузятасць, бяспека, празрыстасць, адказнасць
  • Захаванне прававых патрабаванняў: прыватнасць, аўтарскае права, суверэнітэт дадзеных
  • Бяспека: прадухіленне ўцечкі дадзеных/мадэляў, кантроль доступу

У цяперашні час колькасць спецыялістаў у галіне даследаванняў AI ва ўсім свеце складае каля 2 000 чалавек, і большасць з іх засяроджана ў буйных тэхналагічных кампаніях, такіх як META, Google, XAI і інш. У Паўднёвай Карэі вельмі мала каманд, здольных самастойна распрацаваць Foundation-мадэль — ад збору дадзеных да інфраструктуры маштабнага навучання.

3. Стварэнне вялікай моўнай мадэлі невялікай камандай.

Аднак генеральны дырэктар Clevi Лі Хванхо вырашыў стварыць у «Clevi» найлепшы ў свеце AI

Генеральны дырэктар Лі Хванхо, абапіраючыся на больш чым 10-гадовы досвед даследаванняў у галіне deep learning і machine learning, тры гады таму заснаваў кампанію (Clevi) з мэтай «стварыць найлепшы ў свеце AI».

Самастойна распрацаваўшы ўсе працэсы — ад стварэння ўласнага канвеера дадзеных кампаніі, праектавання інфраструктуры размеркаванага deep learning вялікага маштабу, распрацоўкі архітэктуры мадэлі да праверкі якасці — кампанія набыла кампетэнцыі, неабходныя для распрацоўкі Foundation Model.

У выніку шматразовага навучання мадэляў кампанія цяпер валодае мадэллю Clevi-5-x, здольнай канкурыраваць з мадэлямі сусветнага ўзроўню.

Выява ў асноўным тэксце

Для эфектыўнага навучання вялікіх моўных мадэляў неабходная інфраструктура, у якой ад сотняў да тысяч GPU злучаныя ў кластар і могуць адначасова выконваць вылічэнні ў аб'ёме да квадрыльёнаў аперацый у секунду. У гэтым працэсе ключавую ролю адыгрываюць тэхналогіі сінхранізацыі вылічэнняў у буйнамаштабным размеркаваным асяроддзі і мінімізацыі затрымак сувязі. Да гэтага часу ў Паўднёвай Карэі большасць кампаній не магла належным чынам навучаць мадэлі з-за адсутнасці «алгарытмаў дакладнага кіравання». Генеральны дырэктар Clevi Лі Хванхо, самастойна распрацаваўшы ўнікальны алгарытм кіравання размеркаванымі вылічэннямі, першым у Паўднёвай Карэі паспяхова завяршыў навучанне вялікай моўнай мадэлі з 1,4 трыльёна (1.4 Trillion) параметраў.

4. Прычыны, па якіх невялікая колькасць распрацоўшчыкаў магла распрацоўваць розныя мадэлі

Большасць буйных тэхналагічных кампаній таксама валодае тэхналогіямі кіравання буйнамаштабнай інфраструктурай і ачысткі даных.

Для кіравання гэтым неабходныя ад некалькіх соцень да некалькіх тысяч навуковых супрацоўнікаў.

Аднак Clevi распрацоўвае і валодае рознымі мадэлямі, маючы невялікую колькасць навуковых супрацоўнікаў.

Як гэта было магчыма?

Выява ў асноўным тэксце

Дзякуючы тэхналогіі Teacher-Student Model (Knowledge Distilation) Clevi распрацоўвае і валодае рознымі мадэлямі з дапамогай невялікай колькасці супрацоўнікаў.

Тады разгледзім тэхналогію Teacher-Student.

Teacher-Student (дыстыляцыя ведаў)

Тэхналогія Teacher-Student — гэта, простымі словамі, тэхналогія, якая дазваляе з дапамогай вялікай моўнай мадэлі (Teacher Model) ацэньваць і даваць зваротную сувязь для даччынай мадэлі (Student Model), замяняючы сотні навуковых супрацоўнікаў невялікай колькасцю спецыялістаў і хутка распрацоўваючы розныя мадэлі.

Выява ў асноўным тэксце
  • Mother Model (вялікая мадэль) ацэньвае розныя галіновыя мадэлі і дае ім зваротную сувязь, замяняючы сотні навуковых супрацоўнікаў.
  • Калі такім спосабам праводзіць навучанне праз Clevi-x-platform, можна за 10–15 дзён навучыць і разгарнуць высокапрадукцыйныя мадэлі, такія як Reasoning, VLM, Physical AI і Coding Agent.

Clevi Coding Agent

Выява ў асноўным тэксце

Clevi Phsycal AI Learning Platform

Выява ў асноўным тэксце

VLM-Vision Language Model

Выява ў асноўным тэксце

Агент бяспекі

Выява ў асноўным тэксце

5. Адметнасці тэхналогій і якасці Clevi-x-platform

Прадукцыйнасць і маштабаванасць мадэлі

  • Перавага ў разважанні (CoT/Reasoning): cip-5-x уключае паэтапнае лагічнае вывядзенне і прадстаўленне абгрунтаванняў у сваю філасофію праектавання, дэманструючы высоканадзейныя здольнасці да вылічэнняў і інтэрпрэтацыі пры вырашэнні навуковых, матэматычных і інжынерных задач. На аснове ўнутраных бенчмаркаў сістэма праектуецца і эксплуатуецца з мэтай дасягнення ўзроўню прадукцыйнасці GPT-5 і вышэй, а ўзнаўляльнасць і магчымасць праверкі пры аднолькавых умовах прамптаў кіруюцца як ключавыя паказчыкі якасці.
Выява ў асноўным тэксце
  • Поўны спектр мультымадальнасці: дзякуючы вытворчасці і камбінаванню на адной платформе мэтанакіраванай VLM (cip-5-vision), вялікай мультымадальнай мадэлі апрацоўкі (ivy-4-mm) і лёгкай мадэлі для прылад (ivy-3-text) можна падабраць аптымальную камбінацыю ў адпаведнасці з характарам задачы (пошук/класіфікацыя/рэзюмаванне ў параўнанні з разважаннем/тлумачэннем/выкананнем).

Прыдатнасць для прадпрыемстваў

  • Бяспека і даступнасць у лакальнай інфраструктуры: эксплуатацыя ва ўсім замкнёным контуры (увод-навучанне-сэрвіс-рэзервовае капіраванне), праектаванне HA, модульнае пашырэнне і ізаляцыя ды абарона даных і параметраў мадэлі з дапамогай SVCE (ізаляванага бяспечнага асяроддзя выканання).
  • Хуткае ўкараненне і маштабаванне: Ivy Chat (мультымадальны дыялог/агенты для працоўных задач) і API Platform (глабальны стандартны SaaS) падтрымліваюць хуткае прымяненне і эксплуатацыю.
Выява ў асноўным тэксце

Адрозненні фізічнага AI (Physical AI)

  • Спалучэнне сімуляцыі на базе NVIDIA Isaac і эвалюцыйнага навучання з падмацаваннем (Evolutionary RL), перанос Sim2Real і паралельнае навучанне на сінтэтычных даных павысілі эфектыўнасць навучання і здольнасць адаптавацца да рэальных умоў. Рэдкасць альтэрнатыў заключаецца ў тым, што рашэнне ахоплівае ўвесь шлях ад лічбавага навучання да рабатызацыі і разгортвання.

Якасць сэрвісаў і кіраванне

  • Версіі мадэляў/прамптаў/інструментаў, наборы ацэнкі (веды на карэйскай і англійскай мовах, галіновыя задачы, паказчыкі галюцынацый і бяспекі), кіраванне зменамі (SLO/SLA) і аперацыйны маніторынг (затрымка/каэфіцыент поспеху/TCO) кіруюцца ў рамках адзінай платформеннай працэдуры.

У цяперашні час у Паўднёвай Карэі існуе больш за 300 кампаній, якія прадастаўляюць сэрвісы AI-мадэляў, але

толькі Clevi можа адначасова прадастаўляць лакальныя і воблачныя сэрвісы дзякуючы ўласнай высокапрадукцыйнай фундаментальнай мадэлі.

6. Спосабы выкарыстання моўных мадэляў у прамысловасці

Паколькі ўкараненне AI патрабуе значных інвестыцый і дбайнай праверкі, неабходна непасрэдна параўнаць і апрабаваць рашэнне, каб пераканацца, што яно сапраўды прыносіць карысць прадпрыемству.

  • Clevi не абмяжоўваецца стварэннем мадэляў, а прапануе практычныя рашэнні ў галіне AI, прыдатныя для прымянення ў рэальных прамысловых умовах.
  • Напрыклад, мы цалкам ахопліваем карпаратыўныя каналы, уключаючы Ivy Chat Platform, Clevi API Platform, кастамізацыю для асобных галін, адпаведнасць патрабаванням бяспекі і іншае.
  • Мы валодаем тэхналагічнымі кампетэнцыямі, якія рэдка можна сустрэць як у краіне, так і за мяжой, уключаючы фізічны AI, робататэхніку і мультымадальную апрацоўку даных.

Clevi разглядае AI не як «мэту», а як «інструмент», і прапануе практычныя рашэнні ў галіне AI, якія спрыяюць павышэнню эфектыўнасці рэальнай працы і прамысловым інавацыям. Непасрэдна адчуйце адрозненні сапраўднай From-scratch Foundation мадэлі.

Запыты і просьбы аб дэманстрацыі: [email protected]

Copyright© 2025 Clevi Inc. Усе правы абаронены.

Назад у прэс-цэнтр
CLEVI

Мова і рэгіён

Пазначаны мовы, перакладзеныя машынай. Даступнасць адпавядае апублікаванаму набору сайта.

136 моў

Рэкамендуецца

1

Усходняя Азія

7

Паўднёва-Усходняя Азія

11

Паўднёвая Азія

18

Цэнтральная Азія

5

Блізкі Усход і Каўказ

10

Заходняя Еўропа і Паўднёвая Еўропа

16

Вялікабрытанія і Ірландыя

4

Паўночная Еўропа

10

Цэнтральная Еўропа і Балканы

14

Усходняя Еўропа

5

Усходняя Афрыка

8

Заходняя Афрыка і Сярэдняя Афрыка

9

Паўднёвая Афрыка

8

Паўночная і Паўднёвая Амерыкі

5

Акіянія

5
Фундаментальная мадэль, створаная з нуля, — Клеві AI(ivy) — CLEVI