«چگونه یک شرکت کوچک توانست یک مدل زبانی هوش مصنوعی عظیم در سطح جهانی بسازد؟»
چگونه یک استارتاپ کوچک یک مدل زبانی عظیم ساخت؟
این پرسشی است که پس از انتشار مدل پایه ۱.۴ تریلیون پارامتری توسط CLEVI، بیش از هر پرسش دیگری مطرح شده است.
برخلاف بسیاری از شرکتها که صرفاً مدلهای متنباز را ریزتنظیم میکنند، CLEVI تمامی فرایندها، از جمعآوری داده و طراحی مدل گرفته تا آموزش توزیعشده در مقیاس بزرگ و اعتبارسنجی کیفیت، را بهصورت مستقل انجام داده است.
در ادامه، راز این موفقیت و مزیت رقابتی آن را با جزئیات معرفی میکنیم.
۱. یک شرکت کوچک مدل زبانی عظیم میسازد؟
در ژوئیه ۲۰۲۵، هنگامی که CLEVI مدل زبانی عظیم توسعهیافته توسط خود را به بازار عرضه کرد، مشتریان (کاربران) بسیاری با شگفتی و تردید واکنش نشان دادند. «آیا واقعاً توسعه آن کاملاً داخلی بوده است؟» «آیا فقط مدل متنباز را کمی تغییر ندادهاند؟»
در واقع، بسیاری از شرکتهای داخلی و خارجی تنها مدلهای متنباز را با انتقال یادگیری (fine-tuning) آموزش داده و آنها را بهعنوان مدل اختصاصی خود تبلیغ میکنند.
اما CLEVI بر **«From-scratch Foundation Model»** تأکید کرد.
به بیان دیگر، CLEVI تمام فرایندها، از جمعآوری داده و طراحی مدل گرفته تا آموزش توزیعشده در مقیاس بزرگ و اعتبارسنجی کیفیت، را مستقیماً طراحی و اجرا کرده است.
۲. چرا توسعه مدل زبانی عظیم دشوار است
برای آموزش From-Scratch Foundation Model، باید همه موارد زیر را فرا گرفت.
به مجموعهدادهای بزرگ و باکیفیت نیاز است
- تنوع: تضمین تنوع زبانها، حوزهها و قالبها (متن، تصویر و غیره)
- پاکسازی: حذف نویز، مدیریت کیفیت و فیلتر کردن دادههای تکراری/مضر
- مجوزها: شفافسازی حق نشر و حقوق استفاده از داده
زیرساخت محاسباتی در مقیاس بزرگ
- خوشه GPU/TPU با عملکرد بالا: یکپارچهسازی تجهیزات شامل هزاران تا دهها هزار گره برای پشتیبانی از آموزش توزیعشده در مقیاس بزرگ
- چارچوب آموزش توزیعشده کارآمد: DeepSpeed، Megatron-LM، Ray و غیره
- ذخیرهسازی/شبکه: ورودی و خروجی دادههای حجیم و محیط شبکهای سریع
طراحی معماری مدل
- انعکاس معماریهای جدید: Transformer، MoE(Mixture of Experts)، چندوجهی و موارد دیگر
- مقیاسپذیری: در نظر گرفتن قابلیت گسترش تعداد پارامترها، تعداد لایهها، طول ورودی و موارد دیگر
- کارایی: بهینهسازی سرعت آموزش/استنتاج و مصرف حافظه
راهبردها و الگوریتمهای آموزش
- هدف پیشآموزش: مدل زبانی (برای مثال، next token prediction)، چندوجهی (برای مثال، contrastive learning) و موارد دیگر
- روشهای بهینهسازی: mixed precision، gradient accumulation، learning rate schedule و موارد دیگر
- نرمالسازی/پایدارسازی: dropout، layer norm، weight decay و موارد دیگر
چارچوب ارزیابی و اعتبارسنجی
- مجموعههای معیار: استفاده از مجموعهدادههای استاندارد (Benchmarks)
- ارزیابی داخلی: ارزیابی مبتنی بر سناریوهای واقعی استفاده
- پایش مستمر: بررسی کیفیت، سوگیری و ایمنی در حین و پس از آموزش
نیروی انسانی و توانمندی سازمانی
- پژوهشگران AI/ML: طراحی مدل و توسعه الگوریتم
- مهندسان داده: جمعآوری/پاکسازی/مدیریت داده
- مهندسان زیرساخت: سیستمهای توزیعشده و مدیریت ابر/زیرساخت داخلی
- مدیر پروژه: مدیریت زمانبندی، بودجه و کیفیت
ملاحظات اخلاقی، حقوقی و امنیتی
- اخلاق AI: سوگیری، ایمنی، شفافیت و پاسخگویی
- رعایت الزامات قانونی: حریم خصوصی، حق نشر و حاکمیت داده
- امنیت: جلوگیری از افشای داده/مدل و کنترل دسترسی
در حال حاضر، تعداد نیروی انسانی پژوهشی AI در سراسر جهان حدود ۲٬۰۰۰ نفر است و حتی همین تعداد نیز عمدتاً در شرکتهای بزرگ فناوری مانند META، Google و XAI متمرکز هستند. در داخل کشور، تیمهایی که بتوانند از جمعآوری داده تا زیرساخت آموزش در مقیاس بزرگ را مستقیماً طراحی کرده و یک مدل Foundation بسازند، بسیار نادرند.
۳. ساخت یک مدل زبانی عظیم با نیروی انسانی اندک.
اما مدیرعامل کلوی، لی هوانهو، تصمیم گرفت در «کلوی» بهترین AI جهان را بسازد
مدیرعامل لی هوانهو با تکیه بر بیش از ۱۰ سال تجربه پژوهش در زمینه یادگیری عمیق و یادگیری ماشین، سه سال پیش شرکت «کلوی» را با هدف «ساخت بهترین AI جهان» تأسیس کرد.
این شرکت با طراحی مستقیم تمامی فرایندها، از ایجاد خط لوله داده اختصاصی و طراحی زیرساخت یادگیری عمیق توزیعشده در مقیاس بزرگ گرفته تا توسعه معماری مدل و اعتبارسنجی کیفیت، توانمندیهای لازم برای توسعه مدل Foundation را به دست آورده است.
در نتیجه آموزش مدل در چندین نوبت، اکنون مدل Clevi-5-x را در اختیار دارد که میتواند با مدلهای همسطح جهانی رقابت کند.
برای آموزش مؤثر مدلهای زبانی فوقعظیم، زیرساختی لازم است که صدها تا هزاران GPU را بهصورت خوشهای به یکدیگر متصل کند و بتواند همزمان محاسباتی در مقیاس دهها کوادریلیون عملیات در ثانیه انجام دهد. در این فرایند، فناوریهایی که همگامسازی محاسبات و تأخیر ارتباطی را در محیطهای توزیعشده بزرگمقیاس به حداقل میرسانند، اهمیت اساسی دارند. تاکنون در کره، به دلیل نبود «الگوریتمهای کنترل دقیق»، بیشتر شرکتها نتوانستهاند مدلها را بهدرستی آموزش دهند. مدیرعامل CLEVI، لی هوانهو، با توسعه داخلی این الگوریتم کنترل محاسبات توزیعشده اختصاصی، برای نخستین بار در کره موفق به آموزش یک مدل زبانی فوقعظیم با مقیاس ۱٫۴ تریلیون (1.4 Trillion) پارامتر شد.
۴. دلیل امکان توسعه مدلهای متنوع با تعداد اندکی نیروی توسعهدهنده
بیشتر شرکتهای بزرگ فناوری نیز از فناوریهای کنترل زیرساختهای بزرگمقیاس و پالایش داده برخوردارند.
مدیریت این موارد به صدها تا هزاران نیروی پژوهشی نیاز دارد.
بااینحال، CLEVI با تعداد اندکی نیروی پژوهشی، مدلهای متنوعی را توسعه داده و در اختیار دارد.
چگونه چنین چیزی ممکن است؟
CLEVI با استفاده از فناوری Teacher-Student Model(Knowledge Distilation)، با تعداد اندکی نیروی انسانی مدلهای متنوعی را توسعه داده و در اختیار دارد.
اکنون فناوری Teacher-Student را بررسی کنیم.
Teacher-Student (تقطیر دانش)
فناوری Teacher-Student بهطور ساده، فناوریای است که در آن مدل فرزند (Student Model) از طریق ارزیابی و دریافت بازخورد از مدل زبانی فوقعظیم (Teacher Model)، امکان توسعه سریع مدلهای متنوع را با تعداد اندکی نیروی انسانی فراهم میکند و جایگزین صدها نیروی پژوهشی میشود.
- مدل مادر (Mother Model، مدل فوقعظیم) با ارزیابی و ارائه بازخورد درباره مدلهای حوزههای مختلف، جایگزین صدها نیروی پژوهشی میشود.
- اگر آموزش از طریق Clevi-x-platform به این روش انجام شود، میتوان مدلهای پرقدرتی مانند Reasoning، VLM، Physical AI و Coding Agent را طی ۱۰ تا ۱۵ روز آموزش داده و مستقر کرد.
Clevi Coding Agent
Clevi Phsycal AI Learning Platform
VLM-Vision Language Model
عامل امنیتی
۵. تمایز فناوری و کیفیت Clevi-x-platform
عملکرد و مقیاسپذیری مدل
- برتری در استدلال (CoT/Reasoning): cip-5-x با گنجاندن بسط منطقی مرحلهبهمرحله و ارائه شواهد در فلسفه طراحی خود، توانایی محاسبه و تفسیر با قابلیت اطمینان بالا را در حل مسائل علمی، ریاضی و مهندسی نشان میدهد. این مدل بر اساس معیارهای بنچمارک داخلی با هدف دستیابی به عملکردی همسطح یا بالاتر از GPT-5 طراحی و در حال بهرهبرداری است و تکرارپذیری/قابلیت راستیآزمایی در شرایط یکسان پرامپت را بهعنوان شاخص کلیدی کیفیت مدیریت میکند.
- طیف کامل چندوجهی: با تولید و ترکیب VLM هدفمحور (cip-5-vision)، مدل پردازش چندوجهی با ظرفیت بالا (ivy-4-mm) و مدل سبک روی دستگاه (ivy-3-text) در یک پلتفرم، میتوان ترکیب بهینه را متناسب با ویژگیهای کار (جستوجو/دستهبندی/خلاصهسازی در برابر استدلال/توضیح/اجرا) انتخاب کرد.
قابلیت بهکارگیری سازمانی
- امنیت و دسترسپذیری در محل: بهرهبرداری در سراسر شبکه بسته (ورودی-آموزش-سرویس-پشتیبانگیری)، طراحی HA، توسعه ماژولار و حفاظت تفکیکشده از دادهها و پارامترهای مدل با SVCE (محیط اجرای ایمن ایزوله).
- استقرار و توسعه سریع: پشتیبانی از بهکارگیری و بهرهبرداری سریع با Ivy Chat (گفتوگوی چندوجهی/عاملمحور برای امور کاری) و API Platform (SaaS با استاندارد جهانی).
تمایز هوش مصنوعی فیزیکی (Physical AI)
- با ترکیب شبیهسازی مبتنی بر NVIDIA Isaac و یادگیری تقویتی تکاملی (Evolutionary RL)، و با آموزش موازی انتقال Sim2Real و دادههای مصنوعی، کارایی آموزش و سازگاری با محیط واقعی افزایش یافته است. پوشش کامل فرایند از یادگیری دیجیتال-رباتیک تا استقرار، ویژگیای است که جایگزینهای کمی برای آن وجود دارد.
کیفیت سرویس و حاکمیت
- مدیریت نسخه مدلها/پرامپتها/ابزارها، مجموعه ارزیابی (دانش کرهای و انگلیسی، وظایف صنعتی، شاخصهای توهم و ایمنی)، مدیریت تغییر (SLO/SLA) و پایش عملیات (تأخیر، نرخ موفقیت و TCO) در قالب رویههای یک پلتفرم واحد انجام میشود.
در حال حاضر، بیش از حدود ۳۰۰ شرکت ارائهدهنده خدمات مدلهای هوش مصنوعی در کره جنوبی وجود دارد،
اما CLEVI تنها شرکتی است که میتواند از طریق مدل بنیادین مستقل و پربازده خود، خدمات در محل و ابری را بهطور همزمان ارائه دهد.
۶. روشهای بهکارگیری مدلهای زبانی در صنعت
از آنجا که پذیرش هوش مصنوعی به سرمایهگذاری هنگفت و راستیآزمایی دقیق نیاز دارد، مقایسه و تجربه مستقیم راهکارها برای اطمینان از سودمندی واقعی آنها برای شرکتها ضروری است.
- CLEVI فقط به ساخت مدلها بسنده نمیکند، بلکه راهکارهای هوش مصنوعی ارائه میدهد که قابلیت بهکارگیری در محیطهای واقعی صنعتی را دارند.
- برای مثال، این شرکت کانالهای سازمانی کاملی از جمله Ivy Chat Platform، Clevi API Platform، سفارشیسازی متناسب با صنایع و 대응 به الزامات امنیتی را فراهم کرده است.
- این شرکت از توانمندیهای فنی منحصربهفردی در زمینههایی مانند هوش مصنوعی فیزیکی، رباتیک و پردازش دادههای چندوجهی برخوردار است؛ توانمندیهایی که یافتن نمونه مشابه آنها در داخل و خارج از کشور دشوار است.
CLEVI هوش مصنوعی را نه بهعنوان «هدف»، بلکه بهعنوان «ابزار» به کار میگیرد و راهکارهای واقعی هوش مصنوعی ارائه میدهد که به افزایش بهرهوری کاری و نوآوری صنعتی کمک میکنند. تفاوت مدل بنیادین واقعی From-scratch را مستقیماً تجربه کنید.
درخواست مشاوره و دمو: [email protected]
Copyright© 2025 Clevi Inc. All rights reserved.
