"כיצד הצליחה חברה קטנה ליצור מודל שפה גדול במיוחד ברמה עולמית?"
כיצד יצר סטארט-אפ קטן מודל שפה גדול במיוחד?
זו השאלה שנשאלנו בתדירות הגבוהה ביותר לאחר ש-CLEVI חשפה Foundation Model בהיקף של 1.4 טריליון פרמטרים.
בניגוד לחברות רבות שמבצעות פיין-טיונינג פשוט של מודלים בקוד פתוח, CLEVI ביצעה באופן עצמאי את כל התהליך, מאיסוף הנתונים, דרך תכנון המודל ולמידה מבוזרת בקנה מידה גדול, ועד לאימות האיכות.
להלן נציג בפירוט את הסוד ואת היתרון התחרותי שלה.
1. חברה קטנה יוצרת מודל שפה גדול במיוחד?
ביולי 2025, כאשר CLEVI חשפה לשוק את מודל השפה הגדול במיוחד שפיתחה בעצמה, לקוחות (משתמשים) רבים סערו בתדהמה ובספקנות. "האם הוא באמת פותח באופן עצמאי?" "האם לא מדובר בשינוי קל של מודל בקוד פתוח?"
למעשה, חברות רבות בארץ ובעולם מסתפקות בלמידת העברה (fine-tuning) פשוטה של מודלים בקוד פתוח, ומשווקות אותם כמודלים עצמאיים.
אולם CLEVI הציגה **‘From-scratch Foundation Model’**.
כלומר, היא תכננה וביצעה בעצמה את כל התהליך, מאיסוף הנתונים, דרך תכנון המודל ולמידה מבוזרת בקנה מידה גדול, ועד לאימות האיכות.
2. מדוע קשה לפתח מודל שפה גדול במיוחד
כדי לאמן From-Scratch Foundation Model, יש ללמוד את כל הפריטים הבאים.
נדרש מערך נתונים גדול ואיכותי
- גיוון: הבטחת גיוון בשפות, בתחומים ובפורמטים (טקסט, תמונות וכו׳)
- טיהור: הסרת רעשים, בקרת איכות וסינון נתונים כפולים/מזיקים
- רישוי: הבהרת זכויות היוצרים וזכויות השימוש בנתונים
תשתית מחשוב בקנה מידה גדול
- אשכולות GPU/TPU בעלי ביצועים גבוהים: טכנולוגיה לשילוב ציוד של אלפי עד עשרות אלפי צמתים ותמיכה בלמידה מבוזרת של כמויות נתונים גדולות
- מסגרת יעילה ללמידה מבוזרת: DeepSpeed, Megatron-LM, Ray ועוד
- אחסון/רשת: קלט ופלט של כמויות נתונים גדולות, סביבת רשת מהירה
תכנון ארכיטקטורת המודל
- משקף את המבנה העדכני: Transformer, MoE(Mixture of Experts), מולטימודלי ועוד
- סקלביליות: התחשבות בהרחבת מספר הפרמטרים, מספר השכבות, אורך הקלט ועוד
- יעילות: אופטימיזציה של מהירות האימון/ההסקה ושל השימוש בזיכרון
אסטרטגיות ואלגוריתמים לאימון
- מטרות פרה-טריינינג: מודל שפה (לדוגמה: next token prediction), מולטימודלי (לדוגמה: contrastive learning) ועוד
- שיטות אופטימיזציה: mixed precision, gradient accumulation, learning rate schedule ועוד
- נרמול/ייצוב: dropout, layer norm, weight decay ועוד
מערכת הערכה ואימות
- ชุดי בנצ'מרק: שימוש במערכי נתונים סטנדרטיים (Benchmarks)
- הערכה פנימית: הערכה המבוססת על תרחישי שימוש אמיתיים
- ניטור מתמשך: בדיקת איכות, הטיות ובטיחות במהלך האימון ולאחריו
כוח אדם ויכולות ארגוניות
- חוקרי AI/ML: תכנון מודלים ופיתוח אלגוריתמים
- מהנדסי נתונים: איסוף/טיוב/ניהול נתונים
- מהנדסי תשתיות: מערכות מבוזרות וניהול ענן/תשתיות מקומיות
- מנהלי פרויקטים: ניהול לוחות זמנים, תקציבים ואיכות
שיקולים אתיים, משפטיים ואבטחתיים
- אתיקה של AI: הטיות, בטיחות, שקיפות ואחריותיות
- ציות לחוק: פרטיות, זכויות יוצרים וריבונות נתונים
- אבטחה: מניעת דליפת נתונים/מודלים ובקרת גישה
כיום, מספר אנשי המחקר בתחום ה-AI ברחבי העולם עומד על כ-2,000 בלבד, וגם הם מרוכזים ברובם בחברות טכנולוגיה גדולות כמו META, Google ו-XAI. בישראל נדיר ביותר למצוא צוותים שיכולים לתכנן באופן עצמאי, מאיסוף נתונים ועד תשתית אימון בקנה מידה גדול, ולפתח מודל Foundation.
3. יצירת מודל שפה ענק באמצעות כוח אדם מצומצם.
עם זאת, מנכ״ל CLEVI, לי הוואן-הו, החליט ליצור ב-CLEVI את ה-AI הטוב בעולם
המנכ״ל לי הוואן-הו הקים את החברה (CLEVI) לפני שלוש שנים, על בסיס יותר מעשר שנות ניסיון במחקר למידה עמוקה ולמידת מכונה, מתוך מטרה “ליצור את ה-AI הטוב בעולם”.
באמצעות תכנון עצמאי וישיר של כל התהליכים — בניית תשתית צינור נתונים של החברה, תכנון תשתית למידה עמוקה מבוזרת בקנה מידה גדול, פיתוח ארכיטקטורת מודל ואימות איכות — החברה רכשה את היכולות הנדרשות לפיתוח Foundation Model.
לאחר אימון המודל מספר פעמים, החברה מחזיקה כיום במודל Clevi-5-x שיכול להתחרות במודלים ברמה הגבוהה ביותר בעולם.
כדי לאמן ביעילות מודל שפה גדול במיוחד, נדרשת תשתית המחברת מאות עד אלפי יחידות GPU לאשכול ומסוגלת לבצע במקביל חישובים בהיקף של מאות קוודריליוני פעולות בשנייה. בתהליך זה, טכנולוגיות למזעור סנכרון החישובים ועיכובי התקשורת בסביבה מבוזרת רחבת היקף הן חיוניות. עד כה, בהיעדר "אלגוריתם בקרה מדויק", מרבית החברות המקומיות לא הצליחו לאמן מודלים כראוי. מנכ״ל Clevi, לי הוואן-הו, פיתח באופן עצמאי אלגוריתם בקרה ייחודי לחישובים מבוזרים, ובכך הצליח לראשונה בקוריאה לאמן מודל שפה גדול במיוחד בהיקף של 1.4 טריליון (1.4 Trillion) פרמטרים.
4. הסיבה שמעט מפתחי מחקר הצליחו לפתח מגוון מודלים
גם לרוב חברות הביג טק יש טכנולוגיות לשליטה בתשתיות רחבות היקף ולטיהור נתונים.
כדי לנהל זאת נדרשים מאות עד אלפי אנשי מחקר.
עם זאת, Clevi מפתחת ומחזיקה במגוון מודלים באמצעות מספר מצומצם של אנשי מחקר.
כיצד הדבר התאפשר?
באמצעות טכנולוגיית Teacher-Student Model(Knowledge Distilation), Clevi מפתחת ומחזיקה במגוון מודלים באמצעות מספר מצומצם של אנשי צוות.
כעת נבחן את טכנולוגיית Teacher-Student.
Teacher-Student(זיקוק ידע)
במילים פשוטות, טכנולוגיית Teacher-Student מאפשרת להעריך ולספק משוב למודל צאצא (Student Model) באמצעות מודל שפה גדול במיוחד (Teacher Model), ובכך להחליף מאות אנשי מחקר באמצעות מספר מצומצם של עובדים ולפתח במהירות מגוון מודלים.
- מודל Mother Model(מודל גדול במיוחד) מעריך ומספק משוב למודלים בתחומים שונים, ובכך מחליף מאות אנשי מחקר.
- אם האימון יתבצע בדרך זו באמצעות Clevi-x-platform, ניתן לאמן ולפרוס מודלים בעלי ביצועים גבוהים, כגון Reasoning, VLM, Physical AI ו-Coding Agent, בתוך 10–15 ימים.
Clevi Coding Agent
Clevi Phsycal AI Learning Platform
VLM-Vision Language Model
סוכן אבטחה
5. הייחודיות של טכנולוגיית Clevi-x-platform ואיכותה
ביצועי המודל ויכולת ההרחבה
- עליונות בהסקה (CoT/Reasoning): cip-5-x תוכנן כך שפיתוח לוגי מדורג והצגת נימוקים הם חלק מפילוסופיית התכנון שלו, והוא מפגין יכולות חישוב ופרשנות בעלות אמינות גבוהה בפתרון בעיות מדעיות, מתמטיות והנדסיות. בהתאם למדדים פנימיים, הוא מתוכנן ומופעל במטרה להשיג ביצועים ברמה של GPT-5 ומעלה, תוך ניהול יכולת השחזור והאימות בתנאי פרומפט זהים כמדדי איכות מרכזיים.
- ספקטרום מלא של מולטימודלי: ניתן לייצר ולשלב בפלטפורמה אחת VLM ייעודי למטרה (cip-5-vision), מודל עיבוד מולטימודלי בנפח גדול (ivy-4-mm) ומודל קל משקל הפועל במכשיר (ivy-3-text), כדי לאפשר שילוב מיטבי בהתאם למאפייני המשימה (חיפוש/סיווג/סיכום לעומת הסקה/הסבר/ביצוע).
התאמה ארגונית
- אבטחה וזמינות בסביבה מקומית: הפעלה לאורך כל התהליך ברשת סגורה (קלט-אימון-שירות-גיבוי), תכנון HA, הרחבה מודולרית והפרדה והגנה על נתונים ופרמטרים של מודלים באמצעות SVCE (סביבת ביצוע בטוחה ומבודדת).
- הטמעה והרחבה מהירות: Ivy Chat (שיחה/סוכן מולטימודלי לתהליכי עבודה) ו-API Platform (SaaS בתקן גלובלי) תומכים בהטמעה ובהפעלה מהירות.
ייחודיות של AI פיזי (Physical AI)
- השילוב בין סימולציה המבוססת על NVIDIA Isaac לבין למידת חיזוק אבולוציונית (Evolutionary RL), יחד עם העברת Sim2Real ולמידה מקבילית על נתונים סינתטיים, משפר את יעילות הלמידה ואת יכולת ההסתגלות בשטח. היכולת לכסות את כל התהליך, מלמידה דיגיטלית-רובוטית ועד לפריסה, היא נדירה בקרב החלופות.
איכות שירות וממשל
- ניהול גרסאות של מודלים/פרומפטים/כלים, ערכת הערכה (ידע בקוריאנית ובאנגלית, משימות לפי תעשייה, מדדי הזיה ובטיחות), ניהול שינויים (SLO/SLA) ותצפית תפעולית (השהיה·שיעור הצלחה·TCO) מנוהלים באמצעות נהלי פלטפורמה יחידה.
כיום קיימות בקוריאה יותר מכ-300 חברות שירותי מודלים של AI, אך
CLEVI היא החברה היחידה שיכולה לספק בו-זמנית שירותים בסביבה מקומית ובענן באמצעות מודל בסיס עצמאי בעל ביצועים גבוהים.
6. דרכים לניצול מודלים של שפה בתעשייה
מאחר שהטמעת AI דורשת השקעה עצומה ואימות יסודי, חיוני להשוות ולהתנסות ישירות כדי לבדוק אם מדובר בפתרון שבאמת מסייע לארגון.
- CLEVI אינה מסתפקת ביצירת מודלים, אלא מספקת פתרונות AI שניתן ליישם בסביבות תעשייתיות אמיתיות.
- לדוגמה, היא מציעה ערוצי Enterprise מלאים, לרבות Ivy Chat Platform, Clevi API Platform, התאמה אישית לפי תעשייה ועמידה בדרישות אבטחה.
- ל-CLEVI יכולות טכנולוגיות שקשה למצוא בארץ ובעולם, בתחומים כגון AI פיזי, רובוטיקה ועיבוד נתונים מולטימודלי.
CLEVI מספקת פתרונות AI מעשיים, שבהם ה-AI הוא ‘אמצעי’ ולא ‘מטרה’, ותורמים ליעילות תפעולית אמיתית ולחדשנות תעשייתית.התנסו בעצמכם בבידול של מודל Foundation אמיתי שנבנה From-scratch.
פניות ובקשות להדגמה: [email protected]
Copyright© 2025 Clevi Inc. All rights reserved.
