משמעות ציוני GAIA — עד כמה התפתחו סוכני AI
כאשר מדד GAIA פורסם לראשונה, אפילו GPT-4, שהיה אז מודל ברמה הגבוהה ביותר, הסתפק בציון של כ-30%. משמעות הדבר היא שבשל מאפייני GAIA, הדורש מעבר לשאלות ותשובות פשוטות גם הסקה מורכבת, שימוש בכלים ופתרון בעיות רב-שלבי, ה-AI באותה תקופה עדיין היה בשלב התחלתי בכל הנוגע ליכולת “לחשוב ולבצע”.
אולם כיום, הסוכנים המובילים הגיעו ל-92.36%.
שינוי זה אינו שיפור ביצועים גרידא. זהו מדד המראה כי ה-AI חצה כעת את רמת המענה על שאלות ונכנס לשלב של ‘Agentic AI’, שבו הוא מפרש מצבים, בוחר את הכלים הנדרשים ומתכנן ומבצע בעצמו מספר שלבים.
בתוך שנים ספורות בלבד, ה-AI התפתח מ“כלי ליצירת ידע” ל“גורם ביצועי שמבצע משימות”.
📌 ובין 2.5% העליונים האלה נמצאת גם CLEVI
בסביבה תחרותית גלובלית זו, העובדה שהסוכן של CLEVI, שפותח בקוריאה, נרשם ב-2.5% העליונים של לוח המובילים של GAIA, מוכיחה עצמאות טכנולוגית ומהווה מקרה המוכיח שסוכני AI שנוצרו בקוריאה עומדים גם בסטנדרטים גלובליים. לכך יש משמעות החורגת מנתון גרידא. משמעות הדבר היא יכולת טכנולוגית שאומתה באופן אובייקטיבי באמצעות תחרות מול אלפי מודלים במדד גלובלי פתוח, ולא בסביבת הדגמה ייעודית.
חשוב מכך, הישג זה אינו תוצאה מקרית של מודל יחיד, אלא העובדה שסוכנים בעלי תכנונים שונים הפיקו שוב ושוב ביצועים ברמה הגבוהה ביותר על גבי אותו Agent Stack.
כלומר, הטכנולוגיה של CLEVI אינה “תוצאה טובה שהתקבלה פעם אחת”, אלא תחרותיות מבנית הניתנת לשחזור, ויכולת ברמת פלטפורמה הניתנת להרחבה לתעשיות ולתרחישים מגוונים.
אם כך, מה משמעותו של מדד זה?
מנקודת מבטו של המשתמש, המחסום הגדול ביותר לאימוץ AI הוא השאלה: "האם באמת ניתן לסמוך עליו ולהפקיד בידיו משימות?"
ביצועים שהוכחו שוב ושוב על במה של צד שלישי — דירוג עולמי פומבי — ולא באמצעות הדגמות מרשימות או חומרי מצגות של החברה, הם התשובה האובייקטיבית ביותר לשאלה הזו. באופן קונקרטי, יש לכך משמעות בשלושה היבטים.
ראשית, הפחתת סיכוני ההטמעה
חיבור AI שלא אומת לתהליכים הפנימיים הוא נטל משמעותי עבור ארגונים.
הישגים במדדים מוכרים כגון GAIA יכולים לשמש ישירות בסיס לאמון בשלב בחינת הטכנולוגיה.
שנית, הפיכת האוטומציה של משימות מורכבות למציאות
הנתון של 2.5% העליונים מצביע על רמת אינטליגנציה החורגת ממשימות חוזרות פשוטות, ומאפשרת להבין הקשר, לקבל החלטות עצמאיות במספר שלבים ולהשלים את המשימה.
תחומי עבודה שנחשבו עד כה ל"קשים להפקדה בידי AI" יכולים להפוך ליעדים מעשיים לאוטומציה.
שלישית, השגת אבטחת מידע וביצועים בו-זמנית
מבנה ה-Agent Stack העצמאי משמעו שזרימת הנתונים אינה יוצאת החוצה.
כך ניתן להיחלץ מהדילמה הקיימת, שלפיה היה צורך להתפשר על האבטחה כדי להשתמש ב-AI בעל ביצועים גבוהים.
מבנה זה מהווה יתרון מבדל מכריע במיוחד בתעשיות בעלות רגישות נתונים גבוהה, כגון פיננסים, רפואה ומשפטים.
האפשרות לשחזר את המבנה כבר החלה להיות מוכחת.
והביצועים של כל Agent שנבנה על גבי המבנה הזה יובילו בקרוב לשינוי ממשי בשטח.
"בסופו של דבר, שלמותה של הטכנולוגיה מושלמת באמצעות 'הביטחון' בשטח."
CLEVI אינה מסתפקת באספקת AI בעל ביצועים גבוהים. המהות שלנו היא לבנות "תשתית ביצועית" שמסירה את מחסום האבטחה מולו ניצבים ארגונים, ומסוגלת להשלים בפועל משימות עסקיות מורכבות.
כעת, צאו משלב ההתלבטות לגבי ההטמעה והתחילו, יחד עם CLEVI, סביבת עבודה בטוחה ועוצמתית המבוססת על AI.
כשותפה איתנה שאפשר להפקיד בידיה את העבודה בביטחון, ניצור יחד חדשנות ממשית בסביבה העסקית שלכם.
