חדשות

סטארטאפ ה-AI קלבי נכנס ל-2.5% העליונים ב-GAIA… מציג אמינות מוכחת

מקור: קוּ בּוֹן-גיו, דיגיטל טיימס

מקור: קוּ בּוֹן-גיו, דיגיטל טיימס

ציטוט מלא של הכתבה “סטארטאפ ה-AI קלבי נכנס ל-2.5% העליונים ב-GAIA… מציג אמינות מוכחת”

תאריך פרסום 2026-04-08

קישור : https://n.news.naver.com/article/029/0003020511?sid=105

סטארטאפ ה-AI הקוריאני ‘קלבי (Clevi)’ הודיע כי לאחר שבנה מודל עצמאי ופתרון סוכנים עצמאי שנוצרו from scratch, הוא נכנס לראשונה בקוריאה ל-2.5% העליונים במבחן הייחוס GAIA, מתוך 3,090 מודלים רשומים בסך הכול.

לפי הסברי גורמים בתעשייה, GAIA, שתוכנן על ידי Meta AI ומופעל על ידי Hugging Face, בוחן אצל AI לא את ‘היכולת לבצע דבר אחד היטב’, אלא את ‘היכולת לשלב כמה יכולות כדי לפתור בעיות אמיתיות’. עליו למצוא מידע באינטרנט, לקרוא טבלאות בתוך קובצי PDF, לנתח תמונות, להריץ קוד לצורך חישובים ולשלב את התוצאות כדי לספק תשובה אחת נכונה. המבנה, המבוסס על 301 שאלות חסויות, שלוש רמות קושי ועיקרון של אי-חשיפת התשובות, אינו מאפשר לא התאמת-יתר ולא רמאות.

כדי לקבל ציון גבוה במבחן זה נדרשים שני דברים. האחד הוא יכולת ההיסק של מודל השפה הבסיסי, והשני הוא פתרון סוכנים שמחבר את המודל לכלים בעולם האמיתי ומאפשר לו לבצע משימות באופן אוטונומי. גם אם המודל טוב ככל שיהיה, אם הסוכן חלש לא ניתן לפתור את Level 3; וגם אם הסוכן מתוחכם ככל שיהיה, אם יכולת ההיסק של המודל אינה מספקת, תשובות שגויות יתפשטו כבר בשלבי הביניים.

כאשר בוחנים את המבנה הנוכחי של לוח המובילים של GAIA, ניתן לראות דפוס מעניין. רוב הסוכנים המדורגים במקומות הגבוהים אימצו אסטרטגיית ‘מיקס של מודלים מרובים’, המשלבת כמה מודלים של חברות טכנולוגיה גדולות, כגון GPT, Claude ו-Gemini. זוהי גישה הגיונית המשלבת את נקודות החוזק של כל מודל ומגינה מפני ירידה בציונים הנגרמת מאובדן מידע וכדומה.

לעומת זאת, קלבי לא הצטרפה לשורה זו. cip-5.5-agent (בינה מלאכותית סוכנית), שפותח בשיטת from scratch, מבצע באופן אוטונומי תכנון, ביצוע ואימות של משימות מורכבות, בעוד cip-5.5-mm (מולטימודלי רב-תכליתי בעל ביצועים גבוהים) מבין ומסיק לגבי מגוון פורמטים של קבצים, כגון קול, תמונות ווידאו. שני המודלים פותחו באופן עצמאי בתוך קלבי, ולא נעשה כל שימוש ב-API של LLM חיצוני.

ובאמצעות מחסנית המודלים העצמאית הזו, היא הציבה 5 סוכנים ב-GAIA, וכולם השיגו מעל 70 נקודות. מטווח של 79.07% במקום הראשון ועד 70.76%, הוכחה בכך יציבותה של המחסנית כולה, ולא מזל של תוצאה יחידה.

תמונת גוף

לפי הסבר החברה, מאחורי הציון הרשמי של 79.07% מסתתר מספר נוסף. בבדיקה שלאחר המבחן שביצעה CLEVI באופן פנימי, נמצא כי מתוך 301 השאלות, במספר ניכר מהן אבדו כיום מקורות האימות לתשובות הנכונות באינטרנט הפתוח. בהערכה מחדש, שהתבססה רק על שאלות שהתשובה הנכונה להן עדיין קיימת באינטרנט, שיעור התשובות הנכונות של CLEVI עמד על יותר מ-98%. נתון זה כבר חצה את הממוצע האנושי (92%).

כמובן, אילו הייתה משלבת מודלים כלליים חזקים של חברות אחרות, ייתכן שהייתה יכולה להעלות עוד יותר את הציון הרשמי. אולם CLEVI בחרה במכוון שלא לאמץ אסטרטגיה זו. זאת משום שמטרת הבנצ'מרק הזה לא הייתה תחרות על הציון הגבוה ביותר, אלא לבדוק אם מודל עצמאי from scratch הגיע לרמה המאפשרת לו להתחרות בזירה הגלובלית.

הופעת השם ב-GAIA Leaderboard משמעותה רבה, משום שהיא מעידה על אמינות מאומתת שהוענקה באמצעות הערכה עצמאית של צד שלישי. זהו בסיס אובייקטיבי שניתן לנצל בכל שלב — מגיוס השקעות, דרך התרחבות לחו״ל ועד מכירות B2B.

נציג CLEVI מסר: “חלק ניכר מתוך 63 התשובות השגויות הרשמיות נבע מאי־התאמה בפורמט הפלט, מטעויות בפרשנות של חומר חזותי ומשאלות שלא ניתן היה לענות עליהן עקב אובדן מידע. אין מדובר במגבלה יסודית של הסקה לוגית, אלא בבעיה של דיוק העיבוד לאחר הפלט ושל זמינות המידע החיצוני. מכיוון שמדובר במודל עצמאי, CLEVI יכולה לשפר אותו בעצמה. זהו בדיוק היתרון המבני של מודל עצמאי from scratch. ההישג של CLEVI הפעם מציב בפני תעשיית ה-AI הקוריאנית את השאלה: “עד מתי נמשיך להסתמך על ‘מוחות שאולים’?” CLEVI בחרה בדרך הקשה יותר של from scratch, ושואפת להוכיח את התשובה לכך בזירה העולמית”.

חזרה לחדר החדשות
CLEVI

שפה ואזור

הגדרות קובצי Cookie

136 שפות

מומלץ

1

מזרח אסיה

7

דרום־מזרח אסיה

11

דרום אסיה

18

מרכז אסיה

5

המזרח התיכון והקווקז

10

מערב אירופה ודרום אירופה

16

בריטניה ואירלנד

4

צפון אירופה

10

מרכז אירופה והבלקן

14

מזרח אירופה

5

מזרח אפריקה

8

מערב אפריקה ומרכז אפריקה

9

דרום יבשת אפריקה

8

אמריקה

5

אוקיאניה

5
סטארטאפ ה-AI קלבי נכנס ל-2.5% העליונים ב-GAIA… מציג אמינות מוכחת — CLEVI