מקור: כתב אלקטרוני, לי וון-ג'י
ציטוט מלא של הכתבה “CLEVI, מודל עצמאי שפותח from scratch משיג 79.07% ב-GAIA... בין 3,090 מודלים, ב-2.5% העליונים”
תאריך פרסום: 2026-04-07
קישור: https://www.etnews.com/20260407000203
מחסנית מודלים עצמאית cip-5.5-agent·cip-5.5-mm, כל 5 הסוכנים השיגו מעל 70 נקודות
בהתחשב באובדן מידע, שיעור הדיוק הוא מעל 98%, גבוה מזה של בני אדם (92%)
חברת הסטארט-אפ בתחום ה-AI 'CLEVI' השיגה שיעור דיוק של 79.07% ב-'GAIA', בנצ'מרק עולמי לסוכני AI, באמצעות מודל עצמאי שפותח from scratch, והתמקמה בין 2.5% המודלים המובילים מתוך 3,090 המודלים הרשומים בסך הכול.
לפי הסברים בתעשייה, בשוק בנצ'מרקי ה-AI, GAIA נחשב למדד המשקף נאמנה את היכולות של 'סוכני AI מעשיים'. בנצ'מרק זה, שפותח במשותף על ידי Meta AI, HuggingFace ואוניברסיטת פריז-סקליי, פורסם לראשונה בנובמבר 2023.
ל-GAIA שלושה מאפיינים מרכזיים המבדילים אותו מבנצ'מרקים אחרים. ראשית, מאחר שהתשובות הנכונות אינן公開ות, לא ניתן לבצע התאמת-יתר. שנית, מכיוון שהוא דורש הסקה מורכבת מרובת-שלבים ורב-מודאלית, לא ניתן להשיג ציון גבוה באמצעות התאמת תבניות פשוטה. שלישית, יותר מ-3,090 מודלים מרחבי העולם מתחרים באותם תנאים באמצעות לוח התוצאות הרשמי של HuggingFace.
ערכת הבדיקה מורכבת מ-301 שאלות בסך הכול. Level 1 כולל שימוש בכלי יחיד והסקה פשוטה, Level 2 כולל שילוב של מספר כלים והסקה ברמה בינונית, ו-Level 3 כולל שאלות ברמת הקושי הגבוהה ביותר, הדורשות תכנון וביצוע של סוכן לאורך חמישה שלבים או יותר. בעת פרסום הבנצ'מרק, השיעור עמד על כ-15% בלבד עבור מודלי GPT (עם תוספים), וכיום הצוותים המובילים העלו אותו לטווח של 70–80%.
בהקשר זה, CLEVI הדגישה כי הנקודה החשובה ביותר מבחינה טכנולוגית בהישג זה היא העובדה שלא נעשה כלל שימוש ב-API של מודלי LLM חיצוניים כגון GPT, Claude ו-Gemini. המאפיין הבולט הוא ש-CLEVI השתמשה בשני מודלים שפותחו באופן עצמאי בשיטת from scratch.
cip-5.5-agent הוא מודל AI אג'נטי, המשמש כמוח המרכזי של צינור עיבוד לסוכנים שמתכננים (planning), מבצעים (execution) ומאמתים (verification) באופן אוטונומי משימות מורכבות. cip-5.5-mm הוא מודל מולטימודלי רב־תכליתי וביצועים גבוהים, שמבין ומסיק מסקנות ממגוון פורמטים של קבצים, כגון קול, תמונות ווידאו. מכיוון שחלק ניכר מהשאלות ב-GAIA כולל קלטים שאינם טקסט, כגון קובצי PDF, תמונות וקובצי שמע, היכולת המולטימודלית הזו הפכה לגורם מרכזי בהשגת ציון גבוה.
קלבי השתתפה ב-GAIA עם 5 תצורות שונות של סוכנים, המבוססות על שני המודלים שפותחו באופן עצמאי, וכולן השיגו ציון של 70 ומעלה.
לפי הסבר החברה, בבדיקה שלאחר מכן שנערכה בתוך קלבי התגלו תוצאות מעניינות. מתוך 301 השאלות הכוללות, עבור חלקן אבדו כיום המקורות התומכים בתשובות באתר הציבורי. מדובר במקרים שבהם מידע שהיה זמין בעבר באינטרנט או במנועי חיפוש נמחק או שונה, ולכן לא ניתן לגשת אליו עוד. בהערכה מחדש במסגרת המידע שאנשים יכולים לאמת באופן ציבורי כיום, שיעור התשובות הנכונות של קלבי עמד על יותר מ-98%. זהו נתון שכבר עולה על הממוצע האנושי, העומד על 92%.
נציג קלבי הסביר: “קלבי נכנסה ל-2.5% העליונים בבנצ'מרק ציבורי, כאשר כל 5 הסוכנים השיגו 70+ ללא שילוב של מודלים חיצוניים, אלא באמצעות מודלים עצמאיים שפותחו from scratch ופתרונות AI אג'נטיים עצמאיים. נראה כי באמצעות שיפור המודלים העצמאיים ופתרונות הסוכנים בעתיד, ניתן יהיה לשפר עוד יותר גם את הציון הרשמי. להישג הזה יש משמעות רבה מכיוון שהוא מציג 'אמון מאומת', שנמדד בבנצ'מרק ציבורי גלובלי; מכיוון שמדובר בהישג המבוסס על מודל עצמאי שפותח from scratch על ידי חברת AI מקומית; מכיוון שהוא נובע ממחסנית מודלים עצמאית ולא משילוב של מודלים חיצוניים; ומכיוון שלאור אובדן המידע בחלק מהשאלות, יש לו ערך פרשני העולה על הציון עצמו.”
