מחקר

מסד הנתונים הסמנטי של Clevi

אחד האתגרים המרכזיים בהטמעת AI בעבודה בפועל הוא תופעת השכחה הקטסטרופלית (Catastrophic Forgetting), המתרחשת בעת כוונון עדין של הידע שנלמד קודם לכן באמצעות נתונים חדשים.

1. המגבלות של Catastrophic Forgetting ושל RAG

אחד האתגרים המרכזיים בהטמעת AI בעבודה בפועל הוא תופעת השכחה הקטסטרופלית (Catastrophic Forgetting), המתרחשת בעת כוונון עדין של הידע שנלמד קודם לכן באמצעות נתונים חדשים.

זוהי תופעה שבה AI המבוסס על רשתות עצביות מאבד במהירות את הידע או את הדפוסים שרכש קודם לכן במהלך לימוד מידע חדש.

לדוגמה, כאשר מבצעים כוונון עדין של LLM בקוד פתוח באמצעות נתונים של חברה מסוימת, הידע הכללי או היכולת הלשונית עלולים להיפגע.

כדי להימנע מבעיה זו, נעשה שימוש נרחב בטכנולוגיית RAG(Retrieval-Augmented Generation), אך גם ל-RAG יש מגבלות.

תמונה בגוף הטקסט

המגבלות העיקריות של RAG

  • עיבוד לקוי של נתונים מובנים (Structured Data QA): מערכות RAG מותאמות בעיקר למסמכי טקסט לא מובנים, ולכן אינן מצליחות להבין או לנצל כראוי את המשמעות והקשרים של נתונים מובנים (טבלאות, מסדי נתונים, גיליונות אלקטרוניים וכו').
  • מגבלות של קובצי PDF מורכבים/מסמכים לא מובנים (Complex PDFs): במסמכי PDF מורכבים (הכוללים טבלאות, עמודות מרובות, תמונות וכו'), מידע עלול להישמט או שההקשר עלול להתעוות במהלך תהליך ה-chunking (חלוקה למקטעים). כתוצאה מכך, נתונים חשובים עלולים שלא להיכלל באינדקס, או שהחיפוש אחריהם עלול להיות קשה.
  • היעדר מודל Fallback (גיבוי) (Fallback Model(s)): כאשר מערכת RAG אינה מצליחה למצוא תשובה מתאימה, הלוגיקה למעבר למודל חלופי (גיבוי) חסרה או אינה יעילה. כתוצאה מכך, במקרה של כישלון במתן תשובה, לא מסופקת חלופה שתספק את המשתמש.
  • פרצות אבטחה (LLM Security): ההגנה מפני פרצות האבטחה של ה-LLM עצמו (הזרקת פרומפטים, דליפת נתונים וכו') אינה מספקת, ולכן קיים סיכון לחשיפת מידע רגיש.
  • חוסר בסקלביליות (Data Ingestion Scalability): מתעוררות בעיות סקלביליות במהלך יצירת האינדקס ואחסון כמויות גדולות של נתונים. ככל שכמות הנתונים גדלה, מהירות ה-chunking, האחסון והחיפוש יורדת, ועומס המערכת גדל.
  • השמטת מידע חשוב (Missing Content): לעיתים קרובות תוכן חשוב במסמך נשמט במהלך תהליך ה-chunking או אינו נכלל באינדקס. כתוצאה מכך, המשתמש אינו יכול לחפש את המידע הרצוי.
  • השמטת דירוגים גבוהים (Missed Top Ranked): תיתכן השמטה של ה-chunk הרלוונטי ביותר בפועל (המדורג במקום הגבוה ביותר) מתוצאות החיפוש. הסיבות לכך כוללות מגבלות של אלגוריתם החיפוש, ירידה באיכות ה-embedding ושגיאות דירוג.
  • אי-התאמה להקשר (Not in Context): לעיתים קרובות ה-chunk שנמצא אינו תואם להקשר בפועל של השאלה. זוהי מגבלה של חיפוש המבוסס רק על דמיון, הגורמת לחוסר בקישור סמנטי.
  • שגיאת פורמט (Wrong Format): הפורמט של ה-chunk שנמצא עלול להיות בלתי מתאים לעיבוד על ידי LLM, או להיות שונה מפורמט התשובה שהמשתמש מעוניין בו. לדוגמה, טבלה עלולה להיות מומרת לטקסט ולגרום לעיוות המידע.
  • כשל בחילוץ מידע (Not Extracted): המידע הנדרש אינו מחולץ כראוי מה-chunk, או שה-LLM אינו מצליח לזהות את המידע. מצב זה מתרחש לעיתים קרובות במבני משפטים מורכבים, בטבלאות, בתמונות וכו'.
  • היקף/עומק מידע בלתי מתאימים (Incorrect Specificity): התשובה עלולה להיות כללית מדי ביחס לשאלה, או לחלופין מפורטת מדי, ולכן אינה תואמת את דרישות המשתמש בפועל. קשה להתאים את היקף המידע ואת עומקו.
  • תשובה חלקית (Incomplete): התשובה שנוצרה בסופו של דבר עלולה להיות חלקית, או לספק מידע חלקי בלבד, ולכן לא לענות באופן מספק על דרישות המשתמש. הסיבות לכך כוללות חוסר יכולת לשלב מידע ממספר chunks, או שימוש של ה-LLM רק בחלק מהמידע.

כך, מכיוון ש-RAG מסתמך יתר על המידה על חיפוש דמיון וקטורי פשוט ועל אינדוקס מבוסס chunk, מגבלותיו מבחינת אמינות, מדרגיות ודיוק בעבודה בפועל ברורות.

2. מסד הנתונים הסמנטי של CLEVI, שהתגבר על מגבלות RAG

כדי להתגבר על מגבלות אלה, CLEVI פיתחה תשתית ידע מתקדמת של AI, המותאמת לקשרים סמנטיים, להסקה מורכבת ולתגובות מבוססות ראיותClevi Semantic Database.

זהו פתרון המתאפשר בזכות העובדה שברשותה מודל Reasoning עצמאי, AI מולטימודלי ומודלי AI מבוססי סוכנים, והוא אחת הטכנולוגיות העוצמתיות הייחודיות ל-CLEVI, שהופכות את ה-AI למועיל באמת בעולם האמיתי.

בהשאלה, אם מסד נתונים שבו מאוחסן מידע הוא ספרייה, אפשר לחשוב על מסד הנתונים הסמנטי של CLEVI כעל ספרן מצטיין. (כאשר מבקשים מהספרן את המידע הדרוש, ניתן לקבל תשובה מדויקת ומהירה.)

המשתמשים יכולים להוסיף מידע חדש לספרייה ולשלוף את המידע הדרוש בכל עת.

בנוסף, ניתן להגדיר כרצונכם גם ניהול גרסאות של הנתונים וגם הרשאות גישה.

כל פעולה של הספרן נשמרת ביומן (רשומה), ולכן ניתן לתקן גם במקרה של טעות.

תמונת גוף הטקסט

<Clevi Semantic Database Structure>

מאפיינים עיקריים ומבנה טכנולוגי

אחסון נתונים סמנטי

  • אחסון של קשרים סמנטיים בין נתונים (הקשר, היררכיה, סיבתיות ועוד) בגרף DB, במקום Vector DB פשוט המבוסס על chunk
  • קל להרחיב ולהשלים אותו בצורת גרף ידע/רשת סמנטית

חיפוש והסקה היברידיים

  • CTA+Context Query: שילוב ההקשר (Context) של השאילתה ושל CTA
  • Hybrid Retrieval: שילוב של דמיון וקטורי עם חיפוש המבוסס על כללים/גרפים
  • Intelligent Folder Hits: איתור אוטומטי של תיקיות/קטגוריות הקשורות סמנטית

עיבוד מולטימודלי בו-זמני

  • פענוח בו-זמני של נתונים מסוגים שונים, כגון טקסט, תמונות, טבלאות וקול, באמצעות TextReader Pool, VisionReader Pool ועוד
  • בעוד ש-RAG הקיים מסוגל לעבד בעיקר טקסט בלבד, מסד הנתונים הסמנטי מצטיין ביכולת עיבוד מולטימודלית

תגובות מבוססות ראיות ואימות אמינות

  • סיכומי מסמכים וציטוטים, ממצאים בטבלאות ועוד — יצירה אוטומטית של סיכומי מסמכים ומקורות
  • Merge & Verify: שילוב סמנטי של מידע ממקורות מרובים ואימות מהימנות
  • Evidence Pack: מתן חבילת תגובות המבוססת על ראיות

הסקה מורכבת ומתכנן

  • Planner/DAG: תכנון שלב-אחר-שלב והסקה המבוססת על DAG (Directed Acyclic Graph) עבור שאילתות מורכבות

מבנה סוכן משולב

  • cip-5-agent Supervisor: סוכן-על המנהל ומתאם את כלל תהליכי החיפוש, ההסקה והשילוב
תמונת גוף הטקסט

3. סיכום והשוואה של המבנה

לסיכום, Semantic DB מקבל נתונים במגוון צורות (קול, טקסט, תמונות, וידאו ועוד) ומסווג ידע לא רק לפי Chunk פשוט, אלא תוך קישור גם של יחסים סמנטיים בין הנתונים (הקשר, היררכיה, סיבתיות ועוד).

בהתבסס על כך, במקום חיפוש המבוסס על מילות מפתח/דמיון כמו RAG, מתבצעים חיפוש והסקה תוך שימוש בקשרים סמנטיים, ולכן ניתן לקבל מה-AI חיפוש מידע ותשובות מדויקים יותר.

בנוסף, מכיוון שהידע נשמר בצורת גרף ידע/רשת סמנטית, קל להרחיבו ולהשלימו באופן מתמשך.

קלבי זיהתה את מגבלות מערכות ה-RAG בעידן המהפך של ה-AI, ובאמצעות מסד נתונים סמנטי ומודל AI ייחודי המסוגלים לפתור מגבלות אלה, התאפשר לנו לספק ללקוחות תגובות מהירות יותר עם נתונים מדויקים ואמינים יותר.

מערכת ה-AI של קלבי יכולה להפוך את הנתונים היקרים של לקוחותינו לבעלי ערך, ללא קשר לסוג התחום ובכל סביבה.

גם בעתיד, קלבי תעשה כל שביכולתה כדי למקסם את הערך הטמון בנתוני לקוחותיה ולספק חוויית AI חדשנית.

אנו מזמינים אתכם לחוות את עתיד ה-AI החדש יחד עם קלבי.

פניות ובקשות להדגמה: [email protected]

Copyright© 2025 Clevi Inc. כל הזכויות שמורות.

חזרה לחדר החדשות
CLEVI

שפה ואזור

הגדרות קובצי Cookie

136 שפות

מומלץ

1

מזרח אסיה

7

דרום־מזרח אסיה

11

דרום אסיה

18

מרכז אסיה

5

המזרח התיכון והקווקז

10

מערב אירופה ודרום אירופה

16

בריטניה ואירלנד

4

צפון אירופה

10

מרכז אירופה והבלקן

14

מזרח אירופה

5

מזרח אפריקה

8

מערב אפריקה ומרכז אפריקה

9

דרום יבשת אפריקה

8

אמריקה

5

אוקיאניה

5