კვლევა

Clevi Semantic Database

როდესაც AI რეალურ სამუშაო პროცესებში ინერგება, ერთ-ერთი ყველაზე დიდი გამოწვევა არის კატასტროფული დავიწყების (Catastrophic Forgetting) ფენომენი, რომელიც წარმოიქმნება არსებული ცოდნის ახალი მონაცემებით ფაინ-თიუნინგის დროს.

1. Catastrophic Forgetting-ისა და RAG-ის შეზღუდვები

როდესაც AI რეალურ სამუშაო პროცესებში ინერგება, ერთ-ერთი ყველაზე დიდი გამოწვევა არის კატასტროფული დავიწყების (Catastrophic Forgetting) ფენომენი, რომელიც წარმოიქმნება არსებული ცოდნის ახალი მონაცემებით ფაინ-თიუნინგის დროს.

ეს არის ფენომენი, როდესაც ნეირონულ ქსელზე დაფუძნებული AI ახალი ინფორმაციის სწავლის პროცესში სწრაფად კარგავს ადრე ათვისებულ ცოდნას ან შაბლონებს.

მაგალითად, თუ ღია კოდის LLM-ს კონკრეტული კომპანიის მონაცემებით ფაინ-თიუნინგს ჩაუტარებთ, შეიძლება ზოგადი საღი აზრი ან ენობრივი უნარები დაქვეითდეს.

ამ პრობლემის თავიდან ასაცილებლად ფართოდ გამოიყენება RAG(Retrieval-Augmented Generation) ტექნოლოგია, თუმცა RAG-საც აქვს შეზღუდვები.

ძირითადი ტექსტის სურათი

RAG-ის ძირითადი შეზღუდვები

  • სტრუქტურირებული მონაცემების არასათანადო დამუშავება (Structured Data QA): RAG სისტემა ძირითადად არასტრუქტურირებულ ტექსტურ დოკუმენტებზეა ოპტიმიზებული, ამიტომ ვერ აღიქვამს ან ვერ იყენებს სათანადოდ სტრუქტურირებული მონაცემების (ცხრილები, მონაცემთა ბაზები, ელცხრილები და სხვ.) მნიშვნელობასა და ურთიერთკავშირებს.
  • რთული PDF/არასტრუქტურირებული დოკუმენტების შეზღუდვები (Complex PDFs): რთული PDF დოკუმენტების (ცხრილები, მრავალი სვეტი, სურათები და სხვ.) chunking(დაყოფის) პროცესში ინფორმაცია შეიძლება დაიკარგოს ან კონტექსტი დამახინჯდეს. შედეგად, მნიშვნელოვანი მონაცემები შეიძლება არ ინდექსირდეს ან მათი მოძიება გართულდეს.
  • Fallback(სარეზერვო) მოდელის არარსებობა (Fallback Model(s)): როდესაც RAG სისტემა შესაბამის პასუხს ვერ პოულობს, შემცვლელ (სარეზერვო) მოდელზე გადასვლის ლოგიკა არასაკმარისი ან არაეფექტურია. ამის გამო პასუხის წარუმატებლობისას მომხმარებელს მისაღები ალტერნატივა არ მიეწოდება.
  • უსაფრთხოების სისუსტეები (LLM Security): LLM-ის თავად უსაფრთხოების სისუსტეების (prompt injection, მონაცემთა გაჟონვა და სხვ.) წინააღმდეგ დაცვა არასაკმარისია, რის გამოც არსებობს მგრძნობიარე ინფორმაციის გამჟღავნების რისკი.
  • მასშტაბირებადობის ნაკლებობა (Data Ingestion Scalability): დიდი მოცულობის მონაცემების ინდექსირებისა და შენახვის პროცესში მასშტაბირებადობის პრობლემები წარმოიქმნება. მონაცემთა მოცულობის ზრდასთან ერთად მცირდება chunking-ის, შენახვისა და ძიების სიჩქარე, ხოლო სისტემის დატვირთვა იზრდება.
  • მნიშვნელოვანი ინფორმაციის გამოტოვება (Missing Content): დოკუმენტში მნიშვნელოვანი შინაარსი ხშირად იკარგება chunking-ის პროცესში ან არ ინდექსირდება. ამის გამო მომხმარებელი სასურველ ინფორმაციას ვერ პოულობს.
  • ზედა რანგის შედეგების გამოტოვება (Missed Top Ranked): ძიების შედეგებში შეიძლება გამოტოვებული იყოს რეალურად ყველაზე რელევანტური chunk(ზედა რანგის შედეგი). მიზეზი შეიძლება იყოს ძიების ალგორითმის შეზღუდვები, embedding-ის დაბალი ხარისხი, რანგირების შეცდომები და სხვ.
  • კონტექსტთან შეუსაბამობა (Not in Context): ხშირად მოძიებული chunk არ შეესაბამება რეალური კითხვის კონტექსტს. ეს მარტივ მსგავსებაზე დაფუძნებული ძიების შეზღუდვის შედეგია, რის გამოც სემანტიკური კავშირი არასაკმარისია.
  • ფორმატის შეცდომა (Wrong Format): მოძიებული chunk-ის ფორმატი შეიძლება LLM-ის დასამუშავებლად შეუსაბამო იყოს ან განსხვავდებოდეს მომხმარებლისთვის სასურველი პასუხის ფორმატისგან. მაგალითად, ცხრილის ტექსტად გარდაქმნისას ინფორმაცია შეიძლება დამახინჯდეს.
  • ინფორმაციის ამოღების წარუმატებლობა (Not Extracted): საჭირო ინფორმაცია შეიძლება chunk-იდან სათანადოდ ვერ ამოიღონ ან LLM-მა ვერ ამოიცნოს. ეს ხშირად ხდება რთული წინადადების სტრუქტურის, ცხრილებისა და სურათების შემთხვევაში.
  • ინფორმაციის მოცულობის/სიღრმის შეუსაბამობა (Incorrect Specificity): პასუხი შეიძლება კითხვასთან მიმართებით ზედმეტად ზოგადი ან, პირიქით, ზედმეტად კონკრეტული იყოს და მომხმარებლის რეალურ მოთხოვნას არ შეესაბამებოდეს. ინფორმაციის მოცულობისა და სიღრმის სათანადოდ რეგულირება რთულია.
  • არასრული პასუხი (Incomplete): საბოლოოდ გენერირებული პასუხი შეიძლება არასრული იყოს ან მხოლოდ გარკვეული ინფორმაცია提供დეს, რის გამოც მომხმარებლის მოთხოვნა სრულად ვერ დაკმაყოფილდეს. მიზეზი შეიძლება იყოს რამდენიმე chunk-იდან ინფორმაციის ვერ გაერთიანება ან LLM-ის მიერ ინფორმაციის მხოლოდ ნაწილის გამოყენება.

ამგვარად, რადგან RAG ზედმეტად არის დამოკიდებული მხოლოდ ვექტორული მსგავსების ძიებასა და chunk-ზე დაფუძნებულ ინდექსირებაზე, რეალურ სამუშაო პროცესებში მას მკაფიო შეზღუდვები აქვს სანდოობის, მასშტაბირებადობისა და სიზუსტის თვალსაზრისით.

2. CLEVI-ის სემანტიკური მონაცემთა ბაზა, რომელმაც RAG-ის შეზღუდვები დაძლია

ამ შეზღუდვების დასაძლევად CLEVI-მ შეიმუშავა ახალი თაობის AI ცოდნის ინფრასტრუქტურა, სემანტიკურ კავშირებზე, კომპლექსურ მსჯელობასა და მტკიცებულებებზე დაფუძნებულ პასუხებზე ოპტიმიზებული Clevi Semantic Database.

ეს არის შესაძლებელი, რადგან მას გააჩნია საკუთარი Reasoning მოდელი, მულტიმოდალური AI და აგენტური AI მოდელები; ეს არის CLEVI-ის ერთ-ერთი ძლიერი ტექნოლოგია, რომელიც AI-ს რეალურ სამყაროში პრაქტიკულად სასარგებლოს ხდის.

ანალოგიისთვის, თუ ინფორმაციის შემცველ მონაცემთა ბაზას ბიბლიოთეკად მივიჩნევთ, CLEVI-ის სემანტიკური მონაცემთა ბაზა შეგვიძლია წარმოვიდგინოთ, როგორც ძალიან გამოცდილი ბიბლიოთეკარი. (ბიბლიოთეკარისთვის საჭირო ინფორმაციის მოთხოვნისას ზუსტ და სწრაფ პასუხს მიიღებთ.)

მომხმარებელს ნებისმიერ დროს შეუძლია ბიბლიოთეკაში ახალი ინფორმაციის დამატება და საჭირო ინფორმაციის მოძიება.

ასევე, მონაცემთა ვერსიების მართვა და წვდომის უფლებები შეგიძლიათ სასურველი ფორმით დააყენოთ.

ბიბლიოთეკარის ყველა მოქმედება ჟურნალში (ჩანაწერში) ინახება, ამიტომ შეცდომის დაშვების შემთხვევაშიც შესაძლებელია მისი გამოსწორება.

ძირითადი ტექსტის სურათი

<Clevi Semantic Database Structure>

ძირითადი მახასიათებლები და ტექნიკური სტრუქტურა

სემანტიკური მონაცემთა შენახვა

  • მხოლოდ chunk ვექტორულ DB-ზე დაფუძნებული მიდგომის ნაცვლად, მონაცემებს შორის სემანტიკური ურთიერთობები (კონტექსტი, იერარქია, მიზეზ-შედეგობრივი კავშირები და სხვ.) ინახება გრაფულ DB-ში
  • ადვილად ფართოვდება და იხვეწება ცოდნის გრაფის/სემანტიკური ქსელის სახით

ჰიბრიდული ძიება და მსჯელობა

  • CTA+Context Query: ერთდროულად ითვალისწინებს მოთხოვნის კონტექსტს (Context) და CTA-ს
  • Hybrid Retrieval: აერთიანებს ვექტორული მსგავსების ძიებასა და წესებზე/გრაფზე დაფუძნებულ ძიებას
  • Intelligent Folder Hits: ავტომატურად ეძებს სემანტიკურად დაკავშირებულ საქაღალდეებს/კატეგორიებს

მულტიმოდალური ერთდროული დამუშავება

  • TextReader Pool, VisionReader Pool და სხვა კომპონენტები ერთდროულად ახდენენ სხვადასხვა ტიპის მონაცემების, მათ შორის ტექსტის, სურათების, ცხრილებისა და აუდიოს, ინტერპრეტაციას
  • მაშინ, როდესაც არსებული RAG ძირითადად მხოლოდ ტექსტის დამუშავებას ახერხებს, სემანტიკური მონაცემთა ბაზა მულტიმოდალურ დამუშავებაში გამორჩეული შესაძლებლობებით გამოირჩევა

მტკიცებულებებზე დაფუძნებული პასუხები და სანდოობის შემოწმება

  • დოკუმენტების შეჯამებები და ციტირებები, ცხრილის მიგნებები და დოკუმენტების შეჯამებისა და წყაროების ავტომატური გენერაცია
  • Merge & Verify: მრავალი წყაროდან მიღებული ინფორმაციის სემანტიკური გაერთიანება და სანდოობის გადამოწმება
  • Evidence Pack: მტკიცებულებებზე დაფუძნებული პასუხების პაკეტის მიწოდება

კომპლექსური მსჯელობა და პლანერი

  • Planner/DAG: რთული მოთხოვნებისთვის ეტაპობრივი გეგმის შედგენა და DAG (Directed Acyclic Graph)-ზე დაფუძნებული მსჯელობა

ინტეგრირებული აგენტების არქიტექტურა

  • cip-5-agent Supervisor: უმაღლესი დონის აგენტი, რომელიც მართავს და კოორდინაციას უწევს ძიების, მსჯელობისა და ინტეგრაციის მთელ პროცესს
ძირითადი ტექსტის სურათი

3. სტრუქტურის შეჯამება და შედარება

შეჯამების სახით, Semantic DB სხვადასხვა ფორმატის მონაცემებს (ხმა, ტექსტი, სურათი, ვიდეო და სხვა) იღებს და ცოდნას კლასიფიცირებს არა მხოლოდ მარტივ Chunk-ებად, არამედ მონაცემებს შორის სემანტიკური კავშირების (კონტექსტი, იერარქია, მიზეზ-შედეგობრივი კავშირები და სხვა) გაერთიანებით.

ამის საფუძველზე, RAG-ის მსგავსად საკვანძო სიტყვებსა და მსგავსებაზე დაფუძნებული ძიების ნაცვლად, სემანტიკურ კავშირებზე დაფუძნებული ძიებისა და მსჯელობის განხორციელება არის შესაძლებელი, რის შედეგადაც AI-სგან უფრო ზუსტი ინფორმაციის მოძიება და პასუხების მიღება შეგიძლიათ.

გარდა ამისა, ვინაიდან მონაცემები ცოდნის გრაფიკისა და სემანტიკური ქსელის ფორმით ინახება, მათი უწყვეტი გაფართოება და შევსება მარტივია.

Clevi-მ AI-ის ტრანსფორმაციის ეპოქაში აღმოაჩინა RAG სისტემების შეზღუდვები და მათი გადაჭრა შეძლო სემანტიკური მონაცემთა ბაზისა და საკუთარი AI მოდელის მეშვეობით, რაც მომხმარებლებს უფრო ზუსტი და სანდო მონაცემების სწრაფად მიღების შესაძლებლობას აძლევს.

Clevi-ის AI სისტემა, ნებისმიერ გარემოში და დომენის ტიპის მიუხედავად, შეძლებს თქვენი ძვირფასი მონაცემების ღირებულ რესურსად გარდაქმნას.

Clevi მომავალშიც ყველაფერს გააკეთებს მომხმარებლის მონაცემებში არსებული ღირებულების მაქსიმალურად გასაზრდელად და ინოვაციური AI გამოცდილების უზრუნველსაყოფად.

გთხოვთ, Clevi-სთან ერთად განიცადოთ ახალი AI-ის მომავალი.

კითხვები და დემო ვერსიის მოთხოვნა: [email protected]

Copyright© 2025 Clevi Inc. ყველა უფლება დაცულია.

ნიუსრუმში დაბრუნება
CLEVI

ენა და რეგიონი

მანქანურად ნათარგმნი ენები მონიშნულია. ხელმისაწვდომობა გამოქვეყნებული საიტის პაკეტის შესაბამისად განისაზღვრება.

136 ენა

რეკომენდებული

1

აღმოსავლეთ აზია

7

სამხრეთ-აღმოსავლეთ აზია

11

სამხრეთ აზია

18

ცენტრალური აზია

5

ახლო აღმოსავლეთი და კავკასია

10

დასავლეთ ევროპა და სამხრეთ ევროპა

16

გაერთიანებული სამეფო და ირლანდია

4

ჩრდილოეთ ევროპა

10

ცენტრალური ევროპა და ბალკანეთი

14

აღმოსავლეთ ევროპა

5

აღმოსავლეთ აფრიკა

8

დასავლეთ აფრიკა და შუა აფრიკა

9

სამხრეთ აფრიკა

8

ამერიკები

5

ოკეანეთი

5
Clevi Semantic Database — CLEVI