Зерттеулер

Clevi Semantic Database

AI нақты жұмысқа енгізілген кезде ең үлкен мәселелердің бірі — бұрын үйренген білімді жаңа деректермен әрі қарай баптау кезінде туындайтын апатты ұмыту (Catastrophic Forgetting) құбылысы.

1. Catastrophic Forgetting және RAG шектеулері

AI нақты жұмысқа енгізілген кезде ең үлкен мәселелердің бірі — бұрын үйренген білімді жаңа деректермен әрі қарай баптау кезінде туындайтын апатты ұмыту (Catastrophic Forgetting) құбылысы.

Бұл — нейрондық желіге негізделген AI жаңа ақпаратты үйрену барысында бұрын меңгерген білімін немесе үлгілерін күрт жоғалтатын құбылыс.

Мысалы, ашық бастапқы кодты LLM-ді белгілі бір компанияның деректерімен әрі қарай баптау жалпыға ортақ білімнің немесе тілдік қабілеттердің төмендеуіне әкелуі мүмкін.

Мұндай мәселені болдырмау үшін RAG(Retrieval-Augmented Generation) технологиясы кеңінен қолданылғанымен, RAG-тың да шектеулері бар.

Негізгі мәтіндегі сурет

RAG-тың негізгі шектеулері

  • Құрылымдалған деректерді өңдеудің жеткіліксіздігі (Structured Data QA): RAG жүйелері негізінен құрылымдалмаған мәтіндік құжаттарға оңтайландырылған, сондықтан құрылымдалған деректердің (кестелер, дерекқорлар, электрондық кестелер және т.б.) мағынасы мен байланыстарын дұрыс түсініп, пайдалана алмайды.
  • Күрделі PDF/құрылымдалмаған құжаттардың шектеулері (Complex PDFs): Күрделі PDF құжаттарда (кестелер, бірнеше баған, кескіндер және т.б. бар) chunking (бөлу) процесі кезінде ақпарат жоғалуы немесе контекст бұрмалануы мүмкін. Соның салдарынан маңызды деректер индекстелмей қалуы немесе оларды іздеу қиындауы мүмкін.
  • Fallback (резервтік) модельдің болмауы (Fallback Model(s)): RAG жүйесі тиісті жауапты таба алмаған кезде, балама (резервтік) модельге ауысу логикасы жеткіліксіз немесе тиімсіз болады. Соның салдарынан жауап беру сәтсіз болғанда пайдаланушыға қанағаттанарлық балама ұсынылмайды.
  • Қауіпсіздік осалдығы (LLM Security): LLM жүйесінің өзіндегі қауіпсіздік осалдықтарынан (prompt injection, деректердің таралуы және т.б.) қорғау жеткіліксіз болғандықтан, құпия ақпараттың ашылып қалу қаупі бар.
  • Масштабталудың жеткіліксіздігі (Data Ingestion Scalability): Үлкен көлемдегі деректерді индекстеу және сақтау процесінде масштабталу мәселелері туындайды. Деректер көлемі артқан сайын chunking, сақтау және іздеу жылдамдығы төмендеп, жүйеге түсетін жүктеме артады.
  • Маңызды ақпараттың жоғалуы (Missing Content): Құжаттағы маңызды мазмұн chunking процесі кезінде жоғалып немесе индекстелмей қалуы мүмкін. Соның салдарынан пайдаланушы қажет ақпаратты іздей алмайды.
  • Жоғары рейтингтегі нәтижелердің түсіп қалуы (Missed Top Ranked): Іздеу нәтижелерінде шын мәнінде ең өзекті chunk (жоғары рейтингтегі нәтиже) түсіп қалуы мүмкін. Бұған іздеу алгоритмінің шектеулері, embedding сапасының төмендеуі және рейтингтеу қателері себеп болады.
  • Контекстің сәйкес келмеуі (Not in Context): Ізделген chunk нақты сұрақтың контекстіне сәйкес келмейтін жағдайлар жиі кездеседі. Бұл — қарапайым ұқсастыққа негізделген іздеудің шектеуі, себебі семантикалық байланыс жеткіліксіз.
  • Пішім қатесі (Wrong Format): Ізделген chunk пішімі LLM өңдеуі үшін қолайсыз немесе пайдаланушы қалаған жауап пішімінен өзгеше болуы мүмкін. Мысалы, кесте мәтінге түрлендіріліп, нәтижесінде ақпарат бұрмалануы мүмкін.
  • Ақпаратты шығарып алу сәтсіздігі (Not Extracted): Қажетті ақпарат chunk ішінен дұрыс шығарылмауы немесе LLM ақпаратты тани алмауы мүмкін. Бұл күрделі сөйлем құрылымдарында, кестелерде және кескіндерде жиі кездеседі.
  • Ақпарат ауқымы/тереңдігінің сәйкес келмеуі (Incorrect Specificity): Жауап сұраққа қатысты тым жалпы немесе керісінше шамадан тыс нақты болып, пайдаланушының нақты талабына сәйкес келмеуі мүмкін. Ақпараттың ауқымы мен тереңдігін реттеу қиын.
  • Толық емес жауап (Incomplete): Соңында жасалған жауап толық болмауы немесе ақпараттың бір бөлігі ғана ұсынылып, пайдаланушының талабын толық қанағаттандырмауы мүмкін. Бұған бірнеше chunk ішіндегі ақпаратты біріктіре алмау немесе LLM-нің ақпараттың бір бөлігін ғана пайдалануы себеп болады.

Осылайша, RAG қарапайым векторлық ұқсастық бойынша іздеуге және chunk негізіндегі индекстеуге шамадан тыс тәуелді болғандықтан, нақты жұмыс барысында сенімділік, масштабталу және дәлдік тұрғысынан шектеулері айқын көрінеді.

2. RAG шектеулерін еңсерген CLEVI семантикалық дерекқоры

CLEVI осы шектеулерді еңсеру үшін семантикалық байланыстарға, күрделі пайымдауға және дәлелдерге негізделген жауаптарға оңтайландырылған жаңа буын AI білім инфрақұрылымы — Clevi Semantic Database әзірледі.

Бұл — меншікті Reasoning моделіне, мультимодальды AI және агенттік AI модельдерінің барлығына ие болғандықтан мүмкін болған шешім және AI-ды шынайы өмірде іс жүзінде пайдалы ететін CLEVI-дің бірегей қуатты технологияларының бірі.

Салыстырып айтқанда, ақпарат сақталатын дерекқорды кітапхана деп қарастырсақ, CLEVI семантикалық дерекқорында өте білікті кітапханашы бар деп елестетуге болады. (Кітапханашыдан қажетті ақпаратты сұрасаңыз, дәл әрі жылдам жауап ала аласыз.)

Пайдаланушылар кітапханаға кез келген уақытта жаңа ақпарат қосып, қажетті ақпаратты ала алады.

Сонымен қатар деректер нұсқаларын басқаруды немесе оларға қол жеткізу құқықтарын өз қалауыңызға сай реттеуге болады.

Кітапханашының барлық әрекеті журналда (жазбада) сақталатындықтан, қате орын алса да, оны түзетуге болады.

Негізгі мәтіндегі сурет

<Clevi Semantic Database Structure>

Негізгі мүмкіндіктері мен технологиялық құрылымы

Семантикалық деректерді сақтау

  • Қарапайым chunk векторлық дерекқоры емес, деректер арасындағы семантикалық қатынастарды (контекст, иерархия, себеп-салдар және т.б.) графтық дерекқорда сақтау
  • Білім графигі/семантикалық желі түрінде кеңейту және толықтыру оңай

Гибридті іздеу және пайымдау

  • CTA+Context Query: сұрау контекстін (Context) және CTA-ны бірге ескеру
  • Hybrid Retrieval: векторлық ұқсастық бойынша іздеуді ережелерге/графқа негізделген іздеумен біріктіру
  • Intelligent Folder Hits: семантикалық тұрғыдан байланысты қалталар/санаттарды автоматты түрде іздеу

Мультимодальды деректерді бір уақытта өңдеу

  • TextReader Pool, VisionReader Pool және басқа құралдар арқылы мәтін, сурет, кесте, дауыс сияқты әртүрлі деректерді бір уақытта түсіндіру
  • Қолданыстағы RAG негізінен тек мәтінді өңдей алатын болса, семантикалық дерекқор мультимодальды өңдеу мүмкіндіктері бойынша әлдеқайда озық

Дәлелдерге негізделген жауаптар және сенімділікті тексеру

  • Құжат қорытындылары және дәйексөздер, кестедегі тұжырымдар және т.б. құжат қорытындылары мен дереккөздерін автоматты түрде жасау
  • Біріктіру және тексеру: бірнеше дереккөздегі ақпаратты мағыналық біріктіру және сенімділігін тексеру
  • Дәлелдер пакеті: дәлелдерге негізделген жауаптар пакетін ұсыну

Күрделі пайымдау және жоспарлаушы

  • Planner/DAG: күрделі сұраулар үшін кезең-кезеңмен жоспарлау және DAG(Directed Acyclic Graph) негізіндегі пайымдау

Біріктірілген агент құрылымы

  • cip-5-agent Supervisor: бүкіл іздеу/пайымдау/біріктіру үдерісін басқаратын және үйлестіретін жоғарғы деңгейлі агент
Негізгі мәтіндегі сурет

3. Құрылымды қорытындылау және салыстыру

Қорытындылай келе, Semantic DB әртүрлі пішіндегі (дауыс, мәтін, сурет, бейне және т.б.) деректерді қабылдап, оларды жай ғана Chunk ретінде емес, деректер арасындағы мағыналық байланыстарды (контекст, иерархия, себеп-салдар және т.б.) да байланыстыра отырып, білім ретінде жіктейді.

Осының негізінде RAG сияқты кілтсөздерге/ұқсастыққа негізделген іздеудің орнына, мағыналық байланыстарды пайдаланып іздеу және пайымдау орындалатындықтан, AI жүйесінен дәлірек ақпарат іздеу нәтижелері мен жауаптар алуға болады.

Сонымен қатар, білім графигі/семантикалық желі түрінде сақталатындықтан, оны үздіксіз кеңейту және толықтыру оңай.

CLEVI AI трансформациясы дәуірінде RAG жүйелерінің шектеулерін анықтап, оларды шеше алатын семантикалық дерекқор мен бірегей AI модельдері арқылы клиенттерге дәлірек әрі сенімді деректерді жылдам ұсына алады.

CLEVI AI жүйесі кез келген ортада, домен түріне қарамастан, клиенттердің құнды деректерін пайдалы іске айналдыра алады.

Бұдан әрі де CLEVI клиенттер деректерінің құндылығын барынша арттыру және инновациялық AI тәжірибесін ұсыну үшін бар күшін салады.

CLEVI-пен бірге жаңа AI болашағын сезініп көріңіз.

Сұрақтар және демонстрацияға өтінім: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Жаңалықтар бөліміне оралу
CLEVI

Тіл мен аймақ

Машиналық аударылған тілдер белгіленген. Қолжетімділік жарияланған сайт бумасына сәйкес келеді.

136 тіл

Ұсынылады

1

Шығыс Азия

7

Оңтүстік-Шығыс Азия

11

Оңтүстік Азия

18

Орталық Азия

5

Таяу Шығыс және Кавказ

10

Батыс Еуропа және Оңтүстік Еуропа

16

Ұлыбритания және Ирландия

4

Солтүстік Еуропа

10

Орталық Еуропа және Балқан

14

Шығыс Еуропа

5

Шығыс Африка

8

Батыс Африка және Орталық Африка

9

Оңтүстік Африка аймағы

8

Америка

5

Океания

5
Clevi Semantic Database — CLEVI