Изилдөө

Clevi семантикалык маалымат базасы

AI реалдуу ишке киргизилгенде, эң чоң көйгөйлөрдүн бири — мурда үйрөнгөн билимди жаңы маалыматтар менен кайрадан так жөндөп үйрөтүүдө пайда болгон катастрофалык унутуу (Catastrophic Forgetting) көрүнүшү.

1. Catastrophic Forgetting жана RAG’дын чектөөлөрү

AI реалдуу ишке киргизилгенде, эң чоң көйгөйлөрдүн бири — мурда үйрөнгөн билимди жаңы маалыматтар менен кайрадан так жөндөп үйрөтүүдө пайда болгон катастрофалык унутуу (Catastrophic Forgetting) көрүнүшү.

Бул нейрондук тармакка негизделген AI жаңы маалыматтарды үйрөнүү процессинде мурда өздөштүргөн билимдерин же үлгүлөрүн тез жоготуп коюучу көрүнүш.

Мисалы, ачык булактуу LLM’ди белгилүү бир компаниянын маалыматтары менен кайрадан так жөндөп үйрөтсө, жалпы мүнөздөгү түшүнүк же тил жөндөмү төмөндөшү мүмкүн.

Мындай көйгөйдөн качуу үчүн RAG (Retrieval-Augmented Generation) технологиясы кеңири колдонулат, бирок RAG’дын да чектөөлөрү бар.

Негизги тексттеги сүрөт

RAG’дын негизги чектөөлөрү

  • Структураланган маалыматтарды иштетүүнүн жетишсиздиги (Structured Data QA): RAG системалары негизинен структураланбаган тексттик документтер үчүн оптималдаштырылгандыктан, структураланган маалыматтардын (таблицалар, маалымат базалары, электрондук жадыбалдар ж.б.) маанисин жана байланыштарын туура түшүнүп же пайдалана албайт.
  • Татаал PDF/структураланбаган документтердин чектөөлөрү (Complex PDFs): Татаал PDF документтерде (таблицалар, көп тилкелүү жайгашуу, сүрөттөр ж.б. камтылган) chunking(бөлүү) процессинде маалымат жоголуп же контекст бурмаланышы мүмкүн. Натыйжада маанилүү маалыматтар индекстелбей же аларды издөө кыйын болуп калат.
  • Fallback(камдык) моделдин жоктугу (Fallback Model(s)): RAG системасы ылайыктуу жооп таба албаганда, алмаштыруучу (камдык) моделге өтүү логикасы жетишсиз же натыйжасыз болот. Натыйжада жооп берилбей калган учурда колдонуучуга канааттандырарлык альтернатива сунушталбайт.
  • Коопсуздук кемчиликтери (LLM Security): LLMдин өзүндөгү коопсуздук кемчиликтеринен (промпт инъекциясы, маалыматтын сыртка чыгып кетиши ж.б.) коргонуу жетишсиз болгондуктан, купуя маалыматтын ачыкка чыгуу коркунучу бар.
  • Масштабдалуунун жетишсиздиги (Data Ingestion Scalability): Чоң көлөмдөгү маалыматтарды индекстөө жана сактоо процессинде масштабдалуу көйгөйлөрү пайда болот. Маалымат көбөйгөн сайын chunking, сактоо жана издөө ылдамдыгы төмөндөп, системага түшкөн жүк көбөйөт.
  • Маанилүү маалыматтын түшүп калышы (Missing Content): Документтеги маанилүү мазмун chunking процессинде түшүп калышы же индекстелбей калышы көп кездешет. Натыйжада колдонуучу каалаган маалыматты издей албай калат.
  • Жогорку рейтингдеги натыйжанын түшүп калышы (Missed Top Ranked): Издөө натыйжаларында иш жүзүндө эң жогорку деңгээлде тиешелүү болгон chunk(жогорку рейтингдеги натыйжа) түшүп калышы мүмкүн. Буга издөө алгоритминин чектөөлөрү, embedding сапатынын төмөндөшү жана рейтинг түзүүдөгү каталар себеп болот.
  • Контексттин дал келбеши (Not in Context): Изделип табылган chunk көп учурда суроонун чыныгы контекстине дал келбейт. Бул жөнөкөй окшоштукка негизделген издөөнүн чектөөсүнөн улам келип чыгып, семантикалык байланыш жетишсиз болот.
  • Форматтын туура эмес болушу (Wrong Format): Изделип табылган chunkтин форматы LLM иштетүүгө ылайыксыз же колдонуучу каалаган жооп форматына дал келбеши мүмкүн. Мисалы, таблица текстке айландырылып, маалымат бурмаланышы мүмкүн.
  • Маалыматты чыгарып алуунун ийгиликсиздиги (Not Extracted): Керектүү маалымат chunkтен туура чыгарылбай калышы же LLM маалыматты тааныбай калышы мүмкүн. Бул татаал сүйлөм түзүлүштөрүндө, таблицаларда жана сүрөттөрдө көп кездешет.
  • Маалыматтын көлөмү/тереңдигинин туура эмес болушу (Incorrect Specificity): Жооп суроого карата өтө жалпы же тескерисинче өтө конкреттүү болуп, колдонуучунун чыныгы талабына дал келбей калышы мүмкүн. Маалыматтын көлөмүн жана тереңдигин жөнгө салуу кыйын.
  • Толук эмес жооп (Incomplete): Акырында түзүлгөн жооп толук эмес болуп же маалыматтын бир бөлүгү гана берилип, колдонуучунун талабын жетиштүү деңгээлде канааттандырбай калышы мүмкүн. Буга бир нече chunkтен алынган маалыматтарды бириктире албоо же LLMдин алардын айрымдарын гана пайдаланышы себеп болот.

Ушундайча, RAG жөнөкөй вектордук окшоштукту издөө жана chunk негизиндеги индекстөөгө өтө көз каранды болгондуктан, чыныгы иш чөйрөсүндө ишенимдүүлүк, масштабдуулук жана тактык жагынан чектөөлөрү ачык көрүнөт.

2. RAG’дин чектөөлөрүн жеңген CLEVI’нин семантикалык маалымат базасы

CLEVI бул чектөөлөрдү жеңүү үчүн семантикалык байланыштарга, татаал ой жүгүртүүгө жана далилдерге негизделген жоопторго оптималдаштырылган кийинки муундагы AI билим инфраструктурасы — Clevi Semantic Database түздү.

Бул чечим CLEVI өзүнүн Reasoning моделине, мультимодалдык AI жана агенттик AI моделдерине ээ болгондугунун аркасында мүмкүн болду жана AI’ды реалдуу дүйнөдө чындап пайдалуу кылган CLEVI’нин күчтүү технологияларынын бири болуп саналат.

Салыштырып айтканда, маалымат сакталган маалымат базасын китепкана десек, CLEVI’нин семантикалык маалымат базасында абдан мыкты китепканачы бар деп элестетсе болот. (Китепканачыдан керектүү маалыматты сурасаңыз, так жана тез жооп аласыз.)

Колдонуучулар китепканага каалаган убакта жаңы маалымат кошуп, керектүү маалыматты ала алышат.

Мындан тышкары, маалыматтардын версияларын башкарууну жана кирүү укуктарын каалагандай жөндөөгө болот.

Китепканачынын бардык аракеттери журналга (жазууга) түшүрүлөт, ошондуктан ката кетсе да аны оңдоого болот.

Негизги тексттин сүрөтү

<Clevi Semantic Database Structure>

Негизги өзгөчөлүктөрү жана технологиялык түзүмү

Семантикалык маалыматтарды сактоо

  • Жөнөкөй chunk вектордук маалымат базасы эмес, маалыматтардын ортосундагы семантикалык мамилелерди (контекст, иерархия, себеп-натыйжа ж.б.) графтык маалымат базасында сактоо
  • Билим графиги/семантикалык тармак түрүндө кеңейтүүгө жана толуктоого ыңгайлуу

Гибриддик издөө жана ой жүгүртүү

  • CTA+Context Query: суроонун контекстин (Context) жана CTA’ны биргелешип эске алуу
  • Hybrid Retrieval: вектордук окшоштукка негизделген издөө менен эрежеге/графка негизделген издөөнү айкалыштыруу
  • Intelligent Folder Hits: семантикалык жактан байланышкан папкаларды/категорияларды автоматтык түрдө табуу

Мультимодалдык бир убактагы иштетүү

  • TextReader Pool, VisionReader Pool сыяктуу текстти, сүрөттөрдү, таблицаларды, үндөрдү жана башка ар түрдүү маалыматтарды бир убакта чечмелөө
  • Учурдагы RAG негизинен текстти гана иштете алса, семантикалык маалымат базасы мультимодалдык иштетүү жөндөмү жагынан кыйла мыкты

Далилдерге негизделген жооптор жана ишенимдүүлүктү текшерүү

  • Документтердин кыскача мазмуну жана шилтемелер, Таблицадагы жыйынтыктар ж.б. — документтердин кыскача мазмунун жана булактарын автоматтык түрдө түзүү
  • Merge & Verify: бир нече булактардагы маалыматты маанилик жактан интеграциялоо жана ишенимдүүлүгүн текшерүү
  • Evidence Pack: далилдерге негизделген жооптор топтомун берүү

Татаал ой жүгүртүү жана план түзгүч

  • Planner/DAG: татаал суроолор үчүн этап-этабы менен план түзүү жана DAG (Directed Acyclic Graph) негизинде ой жүгүртүү

Интеграцияланган агент архитектурасы

  • cip-5-agent Supervisor: издөө, ой жүгүртүү жана интеграция процесстерин толугу менен башкарган жана координациялаган жогорку деңгээлдеги агент
Негизги тексттеги сүрөт

3. Түзүмдүн кыскача мазмуну жана салыштыруу

Жыйынтыктап айтканда, Semantic DB ар кандай формадагы (үн, текст, сүрөт, видео ж.б.) маалыматтарды кабыл алып, аларды жөн гана Chunk катары эмес, маалыматтардын ортосундагы маанилик байланыштарды (контекст, иерархия, себеп-натыйжа ж.б.) да бириктирүү аркылуу классификациялайт.

Мунун негизинде RAG сыяктуу ачкыч сөздөргө же окшоштукка негизделген издөө эмес, маанилик байланыштарды пайдаланган издөө жана ой жүгүртүү жүргүзүлгөндүктөн, AI аркылуу кыйла так маалымат издөө жана жоопторду алууга болот.

Мындан тышкары, маалыматтар билим графиги/семантикалык тармак түрүндө сакталгандыктан, аларды үзгүлтүксүз кеңейтүү жана толуктоо оңой.

CLEVI AI трансформациясынын доорунда RAG тутумдарынын чектөөлөрүн аныктап, аларды чечүүгө жөндөмдүү семантикалык маалымат базасы жана өзүнүн AI моделдери аркылуу кардарларга так жана ишенимдүү маалыматтарды тез жеткирүүгө мүмкүнчүлүк түздү.

CLEVIнин AI тутумдары ар кандай чөйрөдө жана домендин түрүнө карабастан, кардарлардын баалуу маалыматтарын пайдалуу баалуулукка айландыра алат.

Мындан ары да CLEVI кардарлардын маалыматтарынын баалуулугун максималдуу жогорулатуу жана инновациялык AI тажрыйбасын сунуштоо үчүн бардык күчүн жумшайт.

CLEVI менен бирге AIнын жаңы келечегин баштан өткөрүп көрүңүз.

Суроолор жана демо өтүнүчтөрү: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Жаңылыктар бөлүмүнө кайтуу
CLEVI

Тил жана аймак

Машина аркылуу которулган тилдер белгиленген. Жеткиликтүүлүк жарыяланган сайт топтомуна жараша болот.

136 тил

Сунушталат

1

Чыгыш Азия

7

Түштүк-Чыгыш Азия

11

Түштүк Азия

18

Борбор Азия

5

Жакынкы Чыгыш жана Кавказ

10

Батыш Европа жана Түштүк Европа

16

Улуу Британия жана Ирландия

4

Түндүк Европа

10

Борбордук Европа жана Балкан

14

Чыгыш Европа

5

Чыгыш Африка

8

Батыш Африка жана Борбордук Африка

9

Түштүк Африка

8

Америка

5

Океания

5
Clevi семантикалык маалымат базасы — CLEVI