1. Catastrophic Forgetting un RAG ierobežojumi
Kad MI tiek ieviests reālajā darbā, viena no lielākajām bažām ir katastrofālā aizmiršana (Catastrophic Forgetting), kas rodas, iepriekš apgūtās zināšanas precizējot ar jauniem datiem.
Tā ir parādība, kad neironu tīklos balstīts MI jaunas informācijas apguves procesā strauji zaudē iepriekš apgūtās zināšanas vai modeļus.
Piemēram, precizējot atvērtā pirmkoda LLM ar konkrēta uzņēmuma datiem, var pasliktināties vispārīgās zināšanas vai valodas prasmes.
Lai izvairītos no šīs problēmas, plaši tiek izmantota RAG(Retrieval-Augmented Generation) tehnoloģija, taču arī RAG ir ierobežojumi.
Būtiskākie RAG ierobežojumi
- Nepietiekama strukturētu datu apstrāde (Structured Data QA): RAG sistēmas galvenokārt ir optimizētas nestrukturētiem teksta dokumentiem, tāpēc tās nespēj pienācīgi izprast vai izmantot strukturētu datu (tabulu, datubāzu, izklājlapu u. c.) nozīmi un attiecības.
- Sarežģītu PDF/nestrukturētu dokumentu ierobežojumi (Complex PDFs): sarežģīti PDF dokumenti (tostarp tabulas, vairākas slejas, attēli u. c.) chunking (sadalīšanas) procesā var zaudēt informāciju vai izraisīt konteksta izkropļojumus. Tādēļ svarīgi dati var netikt indeksēti vai tos var būt grūti atrast.
- Fallback (rezerves) modeļa trūkums (Fallback Model(s)): ja RAG sistēma neatrod piemērotu atbildi, loģika pārejai uz alternatīvu (rezerves) modeli var būt nepietiekama vai neefektīva. Tādēļ atbildes neizdošanās gadījumā lietotājam netiek nodrošināta apmierinoša alternatīva.
- Drošības ievainojamības (LLM Security): aizsardzība pret paša LLM drošības ievainojamībām (promptu injekcijām, datu noplūdi u. c.) ir nepietiekama, tādēļ pastāv sensitīvas informācijas atklāšanas risks.
- Nepietiekama mērogojamība (Data Ingestion Scalability): liela datu apjoma indeksēšanas un glabāšanas procesā rodas mērogojamības problēmas. Datu apjomam palielinoties, chunking, glabāšanas un meklēšanas ātrums samazinās, bet sistēmas slodze palielinās.
- Svarīgas informācijas trūkums (Missing Content): dokumentos svarīgs saturs chunking procesā bieži tiek zaudēts vai netiek indeksēts. Tādēļ lietotājs nevar atrast vajadzīgo informāciju.
- Augstākā ranga rezultātu trūkums (Missed Top Ranked): meklēšanas rezultātos var netikt iekļauts faktiski visatbilstošākais chunk (augstākā ranga rezultāts). To var izraisīt meklēšanas algoritma ierobežojumi, zema iegulumu kvalitāte, ranžēšanas kļūdas u. c.
- Konteksta neatbilstība (Not in Context): atrastais chunk bieži neatbilst faktiskajam jautājuma kontekstam. Tā ir uz vienkāršu līdzību balstītas meklēšanas ierobežojuma sekas, jo semantiskā saistība ir nepietiekama.
- Nepareizs formāts (Wrong Format): atrastā chunk formāts var nebūt piemērots LLM apstrādei vai atšķirties no lietotāja vēlamā atbildes formāta. Piemēram, tabula var tikt pārveidota par tekstu, tādējādi izkropļojot informāciju.
- Informācijas izgūšanas kļūme (Not Extracted): nepieciešamā informācija no chunk var netikt pienācīgi izgūta vai LLM var to neatpazīt. Tas bieži notiek sarežģītu teikumu struktūru, tabulu, attēlu u. c. gadījumā.
- Nepiemērots informācijas tvērums/dziļums (Incorrect Specificity): atbilde uz jautājumu var būt pārāk vispārīga vai, gluži pretēji, pārmērīgi specifiska un neatbilst lietotāja faktiskajām vajadzībām. Ir grūti pielāgot informācijas tvērumu un dziļumu.
- Nepilnīga atbilde (Incomplete): galīgā ģenerētā atbilde var būt nepilnīga vai sniegt tikai daļu informācijas, tādējādi pietiekami neapmierinot lietotāja vajadzības. To var izraisīt nespēja apkopot informāciju no vairākiem chunk vai LLM izmantot tikai daļu informācijas.
Šādi RAG, pārmērīgi paļaujoties uz vienkāršu vektoru līdzības meklēšanu un uz chunk balstītu indeksēšanu, reālajā darbā saskaras ar skaidriem ierobežojumiem uzticamības, mērogojamības un precizitātes ziņā.
2. CLEVI semantiskā datubāze, kas pārvar RAG ierobežojumus
Lai pārvarētu šos ierobežojumus, CLEVI izstrādāja nākamās paaudzes AI zināšanu infrastruktūru — optimizētu semantiskajiem savienojumiem, sarežģītai secināšanai un uz pierādījumiem balstītām atbildēm — Clevi Semantic Database.
Šis risinājums ir iespējams, jo mums ir pašiem savs Reasoning modelis, multimodālais AI un aģentiskais AI modelis, un tā ir viena no CLEVI unikālajām spēcīgajām tehnoloģijām, kas ļauj AI sniegt reālu palīdzību ikdienas dzīvē.
Salīdzinājumam: ja datubāzi, kurā glabājas informācija, uzskatām par bibliotēku, tad CLEVI semantisko datubāzi varam iztēloties kā bibliotēku ar izcilu bibliotekāru. (Ja bibliotekāram pieprasīsiet nepieciešamo informāciju, saņemsiet precīzu un ātru atbildi.)
Lietotāji jebkurā laikā var bibliotēkai pievienot jaunu informāciju un izgūt nepieciešamo informāciju.
Turklāt datu versiju pārvaldību un piekļuves tiesības var iestatīt atbilstoši savām vēlmēm.
Visas bibliotekāra darbības tiek saglabātas žurnālā (ierakstā), tāpēc arī kļūdu gadījumā tās var labot.
<Clevi Semantic Database Structure>
Galvenās iezīmes un tehniskā struktūra
Semantiska datu glabāšana
- Dati tiek glabāti grafu DB kā semantiskās attiecības starp datiem (konteksts, hierarhija, cēloņsakarības u. c.), nevis vienkāršā chunk vektoru DB
- To ir viegli paplašināt un papildināt zināšanu grafa/semantiskā tīkla formā
Hibrīda meklēšana un secināšana
- CTA+Context Query: vienlaikus tiek ņemti vērā vaicājuma konteksts (Context) un CTA
- Hybrid Retrieval: apvienota vektoru līdzības meklēšana ar uz noteikumiem/grafiem balstītu meklēšanu
- Intelligent Folder Hits: automātiska semantiski saistītu mapju/kategoriju meklēšana
Vienlaicīga multimodāla apstrāde
- Vienlaicīga dažādu datu, piemēram, teksta, attēlu, tabulu un balss, interpretācija, izmantojot TextReader Pool, VisionReader Pool u. c.
- Kamēr tradicionālais RAG galvenokārt var apstrādāt tikai tekstu, semantiskā datubāze izceļas ar multimodālas apstrādes iespējām
Uz pierādījumiem balstītas atbildes un uzticamības pārbaude
- Dokumentu kopsavilkumi un citāti, tabulu atziņas u. c. — automātiska dokumentu kopsavilkumu un avotu ģenerēšana
- Merge & Verify: informācijas semantiska apvienošana no vairākiem avotiem un uzticamības pārbaude
- Evidence Pack: uz pierādījumiem balstītas atbilžu pakotnes nodrošināšana
Sarežģīta spriešana un plānotājs
- Planner/DAG: pakāpeniska plānošana un uz DAG (Directed Acyclic Graph) balstīta spriešana sarežģītiem vaicājumiem
Integrēta aģentu struktūra
- cip-5-agent Supervisor: augstākā līmeņa aģents, kas pārvalda un koordinē visu meklēšanas, spriešanas un integrācijas procesu
3. Struktūras kopsavilkums un salīdzinājums
Kopsavilkumā Semantic DB saņem dažādu veidu datus (balsi, tekstu, attēlus, video u. c.) un klasificē zināšanas, savienojot ne tikai vienkāršus Chunk, bet arī semantiskās attiecības starp datiem (kontekstu, hierarhiju, cēloņsakarības u. c.).
Pamatojoties uz to, tas nodrošina meklēšanu un spriešanu, izmantojot semantiskās saiknes, nevis uz atslēgvārdiem vai līdzību balstītu meklēšanu, kā RAG, tādējādi AI var sniegt precīzāku informācijas meklēšanu un atbildes.
Turklāt, tā kā dati tiek glabāti zināšanu grafika vai semantiskā tīkla veidā, tos ir viegli nepārtraukti paplašināt un papildināt.
Clevi esam atklājuši RAG sistēmu ierobežojumus AI transformācijas laikmetā un, izmantojot semantisko datubāzi un mūsu pašu AI modeli, kas šos ierobežojumus novērš, varam klientiem ātri sniegt precīzākus un uzticamākus datus.
Mūsu Clevi AI sistēma jebkurā vidē un neatkarīgi no domēna veida spēj piešķirt vērtību mūsu klientu vērtīgajiem datiem.
Arī turpmāk Clevi darīs visu iespējamo, lai maksimāli palielinātu klientu datu vērtību un nodrošinātu inovatīvu AI pieredzi.
Aicinām kopā ar Clevi piedzīvot jaunās AI nākotni.
Jautājumi un demonstrācijas pieprasījumi: [email protected]
Copyright© 2025 Clevi Inc. Visas tiesības aizsargātas.
