1. Catastrophic Forgettingu ja RAG-i piirangud
Kui tehisintellekt võetakse kasutusele tegelikus töös, on üheks suurimaks murekohaks katastroofiline unustamine (Catastrophic Forgetting), mis tekib olemasolevate õpitud teadmiste uute andmetega peenhäälestamisel.
See on nähtus, mille puhul närvivõrgupõhine tehisintellekt kaotab uue teabe õppimise käigus kiiresti varem omandatud teadmised või mustrid.
Näiteks kui avatud lähtekoodiga LLM-i peenhäälestada konkreetse ettevõtte andmetega, võivad halveneda üldteadmised või keeleoskused.
Selle probleemi vältimiseks kasutatakse laialdaselt RAG-i (Retrieval-Augmented Generation) tehnoloogiat, kuid ka RAG-il on piiranguid.
RAG-i peamised piirangud
- Struktureeritud andmete ebapiisav töötlemine (Structured Data QA): RAG-süsteemid on peamiselt optimeeritud struktureerimata tekstidokumentide jaoks, mistõttu ei suuda need struktureeritud andmete (tabelid, andmebaasid, arvutustabelid jne) tähendust ja seoseid õigesti mõista ega kasutada.
- Keerukate PDF-ide/struktureerimata dokumentide piirangud (Complex PDFs): Keerukate PDF-dokumentide (sh tabelid, mitmeveeruline paigutus, pildid jne) puhul võib chunking'u (tükeldamise) käigus teave kaduma minna või kontekst moonutuda. Seetõttu ei pruugita olulisi andmeid indekseerida või võib nende otsimine olla keeruline.
- Fallback-mudeli puudumine (Fallback Model(s)): Kui RAG-süsteem ei leia sobivat vastust, on alternatiivsele (varu-)mudelile ülemineku loogika ebapiisav või ebatõhus. Seetõttu ei pakuta vastuse ebaõnnestumise korral kasutajale rahuldavat alternatiivi.
- Turvanõrkused (LLM Security): LLM-i enda turvanõrkuste (prompt injection, andmeleke jne) vastane kaitse on ebapiisav, mistõttu on tundliku teabe paljastumise oht.
- Ebapiisav skaleeritavus (Data Ingestion Scalability): Suuremahuliste andmete indekseerimise ja salvestamise käigus tekivad skaleeritavusprobleemid. Andmemahu suurenedes aeglustuvad chunking, salvestamine ja otsing ning süsteemi koormus suureneb.
- Olulise teabe puudumine (Missing Content): Dokumendi oluline sisu võib chunking'u käigus sageli kaduma minna või jääda indekseerimata. Seetõttu ei leia kasutaja soovitud teavet.
- Kõrgeima asetusega tulemuse puudumine (Missed Top Ranked): Otsingutulemustest võib puududa tegelikult kõige asjakohasem chunk (kõrgeima asetusega tulemus). Põhjusteks võivad olla otsingualgoritmi piirangud, embedding'ute kvaliteedi langus ja järjestusvead.
- Konteksti sobimatus (Not in Context): Sageli ei vasta leitud chunk tegelikult küsimuse kontekstile. See tuleneb lihtsal sarnasusel põhineva otsingu piirangutest, mille tõttu puudub semantiline seotus.
- Vale vorming (Wrong Format): Leitud chunk'i vorming võib olla LLM-i jaoks töötlemiseks sobimatu või erineda kasutaja soovitud vastusevormingust. Näiteks võib tabeli tekstiks teisendamisel teave moonduda.
- Teabe eraldamine ebaõnnestub (Not Extracted): Vajalikku teavet ei eraldata chunk'ist õigesti või LLM ei suuda teavet ära tunda. Seda juhtub sageli keerukate lausestruktuuride, tabelite ja piltide puhul.
- Teabe ulatus/sügavus ei ole sobiv (Incorrect Specificity): Vastus võib olla küsimuse jaoks liiga üldine või vastupidi liiga üksikasjalik ega vasta seetõttu kasutaja tegelikele vajadustele. Teabe ulatust ja sügavust on keeruline kohandada.
- Mittetäielik vastus (Incomplete): Lõplikult genereeritud vastus võib olla mittetäielik või sisaldada ainult osa teabest, mistõttu ei rahulda see piisavalt kasutaja vajadusi. Põhjuseks võib olla suutmatus koondada teavet mitmest chunk'ist või see, et LLM kasutab ainult osa teabest.
Seetõttu on RAG-il, mis sõltub liigselt lihtsast vektorite sarnasuse otsingust ja chunk-põhisest indekseerimisest, tegelikus töös selged piirangud usaldusväärsuse, skaleeritavuse ja täpsuse osas.
2. CLEVI semantiline andmebaas, mis ületab RAG-i piirangud
Nende piirangute ületamiseks töötas CLEVI välja järgmise põlvkonna tehisintellekti teadmiste taristu, mis on optimeeritud semantiliste seoste, keeruka tuletamise ja tõenduspõhiste vastuste jaoks – Clevi Semantic Database.
See lahendus on võimalik tänu sellele, et CLEVI-l on oma Reasoning-mudelid, multimodaalne AI ja agendipõhised AI-mudelid. See on üks CLEVI võimsatest tehnoloogiatest, mis muudab AI tegelikus elus tõeliselt kasulikuks.
Võrdluseks: kui andmebaasi, kuhu teave on salvestatud, pidada raamatukoguks, siis CLEVI semantilist andmebaasi võib kujutleda raamatukoguna, kus töötab väga hea raamatukoguhoidja. (Kui palute raamatukoguhoidjalt vajalikku teavet, saate täpse ja kiire vastuse.)
Kasutajad saavad igal ajal raamatukokku uut teavet lisada ja vajalikku teavet hankida.
Samuti saab andmete versioonihaldust ja juurdepääsuõigusi seadistada vastavalt soovile.
Kõik raamatukoguhoidja toimingud salvestatakse logina (kirjena), nii et isegi vea tekkimisel saab selle parandada.
<Clevi Semantic Database Structure>
Peamised omadused ja tehniline struktuur
Semantiline andmesalvestus
- Andmetevahelised semantilised seosed (kontekst, hierarhia, põhjuslikkus jne) salvestatakse graafandmebaasi, mitte lihtsasse chunk-vektorandmebaasi
- Lihtne laiendada ja täiendada teadmiste graafi või semantilise võrgustikuna
Hübriidotsing ja tuletamine
- CTA+Context Query: päringu konteksti (Context) ja CTA samaaegne arvestamine
- Hybrid Retrieval: vektorite sarnasuse otsingu ning reegli- ja graafipõhise otsingu ühendamine
- Intelligent Folder Hits: semantiliselt seotud kaustade/kategooriate automaatne otsimine
Multimodaalne samaaegne töötlemine
- TextReader Pool, VisionReader Pool jne võimaldavad samaaegselt tõlgendada mitmesuguseid andmeid, nagu tekst, pildid, tabelid ja heli
- Kui olemasolev RAG suudab peamiselt töödelda ainult teksti, siis semantiline andmebaas paistab silma suurepärase multimodaalse töötlemisvõime poolest
Tõenduspõhised vastused ja usaldusväärsuse kontroll
- Dokumentide kokkuvõtted ja viited, tabelite leidude automaatne genereerimine
- Merge & Verify: mitmest allikast pärit teabe semantiline ühendamine ja usaldusväärsuse kontrollimine
- Evidence Pack: tõenduspõhiste vastuste pakettide pakkumine
Keerukas arutlus ja planeerija
- Planner/DAG: samm-sammulised plaanid ja DAG-il (Directed Acyclic Graph) põhinev arutlus keerukate päringute jaoks
Integreeritud agendi arhitektuur
- cip-5-agent Supervisor: tipptaseme agent, mis haldab ja koordineerib kogu otsingu-, arutlus- ja integreerimisprotsessi
3. Struktuuri kokkuvõte ja võrdlus
Kokkuvõttes võtab Semantic DB vastu eri vormides andmeid (hääl, tekst, pildid, video jne) ning klassifitseerib teadmisi, ühendades mitte ainult lihtsaid tükke, vaid ka andmete vahelisi semantilisi suhteid (kontekst, hierarhia, põhjuslikkus jne).
Selle põhjal võimaldab see RAG-i sarnaselt märksõna- või sarnasuspõhise otsingu asemel semantilistel seostel põhinevat otsingut ja arutlust, mistõttu saab tehisintellektilt täpsemat teabeotsingut ja vastuseid.
Lisaks sellele, et teadmised salvestatakse teadmiste graafi või semantilise võrgustiku kujul, on neid lihtne pidevalt laiendada ja täiendada.
Clevi avastas tehisintellekti ulatusliku ülemineku ajastul RAG-süsteemide piirangud ning tänu neid piiranguid lahendavale semantilisele andmebaasile ja meie enda AI-mudelile suudame nüüd klientidele kiiremini pakkuda täpsemaid ja usaldusväärsemaid andmeid.
Clevi AI-süsteem suudab igas keskkonnas, olenemata valdkonnast, muuta klientide väärtuslikud andmed väärtuslikumaks.
Ka edaspidi annab Clevi endast parima, et maksimeerida klientide andmete väärtust ja pakkuda uuenduslikku AI-kogemust.
Kutsume teid koos Cleviga kogema uue AI tulevikku.
Päringud ja demo taotlused: [email protected]
Copyright© 2025 Clevi Inc. Kõik õigused kaitstud.
