1. A Catastrophic Forgetting és a RAG korlátai
Amikor az AI-t tényleges munkafolyamatokban vezetik be, az egyik legnagyobb aggodalom a katasztrofális felejtés (Catastrophic Forgetting) jelensége, amely akkor lép fel, amikor a korábban megtanult tudást új adatokkal finomhangolják.
Ez azt a jelenséget jelenti, amikor a neurális hálózaton alapuló AI az új információk megtanulása során hirtelen elveszíti a korábban elsajátított tudást vagy mintázatokat.
Ha például egy nyílt forráskódú LLM-et egy adott vállalat adataival finomhangolnak, az általános világismeret vagy a nyelvi képességek romolhatnak.
A probléma elkerülésére széles körben használják a RAG (Retrieval-Augmented Generation) technológiát, azonban a RAG-nak is vannak korlátai.
A RAG főbb korlátai
- Nem megfelelő strukturáltadat-feldolgozás (strukturált adatok minőségbiztosítása): A RAG-rendszerek elsősorban strukturálatlan szöveges dokumentumokra vannak optimalizálva, ezért nem képesek megfelelően felismerni vagy felhasználni a strukturált adatok (táblázatok, adatbázisok, táblázatkezelő munkalapok stb.) jelentését és összefüggéseit.
- Összetett PDF-ek és strukturálatlan dokumentumok korlátai (összetett PDF-ek): Az összetett PDF-dokumentumok (például táblázatokat, több hasábot vagy képeket tartalmazó dokumentumok) esetében a chunking (felosztás) során információk veszhetnek el, illetve a kontextus torzulhat. Emiatt fontos adatok nem kerülnek indexelésre, vagy nehezen kereshetők.
- Fallback (tartalék) modell hiánya (tartalék modellek): Amikor a RAG-rendszer nem talál megfelelő választ, a helyettesítő (tartalék) modellre való átváltás logikája hiányos vagy nem hatékony. Emiatt a válasz sikertelensége esetén nem áll rendelkezésre a felhasználó számára kielégítő alternatíva.
- Biztonsági sebezhetőségek (LLM-biztonság): Az LLM saját biztonsági sebezhetőségei (például promptinjektálás és adatszivárgás) elleni védelem nem megfelelő, ezért fennáll az érzékeny információk felfedésének kockázata.
- Nem megfelelő skálázhatóság (adatbetöltés skálázhatósága): Nagy mennyiségű adat indexelése és tárolása során skálázhatósági problémák merülnek fel. Az adatmennyiség növekedésével romlik a chunking, a tárolás és a keresés sebessége, miközben nő a rendszer terhelése.
- Fontos információk hiánya (hiányzó tartalom): A dokumentumok fontos tartalma gyakran elveszik a chunking során, vagy nem kerül indexelésre. Emiatt a felhasználók nem tudják megtalálni a keresett információt.
- A legmagasabb rangú találatok hiánya (kihagyott legmagasabb rangú találat): A keresési eredményekből hiányozhat a ténylegesen legrelevánsabb chunk (legmagasabb rangú találat). Ennek oka lehet a keresési algoritmus korlátja, a gyenge embeddingminőség, rangsorolási hiba stb.
- Kontextusbeli eltérés (nincs kontextusban): A megtalált chunk gyakran nem illeszkedik a kérdés tényleges kontextusához. Ez az egyszerű hasonlóságon alapuló keresés korlátjaiból fakad, mivel hiányzik a szemantikai kapcsolat.
- Formázási hiba (hibás formátum): A megtalált chunk formátuma alkalmatlan lehet az LLM általi feldolgozásra, vagy eltérhet a felhasználó által kívánt válaszformátumtól. Például a táblázat szöveggé alakítása az információ torzulásához vezethet.
- Információkinyerési hiba (nem kinyert): A szükséges információt nem sikerül megfelelően kinyerni a chunkból, vagy az LLM nem ismeri fel az információt. Ez gyakran fordul elő összetett mondatszerkezetek, táblázatok és képek esetén.
- Nem megfelelő információs tartomány/mélység (nem megfelelő részletesség): A válasz túl általános a kérdéshez képest, vagy éppen túlzottan konkrét, ezért nem felel meg a felhasználó tényleges igényeinek. Nehéz megfelelően beállítani az információ tartományát és mélységét.
- Hiányos válasz (hiányos): A végül létrehozott válasz hiányos, vagy csak az információ egy részét tartalmazza, ezért nem elégíti ki megfelelően a felhasználó igényeit. Ennek oka lehet, hogy a rendszer nem tudja több chunkból összefoglalni az információt, vagy az LLM csak annak egy részét használja fel.
Mivel a RAG túlzottan az egyszerű vektorszimilaritás-alapú keresésre és a chunk-alapú indexelésre támaszkodik, a valós üzleti környezetben egyértelmű korlátai vannak a megbízhatóság, a skálázhatóság és a pontosság terén.
2. A CLEVI szemantikus adatbázisa, amely leküzdi a RAG korlátait
E korlátok leküzdésére a CLEVI kifejlesztette a következő generációs AI-tudásinfrastruktúrát, a szemantikus kapcsolatokra, összetett következtetésre és bizonyítékokon alapuló válaszokra optimalizált Clevi Semantic Database rendszert.
Ez a megoldás azért lehetséges, mert saját Reasoning modellekkel, multimodális AI- és ügynökalapú AI-modellekkel egyaránt rendelkezik, és a CLEVI egyik olyan erőteljes technológiája, amely lehetővé teszi, hogy az AI a valóságban ténylegesen hasznos legyen.
Hasonlatként: ha az információkat tároló adatbázist könyvtárnak tekintjük, akkor képzeljük el úgy a CLEVI szemantikus adatbázisát, mintha egy rendkívül kiváló könyvtáros állna rendelkezésünkre. (Ha a könyvtárostól a szükséges információt kérjük, pontos és gyors választ kaphatunk.)
A felhasználók bármikor új információkat adhatnak hozzá a könyvtárhoz, és lekérhetik a szükséges információkat.
Emellett az adatok verziókezelése és a hozzáférési jogosultságok is tetszés szerint beállíthatók.
A könyvtáros minden művelete naplóként (rekordként) megmarad, így hiba esetén is kijavítható.
<Clevi Semantic Database Structure>
Főbb jellemzők és technológiai felépítés
Szemantikus adattárolás
- Az egyszerű chunk vektoradatbázisokkal ellentétben az adatok közötti szemantikus kapcsolatokat (kontextus, hierarchia, okság stb.) gráfadatbázisban tárolja
- Könnyen bővíthető és kiegészíthető tudásgráf/ szemantikus hálózat formájában
Hibrid keresés és következtetés
- CTA+Context Query: a lekérdezés kontextusát (Context) és a CTA-t egyaránt figyelembe veszi
- Hybrid Retrieval: a vektorszimilaritás-alapú és a szabály-/gráfalapú keresés kombinációja
- Intelligent Folder Hits: a szemantikusan kapcsolódó mappák/kategóriák automatikus feltérképezése
Multimodális egyidejű feldolgozás
- A TextReader Pool, a VisionReader Pool és más komponensek egyidejűleg értelmezik a különböző típusú adatokat, például a szöveget, képeket, táblázatokat és hanganyagokat
- Míg a meglévő RAG-rendszerek többnyire csak szöveget képesek feldolgozni, a szemantikus adatbázis kiemelkedő multimodális feldolgozási képességekkel rendelkezik
Bizonyítékokon alapuló válaszadás és megbízhatóság-ellenőrzés
- Dokumentum-összefoglalók és hivatkozások, táblázatos megállapítások stb. – dokumentum-összefoglalók és források automatikus létrehozása
- Merge & Verify: több forrásból származó információk szemantikai integrációja és megbízhatóságának ellenőrzése
- Evidence Pack: bizonyítékokon alapuló válaszcsomag biztosítása
Összetett következtetés és tervező
- Planner/DAG: lépésről lépésre kidolgozott tervek és DAG (Directed Acyclic Graph) alapú következtetés összetett lekérdezésekhez
Integrált ügynökstruktúra
- cip-5-agent Supervisor: a teljes keresési, következtetési és integrációs folyamatot kezelő és koordináló legfelső szintű ügynök
3. Szerkezeti összefoglaló és összehasonlítás
Összefoglalva: a Semantic DB különböző formátumú adatokat (hang, szöveg, kép, videó stb.) fogad bemenetként, és nem csupán Chunkokra bontva osztályozza a tudást, hanem az adatok közötti szemantikai kapcsolatokat (kontextus, hierarchia, ok-okozat stb.) is összekapcsolja.
Ennek köszönhetően a RAG-hoz hasonló kulcsszó- vagy hasonlóságalapú keresés helyett szemantikai kapcsolatokat használ a kereséshez és a következtetéshez, így pontosabb információkeresést és válaszokat kaphatunk az AI-tól.
Emellett, mivel tudásgráf vagy szemantikai hálózat formájában tárolja az adatokat, könnyen folyamatosan bővíthető és kiegészíthető.
A Clevi az AI-átalakulás korában felismerte a RAG-rendszerek korlátait, és egy szemantikus adatbázis, valamint saját AI-modellek segítségével képessé vált arra, hogy ügyfelei számára gyorsabban biztosítson pontosabb és megbízhatóbb adatokat.
A Clevi AI-rendszere bármilyen környezetben, a szakterület típusától függetlenül képes értékessé tenni ügyfelei értékes adatait.
A Clevi a jövőben is mindent megtesz annak érdekében, hogy maximalizálja ügyfelei adatainak értékét, és innovatív AI-élményt nyújtson.
Tapasztalja meg az új AI jövőjét a Clevivel.
Érdeklődés és demókérés: [email protected]
Copyright© 2025 Clevi Inc. All rights reserved.
