Kutatás

Clevi szemantikus adatbázis

Amikor az AI-t tényleges munkafolyamatokban vezetik be, az egyik legnagyobb aggodalom a katasztrofális felejtés (Catastrophic Forgetting) jelensége, amely akkor lép fel, amikor a korábban megtanult tudást új adatokkal finomhangolják.

1. A Catastrophic Forgetting és a RAG korlátai

Amikor az AI-t tényleges munkafolyamatokban vezetik be, az egyik legnagyobb aggodalom a katasztrofális felejtés (Catastrophic Forgetting) jelensége, amely akkor lép fel, amikor a korábban megtanult tudást új adatokkal finomhangolják.

Ez azt a jelenséget jelenti, amikor a neurális hálózaton alapuló AI az új információk megtanulása során hirtelen elveszíti a korábban elsajátított tudást vagy mintázatokat.

Ha például egy nyílt forráskódú LLM-et egy adott vállalat adataival finomhangolnak, az általános világismeret vagy a nyelvi képességek romolhatnak.

A probléma elkerülésére széles körben használják a RAG (Retrieval-Augmented Generation) technológiát, azonban a RAG-nak is vannak korlátai.

A törzsszöveg képe

A RAG főbb korlátai

  • Nem megfelelő strukturáltadat-feldolgozás (strukturált adatok minőségbiztosítása): A RAG-rendszerek elsősorban strukturálatlan szöveges dokumentumokra vannak optimalizálva, ezért nem képesek megfelelően felismerni vagy felhasználni a strukturált adatok (táblázatok, adatbázisok, táblázatkezelő munkalapok stb.) jelentését és összefüggéseit.
  • Összetett PDF-ek és strukturálatlan dokumentumok korlátai (összetett PDF-ek): Az összetett PDF-dokumentumok (például táblázatokat, több hasábot vagy képeket tartalmazó dokumentumok) esetében a chunking (felosztás) során információk veszhetnek el, illetve a kontextus torzulhat. Emiatt fontos adatok nem kerülnek indexelésre, vagy nehezen kereshetők.
  • Fallback (tartalék) modell hiánya (tartalék modellek): Amikor a RAG-rendszer nem talál megfelelő választ, a helyettesítő (tartalék) modellre való átváltás logikája hiányos vagy nem hatékony. Emiatt a válasz sikertelensége esetén nem áll rendelkezésre a felhasználó számára kielégítő alternatíva.
  • Biztonsági sebezhetőségek (LLM-biztonság): Az LLM saját biztonsági sebezhetőségei (például promptinjektálás és adatszivárgás) elleni védelem nem megfelelő, ezért fennáll az érzékeny információk felfedésének kockázata.
  • Nem megfelelő skálázhatóság (adatbetöltés skálázhatósága): Nagy mennyiségű adat indexelése és tárolása során skálázhatósági problémák merülnek fel. Az adatmennyiség növekedésével romlik a chunking, a tárolás és a keresés sebessége, miközben nő a rendszer terhelése.
  • Fontos információk hiánya (hiányzó tartalom): A dokumentumok fontos tartalma gyakran elveszik a chunking során, vagy nem kerül indexelésre. Emiatt a felhasználók nem tudják megtalálni a keresett információt.
  • A legmagasabb rangú találatok hiánya (kihagyott legmagasabb rangú találat): A keresési eredményekből hiányozhat a ténylegesen legrelevánsabb chunk (legmagasabb rangú találat). Ennek oka lehet a keresési algoritmus korlátja, a gyenge embeddingminőség, rangsorolási hiba stb.
  • Kontextusbeli eltérés (nincs kontextusban): A megtalált chunk gyakran nem illeszkedik a kérdés tényleges kontextusához. Ez az egyszerű hasonlóságon alapuló keresés korlátjaiból fakad, mivel hiányzik a szemantikai kapcsolat.
  • Formázási hiba (hibás formátum): A megtalált chunk formátuma alkalmatlan lehet az LLM általi feldolgozásra, vagy eltérhet a felhasználó által kívánt válaszformátumtól. Például a táblázat szöveggé alakítása az információ torzulásához vezethet.
  • Információkinyerési hiba (nem kinyert): A szükséges információt nem sikerül megfelelően kinyerni a chunkból, vagy az LLM nem ismeri fel az információt. Ez gyakran fordul elő összetett mondatszerkezetek, táblázatok és képek esetén.
  • Nem megfelelő információs tartomány/mélység (nem megfelelő részletesség): A válasz túl általános a kérdéshez képest, vagy éppen túlzottan konkrét, ezért nem felel meg a felhasználó tényleges igényeinek. Nehéz megfelelően beállítani az információ tartományát és mélységét.
  • Hiányos válasz (hiányos): A végül létrehozott válasz hiányos, vagy csak az információ egy részét tartalmazza, ezért nem elégíti ki megfelelően a felhasználó igényeit. Ennek oka lehet, hogy a rendszer nem tudja több chunkból összefoglalni az információt, vagy az LLM csak annak egy részét használja fel.

Mivel a RAG túlzottan az egyszerű vektorszimilaritás-alapú keresésre és a chunk-alapú indexelésre támaszkodik, a valós üzleti környezetben egyértelmű korlátai vannak a megbízhatóság, a skálázhatóság és a pontosság terén.

2. A CLEVI szemantikus adatbázisa, amely leküzdi a RAG korlátait

E korlátok leküzdésére a CLEVI kifejlesztette a következő generációs AI-tudásinfrastruktúrát, a szemantikus kapcsolatokra, összetett következtetésre és bizonyítékokon alapuló válaszokra optimalizált Clevi Semantic Database rendszert.

Ez a megoldás azért lehetséges, mert saját Reasoning modellekkel, multimodális AI- és ügynökalapú AI-modellekkel egyaránt rendelkezik, és a CLEVI egyik olyan erőteljes technológiája, amely lehetővé teszi, hogy az AI a valóságban ténylegesen hasznos legyen.

Hasonlatként: ha az információkat tároló adatbázist könyvtárnak tekintjük, akkor képzeljük el úgy a CLEVI szemantikus adatbázisát, mintha egy rendkívül kiváló könyvtáros állna rendelkezésünkre. (Ha a könyvtárostól a szükséges információt kérjük, pontos és gyors választ kaphatunk.)

A felhasználók bármikor új információkat adhatnak hozzá a könyvtárhoz, és lekérhetik a szükséges információkat.

Emellett az adatok verziókezelése és a hozzáférési jogosultságok is tetszés szerint beállíthatók.

A könyvtáros minden művelete naplóként (rekordként) megmarad, így hiba esetén is kijavítható.

A törzsszöveg képe

<Clevi Semantic Database Structure>

Főbb jellemzők és technológiai felépítés

Szemantikus adattárolás

  • Az egyszerű chunk vektoradatbázisokkal ellentétben az adatok közötti szemantikus kapcsolatokat (kontextus, hierarchia, okság stb.) gráfadatbázisban tárolja
  • Könnyen bővíthető és kiegészíthető tudásgráf/ szemantikus hálózat formájában

Hibrid keresés és következtetés

  • CTA+Context Query: a lekérdezés kontextusát (Context) és a CTA-t egyaránt figyelembe veszi
  • Hybrid Retrieval: a vektorszimilaritás-alapú és a szabály-/gráfalapú keresés kombinációja
  • Intelligent Folder Hits: a szemantikusan kapcsolódó mappák/kategóriák automatikus feltérképezése

Multimodális egyidejű feldolgozás

  • A TextReader Pool, a VisionReader Pool és más komponensek egyidejűleg értelmezik a különböző típusú adatokat, például a szöveget, képeket, táblázatokat és hanganyagokat
  • Míg a meglévő RAG-rendszerek többnyire csak szöveget képesek feldolgozni, a szemantikus adatbázis kiemelkedő multimodális feldolgozási képességekkel rendelkezik

Bizonyítékokon alapuló válaszadás és megbízhatóság-ellenőrzés

  • Dokumentum-összefoglalók és hivatkozások, táblázatos megállapítások stb. – dokumentum-összefoglalók és források automatikus létrehozása
  • Merge & Verify: több forrásból származó információk szemantikai integrációja és megbízhatóságának ellenőrzése
  • Evidence Pack: bizonyítékokon alapuló válaszcsomag biztosítása

Összetett következtetés és tervező

  • Planner/DAG: lépésről lépésre kidolgozott tervek és DAG (Directed Acyclic Graph) alapú következtetés összetett lekérdezésekhez

Integrált ügynökstruktúra

  • cip-5-agent Supervisor: a teljes keresési, következtetési és integrációs folyamatot kezelő és koordináló legfelső szintű ügynök
Törzsszöveg képe

3. Szerkezeti összefoglaló és összehasonlítás

Összefoglalva: a Semantic DB különböző formátumú adatokat (hang, szöveg, kép, videó stb.) fogad bemenetként, és nem csupán Chunkokra bontva osztályozza a tudást, hanem az adatok közötti szemantikai kapcsolatokat (kontextus, hierarchia, ok-okozat stb.) is összekapcsolja.

Ennek köszönhetően a RAG-hoz hasonló kulcsszó- vagy hasonlóságalapú keresés helyett szemantikai kapcsolatokat használ a kereséshez és a következtetéshez, így pontosabb információkeresést és válaszokat kaphatunk az AI-tól.

Emellett, mivel tudásgráf vagy szemantikai hálózat formájában tárolja az adatokat, könnyen folyamatosan bővíthető és kiegészíthető.

A Clevi az AI-átalakulás korában felismerte a RAG-rendszerek korlátait, és egy szemantikus adatbázis, valamint saját AI-modellek segítségével képessé vált arra, hogy ügyfelei számára gyorsabban biztosítson pontosabb és megbízhatóbb adatokat.

A Clevi AI-rendszere bármilyen környezetben, a szakterület típusától függetlenül képes értékessé tenni ügyfelei értékes adatait.

A Clevi a jövőben is mindent megtesz annak érdekében, hogy maximalizálja ügyfelei adatainak értékét, és innovatív AI-élményt nyújtson.

Tapasztalja meg az új AI jövőjét a Clevivel.

Érdeklődés és demókérés: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Vissza a sajtószobába
CLEVI

Nyelv és régió

A gépi fordítással készült nyelvek meg vannak jelölve. Az elérhetőség a közzétett webhelycsomagot követi.

136 nyelv

Ajánlott

1

Kelet-Ázsia

7

Délkelet-Ázsia

11

Dél-Ázsia

18

Közép-Ázsia

5

Közel-Kelet és Kaukázus

10

Nyugat-Európa és Dél-Európa

16

Egyesült Királyság és Írország

4

Észak-Európa

10

Közép-Európa és a Balkán

14

Kelet-Európa

5

Kelet-Afrika

8

Nyugat-Afrika és Közép-Afrika

9

Afrika déli része

8

Amerika

5

Óceánia

5
Clevi szemantikus adatbázis — CLEVI