Istraživanje

Clevi semantička baza podataka

Kada se AI uvodi u stvarne poslovne procese, jedan od najvećih izazova je fenomen katastrofalnog zaboravljanja (Catastrophic Forgetting) koji se javlja pri dodatnom učenju prethodno stečenog znanja na novim podacima.

1. Ograničenja Catastrophic Forgettinga i RAG-a

Kada se AI uvodi u stvarne poslovne procese, jedan od najvećih izazova je fenomen katastrofalnog zaboravljanja (Catastrophic Forgetting) koji se javlja pri dodatnom učenju prethodno stečenog znanja na novim podacima.

To je fenomen u kojem AI temeljen na neuronskim mrežama tijekom učenja novih informacija naglo gubi prethodno usvojeno znanje ili obrasce.

Na primjer, ako se otvoreni LLM dodatno uči na podacima određene tvrtke, mogu se pogoršati opće znanje ili jezične sposobnosti.

Kako bi se izbjegao ovaj problem, široko se primjenjuje tehnologija RAG(Retrieval-Augmented Generation), no i RAG ima svoja ograničenja.

Slika u glavnom tekstu

Tipična ograničenja RAG-a

  • Nedostatna obrada strukturiranih podataka (Structured Data QA): RAG sustavi uglavnom su optimizirani za nestrukturirane tekstualne dokumente pa ne mogu pravilno razumjeti ili iskoristiti značenje i odnose strukturiranih podataka (tablica, baza podataka, proračunskih tablica itd.).
  • Ograničenja složenih PDF-ova/nestrukturiranih dokumenata (Complex PDFs): Kod složenih PDF dokumenata (s tablicama, više stupaca, slikama itd.) tijekom postupka chunking (dijeljenja) može doći do gubitka informacija ili narušavanja konteksta. Zbog toga se važni podaci možda neće indeksirati ili će ih biti teško pretražiti.
  • Nedostatak rezervnog modela (Fallback Model(s)): Kada RAG sustav ne pronađe odgovarajući odgovor, logika za prebacivanje na zamjenski (rezervni) model može biti nedostatna ili neučinkovita. Zbog toga se korisniku u slučaju neuspješnog odgovora ne pruža zadovoljavajuća alternativa.
  • Sigurnosne ranjivosti (LLM Security): Zaštita od sigurnosnih ranjivosti samog LLM-a (ubrizgavanje upita, curenje podataka itd.) može biti nedostatna, što stvara rizik od izlaganja osjetljivih informacija.
  • Nedostatak skalabilnosti (Data Ingestion Scalability): Tijekom indeksiranja i pohrane velikih količina podataka pojavljuju se problemi sa skalabilnošću. Kako količina podataka raste, usporavaju se chunking, pohrana i pretraživanje, a opterećenje sustava raste.
  • Izostanak važnih informacija (Missing Content): Važan sadržaj iz dokumenta često se izgubi tijekom postupka chunking ili se ne indeksira. Zbog toga korisnik ne može pronaći željene informacije.
  • Izostanak najviše rangiranih rezultata (Missed Top Ranked): U rezultatima pretraživanja može nedostajati chunk koji je zapravo najrelevantniji (najviše rangiran). Uzroci mogu biti ograničenja algoritma pretraživanja, smanjena kvaliteta ugrađivanja i pogreške u rangiranju.
  • Nesklad s kontekstom (Not in Context): Pretraženi chunk često nije usklađen s kontekstom stvarnog pitanja. Zbog ograničenja pretraživanja temeljenog samo na sličnosti nedostaje semantička povezanost.
  • Pogrešan format (Wrong Format): Format pretraženog chunka može biti neprikladan za obradu u LLM-u ili se može razlikovati od formata odgovora koji korisnik želi. Na primjer, informacije se mogu iskriviti kada se tablica pretvori u tekst.
  • Neuspješno izdvajanje informacija (Not Extracted): Potrebne informacije možda se neće pravilno izdvojiti iz chunka ili ih LLM možda neće prepoznati. To se često događa kod složene strukture rečenica, tablica i slika.
  • Neodgovarajući opseg/dubina informacija (Incorrect Specificity): Odgovor može biti preopćenit ili, suprotno tome, pretjerano specifičan u odnosu na pitanje pa ne odgovara stvarnim potrebama korisnika. Teško je prilagoditi opseg i dubinu informacija.
  • Nepotpun odgovor (Incomplete): Konačno generirani odgovor može biti nepotpun ili pružiti samo dio informacija, zbog čega ne ispunjava u dovoljnoj mjeri korisničke potrebe. Uzroci mogu biti nemogućnost objedinjavanja informacija iz više chunkova ili to što LLM koristi samo dio informacija.

Kao takav, RAG ima jasna ograničenja u pogledu pouzdanosti, skalabilnosti i točnosti u stvarnom poslovnom okruženju jer se previše oslanja na jednostavno pretraživanje vektorske sličnosti i indeksiranje na temelju chunkova.

2. Clevijeva semantička baza podataka koja nadilazi ograničenja RAG-a

Kako bi prevladao ta ograničenja, Clevi je razvio sljedeću generaciju AI podatkovne infrastrukture optimizirane za semantičko povezivanje, složeno zaključivanje i odgovore utemeljene na dokazima, Clevi Semantic Database.

To je rješenje moguće zahvaljujući tome što posjedujemo vlastite Reasoning modele, multimodalni AI i agentske AI modele, a riječ je o jednoj od Clevijevih snažnih tehnologija koja omogućuje da AI doista bude koristan u stvarnom svijetu.

Ako bazu podataka u kojoj su pohranjene informacije usporedimo s knjižnicom, Clevijevu semantičku bazu podataka možemo zamisliti kao knjižnicu s vrlo sposobnim knjižničarem. (Kada od knjižničara zatražite potrebne informacije, možete dobiti točan i brz odgovor.)

Korisnici mogu u bilo kojem trenutku dodavati nove informacije u knjižnicu i dohvaćati potrebne informacije.

Osim toga, upravljanje verzijama podataka i prava pristupa mogu se postaviti prema želji.

Budući da se svaka knjižničareva radnja bilježi u zapisniku, moguće je ispraviti pogreške čak i ako do njih dođe.

Slika glavnog sadržaja

<Clevi Semantic Database Structure>

Ključne značajke i tehnička struktura

Semantička pohrana podataka

  • Za razliku od jednostavnog vektorskog DB-a temeljenog na chunkovima, semantički odnosi između podataka (kontekst, hijerarhija, uzročnost itd.) pohranjuju se u grafičkom DB-u
  • Jednostavno proširivanje i dopunjavanje u obliku grafa znanja/semantičke mreže

Hibridno pretraživanje i zaključivanje

  • CTA+Context Query: istodobno uzima u obzir kontekst (Context) upita i CTA
  • Hybrid Retrieval: kombinira vektorsku sličnost s pretraživanjem na temelju pravila/grafa
  • Intelligent Folder Hits: automatski pronalazi semantički povezane mape/kategorije

Istodobna multimodalna obrada

  • Istodobno tumačenje različitih vrsta podataka, uključujući tekst, slike, tablice i govor, putem TextReader Poola, VisionReader Poola i drugih komponenti
  • Dok postojeći RAG uglavnom može obrađivati samo tekst, semantička baza podataka izvrsna je u multimodalnoj obradi

Odgovori utemeljeni na dokazima i provjera pouzdanosti

  • Sažeci dokumenata i citati, nalazi u tablicama itd. – automatsko generiranje sažetaka dokumenata i izvora
  • Merge & Verify: semantička integracija informacija iz više izvora i provjera pouzdanosti
  • Evidence Pack: pružanje paketa odgovora utemeljenih na dokazima

Složeno zaključivanje i planer

  • Planner/DAG: planiranje korak po korak i zaključivanje na temelju DAG-a (Directed Acyclic Graph) za složene upite

Integrirana agentska struktura

  • cip-5-agent Supervisor: najviši agent koji upravlja i koordinira cjelokupnim procesom pretraživanja, zaključivanja i integracije
Slika u glavnom tekstu

3. Sažetak strukture i usporedba

Ukratko, Semantic DB prima podatke u različitim oblicima (glas, tekst, slike, videozapisi itd.) i klasificira znanje povezivanjem ne samo jednostavnih dijelova podataka, već i semantičkih odnosa među podacima (kontekst, hijerarhija, uzročnost itd.).

Na temelju toga omogućuje pretraživanje i zaključivanje korištenjem semantičkih poveznica, a ne pretraživanje temeljeno na ključnim riječima ili sličnosti poput RAG-a, pa od umjetne inteligencije možete dobiti preciznije pretraživanje informacija i odgovore.

Osim toga, budući da se pohranjuje u obliku grafa znanja ili semantičke mreže, lako ga je kontinuirano proširivati i nadopunjavati.

CLEVI je u doba velike transformacije umjetnom inteligencijom prepoznao ograničenja RAG sustava te je, zahvaljujući semantičkoj bazi podataka i vlastitim AI modelima koji ta ograničenja mogu riješiti, omogućio korisnicima da brzo dobiju preciznije i pouzdanije podatke.

CLEVI-jevi AI sustavi mogu, bez obzira na okruženje ili vrstu domene, vrijedne podatke naših korisnika pretvoriti u vrijedne uvide.

CLEVI će se i ubuduće truditi maksimalno povećati vrijednost podataka svojih korisnika i pružiti inovativno AI iskustvo.

Pozivamo vas da zajedno s CLEVI-jem iskusite budućnost nove umjetne inteligencije.

Upiti i zahtjevi za demonstraciju: [email protected]

Copyright© 2025 Clevi Inc. Sva prava pridržana.

Natrag na redakciju
CLEVI

Jezik i regija

Strojno prevedeni jezici označeni su. Dostupnost prati objavljeni paket web-mjesta.

136 jezika

Preporučeno

1

Istočna Azija

7

Jugoistočna Azija

11

Južna Azija

18

Srednja Azija

5

Bliski istok i Kavkaz

10

Zapadna Europa i Južna Europa

16

Ujedinjeno Kraljevstvo i Irska

4

Sjeverna Europa

10

Srednja Europa i Balkan

14

Istočna Europa

5

Istočna Afrika

8

Zapadna Afrika i Središnja Afrika

9

Južna Afrika

8

Amerike

5

Oceanija

5
Clevi semantička baza podataka — CLEVI