Undersyk

Clevi Semantic Database

As AI yn echte wurkprosessen ynfierd wurdt, is ien fan de grutste soargen it ferskynsel fan katastrofysk ferjitten (Catastrophic Forgetting) dat ûntstiet as besteande learde kennis mei nije gegevens fynôfstimd wurdt.

1. De beheiningen fan Catastrophic Forgetting en RAG

As AI yn echte wurkprosessen ynfierd wurdt, is ien fan de grutste soargen it ferskynsel fan katastrofysk ferjitten (Catastrophic Forgetting) dat ûntstiet as besteande learde kennis mei nije gegevens fynôfstimd wurdt.

Dit is it ferskynsel dat AI op basis fan neurale netwurken by it learen fan nije ynformaasje earder learde kennis of patroanen ynienen ferliest.

As bygelyks in iepenboarne-LLM fynôfstimd wurdt mei gegevens fan in bepaald bedriuw, kinne algemiene kennis of taalfeardigens efterútgean.

Om dit probleem te foarkommen, wurdt de technology RAG(Retrieval-Augmented Generation) breed brûkt, mar ek RAG hat syn beheiningen.

Ofbylding yn de haadtekst

Typyske beheiningen fan RAG

  • Net genôch ferwurking fan strukturearre gegevens (Structured Data QA): RAG-systemen binne benammen optimalisearre foar net-strukturearre tekstdokuminten en kinne de betsjutting en relaasjes fan strukturearre gegevens (tabellen, databases, spreadsheets ensfh.) net goed begripe of brûke.
  • Beheiningen by komplekse PDF’s/net-strukturearre dokuminten (Complex PDFs): By komplekse PDF-dokuminten (mei tabellen, meardere kolommen, ôfbyldingen ensfh.) kin ynformaasje ferlern gean of de kontekst ferfoarme wurde tidens it chunking-proses (opdielen). Dêrtroch kinne wichtige gegevens net yndeksearre wurde of lestich te finen wêze.
  • Gjin Fallback-model (Fallback Model(s)): As in RAG-systeem gjin passend antwurd fine kin, is de logika om oer te skeakeljen nei in alternatyf (backup-)model net genôch of net effisjint. Dêrtroch wurdt by in mislearre antwurd gjin alternatyf oanbean dat de brûker foldocht.
  • Feiligenskwetsberheden (LLM Security): De beskerming tsjin feiligenskwetsberheden fan LLM’s sels (prompt-ynjeksje, datalekken ensfh.) is net genôch, wêrtroch it risiko bestiet dat gefoelige ynformaasje bleatsteld wurdt.
  • Beheinde skalearberens (Data Ingestion Scalability): By it yndeksearjen en opslaan fan grutte hoemannichten gegevens ûntsteane problemen mei skalearberens. As de hoemannichte gegevens tanimt, nimme de snelheid fan chunking, opslach en sykjen ôf en nimt de systeemlêst ta.
  • Wichtige ynformaasje ûntbrekt (Missing Content): Wichtige ynhâld út dokuminten giet faak ferlern tidens it chunking-proses of wurdt net yndeksearre. Dêrtroch kin de brûker de winske ynformaasje net fine.
  • Heechste rang ûntbrekt (Missed Top Ranked): It meast relevante chunk (mei de heechste rang) kin yn de sykresultaten ûntbrekke. Mooglike oarsaken binne beheiningen fan it sykalgoritme, mindere kwaliteit fan embeddings en rangearingsflaters.
  • Net yn de kontekst (Not in Context): It komt faak foar dat it fûne chunk net oerienkomt mei de kontekst fan de eigentlike fraach. Dit komt troch de beheiningen fan sykjen op basis fan allinnich oerienkomst yn gelikenis, wêrtroch semantyske ferbining ûntbrekt.
  • Ferkeard formaat (Wrong Format): It formaat fan it fûne chunk kin net geskikt wêze foar ferwurking troch de LLM of ôfwike fan it antwurdformaat dat de brûker wol. Sa kin in tabel bygelyks nei tekst omset wurde, wêrtroch de ynformaasje ferfoarme wurdt.
  • Ynformaasje net ekstrahearre (Not Extracted): De nedige ynformaasje wurdt net goed út it chunk ekstrahearre, of de LLM werkent de ynformaasje net. Dit bart faak by komplekse sinstruktueren, tabellen en ôfbyldingen.
  • Ferkearde omfang/djipte fan ynformaasje (Incorrect Specificity): It antwurd is te algemien foar de fraach of krekt te spesifyk, en slút dêrtroch net oan by de eigentlike behoeften fan de brûker. It is lestich om de omfang en djipte fan de ynformaasje goed ôf te stimmen.
  • Unfolslein antwurd (Incomplete): It úteinlik generearre antwurd is ûnfolslein of befettet mar in part fan de ynformaasje, en foldocht dêrtroch net genôch oan de behoeften fan de brûker. Mooglike oarsaken binne dat ynformaasje út meardere chunks net gearfoege wurdt of dat de LLM mar in part dêrfan brûkt.

Om't RAG op dizze manier tefolle ôfhinklik is fan ienfâldich sykjen nei fektoroerienkomst en chunk-basearre yndeksearring, binne de beheiningen op it mêd fan betrouberens, skalearberens en krektens yn 'e praktyk dúdlik.

2. Clevi's semantyske databank dy't de beheiningen fan RAG oerwûn hat

Om dizze beheiningen te oerwinnen, hat Clevi de folgjende generaasje AI-kennisynfrastruktuer, optimalisearre foar semantyske ferbiningen, komplekse redenearring en antwurden basearre op bewiis, ûntwikkele: Clevi Semantic Database.

Dit is in oplossing dy't mooglik is om't wy ús eigen Reasoning-model, multimodale AI en agent-basearre AI-modellen allegear yn eigen hûs hawwe, en it is ien fan Clevi's krêftige technologyen dy't AI echt nuttich meitsje yn 'e echte wrâld.

As analogy: as de databank dêr't de ynformaasje yn opslein is in biblioteek is, kinne jo Clevi's semantyske databank beskôgje as in biblioteek mei in tige bekwame biblioteker. (As jo de biblioteker om de nedige ynformaasje freegje, krije jo in krekt en fluch antwurd.)

Brûkers kinne op elk momint nije ynformaasje oan 'e biblioteek tafoegje en de nedige ynformaasje opfreegje.

Ek kinne se ferzjebehear en tagongsrjochten foar de gegevens nei winsk ynstelle.

Om't alle hannelingen fan 'e biblioteker as logs (records) bewarre wurde, kinne flaters ek korrizjearre wurde as se foarkomme.

Ofbylding yn 'e haadtekst

<Clevi Semantic Database Structure>

Wichtichste funksjes en technyske struktuer

Semantyske gegevensopslach

  • Yn stee fan in ienfâldige chunk-fektorDB wurde semantyske relaasjes tusken gegevens (kontekst, hiërargy, kausaliteit, ensfh.) opslein yn in grafyk-DB
  • Maklik út te wreidzjen en oan te foljen yn 'e foarm fan in kennigrafyk/semantysk netwurk

Hybride sykjen en redenearring

  • CTA+Context Query: reflektearret sawol de kontekst (Context) fan 'e fraach as de CTA
  • Hybrid Retrieval: kombinearret sykjen op basis fan fektoroerienkomst mei sykjen op basis fan regels/grafiken
  • Intelligent Folder Hits: fynt automatysk mappen/kategoryen dy't semantysk besibbe binne

Simultane multimodale ferwurking

  • Ynterpretearret tagelyk ferskate soarten gegevens, lykas tekst, ôfbyldingen, tabellen en audio, mei ûnder oaren TextReader Pool en VisionReader Pool
  • Wylst besteande RAG meastentiids allinnich tekst ferwurkje kin, blinkt de semantyske databank út yn multimodale ferwurking

Antwurden basearre op bewiis en ferifikaasje fan betrouberens

  • Dokumintgearfettings en boarnen, automatyske oanmeitsjen fan tabelbefiningen en oare gearfettings en boarnen fan dokuminten
  • Merge & Verify: semantyske yntegraasje en betrouberheidsferifikaasje fan ynformaasje út meardere boarnen
  • Evidence Pack: it leverjen fan antwurdpakketten basearre op bewiis

Komplekse redenearring en planner

  • Planner/DAG: stap-foar-stapplanning en redenearring op basis fan in DAG (Directed Acyclic Graph) foar komplekse fragen

Yntegrearre agint-arsjitektuer

  • cip-5-agent Supervisor: de boppesteande agint dy't it folsleine proses fan sykjen, redenearjen en yntegraasje beheart en koördinearret
Ofbylding yn de haadtekst

3. Gearfetting en ferliking fan de struktuer

Gearfette: in Semantic DB nimt gegevens yn ferskate foarmen (spraak, tekst, ôfbyldingen, fideo en sa fierder) as ynfier en klassifisearret kennis troch net allinnich ienfâldige Chunks, mar ek de semantyske relaasjes tusken gegevens (kontekst, hiërargy, kausaliteit en sa fierder) te ferbinen.

Op basis dêrfan kin AI krekter ynformaasje ophelje en antwurden jaan, om't it, oars as RAG, dat sykjen en redenearjen basearret op kaaiwurden en oerienkomst, gebrûk makket fan semantyske ferbiningen.

Om't de gegevens ek yn de foarm fan in kennisgraaf of semantysk netwurk opslein wurde, is trochgeande útwreiding en oanfolling maklik.

Clevi hat yn it tiidrek fan de grutte AI-transformaasje de beheiningen fan RAG-systemen ûntdutsen en kin klanten no, troch in semantyske databank en eigen AI-modellen dy't dizze problemen oplosse, fluch krekter en betrouberder gegevens leverje.

It AI-systeem fan Clevi kin yn elke omjouwing en ûnôfhinklik fan it domein de wearde fan de weardefolle gegevens fan klanten ferheegje.

Ek yn de takomst sil Clevi alles dwaan om de wearde fan klantgegevens te maksimalisearjen en ynnovative AI-ûnderfiningen te bieden.

Belibje tegearre mei Clevi de nije takomst fan AI.

Kontakt en in demo oanfreegje: [email protected]

Copyright© 2025 Clevi Inc. Alle rjochten foarbeholden.

Werom nei de nijsredaksje
CLEVI

Taal en regio

Talen dy’t troch masine oerset binne, wurde markearre. De beskikberens folget it publisearre sitepakket.

136 talen

Oanrekommandearre

1

East-Azië

7

Sûdoost-Azië

11

Sûd-Azië

18

Sintraal-Azië

5

Midden-Easten en de Kaukasus

10

West-Europa en Sûd-Europa

16

Verenigd Koninkrijk en Ierlân

4

Noard-Europa

10

Midden-Europa en de Balkan

14

East-Europa

5

East-Afrika

8

West-Afrika en Sintraal-Afrika

9

Sûdelijk Afrika

8

Amerika

5

Oceanië

5
Clevi Semantic Database — CLEVI