Navorsing

Clevi Semantiese Databasis

Wanneer KI in werklike werk geïmplementeer word, is een van die grootste bekommernisse die verskynsel van katastrofiese vergeetagtigheid (Catastrophic Forgetting) wat ontstaan wanneer bestaande aangeleerde kennis met nuwe data verfyn word.

1. Beperkings van Catastrophic Forgetting en RAG

Wanneer KI in werklike werk geïmplementeer word, is een van die grootste bekommernisse die verskynsel van katastrofiese vergeetagtigheid (Catastrophic Forgetting) wat ontstaan wanneer bestaande aangeleerde kennis met nuwe data verfyn word.

Dit is ’n verskynsel waar KI gebaseer op neurale netwerke die kennis of patrone wat dit voorheen geleer het, vinnig verloor terwyl dit nuwe inligting aanleer.

Byvoorbeeld, as ’n oopbron-LLM met data van ’n spesifieke onderneming verfyn word, kan algemene kennis of taalvermoë verswak.

Om hierdie probleem te vermy, word die tegnologie RAG(Retrieval-Augmented Generation) wyd gebruik, maar RAG het ook beperkings.

Hoofteksprent

Vernaamste beperkings van RAG

  • Onvoldoende verwerking van gestruktureerde data (Gestruktureerde Data QA): RAG-stelsels is hoofsaaklik vir ongestruktureerde teksdokumente geoptimaliseer en kan dus nie die betekenis en verhoudings van gestruktureerde data (tabelle, databasisse, sigblaaie, ens.) behoorlik verstaan of benut nie.
  • Beperkings van komplekse PDF's/ongestruktureerde dokumente (Komplekse PDF's): In komplekse PDF-dokumente (insluitend tabelle, veelkolomuitlegte, beelde, ens.) kan inligting tydens die chunking (verdelings-)proses verlore gaan of die konteks verdraai word. Gevolglik word belangrike data moontlik nie geïndekseer nie, of word dit moeilik om te soek.
  • Afwesigheid van 'n Fallback-rugsteunmodel (Fallback-model(le)): Wanneer die RAG-stelsel nie 'n geskikte antwoord kan vind nie, is die logika om na 'n alternatiewe (rugsteun-)model oor te skakel onvoldoende of ondoeltreffend. Gevolglik word geen bevredigende alternatief aan die gebruiker gebied wanneer die antwoord misluk nie.
  • Sekuriteitskwesbaarhede (LLM-sekuriteit): Beskerming teen sekuriteitskwesbaarhede van die LLM self (prompt-inspuiting, datalekkasie, ens.) is onvoldoende, wat die risiko inhou dat sensitiewe inligting blootgestel word.
  • Onvoldoende skaalbaarheid (Skaalbaarheid van data-inname): Skaalbaarheidsprobleme ontstaan tydens die indeksering en berging van groot hoeveelhede data. Namate die hoeveelheid data toeneem, verswak die spoed van chunking, berging en soektog, en neem die stelsellading toe.
  • Ontbrekende belangrike inligting (Ontbrekende inhoud): Belangrike inhoud uit dokumente word dikwels tydens die chunking-proses weggelaat of nie geïndekseer nie. Gevolglik kan gebruikers nie die inligting vind waarna hulle soek nie.
  • Ontbrekende topposisie-resultate (Gemiste topposisie): Die chunk wat werklik die mees relevant is (die topposisie) kan in die soekresultate ontbreek. Moontlike oorsake sluit die beperkings van die soekalgoritme, swak inbeddingskwaliteit en rangskikkingsfoute in.
  • Kontekswanpassing (Nie in konteks nie): Die opgespoorde chunk pas dikwels nie by die werklike konteks van die vraag nie. Dit is 'n beperking van soektogte wat bloot op ooreenkoms gebaseer is, met onvoldoende semantiese verbondenheid.
  • Formaatfout (Verkeerde formaat): Die formaat van die opgespoorde chunk kan ongeskik wees vir verwerking deur die LLM, of kan verskil van die antwoordformaat wat die gebruiker verlang. Byvoorbeeld, 'n tabel kan na teks omgeskakel word, wat die inligting verdraai.
  • Mislukte inligtingonttrekking (Nie onttrek nie): Die nodige inligting word moontlik nie behoorlik uit die chunk onttrek nie, of die LLM herken die inligting nie. Dit gebeur dikwels met komplekse sinstrukture, tabelle, beelde, ens.
  • Ongeskikte omvang/diepte van inligting (Onjuiste spesifisiteit): Die antwoord kan te algemeen wees met betrekking tot die vraag, of inteendeel, buitensporig spesifiek wees en dus nie by die gebruiker se werklike behoeftes pas nie. Dit is moeilik om die omvang en diepte van die inligting aan te pas.
  • Onvolledige antwoord (Onvolledig): Die uiteindelik gegenereerde antwoord kan onvolledig wees of slegs gedeeltelike inligting verskaf, sodat dit nie voldoende aan die gebruiker se behoeftes voldoen nie. Moontlike oorsake is dat inligting uit verskeie chunks nie saamgevoeg word nie, of dat die LLM slegs 'n gedeelte daarvan benut.

Omdat RAG op hierdie manier buitensporig staatmaak op eenvoudige vektorooreenkomstigheidsoektogte en chunk-gebaseerde indeksering, is die beperkings daarvan in werklike werk duidelik wat betref betroubaarheid, skaalbaarheid en akkuraatheid.

2. Clevi se semantiese databasis wat die beperkings van RAG oorkom

Om hierdie beperkings te oorkom, het Clevi die volgende generasie KI-kennisinfrastruktuur, geoptimaliseer vir semantiese verbindings, komplekse redenasie en bewysgebaseerde antwoorde, Clevi Semantic Database, ontwikkel.

Dit is ’n oplossing wat moontlik gemaak word deurdat ons ons eie Reasoning-modelle, multimodale KI en agentgebaseerde KI-modelle almal besit, en dit is een van Clevi se kragtige tegnologieë wat KI in staat stel om werklik in die werklike wêreld nuttig te wees.

By wyse van spreke: as die databasis waarin inligting gestoor word ’n biblioteek is, kan jy aan Clevi se semantiese databasis dink as ’n uiters bekwame bibliotekaris. (Wanneer jy die bibliotekaris vir die nodige inligting vra, kan jy ’n akkurate en vinnige antwoord ontvang.)

Gebruikers kan te eniger tyd nuwe inligting by die biblioteek voeg en die nodige inligting oproep.

Daarbenewens kan databasisweergawebeheer en toegangsregte volgens jou voorkeure ingestel word.

Omdat elke handeling van die bibliotekaris as ’n logboek (rekord) bewaar word, kan dit reggestel word selfs al vind daar ’n fout plaas.

Hoofteksprent

<Clevi Semantic Database Structure>

Belangrikste kenmerke en tegnologiese struktuur

Semantiese databerging

  • Stoor semantiese verhoudings tussen data (konteks, hiërargie, oorsaaklikheid, ens.) in ’n grafiekdatabasis, eerder as in ’n eenvoudige chunk-vektorDB
  • Maklik om uit te brei en aan te vul in die vorm van ’n kennisgrafiek/semantiese netwerk

Hibriede soektog en redenasie

  • CTA+Context Query: Verwerk die konteks (Context) van die navraag en die CTA saam
  • Hybrid Retrieval: Kombineer vektorooreenkomstigheid met reël-/grafiekgebaseerde soektogte
  • Intelligent Folder Hits: Verken outomaties vouers/kategorieë wat semanties verwant is

Gelyktydige multimodale verwerking

  • Gelyktydige interpretasie van verskeie datatipes, insluitend teks, beelde, tabelle en stem, deur TextReader Pool, VisionReader Pool, ens.
  • Terwyl bestaande RAG-stelsels hoofsaaklik slegs teks kan verwerk, beskik semantiese databasisse oor uitstekende multimodale verwerkingsvermoëns

Bewysgebaseerde antwoorde en betroubaarheidsverifikasie

  • Dokumentsamevattings en aanhalings, tabelbevindinge, ens. outomatiese generering van dokumentsamevattings en bronne
  • Merge & Verify: Semantiese integrasie en betroubaarheidsverifikasie van inligting uit verskeie bronne
  • Evidence Pack: Verskaffing van bewysgebaseerde antwoordpakkette

Komplekse redenasie en beplanner

  • Planner/DAG: Stap-vir-stap-beplanning en DAG (Directed Acyclic Graph)-gebaseerde redenasie vir komplekse navrae

Geïntegreerde agent-argitektuur

  • cip-5-agent Supervisor: Die topvlak-agent wat die volledige soek-, redenasie- en integrasieprosesse bestuur en koördineer
Beeld in die hoofteks

3. Strukturele opsomming en vergelyking

Om dit op te som, ontvang Semantic DB data in verskeie vorme (spraak, teks, beelde, video, ens.) en klassifiseer dit as kennis deur nie net eenvoudige Chunks nie, maar ook die semantiese verhoudings tussen data (konteks, hiërargie, oorsaak en gevolg, ens.) te verbind.

Op grond hiervan maak dit, anders as RAG, wat op sleutelwoorde/ooreenkomste gebaseer is, gebruik van semantiese verbindings vir soektogte en redenasie, waardeur meer akkurate inligtingsoektogte en antwoorde van KI verkry kan word.

Boonop word dit in die vorm van ’n kennisgrafiek/semantiese netwerk gestoor, wat voortdurende uitbreiding en aanvulling vergemaklik.

Clevi het die beperkings van RAG-stelsels in die era van die groot KI-omwenteling ontdek en kan kliënte nou vinnig van meer akkurate en betroubare data voorsien deur ’n semantiese databasis en ’n eie KI-model wat hierdie probleme kan oplos.

Clevi se KI-stelsel kan, ongeag die omgewing of domein, u kliënte se waardevolle data waardevol maak.

Clevi sal voortgaan om sy bes te doen om die waarde van kliënte se data te maksimeer en innoverende KI-ervarings te bied.

Ervaar asseblief saam met Clevi die toekoms van nuwe KI.

Navrae en demo-versoeke: [email protected]

Kopiereg© 2025 Clevi Inc. Alle regte voorbehou.

Terug na die nuuskamer
CLEVI

Taal en streek

Masjienvertaalde tale word gemerk. Beskikbaarheid volg die gepubliseerde werfbundel.

136 tale

Aanbeveel

1

Oos-Asië

7

Suidoos-Asië

11

Suid-Asië

18

Sentraal-Asië

5

Midde-Ooste en die Kaukasus

10

Wes-Europa en Suid-Europa

16

Verenigde Koninkryk en Ierland

4

Noord-Europa

10

Sentraal-Europa en die Balkan

14

Oos-Europa

5

Oos-Afrika

8

Wes-Afrika en Midde-Afrika

9

Suider-Afrika

8

Amerikas

5

Oseanië

5
Clevi Semantiese Databasis — CLEVI