1. Begrensningene ved Catastrophic Forgetting og RAG
Når AI tas i bruk i faktiske arbeidsprosesser, er et av de største problemene fenomenet katastrofal glemsel (Catastrophic Forgetting), som oppstår når tidligere innlært kunnskap finjusteres med nye data.
Dette er et fenomen der nevrale nettverksbaserte AI-systemer brått mister kunnskap eller mønstre de tidligere har lært, mens de lærer ny informasjon.
Hvis man for eksempel finjusterer en åpen kildekode-LLM med data fra en bestemt virksomhet, kan generell allmennkunnskap eller språkferdigheter bli svekket.
For å unngå dette problemet brukes teknologien RAG (Retrieval-Augmented Generation) i stor utstrekning, men også RAG har begrensninger.
Typiske begrensninger ved RAG
- Utilstrekkelig behandling av strukturerte data (Structured Data QA): RAG-systemer er hovedsakelig optimalisert for ustrukturerte tekstdokumenter og klarer derfor ikke alltid å forstå eller utnytte betydningen og relasjonene i strukturerte data (tabeller, databaser, regneark osv.) på riktig måte.
- Begrensninger ved komplekse PDF-er/ustrukturerte dokumenter (Complex PDFs): Komplekse PDF-dokumenter (inkludert tabeller, flere spalter, bilder osv.) kan miste informasjon eller få forvrengt kontekst under chunking (oppdeling). Dette kan føre til at viktige data ikke blir indeksert eller blir vanskelige å søke etter.
- Mangel på en Fallback-modell (Fallback Model(s)): Når RAG-systemet ikke finner et passende svar, er logikken for å bytte til en alternativ (backup-)modell utilstrekkelig eller ineffektiv. Som følge av dette tilbys ikke brukeren et tilfredsstillende alternativ når svar genereres uten hell.
- Sikkerhetssårbarheter (LLM Security): Utilstrekkelig beskyttelse mot sikkerhetssårbarheter i selve LLM-en (prompt injection, datalekkasjer osv.) medfører risiko for at sensitiv informasjon eksponeres.
- Manglende skalerbarhet (Data Ingestion Scalability): Det oppstår skaleringsproblemer under indeksering og lagring av store datamengder. Etter hvert som datamengden øker, reduseres hastigheten på chunking, lagring og søk, samtidig som belastningen på systemet øker.
- Manglende viktig informasjon (Missing Content): Viktig innhold i dokumenter blir ofte utelatt under chunking eller blir ikke indeksert. Dette gjør at brukeren ikke kan søke etter informasjonen de trenger.
- Manglende treff blant de høyest rangerte (Missed Top Ranked): De chunk-ene som faktisk er mest relevante (høyest rangerte), kan mangle i søkeresultatene. Årsakene kan være begrensninger i søkealgoritmen, redusert kvalitet på embedding-er eller rangeringsfeil.
- Manglende kontekst (Not in Context): Den søkte chunk-en samsvarer ofte ikke med konteksten i det faktiske spørsmålet. Dette skyldes begrensningene ved søk basert på enkel likhet, som gir utilstrekkelig semantisk sammenheng.
- Feil format (Wrong Format): Formatet på den søkte chunk-en kan være uegnet for behandling av LLM-en eller avvike fra formatet brukeren ønsker på svaret. For eksempel kan informasjon bli forvrengt når en tabell konverteres til tekst.
- Informasjon ikke hentet ut (Not Extracted): Nødvendig informasjon blir ikke hentet ut på riktig måte fra chunk-en, eller LLM-en klarer ikke å gjenkjenne informasjonen. Dette skjer ofte ved komplekse setningsstrukturer, tabeller, bilder osv.
- Uegnet informasjonsomfang/-dybde (Incorrect Specificity): Svaret kan være for overordnet eller omvendt for detaljert i forhold til spørsmålet, og dermed ikke samsvare med brukerens faktiske behov. Det er vanskelig å justere informasjonsomfanget og -dybden.
- Ufullstendig svar (Incomplete): Det endelige svaret kan være ufullstendig eller bare inneholde deler av informasjonen, slik at brukerens behov ikke blir tilstrekkelig dekket. Årsakene kan være at informasjon fra flere chunk-er ikke blir sammenstilt, eller at LLM-en bare bruker deler av informasjonen.
Siden RAG på denne måten er overdrevent avhengig av enkel vektorsimilaritetssøk og chunk-basert indeksering, har det tydelige begrensninger i faktisk arbeid når det gjelder pålitelighet, skalerbarhet og nøyaktighet.
2. CLEVI Semantic Database, som overvinner RAGs begrensninger
For å overvinne disse begrensningene har CLEVI utviklet Clevi Semantic Database, en neste generasjons AI-kunnskapsinfrastruktur optimalisert for semantiske forbindelser, sammensatt resonnering og evidensbaserte svar.
Dette er en løsning som er mulig fordi CLEVI har egne Reasoning-modeller, multimodal AI og agentbaserte AI-modeller, og er en av CLEVIs kraftige teknologier som gjør AI virkelig nyttig i den virkelige verden.
Som en analogi: Hvis databasen der informasjonen er lagret, er et bibliotek, kan du tenke på CLEVIs semantiske database som et bibliotek med en svært dyktig bibliotekar. (Når du ber bibliotekaren om nødvendig informasjon, får du et nøyaktig og raskt svar.)
Brukere kan når som helst legge til ny informasjon i biblioteket og hente frem informasjonen de trenger.
Du kan også konfigurere versjonsstyring og tilgangstillatelser for dataene etter behov.
Alle handlingene bibliotekaren utfører, blir lagret i logger (opptegnelser), slik at de kan korrigeres selv om det oppstår feil.
<Clevi Semantic Database Structure>
Viktige funksjoner og teknisk struktur
Semantisk datalagring
- Lagrer semantiske relasjoner mellom data (kontekst, hierarki, årsakssammenheng osv.) i en grafdatabase, i stedet for i en enkel chunk-vektorDB
- Enkelt å utvide og supplere i form av kunnskapsgrafer/semantiske nettverk
Hybrid søking og resonnering
- CTA+Context Query: Tar hensyn til både spørringens kontekst (Context) og CTA
- Hybrid Retrieval: Kombinerer vektorsimilaritetssøk med regel-/grafbasert søk
- Intelligent Folder Hits: Finner automatisk mapper/kategorier som er semantisk relaterte
Samtidig multimodal behandling
- Tolker samtidig ulike datatyper, som tekst, bilder, tabeller og tale, gjennom blant annet TextReader Pool og VisionReader Pool
- Mens eksisterende RAG hovedsakelig kan behandle tekst, har den semantiske databasen fremragende multimodal behandlingskapasitet
Evidensbaserte svar og pålitelighetsverifisering
- Doc Summaries & Citations, automatisk generering av dokumentsammendrag og kilder, blant annet tabellfunn
- Merge & Verify: semantisk integrering og pålitelighetsverifisering av informasjon fra flere kilder
- Evidence Pack: levering av evidensbaserte svarpakker
Kompleks resonnering og planlegger
- Planner/DAG: trinnvis planlegging og DAG-basert (Directed Acyclic Graph) resonnering for komplekse spørsmål
Integrert agentarkitektur
- cip-5-agent Supervisor: overordnet agent som administrerer og koordinerer hele søke-, resonnerings- og integreringsprosessen
3. Sammendrag og sammenligning av strukturen
For å oppsummere kategoriserer Semantic DB data i ulike former (tale, tekst, bilder, video osv.) ved å koble sammen ikke bare enkle chunker, men også semantiske relasjoner mellom dataene (kontekst, hierarki, årsakssammenheng osv.).
På dette grunnlaget kan AI utføre søk og resonnering ved hjelp av semantiske forbindelser, i stedet for nøkkelord- eller likhetsbaserte søk som i RAG, slik at du kan få mer nøyaktig informasjon og mer presise svar fra AI.
Siden dataene lagres i form av kunnskapsgrafer eller semantiske nettverk, er det også enkelt å utvide og supplere dem kontinuerlig.
Clevi oppdaget begrensningene ved RAG-systemer i en tid med AI-transformasjon, og gjennom en semantisk database og våre proprietære AI-modeller kan vi nå gi kundene raskere svar basert på mer nøyaktige og pålitelige data.
Clevi sitt AI-system kan gjøre kundens verdifulle data nyttige, uavhengig av domenetype og i ethvert miljø.
Clevi vil også fremover gjøre sitt ytterste for å maksimere verdien i kundenes data og levere innovative AI-opplevelser.
Opplev den nye fremtiden for AI sammen med Clevi.
Forespørsler og demoforespørsler: [email protected]
Copyright© 2025 Clevi Inc. Alle rettigheter forbeholdt.
