Forskning

Clevi-semantisk database

Når AI tages i brug i det virkelige arbejde, er en af de største bekymringer fænomenet katastrofal glemsel (Catastrophic Forgetting), som opstår, når tidligere indlært viden finjusteres med nye data.

1. Begrænsninger ved Catastrophic Forgetting og RAG

Når AI tages i brug i det virkelige arbejde, er en af de største bekymringer fænomenet katastrofal glemsel (Catastrophic Forgetting), som opstår, når tidligere indlært viden finjusteres med nye data.

Det er et fænomen, hvor neurale netværksbaserede AI-systemer hurtigt mister tidligere indlært viden eller mønstre, mens de lærer nye oplysninger.

Hvis man for eksempel finjusterer en open source-LLM med data fra en bestemt virksomhed, kan dens generelle viden eller sproglige evner blive forringet.

For at undgå dette problem anvendes teknologien RAG (Retrieval-Augmented Generation) bredt, men RAG har også sine begrænsninger.

Billede i brødteksten

Typiske begrænsninger ved RAG

  • Utilstrækkelig behandling af strukturerede data (Structured Data QA): RAG-systemer er primært optimeret til ustrukturerede tekstdokumenter og kan derfor have svært ved at forstå eller anvende betydningen og relationerne i strukturerede data (tabeller, databaser, regneark osv.) korrekt.
  • Begrænsninger ved komplekse PDF-filer/ustrukturerede dokumenter (Complex PDFs): I komplekse PDF-dokumenter (med tabeller, flere spalter, billeder osv.) kan information gå tabt, eller konteksten kan blive forvrænget under chunking (opdeling). Det kan medføre, at vigtige data ikke indekseres eller bliver vanskelige at søge frem.
  • Manglende Fallback-model (Fallback Model(s)): Når RAG-systemet ikke kan finde et passende svar, er logikken til at skifte til en alternativ (backup-)model utilstrækkelig eller ineffektiv. Derfor tilbydes brugeren ikke et tilfredsstillende alternativ, når besvarelsen mislykkes.
  • Sikkerhedssårbarheder (LLM Security): Utilstrækkelig beskyttelse mod sikkerhedssårbarheder i selve LLM'en (promptinjektion, datalækage osv.) medfører risiko for eksponering af følsomme oplysninger.
  • Manglende skalerbarhed (Data Ingestion Scalability): Der opstår skaleringsproblemer under indeksering og lagring af store datamængder. Jo større datamængden bliver, desto mere forringes hastigheden ved chunking, lagring og søgning, og belastningen på systemet øges.
  • Manglende vigtigt indhold (Missing Content): Vigtigt indhold i dokumenter kan ofte gå tabt under chunking-processen eller undlade at blive indekseret. Det betyder, at brugeren ikke kan søge efter de ønskede oplysninger.
  • Manglende topplacering (Missed Top Ranked): Den chunk, der faktisk er mest relevant (topplaceringen), kan mangle i søgeresultaterne. Årsagerne kan være begrænsninger i søgealgoritmen, forringet kvalitet af embeddings eller fejl i rangeringen.
  • Manglende kontekst (Not in Context): Den fundne chunk passer ofte ikke til den faktiske kontekst i spørgsmålet. Dette skyldes begrænsninger ved søgning baseret på simpel lighed, hvor den semantiske sammenhæng er utilstrækkelig.
  • Forkert format (Wrong Format): Formatet på den fundne chunk kan være uegnet til behandling af LLM'en eller afvige fra det svarformat, brugeren ønsker. Det kan for eksempel ske, hvis en tabel konverteres til tekst, så oplysningerne bliver forvrænget.
  • Kunne ikke udtrække oplysninger (Not Extracted): De nødvendige oplysninger udtrækkes ikke korrekt fra chunken, eller LLM'en kan ikke identificere oplysningerne. Det forekommer ofte i komplekse sætningsstrukturer, tabeller, billeder osv.
  • Uhensigtsmæssigt informationsomfang/-dybde (Incorrect Specificity): Svaret kan være for overordnet i forhold til spørgsmålet eller omvendt overdrevent specifikt, så det ikke stemmer overens med brugerens faktiske behov. Det er vanskeligt at justere informationsomfang og -dybde.
  • Ufuldstændigt svar (Incomplete): Det endeligt genererede svar kan være ufuldstændigt eller kun indeholde nogle af oplysningerne, så brugerens behov ikke dækkes tilstrækkeligt. Årsagerne kan være, at oplysninger fra flere chunks ikke sammenfattes, eller at LLM'en kun anvender en del af dem.

På grund af denne overafhængighed af simpel vektorsimilaritetssøgning og chunk-baseret indeksering har RAG klare begrænsninger i praksis med hensyn til pålidelighed, skalerbarhed og nøjagtighed.

2. Clevi Semantic Database, der overvinder RAG's begrænsninger

For at overvinde disse begrænsninger har CLEVI udviklet den næste generation af AI-vidensinfrastruktur, optimeret til semantiske forbindelser, kompleks inferens og evidensbaserede svar, Clevi Semantic Database.

Dette er en løsning, der er mulig, fordi CLEVI råder over egne Reasoning-modeller samt multimodale AI- og agentbaserede AI-modeller, og det er en af CLEVI's stærke teknologier, der gør AI praktisk nyttig i den virkelige verden.

Som analogi kan man sige, at hvis databasen, hvor oplysningerne er gemt, er et bibliotek, er CLEVI's Semantic Database som at have en yderst dygtig bibliotekar. (Hvis du beder bibliotekaren om de nødvendige oplysninger, får du et nøjagtigt og hurtigt svar.)

Brugere kan til enhver tid tilføje nye oplysninger til biblioteket og hente de nødvendige oplysninger.

Desuden kan versionering af data og adgangstilladelser indstilles efter behov.

Alle bibliotekarens handlinger gemmes som logfiler (optegnelser), så de kan rettes, hvis der opstår fejl.

Billede i brødteksten

<Clevi Semantic Database Structure>

Vigtigste funktioner og tekniske struktur

Semantisk datalagring

  • I stedet for en simpel chunk-vektorDB gemmes semantiske relationer mellem data (kontekst, hierarki, kausalitet osv.) i en grafDB
  • Nem at udvide og supplere i form af en vidensgraf/et semantisk netværk

Hybrid søgning og inferens

  • CTA+Context Query: Inddragelse af både forespørgslens kontekst (Context) og CTA
  • Hybrid Retrieval: Kombination af vektorsimilaritet + regel-/grafbaseret søgning
  • Intelligent Folder Hits: Automatisk søgning efter semantisk relaterede mapper/kategorier

Samtidig multimodal behandling

  • Samtidig fortolkning af forskellige datatyper såsom tekst, billeder, tabeller og lyd ved hjælp af TextReader Pool, VisionReader Pool osv.
  • Mens traditionel RAG hovedsageligt kun kan behandle tekst, har Semantic Database fremragende multimodale behandlingsmuligheder

Evidensbaserede svar og pålidelighedsverificering

  • Dokumentresuméer og kildehenvisninger, tabelresultater m.m. – automatisk generering af dokumentresuméer og kilder
  • Merge & Verify: Semantisk integration og pålidelighedsvalidering af oplysninger fra flere kilder
  • Evidence Pack: Levering af evidensbaserede svarpakker

Kompleks ræsonnering og planlægger

  • Planner/DAG: Trinvis planlægning og DAG-baseret (Directed Acyclic Graph) ræsonnering for komplekse forespørgsler

Integreret agentarkitektur

  • cip-5-agent Supervisor: Den øverste agent, der administrerer og koordinerer hele søge-, ræsonnerings- og integrationsprocessen
Billede i brødteksten

3. Strukturopsummering og sammenligning

Sammenfattende modtager Semantic DB data i forskellige former (tale, tekst, billeder, video m.m.) og klassificerer viden ved ikke blot at opdele den i simple chunks, men også ved at forbinde semantiske relationer mellem data (kontekst, hierarki, årsagssammenhæng m.m.).

På dette grundlag kan AI levere mere præcis informationssøgning og mere præcise svar, fordi systemet udfører søgning og ræsonnering ved hjælp af semantiske forbindelser i stedet for nøgleords- eller lighedsbaseret søgning som i RAG.

Da oplysningerne desuden gemmes i form af vidensgrafer eller semantiske netværk, er de nemme løbende at udvide og supplere.

Hos CLEVI identificerede vi begrænsningerne ved RAG-systemer i en tid med AI-transformation og kan nu med en semantisk database og vores egen AI-model give kunderne hurtige svar baseret på mere præcise og pålidelige data.

CLEVI's AI-system kan gøre kundernes værdifulde data værdiskabende i ethvert miljø, uanset domæne.

Også fremover vil CLEVI gøre sit yderste for at maksimere værdien af kundernes data og levere innovative AI-oplevelser.

Oplev fremtidens nye AI sammen med CLEVI.

Forespørgsler og anmodning om demo: [email protected]

Copyright© 2025 Clevi Inc. Alle rettigheder forbeholdes.

Tilbage til nyhedsredaktionen
CLEVI

Sprog og region

Maskinoversatte sprog er markeret. Tilgængeligheden følger den offentliggjorte webstedspakke.

136 sprog

Anbefales

1

Østasien

7

Sydøstasien

11

Sydasien

18

Centralasien

5

Mellemøsten og Kaukasus

10

Vesteuropa og Sydeuropa

16

Storbritannien og Irland

4

Nordeuropa

10

Centraleuropa og Balkan

14

Østeuropa

5

Østafrika

8

Vestafrika og Centralafrika

9

Det sydlige Afrika

8

Nord-, Mellem- og Sydamerika

5

Oceanien

5
Clevi-semantisk database — CLEVI