Forschung

Clevi Semantic Database

Wenn KI in der Praxis eingesetzt wird, ist eines der größten Probleme das Phänomen des katastrophalen Vergessens (Catastrophic Forgetting), das beim Feinabstimmen des zuvor erlernten Wissens mit neuen Daten auftritt.

1. Catastrophic Forgetting und die Grenzen von RAG

Wenn KI in der Praxis eingesetzt wird, ist eines der größten Probleme das Phänomen des katastrophalen Vergessens (Catastrophic Forgetting), das beim Feinabstimmen des zuvor erlernten Wissens mit neuen Daten auftritt.

Dabei handelt es sich um ein Phänomen, bei dem eine auf neuronalen Netzwerken basierende KI während des Lernens neuer Informationen zuvor erlerntes Wissen oder Muster plötzlich verliert.

Wenn beispielsweise ein Open-Source-LLM mit den Daten eines bestimmten Unternehmens feinabgestimmt wird, können allgemeines Wissen oder die Sprachfähigkeiten beeinträchtigt werden.

Um dieses Problem zu vermeiden, wird häufig die RAG(Retrieval-Augmented Generation)-Technologie eingesetzt, doch auch RAG hat seine Grenzen.

Bild im Haupttext

Typische Grenzen von RAG

  • Unzureichende Verarbeitung strukturierter Daten (Structured Data QA): RAG-Systeme sind hauptsächlich für unstrukturierte Textdokumente optimiert und können daher die Bedeutung und Beziehungen strukturierter Daten (Tabellen, Datenbanken, Tabellenkalkulationen usw.) nicht angemessen erfassen oder nutzen.
  • Einschränkungen bei komplexen PDFs/unstrukturierten Dokumenten (Complex PDFs): Bei komplexen PDF-Dokumenten (einschließlich Tabellen, mehrspaltiger Layouts, Bildern usw.) können während des Chunking-Prozesses Informationen verloren gehen oder Kontexte verfälscht werden. Dadurch werden wichtige Daten möglicherweise nicht indiziert oder sind schwer auffindbar.
  • Fehlendes Fallback-Modell (Fallback Model(s)): Wenn ein RAG-System keine geeignete Antwort findet, fehlt häufig eine ausreichende oder effiziente Logik für den Wechsel zu einem alternativen (Fallback-)Modell. Dadurch wird den Nutzern im Fall eines fehlgeschlagenen Antwortversuchs keine zufriedenstellende Alternative angeboten.
  • Sicherheitslücken (LLM Security): Der Schutz vor Sicherheitslücken des LLM selbst (z. B. Prompt-Injection und Datenlecks) ist unzureichend, wodurch das Risiko besteht, dass vertrauliche Informationen offengelegt werden.
  • Mangelnde Skalierbarkeit (Data Ingestion Scalability): Bei der Indizierung und Speicherung großer Datenmengen treten Skalierbarkeitsprobleme auf. Mit zunehmender Datenmenge verlangsamen sich Chunking, Speicherung und Suche, während die Systemauslastung steigt.
  • Fehlende wichtige Informationen (Missing Content): Wichtige Inhalte eines Dokuments gehen während des Chunking-Prozesses häufig verloren oder werden nicht indiziert. Dadurch können Nutzer die von ihnen gewünschten Informationen nicht suchen.
  • Fehlende Top-Rankings (Missed Top Ranked): Die tatsächlich relevantesten Chunks (mit dem höchsten Ranking) können in den Suchergebnissen fehlen. Ursachen hierfür sind unter anderem Einschränkungen des Suchalgorithmus, eine mangelnde Embedding-Qualität und Ranking-Fehler.
  • Unpassender Kontext (Not in Context): Häufig stimmen die abgerufenen Chunks nicht mit dem tatsächlichen Kontext der Frage überein. Dies ist eine Folge der Einschränkungen einer einfachen Ähnlichkeitssuche, der die semantische Verknüpfung fehlt.
  • Falsches Format (Wrong Format): Das Format der abgerufenen Chunks kann für die Verarbeitung durch das LLM ungeeignet sein oder nicht dem vom Nutzer gewünschten Antwortformat entsprechen. Beispielsweise können Informationen verfälscht werden, wenn eine Tabelle in Text umgewandelt wird.
  • Informationen nicht extrahiert (Not Extracted): Benötigte Informationen werden möglicherweise nicht korrekt aus einem Chunk extrahiert oder vom LLM nicht erkannt. Dies tritt häufig bei komplexen Satzstrukturen, Tabellen und Bildern auf.
  • Ungeeigneter Informationsumfang bzw. unpassende Detailtiefe (Incorrect Specificity): Die Antwort ist möglicherweise zu allgemein oder umgekehrt übermäßig spezifisch und entspricht dadurch nicht den tatsächlichen Anforderungen des Nutzers. Die Anpassung von Umfang und Detailtiefe der Informationen ist schwierig.
  • Unvollständige Antwort (Incomplete): Die letztlich generierte Antwort ist möglicherweise unvollständig oder enthält nur einen Teil der Informationen und erfüllt dadurch die Anforderungen des Nutzers nicht ausreichend. Ursachen können sein, dass Informationen aus mehreren Chunks nicht zusammengeführt werden oder das LLM nur einen Teil davon nutzt.

Da sich RAG in hohem Maße auf die Suche nach einfacher Vektorähnlichkeit und eine chunk-basierte Indizierung stützt, sind die Grenzen in der Praxis hinsichtlich Zuverlässigkeit, Skalierbarkeit und Genauigkeit deutlich erkennbar.

2. Clevi Semantic Database zur Überwindung der Grenzen von RAG

Um diese Grenzen zu überwinden, hat CLEVI die nächste Generation der KI-Wissensinfrastruktur Clevi Semantic Database entwickelt, die für semantische Verknüpfung, komplexe Schlussfolgerungen und evidenzbasierte Antworten optimiert ist.

Diese Lösung ist möglich, weil CLEVI eigene Reasoning-Modelle, multimodale KI und agentenbasierte KI-Modelle vereint. Sie gehört zu den leistungsstarken Technologien von CLEVI, die KI in der Realität tatsächlich hilfreich machen.

Bildlich gesprochen: Wenn die Datenbank, in der Informationen gespeichert sind, eine Bibliothek ist, können Sie sich die Clevi Semantic Database als eine sehr kompetente Bibliothekarin oder einen sehr kompetenten Bibliothekar vorstellen. (Wenn Sie die benötigten Informationen bei der Bibliothek anfordern, erhalten Sie eine präzise und schnelle Antwort.)

Benutzer können jederzeit neue Informationen in der Bibliothek hinzufügen und die benötigten Informationen abrufen.

Außerdem können die Versionsverwaltung der Daten und die Zugriffsberechtigungen nach Wunsch festgelegt werden.

Da jede Handlung der Bibliothekarin bzw. des Bibliothekars als Protokoll (Aufzeichnung) gespeichert wird, können Fehler auch nachträglich korrigiert werden.

Bild im Haupttext

<Clevi Semantic Database Structure>

Wichtige Merkmale und technische Struktur

Semantische Datenspeicherung

  • Nicht in einer einfachen chunk-Vektordatenbank, sondern Speicherung semantischer Beziehungen zwischen Daten (Kontext, Hierarchie, Kausalität usw.) in einer Graphdatenbank
  • Einfache Erweiterung und Ergänzung in Form eines Wissensgraphen bzw. semantischen Netzwerks

Hybride Suche und Schlussfolgerungen

  • CTA+Context Query: Gemeinsame Berücksichtigung des Kontexts (Context) der Abfrage und der CTA
  • Hybrid Retrieval: Kombination aus Vektorähnlichkeit und regel-/graphenbasierter Suche
  • Intelligent Folder Hits: Automatische Suche nach semantisch verbundenen Ordnern/Kategorien

Gleichzeitige multimodale Verarbeitung

  • Gleichzeitige Interpretation verschiedener Datentypen wie Text, Bilder, Tabellen und Sprache mit TextReader Pool, VisionReader Pool usw.
  • Während herkömmliches RAG hauptsächlich Text verarbeiten kann, zeichnet sich die semantische Datenbank durch hervorragende multimodale Verarbeitungsfähigkeiten aus

Evidenzbasierte Antworten und Zuverlässigkeitsprüfung

  • Dokumentzusammenfassungen und Quellenangaben, Tabellenerkenntnisse usw. – automatische Erstellung von Dokumentzusammenfassungen und Quellenangaben
  • Merge & Verify: semantische Integration von Informationen aus mehreren Quellen und Überprüfung ihrer Zuverlässigkeit
  • Evidence Pack: Bereitstellung evidenzbasierter Antwortpakete

Komplexes Schlussfolgern und Planer

  • Planner/DAG: Schrittweise Planung und auf DAG (Directed Acyclic Graph) basierendes Schlussfolgern für komplexe Anfragen

Integrierte Agentenstruktur

  • cip-5-agent Supervisor: übergeordneter Agent zur Verwaltung und Koordination des gesamten Such-, Schlussfolgerungs- und Integrationsprozesses
Abbildungen im Text

3. Strukturelle Zusammenfassung und Vergleich

Zusammengefasst nimmt eine Semantic DB Daten in verschiedenen Formen (Sprache, Text, Bilder, Videos usw.) auf und klassifiziert Wissen, indem sie nicht nur einfache Chunks, sondern auch semantische Beziehungen zwischen den Daten (Kontext, Hierarchie, Kausalität usw.) miteinander verknüpft.

Da sie darauf basierend – anders als RAG – nicht schlüsselwort- oder ähnlichkeitsbasiert sucht, sondern semantische Verbindungen für Suche und Schlussfolgerungen nutzt, können Sie von der KI genauere Informationssuchen und Antworten erhalten.

Da die Daten außerdem in Form eines Wissensgraphen bzw. eines semantischen Netzwerks gespeichert werden, lassen sie sich kontinuierlich erweitern und ergänzen.

CLEVI hat in Zeiten der umfassenden KI-Transformation die Grenzen von RAG-Systemen erkannt und ermöglicht es Kunden durch eine semantische Datenbank und eigene KI-Modelle, schnellere, genauere und zuverlässigere Datenantworten zu erhalten.

Das KI-System von CLEVI kann die wertvollen Daten unserer Kunden in jeder Umgebung und unabhängig von der Art der Domäne in wertvolle Erkenntnisse umwandeln.

Auch in Zukunft wird CLEVI sein Bestes tun, um den Wert der Daten unserer Kunden zu maximieren und innovative KI-Erlebnisse bereitzustellen.

Erleben Sie gemeinsam mit CLEVI die Zukunft der neuen KI.

Kontakt und Demo-Anfrage: [email protected]

Copyright© 2025 Clevi Inc. Alle Rechte vorbehalten.

Zurück zum Newsroom
CLEVI

Sprache und Region

Maschinell übersetzte Sprachen sind gekennzeichnet. Die Verfügbarkeit richtet sich nach dem veröffentlichten Website-Bundle.

136 Sprachen

Empfohlen

1

Ostasien

7

Südostasien

11

Südasien

18

Zentralasien

5

Naher Osten und Kaukasus

10

Westeuropa und Südeuropa

16

Vereinigtes Königreich und Irland

4

Nordeuropa

10

Mitteleuropa und Balkan

14

Osteuropa

5

Ostafrika

8

Westafrika und Zentralafrika

9

Südliches Afrika

8

Amerika

5

Ozeanien

5