Fuerschung

Clevi Semantic Database

Wann KI an der Praxis agesat gëtt, ass eng vun de gréisste Suergen de Phänomen vum katastrophale Vergiessen (Catastrophic Forgetting), deen entsteet, wann dat virdru geléiert Wëssen op nei Donnéeën finetunéiert gëtt.

1. D’Limite vu Catastrophic Forgetting a RAG

Wann KI an der Praxis agesat gëtt, ass eng vun de gréisste Suergen de Phänomen vum katastrophale Vergiessen (Catastrophic Forgetting), deen entsteet, wann dat virdru geléiert Wëssen op nei Donnéeën finetunéiert gëtt.

Dobäi geet eng neuronesch Netzwierk-baséiert KI beim Léiere vun neien Informatioune séier virdru geléiert Wëssen oder Mustere verluer.

Wann een zum Beispill en Open-Source-LLM mat Date vun enger bestëmmter Entreprise finetunéiert, kënnen allgemeng Kenntnesser oder d’Sproochfäegkeete verschlechtert ginn.

Fir dëse Problem ze vermeiden, gëtt d’Technologie RAG(Retrieval-Augmented Generation) wäit verbreet agesat, ma och RAG huet seng Limiten.

Bild am Haapttext

Typesch Limite vu RAG

  • قصور في معالجة البيانات المُهيكلة (Structured Data QA): تكون أنظمة RAG مُحسّنة بشكل أساسي للتعامل مع المستندات النصية غير المُهيكلة، لذلك قد لا تتمكن من فهم معاني البيانات المُهيكلة (الجداول وقواعد البيانات وجداول البيانات وغيرها) وعلاقاتها أو استخدامها بشكل صحيح.
  • قيود ملفات PDF المعقدة/المستندات غير المُهيكلة (Complex PDFs): قد تُفقد المعلومات أو يُشوَّه سياقها أثناء عملية chunking (التقسيم) في مستندات PDF المعقدة (التي تتضمن جداول وأعمدة متعددة وصورًا وغيرها). ونتيجةً لذلك، قد لا تتم فهرسة البيانات المهمة أو قد يصعب البحث عنها.
  • غياب نموذج Fallback (الاحتياطي) (Fallback Model(s)): عندما لا يتمكن نظام RAG من العثور على إجابة مناسبة، قد تكون آلية التحويل إلى نموذج بديل (احتياطي) غير كافية أو غير فعّالة. ونتيجةً لذلك، لا يتم توفير بديل مُرضٍ للمستخدم عند فشل الإجابة.
  • ثغرات أمنية (LLM Security): لا تكون الحماية من الثغرات الأمنية في LLM نفسه (مثل حقن الأوامر وتسريب البيانات وغيرها) كافية، ما يعرّض المعلومات الحساسة لخطر الانكشاف.
  • قصور في قابلية التوسع (Data Ingestion Scalability): تظهر مشكلات في قابلية التوسع أثناء فهرسة البيانات الكبيرة وتخزينها. وكلما زادت كمية البيانات، تراجعت سرعة chunking والتخزين والبحث، وازداد الحمل على النظام.
  • فقدان معلومات مهمة (Missing Content): غالبًا ما تُفقد المعلومات المهمة من المستند أثناء عملية chunking أو لا تتم فهرستها. ونتيجةً لذلك، لا يتمكن المستخدم من البحث عن المعلومات التي يريدها.
  • فقدان النتائج الأعلى ترتيبًا (Missed Top Ranked): قد لا يظهر chunk الأكثر صلة فعليًا (ذو الترتيب الأعلى) في نتائج البحث. وقد يعود ذلك إلى محدودية خوارزمية البحث أو انخفاض جودة التضمين أو أخطاء الترتيب وغيرها.
  • عدم توافق السياق (Not in Context): غالبًا لا يتوافق chunk المُسترجَع مع سياق السؤال الفعلي. ويرجع ذلك إلى محدودية البحث القائم على التشابه البسيط، إذ يفتقر إلى الترابط الدلالي.
  • تنسيق غير صحيح (Wrong Format): قد يكون تنسيق chunk المُسترجَع غير مناسب لمعالجته من قِبل LLM أو قد يختلف عن تنسيق الإجابة الذي يريده المستخدم. فعلى سبيل المثال، قد تُحوَّل الجداول إلى نص، ما يؤدي إلى تشويه المعلومات.
  • فشل استخراج المعلومات (Not Extracted): قد لا تُستخرج المعلومات المطلوبة من chunk بشكل صحيح، أو قد لا يتمكن LLM من التعرّف إلى المعلومات. ويحدث ذلك غالبًا في البنى الجملية المعقدة والجداول والصور وغيرها.
  • نطاق/عمق غير مناسب للمعلومات (Incorrect Specificity): قد تكون الإجابة عامة جدًا بالنسبة إلى السؤال، أو على العكس، محددة بشكل مفرط، فلا تتوافق مع متطلبات المستخدم الفعلية. ويصعب ضبط نطاق المعلومات وعمقها.
  • إجابة غير مكتملة (Incomplete): قد تكون الإجابة المُنشأة نهائيًا غير مكتملة أو قد تتضمن بعض المعلومات فقط، فلا تلبي متطلبات المستخدم بشكل كافٍ. وقد يعود ذلك إلى عدم تجميع المعلومات من عدة chunks أو إلى استخدام LLM جزءًا من المعلومات فقط.

Esou ass RAG staark op eng einfach Sich no Vektorsimilaritéit an op Chunk-baséiert Indexéierung ugewisen, soudatt d’Limiten a punkto Zouverlässegkeet, Skaléierbarkeet a Genauegkeet am reellen Aarbechtsalldag däitlech sinn.

2. Clevis semantesch Datebank, déi d’Limitë vu RAG iwwerwannt

Fir dës Limitë ze iwwerwannen, huet CLEVI déi nächst Generatioun vun AI-Wëssensinfrastruktur entwéckelt, optimiséiert fir semantesch Verbindungen, komplex Inferenzen an begrënnt Äntwerten: d’Clevi Semantic Database.

Dëst ass eng Léisung, déi méiglech ass, well CLEVI souwuel eegen Reasoning-Modeller, multimodal AI wéi och agentesch AI-Modeller besëtzt, an et ass eng vun de staarken Technologien, déi nëmme CLEVI ubitt, fir AI an der Realitéit wierklech hëllefräich ze maachen.

Als Verglach: Wann een d’Datebank, an där d’Informatioune gespäichert sinn, als Bibliothéik betruecht, kann een sech d’semantesch Datebank vu CLEVI als eng aussergewéinlech kompetent Bibliothekarin oder e Bibliothekar virstellen. (Wann een der Bibliothekarin oder dem Bibliothekar déi néideg Informatioun ufreet, kritt een eng präzis a séier Äntwert.)

D’Benotzer kënnen zu all Moment nei Informatiounen an der Bibliothéik dobäisetzen an déi néideg Informatiounen ofruffen.

Ausserdeem kënnen d’Versioune vun den Daten an d’Zougrëffsrechter no Wonsch konfiguréiert ginn.

All Aktioun vun der Bibliothekarin oder vum Bibliothekar gëtt als Log (Opzeechnung) gespäichert, soudatt Feeler och nom Optriede korrigéiert kënne ginn.

Bild am Haapttext

<Clevi Semantic Database Structure>

Haaptmerkmale an technesch Struktur

Semantesch Datespäicherung

  • Amplaz vun enger einfacher Chunk-Vektordatebank ginn déi semantesch Bezéiungen tëscht den Daten (Kontext, Hierarchie, Kausalitéit asw.) an enger Graph-Datebank gespäichert
  • Einfach ausbaubar an ergänzbar a Form vun engem Wëssensgraph oder semanteschen Netzwierk

Hybrid Sich an Inferenz

  • CTA+Context Query: De Kontext (Context) vun der Ufro an d’CTA ginn zesumme berécksiichtegt
  • Hybrid Retrieval: Kombinatioun vu Vektorsimilaritéitssich a Regel-/Graph-baséierter Sich
  • Intelligent Folder Hits: Automatesch Entdeckung vu semantesch verbonne Classeuren/Kategorien

Gläichzäiteg multimodal Veraarbechtung

  • TextReader Pool, VisionReader Pool an aner Funktioune fir verschidden Daten, wéi Text, Biller, Tabellen an Audio, gläichzäiteg ze interpretéieren
  • Wärend traditionell RAG-Systemer meeschtens nëmmen Text veraarbechte kënnen, ass d’semantesch Datebank besonnesch staark an der multimodaler Veraarbechtung

Begrënnt Äntwerten a Validéierung vun der Zouverlässegkeet

  • Dokumentsresuméen & Zitater, automatesch Generéierung vun Tabellebefunner an Dokumentquellen
  • Merge & Verify: Semantesch Integratioun a Verifizéierung vun der Zouverlässegkeet vun Informatiounen aus verschiddene Quellen
  • Evidence Pack: Liwwere vun evidenzbaséierten Äntwertpaketen

Komplexe Raisonnement a Planner

  • Planner/DAG: Schrëttweis Pläng an DAG (Directed Acyclic Graph)-baséiert Raisonnement fir komplex Ufroen

Integréiert Agentenarchitektur

  • cip-5-agent Supervisor: Iwwerwaacht a koordinéiert de gesamte Sich-, Raisonnement- an Integratiounsprozess als héchsten Agent
Bild am Haapttext

3. Strukturresumé a Verglach

Zesummegefaasst hëlt eng Semantic DB Daten a verschiddene Formen (Sprooch, Text, Biller, Videoen, asw.) op a klassifizéiert d'Wëssen, andeems se net nëmmen einfach Chunks, mee och déi semantesch Bezéiungen tëscht den Donnéeën (Kontext, Hierarchie, Kausalitéit, asw.) verknëppt.

Op dëser Basis erméiglecht se, am Géigesaz zu RAG, keng Sich op Basis vu Schlësselwierder oder Ähnlechkeet, mee Sich a Raisonnement mat Hëllef vu semantesche Verknëppungen, sou datt een iwwer AI méi genee Informatiounen a besser Äntwerte kritt.

Ausserdeem gëtt d'Wëssen a Form vun engem Wëssensgraph oder semanteschen Netzwierk gespäichert, wat eng kontinuéierlech Erweiderung an Ergänzung erliichtert.

Clevi huet an der Zäit vun der grousser AI-Transformatioun d'Limitte vu RAG-Systemer erkannt a kann de Clienten elo mat enger semantescher Datebank an eegene AI-Modeller, déi dës Problemer léisen, méi genee an zouverlässeg Donnéeë méi séier liwweren.

Dem Clevi säin AI-System kann déi wäertvoll Donnéeë vun de Clienten an all Ëmfeld, onofhängeg vun der Aart vum Domaine, wäertvoll maachen.

Och an Zukunft wäert Clevi säi Bescht ginn, fir de Wäert vun den Donnéeë vun de Clienten ze maximéieren an innovativ AI-Erfarungen ze bidden.

Erlieft zesumme mat Clevi d'Zukunft vun der neier AI.

Kontakt an Ufro fir eng Demo: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Zréck an de Newsroom
CLEVI

Sprooch a Regioun

Maschinneniwwersat Sprooche si markéiert. D'Verfügbarkeet riicht sech nom publizéierte Site-Bundle.

136 Sproochen

Recommandéiert

1

Ostasien

7

Südostasien

11

Südasien

18

Zentralasien

5

Noen Osten a Kaukasus

10

Westeuropa a(n) Südeuropa

16

Groussbritannien a(n) Irland

4

Nordeuropa

10

Mëtteleuropa a Balkan

14

Osteuropa

5

Ostafrika

8

Westafrika a(n) Zentralafrika

9

Südlecht Afrika

8

Amerika

5

Ozeanien

5
Clevi Semantic Database — CLEVI