Badania

Clevi Semantic Database

Jednym z największych wyzwań związanych z wdrażaniem AI w rzeczywistych procesach biznesowych jest zjawisko katastrofalnego zapominania (Catastrophic Forgetting), które występuje podczas dostrajania wcześniej nabytej wiedzy za pomocą nowych danych.

1. Catastrophic Forgetting i ograniczenia RAG

Jednym z największych wyzwań związanych z wdrażaniem AI w rzeczywistych procesach biznesowych jest zjawisko katastrofalnego zapominania (Catastrophic Forgetting), które występuje podczas dostrajania wcześniej nabytej wiedzy za pomocą nowych danych.

Jest to zjawisko, w którym AI oparta na sieciach neuronowych gwałtownie traci wcześniej przyswojoną wiedzę lub wzorce w procesie uczenia się nowych informacji.

Na przykład dostrajanie modelu LLM typu open source za pomocą danych konkretnej firmy może prowadzić do pogorszenia ogólnej wiedzy i zdolności językowych.

Aby uniknąć tego problemu, powszechnie stosuje się technologię RAG (Retrieval-Augmented Generation), jednak RAG również ma swoje ograniczenia.

Obraz w treści

Typowe ograniczenia RAG

  • Niewystarczające przetwarzanie danych strukturalnych (Structured Data QA): Systemy RAG są głównie zoptymalizowane pod kątem niestrukturyzowanych dokumentów tekstowych, dlatego nie potrafią właściwie rozpoznawać ani wykorzystywać znaczenia i relacji w danych strukturalnych (tabelach, bazach danych, arkuszach kalkulacyjnych itp.).
  • Ograniczenia dotyczące złożonych plików PDF i niestrukturyzowanych dokumentów (Complex PDFs): W przypadku złożonych dokumentów PDF (zawierających tabele, układ wielokolumnowy, obrazy itp.) podczas procesu chunking (dzielenia) może dojść do utraty informacji lub zniekształcenia kontekstu. W rezultacie ważne dane mogą nie zostać zindeksowane lub mogą być trudne do wyszukania.
  • Brak modelu Fallback (modelu zapasowego) (Fallback Model(s)): Gdy system RAG nie może znaleźć odpowiedniej odpowiedzi, logika przełączania na model zastępczy (zapasowy) może być niewystarczająca lub nieefektywna. W rezultacie w przypadku niepowodzenia użytkownik nie otrzymuje satysfakcjonującej alternatywy.
  • Luki w zabezpieczeniach (LLM Security): Niedostateczna ochrona przed lukami w zabezpieczeniach samego LLM (takimi jak prompt injection, wyciek danych itp.) stwarza ryzyko ujawnienia poufnych informacji.
  • Niewystarczająca skalowalność (Data Ingestion Scalability): Podczas indeksowania i przechowywania dużych ilości danych pojawiają się problemy ze skalowalnością. Wraz ze wzrostem ilości danych spada szybkość chunking, przechowywania i wyszukiwania, a obciążenie systemu rośnie.
  • Brak ważnych informacji (Missing Content): Ważne treści z dokumentów często są pomijane podczas procesu chunking lub nie są indeksowane. W rezultacie użytkownik nie może znaleźć potrzebnych informacji.
  • Brak wyników o najwyższym rankingu (Missed Top Ranked): W wynikach wyszukiwania może zabraknąć chunk (najwyżej sklasyfikowanego), który jest faktycznie najbardziej trafny. Przyczyną mogą być ograniczenia algorytmu wyszukiwania, niska jakość embeddingów lub błędy rankingu.
  • Niezgodność kontekstu (Not in Context): Wyszukany chunk często nie pasuje do rzeczywistego kontekstu pytania. Wynika to z ograniczeń wyszukiwania opartego wyłącznie na podobieństwie oraz braku połączeń semantycznych.
  • Nieprawidłowy format (Wrong Format): Format wyszukanego chunk może być nieodpowiedni do przetwarzania przez LLM lub może różnić się od oczekiwanego przez użytkownika formatu odpowiedzi. Przykładowo tabela może zostać przekonwertowana na tekst, co prowadzi do zniekształcenia informacji.
  • Niepowodzenie ekstrakcji informacji (Not Extracted): Wymagane informacje mogą nie zostać prawidłowo wyodrębnione z chunk lub LLM może ich nie rozpoznać. Często występuje to w przypadku złożonych struktur zdań, tabel i obrazów.
  • Nieodpowiedni zakres/głębokość informacji (Incorrect Specificity): Odpowiedź może być zbyt ogólna w stosunku do pytania lub, przeciwnie, nadmiernie szczegółowa, przez co nie odpowiada rzeczywistym wymaganiom użytkownika. Trudno jest dostosować zakres i głębokość informacji.
  • Niekompletna odpowiedź (Incomplete): Wygenerowana odpowiedź końcowa może być niekompletna lub zawierać tylko część informacji, przez co nie spełnia w wystarczającym stopniu wymagań użytkownika. Przyczyną może być brak syntezy informacji z wielu chunk lub wykorzystanie przez LLM tylko części informacji.

Jak wspomniano, ponieważ RAG w nadmiernym stopniu opiera się na wyszukiwaniu na podstawie prostego podobieństwa wektorowego i indeksowaniu opartym na chunkach, jego ograniczenia w zakresie niezawodności, skalowalności i dokładności w rzeczywistych zastosowaniach biznesowych są wyraźne.

2. Clevi Semantic Database, która przezwycięża ograniczenia RAG

Aby przezwyciężyć te ograniczenia, CLEVI opracowało nową generację infrastruktury wiedzy AI, zoptymalizowaną pod kątem połączeń semantycznych, złożonego wnioskowania i odpowiedzi opartych na dowodachClevi Semantic Database.

Jest to rozwiązanie możliwe dzięki temu, że CLEVI posiada własne modele Reasoning, multimodalne modele AI oraz modele AI oparte na agentach. To jedna z unikalnych, potężnych technologii CLEVI, które sprawiają, że AI może realnie pomagać w rzeczywistym świecie.

Obrazowo mówiąc, jeśli bazę danych przechowującą informacje porównamy do biblioteki, Clevi Semantic Database można wyobrazić sobie jako bibliotekę z wyjątkowo kompetentnym bibliotekarzem. (Gdy poprosisz bibliotekarza o potrzebne informacje, otrzymasz dokładną i szybką odpowiedź).

Użytkownicy mogą w dowolnym momencie dodawać nowe informacje do biblioteki i pobierać potrzebne informacje.

Mogą również dowolnie konfigurować zarządzanie wersjami danych oraz uprawnienia dostępu.

Wszystkie działania bibliotekarza są zapisywane w logach (rejestrach), dzięki czemu można je skorygować nawet w przypadku wystąpienia błędu.

Obraz w treści

<Clevi Semantic Database Structure>

Najważniejsze cechy i struktura technologiczna

Semantyczne przechowywanie danych

  • Przechowywanie semantycznych relacji między danymi (kontekstu, hierarchii, przyczynowości itp.) w bazie grafowej, a nie w prostej wektorowej bazie danych opartej na chunkach
  • Łatwe rozszerzanie i uzupełnianie w formie grafu wiedzy lub sieci semantycznej

Wyszukiwanie hybrydowe i wnioskowanie

  • CTA+Context Query: jednoczesne uwzględnianie kontekstu zapytania (Context) i CTA
  • Hybrid Retrieval: łączenie wyszukiwania na podstawie podobieństwa wektorowego z wyszukiwaniem opartym na regułach/grafach
  • Intelligent Folder Hits: automatyczne wyszukiwanie semantycznie powiązanych folderów/kategorii

Jednoczesne przetwarzanie multimodalne

  • Jednoczesna interpretacja różnorodnych danych, takich jak tekst, obrazy, tabele i dźwięk, za pomocą TextReader Pool, VisionReader Pool itp.
  • Podczas gdy tradycyjny RAG może przetwarzać głównie tekst, Clevi Semantic Database wyróżnia się zdolnością do przetwarzania danych multimodalnych

Odpowiedzi oparte na dowodach i weryfikacja wiarygodności

  • Automatyczne generowanie podsumowań dokumentów i źródeł, w tym wyników wyszukiwania w tabelach
  • Merge & Verify: semantyczna integracja informacji z wielu źródeł i weryfikacja ich wiarygodności
  • Evidence Pack: dostarczanie pakietów odpowiedzi opartych na dowodach

Złożone wnioskowanie i planista

  • Planner/DAG: planowanie etapów i wnioskowanie oparte na DAG (Directed Acyclic Graph) dla złożonych zapytań

Zintegrowana struktura agentów

  • cip-5-agent Supervisor: nadrzędny agent zarządzający i koordynujący całym procesem wyszukiwania, wnioskowania i integracji
Obraz w treści

3. Podsumowanie i porównanie struktury

Podsumowując, Semantic DB przyjmuje dane w różnych formach (głos, tekst, obrazy, wideo itd.) i klasyfikuje wiedzę, łącząc nie tylko proste fragmenty, lecz także relacje semantyczne między danymi (kontekst, hierarchię, związki przyczynowo-skutkowe itd.).

Dzięki temu, zamiast wyszukiwania opartego na słowach kluczowych lub podobieństwie, jak w przypadku RAG, możliwe jest wyszukiwanie i wnioskowanie z wykorzystaniem powiązań semantycznych, co pozwala uzyskać od AI dokładniejsze wyszukiwanie informacji i odpowiedzi.

Ponadto, ponieważ dane są przechowywane w formie grafu wiedzy lub sieci semantycznej, można je łatwo stale rozszerzać i uzupełniać.

W erze wielkiej transformacji AI firma CLEVI dostrzegła ograniczenia systemów RAG i dzięki semantycznej bazie danych oraz własnym modelom AI, które mogą te ograniczenia rozwiązać, umożliwiła klientom szybkie uzyskiwanie dokładniejszych i bardziej wiarygodnych danych.

System AI firmy CLEVI może nadawać wartość cennym danym klientów w każdym środowisku, niezależnie od rodzaju domeny.

Firma CLEVI nadal będzie dokładać wszelkich starań, aby maksymalizować wartość danych klientów i zapewniać innowacyjne doświadczenia z AI.

Zapraszamy do odkrywania przyszłości nowej AI razem z CLEVI.

Kontakt i prośba o prezentację: [email protected]

Copyright© 2025 Clevi Inc. Wszelkie prawa zastrzeżone.

Powrót do redakcji
CLEVI

Język i region

Języki przetłumaczone maszynowo są oznaczone. Dostępność jest zgodna z opublikowanym pakietem witryny.

136 języków

Polecane

1

Azja Wschodnia

7

Azja Południowo-Wschodnia

11

Azja Południowa

18

Azja Środkowa

5

Bliski Wschód i Kaukaz

10

Europa Zachodnia i Europa Południowa

16

Wielka Brytania i Irlandia

4

Europa Północna

10

Europa Środkowa i Bałkany

14

Europa Wschodnia

5

Afryka Wschodnia

8

Afryka Zachodnia i Afryka Środkowa

9

Afryka Południowa

8

Ameryka

5

Oceania

5
Clevi Semantic Database — CLEVI