Uurimistöö

Clevi semantiline andmebaas

Kui tehisintellekt võetakse kasutusele tegelikus töös, on üheks suurimaks murekohaks katastroofiline unustamine (Catastrophic Forgetting), mis tekib olemasolevate õpitud teadmiste uute andmetega peenhäälestamisel.

1. Catastrophic Forgettingu ja RAG-i piirangud

Kui tehisintellekt võetakse kasutusele tegelikus töös, on üheks suurimaks murekohaks katastroofiline unustamine (Catastrophic Forgetting), mis tekib olemasolevate õpitud teadmiste uute andmetega peenhäälestamisel.

See on nähtus, mille puhul närvivõrgupõhine tehisintellekt kaotab uue teabe õppimise käigus kiiresti varem omandatud teadmised või mustrid.

Näiteks kui avatud lähtekoodiga LLM-i peenhäälestada konkreetse ettevõtte andmetega, võivad halveneda üldteadmised või keeleoskused.

Selle probleemi vältimiseks kasutatakse laialdaselt RAG-i (Retrieval-Augmented Generation) tehnoloogiat, kuid ka RAG-il on piiranguid.

Põhiteksti pilt

RAG-i peamised piirangud

  • Struktureeritud andmete ebapiisav töötlemine (Structured Data QA): RAG-süsteemid on peamiselt optimeeritud struktureerimata tekstidokumentide jaoks, mistõttu ei suuda need struktureeritud andmete (tabelid, andmebaasid, arvutustabelid jne) tähendust ja seoseid õigesti mõista ega kasutada.
  • Keerukate PDF-ide/struktureerimata dokumentide piirangud (Complex PDFs): Keerukate PDF-dokumentide (sh tabelid, mitmeveeruline paigutus, pildid jne) puhul võib chunking'u (tükeldamise) käigus teave kaduma minna või kontekst moonutuda. Seetõttu ei pruugita olulisi andmeid indekseerida või võib nende otsimine olla keeruline.
  • Fallback-mudeli puudumine (Fallback Model(s)): Kui RAG-süsteem ei leia sobivat vastust, on alternatiivsele (varu-)mudelile ülemineku loogika ebapiisav või ebatõhus. Seetõttu ei pakuta vastuse ebaõnnestumise korral kasutajale rahuldavat alternatiivi.
  • Turvanõrkused (LLM Security): LLM-i enda turvanõrkuste (prompt injection, andmeleke jne) vastane kaitse on ebapiisav, mistõttu on tundliku teabe paljastumise oht.
  • Ebapiisav skaleeritavus (Data Ingestion Scalability): Suuremahuliste andmete indekseerimise ja salvestamise käigus tekivad skaleeritavusprobleemid. Andmemahu suurenedes aeglustuvad chunking, salvestamine ja otsing ning süsteemi koormus suureneb.
  • Olulise teabe puudumine (Missing Content): Dokumendi oluline sisu võib chunking'u käigus sageli kaduma minna või jääda indekseerimata. Seetõttu ei leia kasutaja soovitud teavet.
  • Kõrgeima asetusega tulemuse puudumine (Missed Top Ranked): Otsingutulemustest võib puududa tegelikult kõige asjakohasem chunk (kõrgeima asetusega tulemus). Põhjusteks võivad olla otsingualgoritmi piirangud, embedding'ute kvaliteedi langus ja järjestusvead.
  • Konteksti sobimatus (Not in Context): Sageli ei vasta leitud chunk tegelikult küsimuse kontekstile. See tuleneb lihtsal sarnasusel põhineva otsingu piirangutest, mille tõttu puudub semantiline seotus.
  • Vale vorming (Wrong Format): Leitud chunk'i vorming võib olla LLM-i jaoks töötlemiseks sobimatu või erineda kasutaja soovitud vastusevormingust. Näiteks võib tabeli tekstiks teisendamisel teave moonduda.
  • Teabe eraldamine ebaõnnestub (Not Extracted): Vajalikku teavet ei eraldata chunk'ist õigesti või LLM ei suuda teavet ära tunda. Seda juhtub sageli keerukate lausestruktuuride, tabelite ja piltide puhul.
  • Teabe ulatus/sügavus ei ole sobiv (Incorrect Specificity): Vastus võib olla küsimuse jaoks liiga üldine või vastupidi liiga üksikasjalik ega vasta seetõttu kasutaja tegelikele vajadustele. Teabe ulatust ja sügavust on keeruline kohandada.
  • Mittetäielik vastus (Incomplete): Lõplikult genereeritud vastus võib olla mittetäielik või sisaldada ainult osa teabest, mistõttu ei rahulda see piisavalt kasutaja vajadusi. Põhjuseks võib olla suutmatus koondada teavet mitmest chunk'ist või see, et LLM kasutab ainult osa teabest.

Seetõttu on RAG-il, mis sõltub liigselt lihtsast vektorite sarnasuse otsingust ja chunk-põhisest indekseerimisest, tegelikus töös selged piirangud usaldusväärsuse, skaleeritavuse ja täpsuse osas.

2. CLEVI semantiline andmebaas, mis ületab RAG-i piirangud

Nende piirangute ületamiseks töötas CLEVI välja järgmise põlvkonna tehisintellekti teadmiste taristu, mis on optimeeritud semantiliste seoste, keeruka tuletamise ja tõenduspõhiste vastuste jaoksClevi Semantic Database.

See lahendus on võimalik tänu sellele, et CLEVI-l on oma Reasoning-mudelid, multimodaalne AI ja agendipõhised AI-mudelid. See on üks CLEVI võimsatest tehnoloogiatest, mis muudab AI tegelikus elus tõeliselt kasulikuks.

Võrdluseks: kui andmebaasi, kuhu teave on salvestatud, pidada raamatukoguks, siis CLEVI semantilist andmebaasi võib kujutleda raamatukoguna, kus töötab väga hea raamatukoguhoidja. (Kui palute raamatukoguhoidjalt vajalikku teavet, saate täpse ja kiire vastuse.)

Kasutajad saavad igal ajal raamatukokku uut teavet lisada ja vajalikku teavet hankida.

Samuti saab andmete versioonihaldust ja juurdepääsuõigusi seadistada vastavalt soovile.

Kõik raamatukoguhoidja toimingud salvestatakse logina (kirjena), nii et isegi vea tekkimisel saab selle parandada.

Põhiteksti pilt

<Clevi Semantic Database Structure>

Peamised omadused ja tehniline struktuur

Semantiline andmesalvestus

  • Andmetevahelised semantilised seosed (kontekst, hierarhia, põhjuslikkus jne) salvestatakse graafandmebaasi, mitte lihtsasse chunk-vektorandmebaasi
  • Lihtne laiendada ja täiendada teadmiste graafi või semantilise võrgustikuna

Hübriidotsing ja tuletamine

  • CTA+Context Query: päringu konteksti (Context) ja CTA samaaegne arvestamine
  • Hybrid Retrieval: vektorite sarnasuse otsingu ning reegli- ja graafipõhise otsingu ühendamine
  • Intelligent Folder Hits: semantiliselt seotud kaustade/kategooriate automaatne otsimine

Multimodaalne samaaegne töötlemine

  • TextReader Pool, VisionReader Pool jne võimaldavad samaaegselt tõlgendada mitmesuguseid andmeid, nagu tekst, pildid, tabelid ja heli
  • Kui olemasolev RAG suudab peamiselt töödelda ainult teksti, siis semantiline andmebaas paistab silma suurepärase multimodaalse töötlemisvõime poolest

Tõenduspõhised vastused ja usaldusväärsuse kontroll

  • Dokumentide kokkuvõtted ja viited, tabelite leidude automaatne genereerimine
  • Merge & Verify: mitmest allikast pärit teabe semantiline ühendamine ja usaldusväärsuse kontrollimine
  • Evidence Pack: tõenduspõhiste vastuste pakettide pakkumine

Keerukas arutlus ja planeerija

  • Planner/DAG: samm-sammulised plaanid ja DAG-il (Directed Acyclic Graph) põhinev arutlus keerukate päringute jaoks

Integreeritud agendi arhitektuur

  • cip-5-agent Supervisor: tipptaseme agent, mis haldab ja koordineerib kogu otsingu-, arutlus- ja integreerimisprotsessi
Põhiteksti pilt

3. Struktuuri kokkuvõte ja võrdlus

Kokkuvõttes võtab Semantic DB vastu eri vormides andmeid (hääl, tekst, pildid, video jne) ning klassifitseerib teadmisi, ühendades mitte ainult lihtsaid tükke, vaid ka andmete vahelisi semantilisi suhteid (kontekst, hierarhia, põhjuslikkus jne).

Selle põhjal võimaldab see RAG-i sarnaselt märksõna- või sarnasuspõhise otsingu asemel semantilistel seostel põhinevat otsingut ja arutlust, mistõttu saab tehisintellektilt täpsemat teabeotsingut ja vastuseid.

Lisaks sellele, et teadmised salvestatakse teadmiste graafi või semantilise võrgustiku kujul, on neid lihtne pidevalt laiendada ja täiendada.

Clevi avastas tehisintellekti ulatusliku ülemineku ajastul RAG-süsteemide piirangud ning tänu neid piiranguid lahendavale semantilisele andmebaasile ja meie enda AI-mudelile suudame nüüd klientidele kiiremini pakkuda täpsemaid ja usaldusväärsemaid andmeid.

Clevi AI-süsteem suudab igas keskkonnas, olenemata valdkonnast, muuta klientide väärtuslikud andmed väärtuslikumaks.

Ka edaspidi annab Clevi endast parima, et maksimeerida klientide andmete väärtust ja pakkuda uuenduslikku AI-kogemust.

Kutsume teid koos Cleviga kogema uue AI tulevikku.

Päringud ja demo taotlused: [email protected]

Copyright© 2025 Clevi Inc. Kõik õigused kaitstud.

Tagasi uudistetoimetusse
CLEVI

Keel ja piirkond

Masintõlgitud keeled on märgitud. Saadavus järgib avaldatud saidipaketti.

136 keelt

Soovitatav

1

Ida-Aasia

7

Kagu-Aasia

11

Lõuna-Aasia

18

Kesk-Aasia

5

Lähis-Ida ja Kaukaasia

10

Lääne-Euroopa ja Lõuna-Euroopa

16

Ühendkuningriik ja Iirimaa

4

Põhja-Euroopa

10

Kesk-Euroopa ja Balkan

14

Ida-Euroopa

5

Ida-Aafrika

8

Lääne-Aafrika ja Kesk-Aafrika

9

Lõuna-Aafrika

8

Ameerika

5

Okeaania

5
Clevi semantiline andmebaas — CLEVI