Tyrimai

Clevi semantinė duomenų bazė

Kai dirbtinis intelektas pradedamas taikyti realiame darbe, vienas didžiausių rūpesčių yra katastrofiškojo užmiršimo (Catastrophic Forgetting) reiškinys, atsirandantis derinant anksčiau išmoktų žinių tikslinį mokymą su naujais duomenimis.

1. Catastrophic Forgetting ir RAG apribojimai

Kai dirbtinis intelektas pradedamas taikyti realiame darbe, vienas didžiausių rūpesčių yra katastrofiškojo užmiršimo (Catastrophic Forgetting) reiškinys, atsirandantis derinant anksčiau išmoktų žinių tikslinį mokymą su naujais duomenimis.

Tai reiškinys, kai neuroniniais tinklais pagrįstas dirbtinis intelektas mokydamasis naujos informacijos staiga praranda anksčiau įgytas žinias ar šablonus.

Pavyzdžiui, atliekant atvirojo kodo LLM tikslinį mokymą naudojant konkrečios įmonės duomenis, gali pablogėti bendrosios žinios ar kalbiniai gebėjimai.

Siekiant išvengti šios problemos, plačiai naudojama RAG (Retrieval-Augmented Generation) technologija, tačiau ir RAG turi apribojimų.

Pagrindinio teksto vaizdas

Pagrindiniai RAG apribojimai

  • Nepakankamas struktūrizuotų duomenų apdorojimas (Structured Data QA): RAG sistemos daugiausia optimizuotos nestruktūrizuotiems tekstiniams dokumentams, todėl jos negali tinkamai suprasti ar panaudoti struktūrizuotų duomenų (lentelių, duomenų bazių, skaičiuoklių ir kt.) prasmės bei ryšių.
  • Sudėtingų PDF / nestruktūrizuotų dokumentų apribojimai (Complex PDFs): sudėtingų PDF dokumentų (su lentelėmis, keliais stulpeliais, vaizdais ir kt.) chunking (skaidymo) proceso metu gali būti prarasta informacija arba iškraipytas kontekstas. Dėl to svarbūs duomenys gali būti neindeksuoti arba juos gali būti sunku rasti.
  • Atsarginio modelio nebuvimas (Fallback Model(s)): kai RAG sistema neranda tinkamo atsakymo, perjungimo į alternatyvų (atsarginį) modelį logika yra nepakankama arba neveiksminga. Dėl to, nepavykus pateikti atsakymo, naudotojui nepasiūloma tenkinanti alternatyva.
  • Saugumo spragos (LLM Security): nepakankama apsauga nuo pačių LLM saugumo spragų (promptų injekcijų, duomenų nutekėjimo ir kt.) kelia pavojų, kad bus atskleista neskelbtina informacija.
  • Nepakankamas mastelio keitimas (Data Ingestion Scalability): indeksuojant ir saugant didelius duomenų kiekius kyla mastelio keitimo problemų. Didėjant duomenų kiekiui, lėtėja chunking, saugojimo ir paieškos procesai, o sistemos apkrova didėja.
  • Svarbios informacijos praradimas (Missing Content): dokumento chunking proceso metu svarbus turinys dažnai prarandamas arba neindeksuojamas. Dėl to naudotojas negali rasti norimos informacijos.
  • Aukščiausio reitingo rezultatų praleidimas (Missed Top Ranked): paieškos rezultatuose gali būti praleistas iš tikrųjų aktualiausias chunk (aukščiausio reitingo rezultatas). Priežastys gali būti paieškos algoritmo apribojimai, prasta įterpinių kokybė ar reitingavimo klaidos.
  • Konteksto neatitikimas (Not in Context): dažnai randamas chunk neatitinka tikrojo klausimo konteksto. Tai lemia semantinio ryšio trūkumas, susijęs su paprastos panašumu grindžiamos paieškos apribojimais.
  • Netinkamas formatas (Wrong Format): rasto chunk formatas gali būti netinkamas LLM apdoroti arba neatitikti naudotojo pageidaujamo atsakymo formato. Pavyzdžiui, lentelę pavertus tekstu, informacija gali būti iškraipyta.
  • Informacijos neišgavimas (Not Extracted): reikiama informacija gali būti netinkamai išgaunama iš chunk arba LLM gali jos neatpažinti. Tai dažnai nutinka apdorojant sudėtingą sakinių struktūrą, lenteles, vaizdus ir kt.
  • Netinkamas informacijos apimties / detalumo lygis (Incorrect Specificity): atsakymas gali būti per daug bendras arba, priešingai, pernelyg konkretus, todėl neatitikti tikrųjų naudotojo poreikių. Sunku tinkamai reguliuoti informacijos apimtį ir detalumo lygį.
  • Neišsamus atsakymas (Incomplete): galutinai sugeneruotas atsakymas gali būti neišsamus arba jame gali būti pateikta tik dalis informacijos, todėl naudotojo poreikiai nepakankamai patenkinami. Tai gali lemti nesugebėjimas apibendrinti informacijos iš kelių chunk arba tai, kad LLM panaudoja tik dalį informacijos.

Tokiu būdu, kadangi RAG pernelyg priklauso nuo paprastos vektorių panašumo paieškos ir chunk pagrindu atliekamo indeksavimo, jo ribotumai realiame darbe yra aiškiai matomi patikimumo, mastelio didinimo ir tikslumo aspektais.

2. CLEVI semantinė duomenų bazė, įveikusi RAG ribotumus

Siekdama įveikti šiuos ribotumus, CLEVI sukūrė naujos kartos AI žinių infrastruktūrą – semantiniams ryšiams, kompleksiniam samprotavimui ir įrodymais pagrįstiems atsakymams optimizuotą Clevi Semantic Database.

Tai sprendimas, įmanomas todėl, kad CLEVI turi savo Reasoning modelius, multimodalinį AI ir agentiniais principais pagrįstus AI modelius. Tai viena iš išskirtinai galingų CLEVI technologijų, leidžiančių AI iš tikrųjų būti naudingam realiame pasaulyje.

Jei duomenų bazę, kurioje saugoma informacija, palygintume su biblioteka, CLEVI semantinę duomenų bazę galima įsivaizduoti kaip turinčią itin gabų bibliotekininką. (Paprašę bibliotekininko reikiamos informacijos, gausite tikslų ir greitą atsakymą.)

Naudotojai bet kuriuo metu gali bibliotekoje pridėti naujos informacijos ir gauti reikiamą informaciją.

Be to, duomenų versijų valdymą ir prieigos teises galima nustatyti pagal savo poreikius.

Visi bibliotekininko veiksmai išsaugomi žurnale (įrašuose), todėl net ir įvykus klaidai ją galima ištaisyti.

Pagrindinio teksto vaizdas

<Clevi Semantic Database Structure>

Pagrindinės savybės ir techninė struktūra

Semantinis duomenų saugojimas

  • Duomenų bazėje saugomi ne tik paprasti chunk vektoriai, bet ir semantiniai ryšiai tarp duomenų (kontekstas, hierarchija, priežastingumas ir kt.)
  • Lengva išplėsti ir papildyti žinių grafiko / semantinio tinklo forma

Hibridinė paieška ir samprotavimas

  • CTA+Context Query: kartu atsižvelgiama į užklausos kontekstą (Context) ir CTA
  • Hybrid Retrieval: derinama vektorių panašumo paieška su taisyklėmis / grafais pagrįsta paieška
  • Intelligent Folder Hits: automatiškai ieškomi semantiškai susiję aplankai / kategorijos

Lygiagretus multimodalinis apdorojimas

  • Kartu interpretuojami įvairūs duomenys, pvz., tekstas, vaizdai, lentelės ir garsas, naudojant TextReader Pool, VisionReader Pool ir kt.
  • Nors įprastas RAG daugiausia gali apdoroti tik tekstą, semantinė duomenų bazė pasižymi puikiomis multimodalinio apdorojimo galimybėmis

Įrodymais pagrįsti atsakymai ir patikimumo tikrinimas

  • Dokumentų santraukų ir citatų, lentelėse pateiktų išvadų bei kitos informacijos automatinis generavimas
  • Merge & Verify: semantinis informacijos iš kelių šaltinių integravimas ir patikimumo tikrinimas
  • Evidence Pack: įrodymais pagrįstų atsakymų paketų pateikimas

Sudėtingas samprotavimas ir planuotojas

  • Planner/DAG: nuoseklus sudėtingų užklausų planavimas ir samprotavimas, pagrįstas DAG (Directed Acyclic Graph)

Integruota agentų struktūra

  • cip-5-agent Supervisor: aukščiausio lygio agentas, valdantis ir koordinuojantis visą paieškos, samprotavimo ir integravimo procesą
Pagrindinio teksto vaizdas

3. Struktūros santrauka ir palyginimas

Apibendrinant, Semantic DB priima įvairių formų duomenis (garsą, tekstą, vaizdus, vaizdo įrašus ir kt.) ir klasifikuoja žinias, susiedama ne tik paprastus fragmentus, bet ir semantinius ryšius tarp duomenų (kontekstą, hierarchiją, priežastinius ryšius ir kt.).

Remiantis tuo, užuot naudojus raktažodžiais ar panašumu grindžiamą paiešką, kaip RAG atveju, paieška ir samprotavimas atliekami pasitelkiant semantinius ryšius, todėl AI gali pateikti tikslesnę informacijos paiešką ir atsakymus.

Be to, kadangi žinios saugomos žinių grafiko arba semantinio tinklo forma, jas lengva nuolat plėsti ir papildyti.

CLEVI, AI transformacijos eroje atradusi RAG sistemų ribotumus, pasitelkdama šiuos iššūkius sprendžiančią semantinę duomenų bazę ir nuosavą AI modelį, gali klientams greitai pateikti tikslesnius ir patikimesnius duomenis.

CLEVI AI sistema bet kokioje aplinkoje, nepriklausomai nuo srities, gali paversti vertingais vertingus klientų duomenis.

CLEVI ir toliau dės visas pastangas, kad maksimaliai padidintų klientų duomenų vertę ir suteiktų novatorišką AI patirtį.

Kviečiame kartu su CLEVI patirti naujosios AI eros ateitį.

Užklausos ir demonstracijos prašymai: [email protected]

Copyright© 2025 Clevi Inc. Visos teisės saugomos.

Grįžti į naujienų kambarį
CLEVI

Kalba ir regionas

Mašininio vertimo kalbos yra pažymėtos. Prieinamumas priklauso nuo paskelbto svetainės paketo.

136 kalbos

Rekomenduojama

1

Rytų Azija

7

Pietryčių Azija

11

Pietų Azija

18

Centrinė Azija

5

Artimieji Rytai ir Kaukazas

10

Vakarų Europa ir Pietų Europa

16

Jungtinė Karalystė ir Airija

4

Šiaurės Europa

10

Vidurio Europa ir Balkanai

14

Rytų Europa

5

Rytų Afrika

8

Vakarų Afrika ir Vidurio Afrika

9

Pietinė Afrika

8

Amerika

5

Okeanija

5
Clevi semantinė duomenų bazė — CLEVI