Pananaliksik

Clevi Semantic Database

Kapag ipinapatupad ang AI sa aktuwal na trabaho, isa sa pinakamalaking alalahanin ay ang phenomenon ng catastrophic forgetting na nangyayari kapag fina-fine-tune ang dating natutunang kaalaman gamit ang bagong data.

1. Mga limitasyon ng Catastrophic Forgetting at RAG

Kapag ipinapatupad ang AI sa aktuwal na trabaho, isa sa pinakamalaking alalahanin ay ang phenomenon ng catastrophic forgetting na nangyayari kapag fina-fine-tune ang dating natutunang kaalaman gamit ang bagong data.

Ito ay isang phenomenon kung saan mabilis na nawawala ng neural network-based AI ang dati nitong natutunang kaalaman o mga pattern habang natututo ito ng bagong impormasyon.

Halimbawa, kung fina-fine-tune ang isang open-source LLM gamit ang data ng isang partikular na kumpanya, maaaring bumaba ang pangkalahatang kaalaman o kakayahan sa wika nito.

Upang maiwasan ang problemang ito, malawakang ginagamit ang teknolohiyang RAG(Retrieval-Augmented Generation), ngunit mayroon ding mga limitasyon ang RAG.

Larawan sa katawan ng teksto

Mga pangunahing limitasyon ng RAG

  • Hindi sapat na pagproseso ng structured data (Structured Data QA): Dahil pangunahing naka-optimize ang RAG system para sa mga hindi istrukturadong text document, hindi nito wastong nauunawaan o nagagamit ang kahulugan at ugnayan ng structured data (mga talahanayan, database, spreadsheet, at iba pa).
  • Mga limitasyon sa kumplikadong PDF/hindi istrukturadong dokumento (Complex PDFs): Sa mga kumplikadong PDF document (may mga talahanayan, maraming column, larawan, at iba pa), maaaring mawala ang impormasyon o maiba ang konteksto sa proseso ng chunking (paghahati). Dahil dito, maaaring hindi ma-index ang mahahalagang data o maging mahirap itong hanapin.
  • Kakulangan ng Fallback (backup) model (Fallback Model(s)): Kapag hindi makahanap ng angkop na sagot ang RAG system, maaaring kulang o hindi episyente ang logic para lumipat sa alternatibong (backup) model. Dahil dito, walang naibibigay na kasiya-siyang alternatibo sa user kapag nabigo ang pagsagot.
  • Mga kahinaan sa seguridad (LLM Security): Dahil hindi sapat ang depensa laban sa mga kahinaan sa seguridad ng LLM mismo (prompt injection, pagtagas ng data, at iba pa), may panganib na malantad ang sensitibong impormasyon.
  • Kakulangan sa scalability (Data Ingestion Scalability): Nagkakaroon ng mga problema sa scalability habang ini-index at iniimbak ang malalaking volume ng data. Habang dumarami ang data, bumabagal ang chunking, pag-iimbak, at paghahanap, at tumataas ang load ng system.
  • Pagkawala ng mahahalagang impormasyon (Missing Content): Madalas na nawawala ang mahahalagang nilalaman mula sa dokumento sa proseso ng chunking o hindi ito nai-index. Dahil dito, hindi mahanap ng user ang impormasyong kailangan niya.
  • Pagkawala ng pinakamataas na ranggo (Missed Top Ranked): Maaaring hindi maisama sa mga resulta ng paghahanap ang chunk na aktuwal na may pinakamataas na kaugnayan (top-ranked). Kabilang sa mga sanhi nito ang mga limitasyon ng search algorithm, mababang kalidad ng embedding, at mga error sa ranking.
  • Hindi tugma sa konteksto (Not in Context): Madalas na hindi tugma ang nahanap na chunk sa konteksto ng aktuwal na tanong. Dahil ito sa limitasyon ng paghahanap batay lamang sa pagkakatulad, kaya kulang ang semantikong ugnayan.
  • Maling format (Wrong Format): Maaaring hindi angkop para iproseso ng LLM ang format ng nahanap na chunk o maaaring iba ito sa format ng sagot na hinihiling ng user. Halimbawa, maaaring maiba ang impormasyon kapag na-convert ang talahanayan sa text.
  • Hindi na-extract ang impormasyon (Not Extracted): Maaaring hindi maayos na ma-extract ang kinakailangang impormasyon mula sa chunk o maaaring hindi ito makilala ng LLM. Madalas itong nangyayari sa mga kumplikadong istruktura ng pangungusap, talahanayan, larawan, at iba pa.
  • Hindi angkop na saklaw/lalim ng impormasyon (Incorrect Specificity): Maaaring masyadong malawak ang sagot sa tanong o, sa kabilang banda, masyadong partikular, kaya hindi ito tugma sa aktuwal na pangangailangan ng user. Mahirap ayusin ang saklaw at lalim ng impormasyon.
  • Hindi kumpletong sagot (Incomplete): Maaaring hindi kumpleto ang panghuling nabuong sagot o ilang impormasyon lamang ang maibigay, kaya hindi nito sapat na natutugunan ang pangangailangan ng user. Kabilang sa mga sanhi nito ang hindi pagsasama-sama ng impormasyon mula sa maraming chunk o bahagyang paggamit lamang ng LLM sa impormasyon.

Dahil labis na umaasa ang RAG sa simpleng vector similarity search at chunk-based indexing, malinaw ang mga limitasyon nito sa pagiging maaasahan, scalability, at katumpakan sa aktuwal na trabaho.

2. Semantic Database ng CLEVI na lumalampas sa mga limitasyon ng RAG

Upang malampasan ang mga limitasyong ito, bumuo ang CLEVI ng isang susunod na henerasyong imprastraktura ng kaalaman para sa AI, ang Clevi Semantic Database, na na-optimize para sa semantic na koneksyon, kumplikadong pangangatwiran, at mga tugong batay sa ebidensya.

Posible ang solusyong ito dahil taglay ng CLEVI ang sarili nitong Reasoning model, multimodal AI, at agentic AI model, at isa ito sa makapangyarihang teknolohiya ng CLEVI na nagbibigay-daan upang tunay na makatulong ang AI sa totoong mundo.

Bilang paghahalintulad, kung ang database kung saan nakaimbak ang impormasyon ay isang aklatan, isipin ang Semantic Database ng CLEVI bilang isang napakahusay na librarian. (Kapag hiniling mo sa librarian ang impormasyong kailangan mo, makatatanggap ka ng tumpak at mabilis na sagot.)

Maaaring magdagdag ang mga user ng bagong impormasyon sa aklatan at kumuha ng kinakailangang impormasyon anumang oras.

Maaari ring itakda ayon sa nais ang version control ng data at mga pahintulot sa pag-access.

Naitatala sa mga log ang lahat ng kilos ng librarian, kaya maaaring itama ang mga ito kahit magkaroon ng pagkakamali.

Larawan ng nilalaman

<Clevi Semantic Database Structure>

Mga pangunahing tampok at teknikal na istruktura

Semantic na pag-iimbak ng data

  • Sa halip na simpleng chunk vectorDB, iniimbak sa graph DB ang mga semantic na ugnayan sa pagitan ng data (konteksto, hierarchy, causality, at iba pa)
  • Madaling palawakin at dagdagan sa anyo ng knowledge graph/semantic network

Hybrid na paghahanap at pangangatwiran

  • CTA+Context Query: Sabay na isinasaalang-alang ang konteksto (Context) ng query at ang CTA
  • Hybrid Retrieval: Pinagsasama ang vector similarity at rule/graph-based search
  • Intelligent Folder Hits: Awtomatikong tinutuklas ang mga folder/category na semantically related

Sabayang pagproseso ng multimodal na data

  • Sabay na binibigyang-kahulugan ang iba't ibang data gaya ng text, larawan, talahanayan, at audio gamit ang TextReader Pool, VisionReader Pool, at iba pa
  • Samantalang pangunahing text lamang ang kayang iproseso ng tradisyonal na RAG, mahusay ang Semantic Database sa multimodal na pagproseso

Mga tugong batay sa ebidensya at pagpapatunay ng pagiging maaasahan

  • Awtomatikong pagbuo ng mga buod at sanggunian ng dokumento, mga pagtuklas sa talahanayan, at iba pa
  • Merge & Verify: Semantikong pagsasama ng impormasyon mula sa maraming source at pagpapatunay sa pagiging maaasahan
  • Evidence Pack: Pagbibigay ng paketeng tugon na batay sa ebidensya

Komplikadong pangangatwiran at planner

  • Planner/DAG: Hakbang-hakbang na pagpaplano at pangangatwirang batay sa DAG (Directed Acyclic Graph) para sa mga kumplikadong query

Pinag-isang arkitektura ng ahente

  • cip-5-agent Supervisor: Nangungunang ahente na namamahala at nag-uugnay sa buong proseso ng paghahanap, pangangatwiran, at pagsasama
Larawan sa pangunahing teksto

3. Buod at paghahambing ng istruktura

Sa kabuuan, tumatanggap ang Semantic DB ng data sa iba't ibang anyo (boses, teksto, larawan, video, at iba pa) at inuuri ang kaalaman sa pamamagitan ng pagkonekta hindi lamang ng mga simpleng Chunk kundi pati ng mga semantikong ugnayan sa pagitan ng data (konteksto, hierarchy, sanhi at bunga, at iba pa).

Batay rito, sa halip na paghahanap na nakabatay sa keyword o similarity gaya ng RAG, gumagamit ito ng semantikong koneksyon para sa paghahanap at pangangatwiran, kaya makakakuha mula sa AI ng mas tumpak na paghahanap ng impormasyon at mga sagot.

Bukod dito, dahil nakaimbak ito sa anyo ng knowledge graph o semantic network, madali itong patuloy na palawakin at dagdagan.

Natuklasan ng CLEVI ang mga limitasyon ng mga RAG system sa panahon ng malaking pagbabago sa AI, at sa pamamagitan ng semantic database at sariling AI model na makalulutas sa mga ito, nagawa naming mabilis na makapagbigay sa mga customer ng mas tumpak at mas maaasahang data.

Nagagawa ng AI system ng CLEVI na gawing mahalaga ang mahalagang data ng mga customer, anuman ang kapaligiran at uri ng domain.

Patuloy na pagsisikapan ng CLEVI na mapakinabangan nang husto ang halaga ng data ng mga customer at makapagbigay ng makabagong karanasan sa AI.

Inaanyayahan namin kayong maranasan ang bagong hinaharap ng AI kasama ang CLEVI.

Mga katanungan at kahilingan para sa demo: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Bumalik sa newsroom
CLEVI

Wika at rehiyon

Minarkahan ang mga wikang isinalin ng makina. Ang availability ay nakabatay sa inilathalang bundle ng site.

136 wika

Inirerekomenda

1

Silangang Asya

7

Timog-Silangang Asya

11

Katimugang Asya

18

Gitnang Asya

5

Gitnang Silangan at Caucasus

10

Kanlurang Europe at Katimugang Europe

16

United Kingdom at Ireland

4

Hilagang Europe

10

Gitnang Europa at Balkan

14

Silangang Europe

5

Silangang Africa

8

Kanlurang Africa at Gitnang Africa

9

Katimugang Africa

8

Americas

5

Oceania

5
Clevi Semantic Database — CLEVI