1. Mga Limitasyon sa Catastrophic Forgetting ug RAG
Sa dihang ipatuman ang AI sa aktuwal nga trabaho, usa sa labing dagkong kabalaka mao ang panghitabo sa katastrofikong pagkalimot (Catastrophic Forgetting) nga mahitabo kung i-fine-tune ang kasamtangang nakat-unan nga kahibalo gamit ang bag-ong datos.
Kini usa ka panghitabo diin ang AI nga nakabase sa neural network kalit nga mawad-an sa kahibalo o mga sumbanan nga kaniadto niini nakat-unan samtang nagkat-on kini og bag-ong impormasyon.
Pananglitan, kung i-fine-tune ang usa ka open-source nga LLM gamit ang datos sa usa ka partikular nga kompanya, mahimong mokunhod ang kinatibuk-ang sentido komon o abilidad sa pinulongan niini.
Aron malikayan kini nga problema, kaylap nga gigamit ang teknolohiyang RAG(Retrieval-Augmented Generation), apan aduna gihapoy mga limitasyon ang RAG.
Mga nag-unang limitasyon sa RAG
- Kulang nga pagproseso sa structured data (Structured Data QA): Ang RAG system kasagarang gi-optimize alang sa dili strukturadong mga dokumentong teksto, busa dili niini hustong masabtan o magamit ang kahulogan ug relasyon sa structured data (mga lamesa, database, spreadsheet, ug uban pa).
- Limitasyon sa komplikadong PDF/dili strukturadong mga dokumento (Complex PDFs): Ang komplikadong mga dokumentong PDF (lakip ang mga lamesa, daghang kolum, mga hulagway, ug uban pa) mahimong mawad-an og impormasyon o madaot ang konteksto panahon sa proseso sa chunking (pagbahin). Tungod niini, ang importanteng datos mahimong dili ma-index o mahimong lisod pangitaon.
- Kulang nga Fallback (backup) nga modelo (Fallback Model(s)): Kung dili makakita og tukmang tubag ang RAG system, kulang o dili episyente ang lohika sa pagbalhin ngadto sa alternatibong (backup) nga modelo. Tungod niini, kung mapakyas ang pagtubag, dili matagaan ang tiggamit og alternatibong tubag nga makapatagbaw kaniya.
- Kahuyang sa seguridad (LLM Security): Tungod kay kulang ang depensa batok sa mga kahuyang sa seguridad sa LLM mismo (sama sa prompt injection ug pag-leak sa datos), adunay risgo nga maibutyag ang sensitibong impormasyon.
- Kulang nga scalability (Data Ingestion Scalability): Mahimong motumaw ang mga problema sa scalability panahon sa pag-index ug pagtipig sa dagkong gidaghanon sa datos. Samtang modaghan ang datos, mokunhod ang katulin sa chunking, pagtipig, ug pagpangita, ug modako ang karga sa sistema.
- Pagkawala sa importanteng impormasyon (Missing Content): Kasagaran mawala ang importanteng sulod sa dokumento panahon sa proseso sa chunking o dili kini ma-index. Tungod niini, dili makapangita ang tiggamit sa iyang gikinahanglang impormasyon.
- Wala maapil ang taas nga ranggo (Missed Top Ranked): Mahimong dili maapil sa mga resulta sa pagpangita ang chunk nga tinuod nga labing may kalabotan (top-ranked). Ang mga hinungdan niini mahimong limitasyon sa search algorithm, pagkunhod sa kalidad sa embedding, mga sayop sa ranggo, ug uban pa.
- Dili uyon sa konteksto (Not in Context): Kasagaran dili mohaom ang nakit-ang chunk sa tinuod nga konteksto sa pangutana. Tungod kini sa limitasyon sa pagpangita nga gibase lamang sa yano nga pagkapareho, busa kulang ang semantikong koneksiyon.
- Sayop nga pormat (Wrong Format): Ang pormat sa nakit-ang chunk mahimong dili angay iproseso sa LLM o lahi sa pormat sa tubag nga gusto sa tiggamit. Pananglitan, mahimong mausab ang impormasyon kung ang lamesa himoon nga teksto.
- Kapakyasan sa pagkuha sa impormasyon (Not Extracted): Mahimong dili hustong makuha ang gikinahanglang impormasyon gikan sa chunk, o mahimong dili kini mailhan sa LLM. Kasagaran kini mahitabo sa komplikadong estruktura sa mga tudling-pulong, mga lamesa, mga hulagway, ug uban pa.
- Dili angay ang gilapdon/profundidad sa impormasyon (Incorrect Specificity): Mahimong sobra ka halapad ang tubag sa pangutana o, sa kasukwahi, sobra ka espesipiko, busa dili kini mohaom sa tinuod nga panginahanglan sa tiggamit. Lisod i-adjust ang gilapdon ug profundidad sa impormasyon.
- Dili kompleto nga tubag (Incomplete): Ang kataposang nahimo nga tubag mahimong dili kompleto o maghatag lamang og pipila ka impormasyon, busa dili kini igo nga makatubag sa panginahanglan sa tiggamit. Ang mga hinungdan mahimong ang kawalay-kahimo sa paghiusa sa impormasyon gikan sa daghang chunk o ang paggamit sa LLM sa usa lamang ka bahin niini.
Tungod kay ang RAG sobra nga nagsalig sa yano nga pagpangita base sa pagkapareho sa mga vector ug sa chunk-based nga pag-indeks, klaro ang mga limitasyon niini sa kasaligan, pagpalapad, ug katukma sa aktuwal nga trabaho.
2. Semantikong database sa Clevi nga nakabuntog sa mga limitasyon sa RAG
Aron mabuntog kini nga mga limitasyon, ang Clevi nakahimo sa sunod-henerasyong imprastraktura sa kahibalo sa AI nga na-optimize alang sa semantikong koneksyon, komplikadong pangatarungan, ug tubag nga nakabase sa ebidensya, ang Clevi Semantic Database.
Posible kini tungod kay ang Clevi adunay kaugalingong Reasoning nga modelo, multimodal AI, ug agent-based AI nga mga modelo, ug usa kini sa gamhanang teknolohiya nga talagsaon sa Clevi aron ang AI mahimong tinuod nga mapuslanon sa realidad.
Sa pagpasimple, kung ang database diin gitipigan ang impormasyon itandi sa usa ka librarya, hunahunaa nga ang semantikong database sa Clevi adunay usa ka maayo kaayong librarian. (Kung mangayo ka sa librarian sa gikinahanglang impormasyon, makadawat ka og tukma ug paspas nga tubag.)
Ang mga tiggamit makadugang og bag-ong impormasyon sa librarya ug makakuha sa gikinahanglang impormasyon bisan kanus-a.
Mahimo usab nimong itakda sumala sa imong gusto ang pagdumala sa bersyon sa datos ug ang mga permiso sa pag-access.
Tungod kay ang tanang lihok sa librarian marekord isip log (rekord), mahimo kining usbon bisan pa og adunay sayop.
<Clevi Semantic Database Structure>
Pangunang mga kinaiya ug estruktura sa teknolohiya
Semantikong pagtipig sa datos
- Dili yano nga chunk vector DB, kondili gitipigan sa graph DB ang semantikong mga relasyon tali sa datos (konteksto, herarkiya, hinungdan ug epekto, ug uban pa)
- Sayon kining palapdan ug kompletuhon sa porma sa knowledge graph/semantic network
Hybrid nga pagpangita ug pangatarungan
- CTA+Context Query: dungan nga gikonsiderar ang konteksto (Context) sa pangutana ug ang CTA
- Hybrid Retrieval: kombinasyon sa pagpangita base sa pagkapareho sa mga vector ug pagpangita base sa mga lagda/grafo
- Intelligent Folder Hits: awtomatikong pagpangita sa mga folder/kategoriya nga semantikong may kalabotan
Dungan nga pagproseso sa multimodal nga datos
- Dungan nga paghubad sa lain-laing datos sama sa teksto, hulagway, lamesa, ug tingog pinaagi sa TextReader Pool, VisionReader Pool, ug uban pa
- Samtang ang kasagarang RAG kasagaran makaproseso lamang og teksto, ang semantikong database labaw kaayo sa pagproseso sa multimodal nga datos
Tubag nga nakabase sa ebidensya ug pagsusi sa kasaligan
- Awtomatikong paghimo og mga buod ug citation sa dokumento, mga kaplag sa talaan, ug uban pa
- Merge & Verify: Semantikong paghiusa ug pag-verify sa kasaligan sa impormasyon gikan sa daghang tinubdan
- Evidence Pack: Paghatag og pakete sa mga tubag nga gibase sa ebidensya
Komplikadong pangatarungan ug planner
- Planner/DAG: Sunod-sunod nga pagplano ug pangatarungan nga gibase sa DAG (Directed Acyclic Graph) alang sa komplikadong mga pangutana
Integradong estruktura sa ahente
- cip-5-agent Supervisor: Labing taas nga ahente nga nagdumala ug nagkoordinar sa tibuok proseso sa pagpangita, pangatarungan, ug paghiusa
3. Katingbanan ug pagtandi sa estruktura
Sa pagsumada, ang Semantic DB modawat og datos sa lain-laing porma (tingog, teksto, hulagway, bidyo, ug uban pa) ug nagklasipikar sa kahibalo pinaagi sa pagkonektar dili lamang sa yano nga Chunk kondili apil usab sa semantikong mga relasyon tali sa datos (konteksto, herarkiya, hinungdan ug epekto, ug uban pa).
Pinaagi niini, tungod kay naggamit kini og pagpangita ug pangatarungan nga nakabase sa semantikong koneksyon imbes nga pagpangita nga nakabase sa keyword o pagkapareho sama sa RAG, mas tukma nga pagpangita og impormasyon ug mga tubag ang imong makuha gikan sa AI.
Dugang pa, tungod kay gitipigan kini sa porma sa knowledge graph o semantikong network, sayon ang padayon nga pagpalapad ug pagkompleto niini.
Kami sa Clevi nakadiskubre sa mga limitasyon sa mga sistema sa RAG sa panahon sa dakong pagbalhin ngadto sa AI, ug pinaagi sa semantikong database ug among kaugalingong AI model nga makasulbad niini, nahimo namong mas paspas nga mahatag sa mga kustomer ang mas tukma ug mas kasaligan nga datos.
Ang AI system sa Clevi makahimo sa paghatag og bili sa bililhong datos sa mga kustomer, bisan unsa pa ang palibot ug bisan unsa pa ang matang sa domain.
Sa umaabot, buhaton gihapon sa Clevi ang among labing maayo aron mapadako ang bili sa datos sa mga kustomer ug makahatag og bag-ong kasinatian sa AI.
Gidapit ka namo nga masinati ang kaugmaon sa bag-ong AI uban sa Clevi.
Mga pangutana ug hangyo alang sa demo: [email protected]
Copyright© 2025 Clevi Inc. All rights reserved.
