Riċerka

Database Semantika ta’ Clevi

Meta l-AI tiġi introdotta fix-xogħol reali, waħda mill-akbar tħassib hija l-fenomenu ta’ telf katastrofiku (Catastrophic Forgetting) li jseħħ meta l-għarfien li jkun tgħallem qabel jiġi rfinat b’dejta ġdida.

1. Il-limiti ta’ Catastrophic Forgetting u RAG

Meta l-AI tiġi introdotta fix-xogħol reali, waħda mill-akbar tħassib hija l-fenomenu ta’ telf katastrofiku (Catastrophic Forgetting) li jseħħ meta l-għarfien li jkun tgħallem qabel jiġi rfinat b’dejta ġdida.

Dan huwa fenomenu li fih l-AI bbażata fuq netwerks newrali titlef b’mod rapidu l-għarfien jew ix-xejriet li tkun tgħallmet qabel waqt il-proċess tat-tagħlim ta’ informazzjoni ġdida.

Pereżempju, jekk LLM open source jiġi rfinat b’dejta speċifika ta’ kumpanija, is-sens komun ġenerali jew il-kapaċità lingwistika jistgħu jonqsu.

Biex tiġi evitata din il-problema, it-teknoloġija RAG(Retrieval-Augmented Generation) tintuża b’mod wiesa’, iżda RAG ukoll għandha l-limitazzjonijiet tagħha.

Immaġni fil-kontenut

Il-limitazzjonijiet ewlenin ta’ RAG

  • Ipproċessar insuffiċjenti ta’ data strutturata (Structured Data QA): Is-sistemi RAG huma ottimizzati prinċipalment għal dokumenti b’test mhux strutturat, u għalhekk ma jistgħux jifhmu jew jużaw kif xieraq it-tifsira u r-relazzjonijiet tad-data strutturata (tabelli, databases, spreadsheets, eċċ.).
  • Limitazzjonijiet ta’ PDFs kumplessi/dokumenti mhux strutturati (Complex PDFs): Dokumenti PDF kumplessi (li jinkludu tabelli, kolonni multipli, stampi, eċċ.) jistgħu jwasslu għal telf ta’ informazzjoni jew distorsjoni tal-kuntest matul il-proċess ta’ chunking (diviżjoni). B’hekk, data importanti tista’ ma tiġix indiċizzata jew tista’ tkun diffiċli biex tinstab.
  • Nuqqas ta’ mudell Fallback (Fallback Model(s)): Meta s-sistema RAG ma ssibx tweġiba xierqa, il-loġika biex taqleb għal mudell alternattiv (ta’ riżerva) tista’ tkun insuffiċjenti jew ineffiċjenti. Minħabba f’hekk, meta tfalli t-tweġiba, l-utent ma jingħatax alternattiva sodisfaċenti.
  • Vulnerabbiltajiet tas-sigurtà (LLM Security): Id-difiża kontra l-vulnerabbiltajiet tas-sigurtà tal-LLM innifsu (bħall-prompt injection u t-tnixxija tad-data) tista’ tkun insuffiċjenti, u b’hekk jinħoloq riskju li tiġi esposta informazzjoni sensittiva.
  • Nuqqas ta’ skalabbiltà (Data Ingestion Scalability): Jistgħu jinqalgħu problemi ta’ skalabbiltà matul l-indiċizzazzjoni u l-ħażna ta’ volumi kbar ta’ data. Hekk kif tiżdied id-data, il-veloċità ta’ chunking, ħażna u tfittxija tonqos, filwaqt li t-tagħbija fuq is-sistema tiżdied.
  • Telf ta’ informazzjoni importanti (Missing Content): Kontenut importanti mid-dokumenti spiss jintilef matul il-proċess ta’ chunking jew ma jiġix indiċizzat. B’hekk, l-utent ma jkunx jista’ jsib l-informazzjoni li jkun qed ifittex.
  • Nuqqas tal-ogħla klassifikazzjoni (Missed Top Ranked): Ir-riżultat ta’ chunk (bl-ogħla klassifikazzjoni) li fil-fatt ikun l-aktar rilevanti jista’ ma jidhirx fir-riżultati tat-tfittxija. Il-kawżi jinkludu limitazzjonijiet fl-algoritmu tat-tfittxija, kwalità baxxa tal-embeddings u żbalji fil-klassifikazzjoni.
  • Nuqqas ta’ qbil fil-kuntest (Not in Context): Ħafna drabi, il-chunk misjub ma jkunx jaqbel mal-kuntest attwali tal-mistoqsija. Din hija limitazzjoni tat-tfittxija bbażata biss fuq ix-xebh, li twassal għal nuqqas ta’ konnessjoni semantika.
  • Format ħażin (Wrong Format): Il-format tal-chunk misjub jista’ ma jkunx adattat biex jiġi pproċessat mill-LLM jew jista’ jkun differenti mill-format tat-tweġiba mixtieq mill-utent. Pereżempju, tabella tista’ tiġi kkonvertita f’test u b’hekk l-informazzjoni tiġi distorta.
  • Nuqqas fl-estrazzjoni tal-informazzjoni (Not Extracted): L-informazzjoni meħtieġa tista’ ma tiġix estratta kif xieraq mill-chunk, jew l-LLM jista’ ma jagħrafhiex. Dan iseħħ ta’ spiss fi strutturi ta’ sentenzi kumplessi, tabelli, stampi, eċċ.
  • Speċifiċità mhux xierqa tal-firxa/profondità tal-informazzjoni (Incorrect Specificity): It-tweġiba tista’ tkun wisq ġenerali għall-mistoqsija jew, bil-kontra, speċifika żżejjed, u għalhekk ma taqbilx mal-ħtiġijiet reali tal-utent. Huwa diffiċli li jiġu aġġustati l-firxa u l-profondità tal-informazzjoni.
  • Tweġiba mhux kompluta (Incomplete): It-tweġiba ġġenerata finalment tista’ tkun mhux kompluta jew tipprovdi biss parti mill-informazzjoni, u għalhekk ma tissodisfax biżżejjed il-ħtiġijiet tal-utent. Il-kawżi jistgħu jkunu n-nuqqas li tiġi kkombinata l-informazzjoni minn diversi chunks jew li l-LLM juża biss parti mill-informazzjoni.

B’dan il-mod, peress li RAG tiddependi b’mod eċċessiv fuq it-tfittxija bbażata fuq xebh sempliċi tal-vetturi u l-indiċjar ibbażat fuq chunks, il-limitazzjonijiet tagħha f’termini ta’ affidabbiltà, skalabbiltà u preċiżjoni huma ċari fix-xogħol reali.

2. Id-database semantika ta’ CLEVI li tegħleb il-limitazzjonijiet ta’ RAG

Biex tegħleb dawn il-limitazzjonijiet, CLEVI żviluppat infrastruttura tal-għarfien tal-AI tal-ġenerazzjoni li jmiss, ottimizzata għal konnessjonijiet semantiċi, inferenza kumplessa u tweġibiet ibbażati fuq evidenza, Clevi Semantic Database.

Din hija soluzzjoni possibbli minħabba li għandha Reasoning models proprjetarji, AI multimodali u mudelli AI aġenti kollha, u hija waħda mit-teknoloġiji b’saħħithom uniċi ta’ CLEVI li jagħmlu l-AI tassew utli fid-dinja reali.

B’analoġija, jekk database li fiha tinħażen l-informazzjoni titqies bħala librerija, tista’ taħseb fid-database semantika ta’ CLEVI bħala librerija b’librar eċċellenti. (Meta titlob lill-librar l-informazzjoni li għandek bżonn, tirċievi tweġiba preċiża u rapida.)

L-utenti jistgħu jżidu informazzjoni ġdida fil-librerija u jġibu l-informazzjoni meħtieġa fi kwalunkwe ħin.

Barra minn hekk, jistgħu jistabbilixxu l-ġestjoni tal-verżjonijiet tad-data u l-permessi ta’ aċċess kif jixtiequ.

Peress li kull azzjoni tal-librar tiġi rreġistrata f’log (rekord), anke jekk iseħħ żball, dan jista’ jiġi kkoreġut.

Immaġni fil-kontenut ewlieni

<Clevi Semantic Database Structure>

Karatteristiċi ewlenin u struttura teknika

Ħażna semantika tad-data

  • Minflok vector DB sempliċi bbażata fuq chunks, taħżen ir-relazzjonijiet semantiċi bejn id-data (il-kuntest, il-ġerarkija, il-kawżalità, eċċ.) f’graph DB
  • Faċli li tiġi estiża u kkomplementata f’forma ta’ knowledge graph/semantic network

Tfittxija u inferenza ibridi

  • CTA+Context Query: Tirrifletti kemm il-kuntest (Context) tal-mistoqsija kif ukoll is-CTA
  • Hybrid Retrieval: Tgħaqqad ix-xebh tal-vetturi ma’ tfittxija bbażata fuq ir-regoli/il-grafi
  • Intelligent Folder Hits: Tfittex awtomatikament folders/kategoriji relatati semantikament

Ipproċessar simultanju multimodali

  • TextReader Pool, VisionReader Pool, eċċ. jinterpretaw simultanjament diversi tipi ta’ data, inklużi test, immaġini, tabelli u awdjo
  • Filwaqt li RAG tradizzjonali tista’ tipproċessa prinċipalment test biss, id-database semantika għandha kapaċità eċċellenti ta’ pproċessar multimodali

Tweġibiet ibbażati fuq evidenza u verifika tal-affidabbiltà

  • Doc Summaries & Citations, Table Findings eċċ. Ġenerazzjoni awtomatika ta’ sommarji u sorsi tad-dokumenti
  • Merge & Verify: Integrazzjoni semantika tal-informazzjoni minn sorsi multipli u verifika tal-affidabbiltà
  • Evidence Pack: Provvista ta’ pakketti ta’ tweġibiet ibbażati fuq l-evidenza

Raġunament kumpless u Planner

  • Planner/DAG: Pjanar f’passi u raġunament ibbażat fuq DAG (Directed Acyclic Graph) għal mistoqsijiet kumplessi

Arkitettura ta’ aġent integrat

  • cip-5-agent Supervisor: L-aġent ewlieni li jimmaniġġja u jikkoordina l-proċess kollu ta’ tfittxija, raġunament u integrazzjoni
Immaġni fil-kontenut ewlieni

3. Sommarju u tqabbil tal-istruttura

Fil-qosor, Semantic DB jirċievi dejta f’diversi formati (vuċi, test, immaġni, vidjo, eċċ.) u jikklassifika l-għarfien billi jgħaqqad mhux biss Chunk sempliċi, iżda wkoll ir-relazzjonijiet semantiċi bejn id-dejta (kuntest, ġerarkija, kawżalità, eċċ.).

Abbażi ta’ dan, minflok tfittxija bbażata fuq kliem ewlieni jew xebh bħal RAG, iwettaq tfittxija u raġunament bl-użu ta’ konnessjonijiet semantiċi, u b’hekk jippermetti li tinkiseb informazzjoni u tweġibiet aktar preċiżi mill-AI.

Barra minn hekk, peress li tinħażen fil-forma ta’ graff tal-għarfien/netwerk semantiku, huwa faċli li tiġi estiża u kkomplementata kontinwament.

CLEVI identifikat il-limitazzjonijiet tas-sistemi RAG fl-era tat-trasformazzjoni kbira tal-AI u, permezz ta’ database semantika u mudelli AI proprjetarji li jistgħu jsolvuhom, issa nistgħu nwasslu dejta aktar preċiża u affidabbli lill-klijenti tagħna b’mod rapidu.

Is-sistema AI ta’ CLEVI tista’ tagħmel id-dejta prezzjuża tal-klijenti tagħna ta’ valur, irrispettivament mit-tip ta’ dominju u fi kwalunkwe ambjent.

CLEVI se tkompli tagħmel l-almu tagħha biex timmassimizza l-valur tad-dejta tal-klijenti u tipprovdi esperjenzi AI innovattivi.

Nistednuk tesperjenza l-futur il-ġdid tal-AI flimkien ma’ CLEVI.

Ikkuntattjana u itlob demo: [email protected]

Copyright© 2025 Clevi Inc. Id-drittijiet kollha riżervati.

Lura għall-kamra tal-aħbarijiet
CLEVI

Lingwa u reġjun

Il-lingwi tradotti awtomatikament huma mmarkati. Id-disponibbiltà ssegwi l-pakkett ippubblikat tas-sit.

136 lingwi

Rakkomandat

1

Asja tal-Lvant

7

Asja tax-Xlokk

11

Asja t’Isfel Ċentrali

18

Asja Ċentrali

5

Lvant Nofsani u l-Kawkasu

10

Ewropa tal-Punent u Ewropa t’Isfel

16

ir-Renju Unit u l-Irlanda

4

Ewropa ta’ Fuq

10

Ewropa Ċentrali u l-Balkani

14

Ewropa tal-Lvant

5

Affrika tal-Lvant

8

Affrika tal-Punent u Affrika Nofsani

9

Affrika t’Isfel

8

Amerika

5

Oċejanja

5
Database Semantika ta’ Clevi — CLEVI