1. Catastrophic Forgetting-en eta RAGen mugak
AIa benetako lanetan ezartzean, kezka nagusietako bat da lehendik ikasitako ezagutza datu berriekin doitzeko prozesuan gertatzen den ahazte katastrofikoaren (Catastrophic Forgetting) fenomenoa.
Neurona-sareetan oinarritutako AIak informazio berria ikasteko prozesuan aurretik ikasitako ezagutza edo ereduak bat-batean galtzen dituen fenomenoa da.
Adibidez, kode irekiko LLM bat enpresa jakin baten datuekin doitzen bada, zentzu komun orokorra edo hizkuntza-gaitasuna murriztu daitezke.
Arazo hori saihesteko, RAG(Retrieval-Augmented Generation) teknologia asko erabiltzen bada ere, RAGek ere baditu bere mugak.
RAGen muga nagusiak
- Egituratutako datuen prozesamendu eskasa (Structured Data QA): RAG sistemak batez ere testu-dokumentu ez-egituratuetarako optimizatuta daude; beraz, ezin dituzte behar bezala ulertu edo erabili egituratutako datuen (taulak, datu-baseak, kalkulu-orriak eta abar) esanahia eta erlazioak.
- PDF konplexuen/dokumentu ez-egituratuen mugak (Complex PDFs): PDF dokumentu konplexuetan (taulak, zutabe anitz, irudiak eta abar dituztenetan), informazioa gal daiteke edo testuingurua desitxura daiteke chunking (zatiketa) prozesuan. Horren ondorioz, datu garrantzitsuak ez indexatzea edo bilaketa zailagoa izatea gerta daiteke.
- Fallback (babesko) eredurik eza (Fallback Model(s)): RAG sistemak erantzun egokirik aurkitzen ez duenean, ordezko (babesko) eredu batera aldatzeko logika eskasa edo eraginkortasunik gabea da. Horren ondorioz, erantzunak huts egiten duenean ez zaio erabiltzaileari asebeteko duen alternatibarik eskaintzen.
- Segurtasun-ahuleziak (LLM Security): LLMaren beraren segurtasun-ahulezien aurkako babesa (prompt-injekzioa, datu-isurketak eta abar) eskasa denez, informazio sentikorra agerian geratzeko arriskua dago.
- Eskalatze-falta (Data Ingestion Scalability): Datu-bolumen handiak indexatu eta biltegiratzean, eskalagarritasun-arazoak sortzen dira. Datu gehiago dagoen heinean, chunking-, biltegiratze- eta bilaketa-abiadurak moteldu egiten dira, eta sistemaren karga handitzen da.
- Informazio garrantzitsuaren galera (Missing Content): Dokumentuetako eduki garrantzitsua chunking prozesuan galtzen da edo ez da indexatzen askotan. Horren ondorioz, erabiltzaileak ezin du nahi duen informazioa bilatu.
- Goi-mailako rankinga ez aurkitzea (Missed Top Ranked): Bilaketa-emaitzetan, benetan garrantzitsuenak diren chunkak (goi-mailako rankingekoak) gal daitezke. Arrazoiak izan daitezke bilaketa-algoritmoen mugak, embeddingen kalitate eskasa edo ranking-akatsak.
- Testuinguru-desoreka (Not in Context): Askotan, bilatutako chunkak ez datoz bat benetako galderaren testuinguruarekin. Antzekotasunean oinarritutako bilaketa hutsaren mugen ondorioz, lotura semantikoa eskasa da.
- Formatu-akatsa (Wrong Format): Bilatutako chunkaren formatua desegokia izan daiteke LLMak prozesatzeko, edo erabiltzaileak nahi duen erantzun-formatuarekin bat ez etor daiteke. Adibidez, taula testu bihurtzean informazioa desitxuratzea.
- Informazioa ateratzeko hutsegitea (Not Extracted): Beharrezko informazioa chunketik behar bezala ez ateratzea edo LLMak informazioa ez ezagutzea gerta daiteke. Maiz gertatzen da esaldi-egitura konplexuetan, tauletan, irudietan eta abarretan.
- Informazioaren irismenaren/sakontasunaren desegokitasuna (Incorrect Specificity): Erantzuna galderarako zabalegia edo, alderantziz, gehiegi zehatza denean, ez dator bat erabiltzailearen benetako beharrekin. Zaila da informazioaren irismena eta sakontasuna doitzea.
- Erantzun osatugabea (Incomplete): Azkenean sortutako erantzuna osatugabea izan daiteke, edo informazioaren zati bat bakarrik eman dezake; ondorioz, ez ditu erabiltzailearen beharrak behar bezala betetzen. Arrazoiak izan daitezke hainbat chunketako informazioa ez sintetizatzea edo LLMak informazioaren zati bat bakarrik erabiltzea.
Horrela, RAGek bektore-antzekotasuneko bilaketa sinplean eta chunk-etan oinarritutako indexazioan gehiegi oinarritzen direnez, mugak argiak dituzte benetako lan-inguruneetan, fidagarritasunari, eskalagarritasunari eta zehaztasunari dagokienez.
2. RAGen mugak gainditu dituen CLEVIren datu-base semantikoa
Muga horiek gainditzeko, CLEVIk hurrengo belaunaldiko AI ezagutza-azpiegitura garatu du: lotura semantikoan, arrazoibide konplexuan eta ebidentzian oinarritutako erantzunetan optimizatua, Clevi Semantic Database.
Hori posible da CLEVIk bere Reasoning ereduak, multimodal AI eta agente motako AI ereduak guztiak dituelako, eta AIa errealitatean benetan lagungarria izatea ahalbidetzen duen CLEVIren teknologia indartsuetako bat da.
Metafora gisa, informazioa gordetzen den datu-basea liburutegi bat dela pentsatzen badugu, CLEVIren datu-base semantikoa liburuzain bikaina duen liburutegi bat dela pentsa dezakegu. (Liburuzainari behar duzun informazioa eskatzen badiozu, erantzun zehatza eta azkarra jasoko duzu.)
Erabiltzaileek edozein unetan informazio berria gehi dezakete liburutegian eta behar duten informazioa eskuratu dezakete.
Gainera, datuen bertsioen kudeaketa eta sarbide-baimenak nahi bezala konfigura daitezke.
Liburuzainaren ekintza guztiak erregistro (log) gisa gordetzen direnez, akatsen bat gertatuz gero ere zuzendu egin daiteke.
<Clevi Semantic Database Structure>
Ezaugarri nagusiak eta egitura teknologikoa
Datuen biltegiratze semantikoa
- Ez da chunk bektoreko DB soil bat; datuen arteko erlazio semantikoak (testuingurua, hierarkia, kausalitatea eta abar) grafiko-DB batean gordetzen ditu
- Ezagutza-grafo edo sare semantiko gisa erraz heda eta osa daiteke
Bilaketa eta arrazoibide hibridoa
- CTA+Context Query: kontuan hartzen ditu aldi berean kontsultaren testuingurua (Context) eta CTA
- Hybrid Retrieval: bektore-antzekotasuneko bilaketa eta arauetan/grafoetan oinarritutako bilaketa konbinatzen ditu
- Intelligent Folder Hits: semantikoki erlazionatutako karpetak/kategoriak automatikoki aurkitzen ditu
Prozesamendu multimodala aldi berean
- TextReader Pool, VisionReader Pool eta antzekoek aldi berean interpretatzen dituzte hainbat datu mota, hala nola testua, irudiak, taulak eta audioa
- Lehendik dauden RAGek batez ere testua soilik prozesa dezaketen bitartean, datu-base semantikoak gaitasun bikainak ditu datu multimodalen prozesamenduan
Ebidentzian oinarritutako erantzunak eta fidagarritasunaren egiaztapena
- Dokumentuen laburpenak eta aipamenak, taulen aurkikuntzak eta abar: dokumentuen laburpenak eta iturriak automatikoki sortzea
- Merge & Verify: hainbat iturritako informazioa semantikoki integratzea eta fidagarritasuna egiaztatzea
- Evidence Pack: ebidentzian oinarritutako erantzun-paketeak eskaintzea
Arrazonamendu konplexua eta planifikatzailea
- Planner/DAG: kontsulta konplexuetarako urratsez urratseko planak eta DAG (Directed Acyclic Graph) oinarritutako arrazonamendua
Agente integratuaren egitura
- cip-5-agent Supervisor: bilaketa-, arrazonamendu- eta integrazio-prozesu osoa kudeatzen eta koordinatzen duen goi-mailako agentea
3. Egituraren laburpena eta alderaketa
Laburbilduz, Semantic DBk hainbat formatutako datuak (ahotsa, testua, irudiak, bideoa eta abar) jasotzen ditu, eta ez ditu Chunk soil gisa sailkatzen; aitzitik, datuen arteko erlazio semantikoak (testuingurua, hierarkia, kausalitatea eta abar) ere lotzen ditu ezagutza sailkatzeko.
Horretan oinarrituta, RAGen moduko gako-hitzetan edo antzekotasunean oinarritutako bilaketa egin beharrean, lotura semantikoak erabiltzen ditu bilaketarako eta arrazonamendurako; horri esker, AIaren bidez informazioa zehatzago bilatu eta erantzun zehatzagoak jaso daitezke.
Gainera, ezagutza-grafo edo sare semantiko gisa gordetzen denez, errazagoa da etengabe zabaltzea eta osatzea.
Clevik, AIaren eraldaketa handiaren garaian, RAG sistemen mugak aurkitu ditu, eta horiek konpontzeko Semantic DB eta AI eredu propioei esker, bezeroei datu zehatzagoak eta fidagarriagoak azkarrago eskaintzeko aukera dugu.
Cleviren AI sistemek bezeroen datu baliotsuak balio bihur ditzakete edozein ingurunetan, domeinu-mota edozein dela ere.
Aurrerantzean ere, Clevik ahalegin guztiak egingo ditu bezeroen datuen balioa maximizatzeko eta AI esperientzia berritzaileak eskaintzeko.
Clevirekin batera, bizi ezazue AI berriaren etorkizuna.
Kontsultak eta demo-eskaerak: [email protected]
Copyright© 2025 Clevi Inc. Eskubide guztiak erreserbatuta.
