1. Catastrophic Forgetting a chyfyngiadau RAG
Pan gyflwynir AI i waith go iawn, un o’r pryderon mwyaf yw’r ffenomen o anghofio trychinebus (Catastrophic Forgetting) sy’n digwydd wrth fireinio’r wybodaeth a ddysgwyd eisoes gyda data newydd.
Mae hyn yn cyfeirio at y ffenomen lle mae AI sy’n seiliedig ar rwydweithiau niwral yn colli’r wybodaeth neu’r patrymau a ddysgwyd yn flaenorol yn sydyn wrth ddysgu gwybodaeth newydd.
Er enghraifft, os caiff LLM ffynhonnell agored ei fireinio gyda data cwmni penodol, gall gwybodaeth gyffredinol neu allu ieithyddol ddirywio.
Er mwyn osgoi’r broblem hon, defnyddir technoleg RAG(Retrieval-Augmented Generation) yn eang, ond mae gan RAG gyfyngiadau hefyd.
Prif gyfyngiadau RAG
- Prosesu data strwythuredig annigonol (Structured Data QA): Mae systemau RAG wedi’u optimeiddio’n bennaf ar gyfer dogfennau testunau anstrwythuredig, ac felly nid ydynt yn gallu deall na defnyddio ystyr a pherthnasoedd data strwythuredig (tablau, cronfeydd data, taenlenni ac ati) yn briodol.
- Cyfyngiadau PDFau cymhleth/dogfennau anstrwythuredig (Complex PDFs): Gall dogfennau PDF cymhleth (gan gynnwys tablau, colofnau lluosog, delweddau ac ati) golli gwybodaeth neu ystumio’r cyd-destun yn ystod y broses chunking (rhannu). O ganlyniad, efallai na fydd data pwysig yn cael ei fynegeio neu gall fod yn anodd ei chwilio.
- Absenoldeb model wrth gefn (Fallback Model(s)): Pan na all system RAG ddod o hyd i ateb priodol, mae’r rhesymeg ar gyfer newid i fodel amgen (wrth gefn) yn annigonol neu’n aneffeithlon. O ganlyniad, ni ddarperir dewis arall boddhaol i’r defnyddiwr pan fydd yr ateb yn methu.
- Gwendidau diogelwch (LLM Security): Mae amddiffyniad yn erbyn gwendidau diogelwch yr LLM ei hun (chwistrellu anogwyr, gollyngiadau data ac ati) yn annigonol, gan greu risg y bydd gwybodaeth sensitif yn cael ei datgelu.
- Diffyg scalability (Data Ingestion Scalability): Mae problemau scalability yn codi wrth fynegeio a storio llawer iawn o ddata. Wrth i faint y data gynyddu, mae cyflymder chunking, storio a chwilio yn gostwng, ac mae llwyth y system yn cynyddu.
- Gwybodaeth bwysig ar goll (Missing Content): Mae cynnwys pwysig o ddogfennau yn aml yn cael ei golli yn ystod y broses chunking neu heb ei fynegeio. O ganlyniad, ni all defnyddwyr chwilio am y wybodaeth sydd ei hangen arnynt.
- Hepgor y safle uchaf (Missed Top Ranked): Efallai y bydd y chunk mwyaf perthnasol mewn gwirionedd (y safle uchaf) yn cael ei hepgor o’r canlyniadau chwilio. Mae cyfyngiadau’r algorithm chwilio, ansawdd isel yr embedding, gwallau graddio ac ati yn achosion posibl.
- Anghysondeb cyd-destun (Not in Context): Yn aml, nid yw’r chunk a chwiliwyd yn cyfateb i gyd-destun gwirioneddol y cwestiwn. Oherwydd cyfyngiadau chwilio sy’n seiliedig ar debygrwydd syml, mae’r cysylltiad semantig yn annigonol.
- Fformat anghywir (Wrong Format): Gall fformat y chunk a chwiliwyd fod yn anaddas i’r LLM ei brosesu neu gall fod yn wahanol i’r fformat ateb a ddymunir gan y defnyddiwr. Er enghraifft, gall gwybodaeth gael ei hystumio pan gaiff tabl ei drosi’n destun.
- Methiant i echdynnu gwybodaeth (Not Extracted): Efallai na chaiff y wybodaeth angenrheidiol ei hechdynnu’n briodol o’r chunk, neu efallai na fydd yr LLM yn adnabod y wybodaeth. Mae hyn yn digwydd yn aml gyda strwythurau brawddegau cymhleth, tablau, delweddau ac ati.
- Penodoldeb gwybodaeth yn amhriodol (Incorrect Specificity): Gall yr ateb fod yn rhy gyffredinol neu, i’r gwrthwyneb, yn rhy benodol mewn perthynas â’r cwestiwn, ac felly nid yw’n cyd-fynd ag anghenion gwirioneddol y defnyddiwr. Mae’n anodd addasu cwmpas a dyfnder y wybodaeth.
- Ateb anghyflawn (Incomplete): Gall yr ateb a gynhyrchir yn y pen draw fod yn anghyflawn neu ddarparu dim ond rhan o’r wybodaeth, gan fethu â bodloni gofynion y defnyddiwr yn ddigonol. Gall hyn gael ei achosi gan fethu â chyfuno gwybodaeth o sawl chunk neu gan yr LLM yn defnyddio rhan o’r wybodaeth yn unig.
Gan fod RAG yn dibynnu’n ormodol ar chwilio tebygrwydd fector syml a mynegeio wedi’i seilio ar ddarnau, mae ei gyfyngiadau o ran dibynadwyedd, scalability a chywirdeb mewn gwaith go iawn yn amlwg.
2. Cronfa ddata semantig CLEVI a oresgynnodd gyfyngiadau RAG
Er mwyn goresgyn y cyfyngiadau hyn, datblygodd CLEVI seilwaith gwybodaeth AI cenhedlaeth nesaf, sef Clevi Semantic Database, wedi’i optimeiddio ar gyfer cysylltiadau semantig, rhesymu cymhleth ac ymatebion seiliedig ar dystiolaeth.
Mae hwn yn ddatrysiad sy’n bosibl oherwydd bod ganddo ei fodelau Reasoning ei hun, AI amlfoddol a modelau AI asiantol, ac mae’n un o dechnolegau pwerus unigryw CLEVI sy’n galluogi AI i fod o gymorth gwirioneddol yn y byd go iawn.
I ddefnyddio cyfatebiaeth, os ydym yn ystyried y gronfa ddata lle mae gwybodaeth wedi’i storio yn llyfrgell, gallwch feddwl am gronfa ddata semantig CLEVI fel petai ganddi lyfrgellydd rhagorol. (Pan ofynnwch i’r llyfrgellydd am y wybodaeth sydd ei hangen arnoch, gallwch gael ymateb cywir a chyflym.)
Gall defnyddwyr ychwanegu gwybodaeth newydd i’r llyfrgell a nôl y wybodaeth sydd ei hangen arnynt ar unrhyw adeg.
Yn ogystal, gellir gosod rheoli fersiynau data a chaniatâd mynediad fel y dymunir.
Gan fod holl weithredoedd y llyfrgellydd yn cael eu cadw mewn log (cofnod), gellir cywiro unrhyw gamgymeriadau os byddant yn digwydd.
<Clevi Semantic Database Structure>
Prif nodweddion a strwythur technolegol
Storio data semantig
- Storio perthnasoedd semantig rhwng data (cyd-destun, hierarchaeth, achosiaeth, ac ati) mewn cronfa ddata graff, yn hytrach na Chronfa Ddata fector syml wedi’i seilio ar ddarnau
- Hawdd ei hehangu a’i hategu ar ffurf graff gwybodaeth/rhwydwaith semantig
Chwilio a rhesymu hybrid
- CTA+Context Query: Adlewyrchu cyd-destun (Context) yr ymholiad a’r CTA gyda’i gilydd
- Hybrid Retrieval: Cyfuno tebygrwydd fector â chwilio wedi’i seilio ar reolau/graffiau
- Intelligent Folder Hits: Archwilio ffolderi/categorïau sy’n gysylltiedig yn semantig yn awtomatig
Prosesu amlfoddol ar yr un pryd
- Dehongli data amrywiol fel testun, delweddau, tablau a llais ar yr un pryd, gan gynnwys TextReader Pool a VisionReader Pool
- Er bod RAG presennol yn gallu prosesu testun yn bennaf yn unig, mae gan y gronfa ddata semantig allu rhagorol i brosesu data amlfoddol
Ymatebion seiliedig ar dystiolaeth a dilysu dibynadwyedd
- Crynodebau Dogfennau a Dyfyniadau, Canfyddiadau Tablau ac ati – cynhyrchu crynodebau dogfennau a ffynonellau yn awtomatig
- Cyfuno a Gwirio: integreiddio semantig a dilysu dibynadwyedd gwybodaeth o ffynonellau lluosog
- Pecyn Tystiolaeth: darparu pecynnau ymateb yn seiliedig ar dystiolaeth
Rhesymu cymhleth a chynllunydd
- Cynllunydd/DAG: cynllunio fesul cam a rhesymu yn seiliedig ar DAG (Graff Acyclic Cyfeiriedig) ar gyfer ymholiadau cymhleth
Pensaernïaeth asiant integredig
- Goruchwyliwr cip-5-agent: yr asiant uchaf sy’n rheoli a chydlynu’r broses chwilio/rhesymu/integreiddio gyfan
3. Crynodeb a chymhariaeth o’r strwythur
I grynhoi, mae Semantic DB yn derbyn data mewn amrywiol ffurfiau (llais, testun, delweddau, fideo ac ati) ac yn dosbarthu gwybodaeth drwy gysylltu nid yn unig Chunks syml, ond hefyd y perthnasoedd semantig rhwng data (cyd-destun, hierarchaeth, achosiaeth ac ati).
Yn seiliedig ar hyn, yn hytrach na chwilio yn seiliedig ar eiriau allweddol/cyffelybiaeth fel RAG, mae’n defnyddio cysylltiadau semantig i chwilio a rhesymu, gan alluogi AI i ddarparu adalw gwybodaeth ac atebion mwy cywir.
Yn ogystal, gan ei fod yn cael ei storio ar ffurf graff gwybodaeth/rhwydwaith semantig, mae’n hawdd ei ehangu a’i ategu’n barhaus.
Mae CLEVI wedi darganfod cyfyngiadau systemau RAG yn oes y trawsnewid AI, ac, drwy gronfa ddata semantig a model AI unigryw a all ddatrys y materion hyn, mae bellach yn gallu darparu data mwy cywir a dibynadwy i gwsmeriaid yn gyflym.
Gall system AI CLEVI wneud data gwerthfawr cwsmeriaid yn werthfawr mewn unrhyw amgylchedd, waeth beth fo’r math o faes.
Bydd CLEVI yn parhau i wneud ei orau i wneud y mwyaf o werth data cwsmeriaid a darparu profiadau AI arloesol.
Profwch ddyfodol newydd AI gyda CLEVI.
Cysylltu a gofyn am arddangosiad: [email protected]
Copyright© 2025 Clevi Inc. Cedwir pob hawl.
