Taighde

Bunachar Sonraí Séimeantach Clevi

Nuair a chuirtear AI i bhfeidhm i bhfíorobair, is é ceann de na hábhair imní is mó an feiniméan ar a dtugtar Dearmad Tubaisteach (Catastrophic Forgetting), a tharlaíonn nuair a dhéantar an t-eolas a foghlaimíodh cheana a mhionchoigeartú le sonraí nua.

1. Teorainneacha Catastrophic Forgetting agus RAG

Nuair a chuirtear AI i bhfeidhm i bhfíorobair, is é ceann de na hábhair imní is mó an feiniméan ar a dtugtar Dearmad Tubaisteach (Catastrophic Forgetting), a tharlaíonn nuair a dhéantar an t-eolas a foghlaimíodh cheana a mhionchoigeartú le sonraí nua.

Is feiniméan é seo ina gcailltear go tobann an t-eolas nó na patrúin a foghlaimíodh roimhe seo le linn don AI atá bunaithe ar líonraí néaracha faisnéis nua a fhoghlaim.

Mar shampla, má dhéantar LLM foinse oscailte a mhionchoigeartú le sonraí cuideachta ar leith, d’fhéadfadh eolas ginearálta nó cumas teanga dul in olcas.

Chun an fhadhb seo a sheachaint, úsáidtear an teicneolaíocht RAG (Retrieval-Augmented Generation) go forleathan, ach tá teorainneacha ag RAG freisin.

Íomhá sa phríomhthéacs

Teorainneacha tipiciúla RAG

  • Próiseáil neamhleor sonraí struchtúrtha (Structured Data QA): Tá córais RAG optamaithe go príomha do dhoiciméid téacs neamhstruchtúrtha, agus mar sin ní thuigeann siad ná ní úsáideann siad brí agus gaolta sonraí struchtúrtha (táblaí, bunachair sonraí, scarbhileoga, srl.) i gceart.
  • Teorainneacha PDFanna casta/doiciméad neamhstruchtúrtha (Complex PDFs): I gcás doiciméad PDF casta (ina bhfuil táblaí, leagan amach ilcholún, íomhánna, srl.), d’fhéadfadh faisnéis a bheith in easnamh nó comhthéacs a shaobhadh le linn an phróisis chunking (deighilte). Mar thoradh air sin, d’fhéadfadh sé nach ndéanfaí sonraí tábhachtacha a innéacsú nó go mbeadh sé deacair iad a chuardach.
  • Easpa samhla Fallback (Fallback Model(s)): Nuair nach n-aimsíonn córas RAG freagra oiriúnach, d’fhéadfadh an loighic chun athrú chuig samhail mhalartach (chúltaca) a bheith in easnamh nó neamhéifeachtach. Mar thoradh air sin, ní chuirtear rogha eile shásúil ar fáil don úsáideoir nuair a theipeann ar an bhfreagra.
  • Leochaileachtaí slándála (LLM Security): Toisc nach leor an chosaint ar leochaileachtaí slándála an LLM féin (instealladh pras, sceitheadh sonraí, srl.), tá baol ann go nochtfar faisnéis íogair.
  • Easpa inscálaitheachta (Data Ingestion Scalability): Tagann fadhbanna inscálaitheachta chun cinn le linn sonraí móra a innéacsú agus a stóráil. De réir mar a mhéadaíonn méid na sonraí, laghdaíonn luas an chunking, na stórála agus an chuardaigh, agus méadaíonn ualach an chórais.
  • Easnamh faisnéise tábhachtaí (Missing Content): Is minic a bhíonn ábhar tábhachtach in easnamh ó dhoiciméid le linn an phróisis chunking nó nach ndéantar é a innéacsú. Mar thoradh air sin, ní féidir leis an úsáideoir an fhaisnéis atá uaidh a chuardach.
  • Easnamh sa rangú is airde (Missed Top Ranked): D’fhéadfadh an chunk is ábhartha i ndáiríre (an rangú is airde) a bheith in easnamh sna torthaí cuardaigh. I measc na gcúiseanna tá teorainneacha an algartaim chuardaigh, meath ar cháilíocht na n-embedding agus earráidí rangaithe.
  • Neamhréireacht comhthéacs (Not in Context): Is minic nach mbíonn an chunk a aimsítear ag teacht le comhthéacs iarbhír na ceiste. Mar gheall ar theorainneacha an chuardaigh atá bunaithe ar chosúlacht shimplí, bíonn easpa nasc shéimeantaigh ann.
  • Earráid formáide (Wrong Format): D’fhéadfadh formáid an chunk a aimsítear a bheith mí-oiriúnach do phróiseáil ag an LLM nó a bheith éagsúil ón bhformáid freagra atá ag teastáil ón úsáideoir. Mar shampla, d’fhéadfadh faisnéis a shaobhadh nuair a dhéantar tábla a thiontú go téacs.
  • Teip ar fhaisnéis a bhaint (Not Extracted): D’fhéadfadh sé nach mbainfí an fhaisnéis riachtanach as an chunk i gceart nó nach n-aithneodh an LLM an fhaisnéis. Tarlaíonn sé seo go minic i struchtúir chasta abairte, i dtáblaí agus in íomhánna.
  • Raon/doimhneacht mhí-oiriúnach faisnéise (Incorrect Specificity): D’fhéadfadh an freagra a bheith rófhairsing maidir leis an gceist nó, os a choinne sin, a bheith ró-shonrach, agus mar sin gan teacht le riachtanais iarbhír an úsáideora. Bíonn sé deacair raon agus doimhneacht na faisnéise a choigeartú.
  • Freagra neamhiomlán (Incomplete): D’fhéadfadh an freagra a ghintear ar deireadh a bheith neamhiomlán nó gan ach cuid den fhaisnéis a chur ar fáil, rud a fhágann nach gcomhlíontar riachtanais an úsáideora go leordhóthanach. I measc na gcúiseanna tá neamhábaltacht faisnéis ó ilchnaimh a chomhcheangal nó úsáid an LLM as cuid den fhaisnéis amháin.

Toisc go mbraitheann RAG an iomarca ar chuardach cosúlachta veicteora simplí agus ar innéacsú bunaithe ar smutáin, tá teorainneacha soiléire aige i dtéarmaí iontaofachta, inscálaitheachta agus cruinnis i bhfíorobair.

2. Bunachar sonraí séimeantach CLEVI a sháraíonn teorainneacha RAG

Chun na teorainneacha sin a shárú, d’fhorbair CLEVI bonneagar eolais AI den chéad ghlúin eile, Clevi Semantic Database, atá optamaithe le haghaidh nascadh séimeantach, réasúnú casta agus freagraí bunaithe ar fhianaise.

Is réiteach é seo atá indéanta toisc go bhfuil a samhlacha Reasoning féin, AI ilmhódach agus samhlacha AI gníomhaireacha ag CLEVI, agus tá sé ar cheann de theicneolaíochtaí cumhachtacha uathúla CLEVI a fhágann gur féidir le AI cuidiú go fírinneach sa saol réadúil.

Mar analaí, má mheasaimid gur leabharlann an bunachar sonraí ina stóráiltear faisnéis, is féidir linn smaoineamh ar bhunachar sonraí séimeantach CLEVI mar leabharlannóir den scoth. (Nuair a iarrann tú an fhaisnéis riachtanach ar an leabharlannóir, gheobhaidh tú freagra cruinn tapa.)

Is féidir le húsáideoirí faisnéis nua a chur leis an leabharlann agus an fhaisnéis riachtanach a aisghabháil am ar bith.

Ina theannta sin, is féidir leat bainistiú leaganacha na sonraí agus ceadanna rochtana a shocrú mar is mian leat.

Ós rud é go ndéantar gach gníomh de chuid an leabharlannaí a thaifeadadh i loga, is féidir é a cheartú fiú má tharlaíonn botún.

Íomhá an phríomhthéacs

<Clevi Semantic Database Structure>

Príomhghnéithe agus struchtúr teicniúil

Stóráil sonraí séimeantacha

  • Sonraí a stóráiltear i mbunachar sonraí graif de réir na gcaidreamh séimeantach idir sonraí (comhthéacs, ordlathas, cúisíocht, srl.), seachas i DB veicteora simplí bunaithe ar smutáin
  • Éasca le leathnú agus le comhlánú i bhfoirm ghraif eolais/líonraí séimeantacha

Cuardach agus réasúnú hibrideach

  • CTA+Context Query: Comhthéacs na ceiste (Context) agus an CTA araon curtha san áireamh
  • Hybrid Retrieval: Cosúlacht veicteora + cuardach bunaithe ar rialacha/graif comhcheangailte
  • Intelligent Folder Hits: Fillteáin/chatagóirí atá bainteach go séimeantach a aimsiú go huathoibríoch

Próiseáil chomhuaineach ilmhódach

  • Linnte TextReader agus VisionReader, srl., chun sonraí éagsúla amhail téacs, íomhánna, táblaí agus fuaim a léirmhíniú go comhuaineach
  • Cé nach féidir le RAG traidisiúnta ach téacs a phróiseáil den chuid is mó, tá cumas ilmhódach den scoth ag an mbunachar sonraí séimeantach

Freagraí bunaithe ar fhianaise agus bailíochtú iontaofachta

  • Achoimrí Cáipéisí & Lua Dhearbhuithe, Torthaí Táblaí etc. a ghiniúint go huathoibríoch
  • Cumaisc & Fíoraigh: Comhtháthú séimeantach faisnéise ó fhoinsí iolracha agus fíorú iontaofachta
  • Pacáiste Fianaise: Pacáistí freagraí bunaithe ar fhianaise a sholáthar

Réasúnaíocht chasta agus pleanálaí

  • Pleanálaí/DAG: Pleanáil céim ar chéim agus réasúnaíocht bunaithe ar DAG (Directed Acyclic Graph) le haghaidh fiosrúchán casta

Struchtúr gníomhaire comhtháite

  • cip-5-agent Supervisor: Gach próiseas cuardaigh, réasúnaíochta agus comhtháthaithe a bhainistiú agus a chomhordú mar ghníomhaire ardleibhéil
Íomhá sa phríomhthéacs

3. Achoimre agus comparáid ar an struchtúr

Mar achoimre, faigheann Semantic DB sonraí i bhfoirmeacha éagsúla (guth, téacs, íomhánna, físeáin etc.) mar ionchur agus déanann sé an t-eolas a rangú trí ní hamháin Chunkanna a chruthú, ach trí naisc a dhéanamh idir na caidrimh shéimeantacha idir na sonraí (comhthéacs, ordlathas, cúisíocht etc.) freisin.

Bunaithe air seo, in ionad cuardach agus réasúnaíocht bunaithe ar eochairfhocail nó ar chosúlacht cosúil le RAG, baintear úsáid as naisc shéimeantacha chun cuardach agus réasúnaíocht a dhéanamh, rud a chuireann ar chumas AI faisnéis a aimsiú agus freagraí níos cruinne a thabhairt.

Ina theannta sin, toisc go stóráiltear é i bhfoirm graif eolais nó líonra séimeantaigh, is furasta é a leathnú agus a chomhlánú go leanúnach.

D’aimsigh CLEVI teorainneacha na gcóras RAG i ré na mórathraithe AI, agus trí bhunachar sonraí séimeantach agus samhail AI dhílseánaigh a d’fhorbair muid, táimid anois in ann sonraí níos cruinne agus níos iontaofa a sholáthar do chustaiméirí go tapa.

Is féidir le córas AI CLEVI sonraí luachmhara ár gcustaiméirí a iompú ina luach, beag beann ar an réimse, in aon timpeallacht.

Amach anseo, leanfaidh CLEVI de gach iarracht a dhéanamh chun luach sonraí ár gcustaiméirí a uasmhéadú agus eispéireas nuálach AI a sholáthar.

Tabhair cuireadh duit féin taithí a fháil ar thodhchaí nua AI le CLEVI.

Fiosrúcháin agus iarratais taispeána: [email protected]

Copyright© 2025 Clevi Inc. Gach ceart ar cosaint.

Ar ais chuig an seomra nuachta
CLEVI

Teanga agus réigiún

Jaeger

136 teanga

Molta

1

Oirthear na hÁise

7

an Áise Thoir Theas

11

Deisceart na hÁise

18

an Áise Láir

5

An Meánoirthear agus an Chugais

10

Iarthar na hEorpa agus Deisceart na hEorpa

16

an Ríocht Aontaithe agus Éire

4

Tuaisceart na hEorpa

10

Lár na hEorpa agus na Balcáin

14

Oirthear na hEorpa

5

Oirthear na hAfraice

8

Iarthar na hAfraice agus an Afraic Láir

9

Deisceart na hAfraice

8

Críocha Mheiriceá

5

an Aigéine

5