Rannsóknir

Merkingarfræðilegur gagnagrunnur CLEVI

Þegar gervigreind er tekin í notkun í raunverulegu starfi er eitt stærsta áhyggjuefnið fyrirbærið hörmuleg gleymska (Catastrophic Forgetting), sem á sér stað þegar fyrirliggjandi þekking er fínstillt með nýjum gögnum.

1. Takmarkanir Catastrophic Forgetting og RAG

Þegar gervigreind er tekin í notkun í raunverulegu starfi er eitt stærsta áhyggjuefnið fyrirbærið hörmuleg gleymska (Catastrophic Forgetting), sem á sér stað þegar fyrirliggjandi þekking er fínstillt með nýjum gögnum.

Þetta er fyrirbæri þar sem gervigreind sem byggir á tauganeti tapar skyndilega fyrri þekkingu eða mynstrum í því ferli að læra nýjar upplýsingar.

Til dæmis getur almenn skynsemi eða málfærni rýrnað ef opinn LLM er fínstilltur með gögnum frá tilteknu fyrirtæki.

Til að forðast þetta vandamál er tæknin RAG(Retrieval-Augmented Generation) víða notuð, en RAG hefur einnig sínar takmarkanir.

Mynd í meginmáli

Helstu takmarkanir RAG

  • Ófullnægjandi úrvinnsla skipulagðra gagna (Structured Data QA): RAG-kerfi eru aðallega fínstillt fyrir óskipulögð textaskjöl og geta því átt erfitt með að skilja eða nýta merkingu og tengsl í skipulögðum gögnum (töflum, gagnagrunnum, töflureiknum o.s.frv.).
  • Takmarkanir flókinna PDF-/óskipulagðra skjala (Complex PDFs): Flókin PDF-skjöl (með töflum, mörgum dálkum, myndum o.s.frv.) geta tapað upplýsingum eða fengið brenglað samhengi í chunking-ferlinu (skiptingarferlinu). Þess vegna geta mikilvæg gögn annaðhvort ekki verið skráð í atriðaskrá eða orðið erfið í leit.
  • Skortur á Fallback-líkani (Fallback Model(s)): Þegar RAG-kerfi finnur ekki viðeigandi svar er rökfræði fyrir skiptingu yfir í varalíkan oft ófullnægjandi eða óhagkvæm. Þess vegna er notendum ekki boðinn fullnægjandi valkostur þegar svörun mistekst.
  • Öryggisveikleikar (LLM Security): Varnir gegn öryggisveikleikum í LLM sjálfu (t.d. prompt-inndælingu og gagnaleka) eru ófullnægjandi, sem skapar hættu á að viðkvæmar upplýsingar komist í hendur óviðkomandi.
  • Skortur á sveigjanleika við innlestur gagna (Data Ingestion Scalability): Vandamál með sveigjanleika koma upp við atriðaskráningu og geymslu mikils gagnamagns. Eftir því sem gagnamagnið eykst hægist á chunking, geymslu og leit og álag á kerfið eykst.
  • Mikilvægar upplýsingar vantar (Missing Content): Mikilvægt efni í skjölum getur oft glatast í chunking-ferlinu eða ekki verið skráð í atriðaskrá. Þess vegna geta notendur ekki leitað að þeim upplýsingum sem þeir þurfa.
  • Efsta röðun vantar (Missed Top Ranked): Viðeigandi chunk (efst raðaða einingin) getur vantað í leitarniðurstöður. Orsakir geta verið takmarkanir leitaralgríma, skert gæði innfellinga eða villur í röðun.
  • Samhengi passar ekki (Not in Context): Leitaði chunk-inn passar oft ekki við raunverulegt samhengi spurningarinnar. Þetta stafar af takmörkunum leitar sem byggir eingöngu á líkindum og skorti á merkingarlegum tengslum.
  • Rangt snið (Wrong Format): Snið leitaða chunk-ins getur verið óhentugt fyrir úrvinnslu LLM eða frábrugðið því svari sem notandinn óskar eftir. Til dæmis getur tafla verið umbreytt í texta þannig að upplýsingarnar brenglast.
  • Upplýsingar ekki dregnar út (Not Extracted): Nauðsynlegar upplýsingar eru ekki dregnar rétt út úr chunk-inum eða LLM nær ekki að greina þær. Þetta gerist oft við flókna setningagerð, töflur og myndir.
  • Óviðeigandi umfang/dýpt upplýsinga (Incorrect Specificity): Svarið getur verið of almennt miðað við spurninguna eða, öfugt, of nákvæmt og því ekki í samræmi við raunverulegar þarfir notandans. Erfitt getur verið að stilla umfang og dýpt upplýsinganna.
  • Ófullkomið svar (Incomplete): Svarið sem að lokum er búið til getur verið ófullkomið eða aðeins veitt hluta upplýsinganna og þannig ekki mætt þörfum notandans nægilega. Orsakir geta verið að upplýsingar úr mörgum chunk-um séu ekki teknar saman eða að LLM nýti aðeins hluta þeirra.

Þar sem RAG reiðir sig um of á einfalda leit að vektor-líkindum og chunk-byggða flokkun eru takmarkanir þess í raunverulegu starfi skýrar hvað varðar áreiðanleika, sveigjanleika og nákvæmni.

2. Clevi Semantic Database, sem yfirstígur takmarkanir RAG

Til að yfirstíga þessar takmarkanir þróaði CLEVI næstu kynslóðar gervigreindarþekkingarinnviði, Clevi Semantic Database, sem er fínstilltur fyrir merkingartengsl, samsetta rökhugsun og gagnreynd svör.

Þetta er lausn sem er möguleg vegna þess að CLEVI býr yfir eigin Reasoning-líkani, fjölhátta gervigreind og gervigreindarlíkönum af umboðsmannagerð, og hún er ein af öflugum tækniþáttum CLEVI sem gera gervigreind kleift að nýtast í raunveruleikanum.

Til einföldunar má líkja þessu við bókasafn þar sem upplýsingarnar eru geymdar í gagnagrunni: ímyndaðu þér að í Clevi Semantic Database sé einstaklega hæfur bókavörður. (Ef þú biður bókavörðinn um nauðsynlegar upplýsingar færðu nákvæmt og hratt svar.)

Notendur geta hvenær sem er bætt nýjum upplýsingum við bókasafnið og sótt þær upplýsingar sem þeir þurfa.

Einnig er hægt að stilla útgáfustýringu gagna og aðgangsheimildir eftir þörfum.

Allar aðgerðir bókavarðarins eru skráðar í annál, þannig að hægt er að leiðrétta mistök ef þau koma upp.

Mynd í meginmáli

<Clevi Semantic Database Structure>

Helstu eiginleikar og tæknileg uppbygging

Merkingarbundin gagnageymsla

  • Í stað einfaldrar chunk-vektor-gagnagrunns eru merkingarbundin tengsl milli gagna (samhengi, stigveldi, orsakasambönd o.fl.) geymd í línuritagagnagrunni
  • Auðvelt er að útvíkka og bæta við í formi þekkingarlínurits eða merkingarfræðilegs nets

Blönduð leit og rökhugsun

  • CTA+Context Query: Tekur mið af samhengi fyrirspurnarinnar (Context) og CTA samtímis
  • Hybrid Retrieval: Sameinar leit byggða á vektor-líkindum og leit byggða á reglum/línuriti
  • Intelligent Folder Hits: Finnur sjálfkrafa möppur/flokka sem tengjast merkingarfræðilega

Samhliða vinnsla fjölhátta gagna

  • TextReader Pool, VisionReader Pool o.fl. túlka samtímis fjölbreytt gögn á borð við texta, myndir, töflur og hljóð
  • Þó að hefðbundið RAG geti aðallega unnið úr texta býr merkingarbundni gagnagrunnurinn yfir framúrskarandi getu til vinnslu fjölhátta gagna

Gagnreynd svör og sannprófun á áreiðanleika

  • Skjalayfirlit og tilvísanir, niðurstöður úr töflum og sjálfvirk gerð samantekta og heimilda
  • Merge & Verify: Merkingarfræðileg samþætting upplýsinga úr mörgum heimildum og sannprófun á áreiðanleika
  • Evidence Pack: Afhending svarpakka byggðra á gögnum

Flókin rökhugsun og skipuleggjandi

  • Planner/DAG: Skrefaskipt áætlanagerð og rökhugsun byggð á DAG (Directed Acyclic Graph) fyrir flóknar fyrirspurnir

Samþætt umboðsmannabygging

  • cip-5-agent Supervisor: Yfirumsjónarmaður sem stjórnar og samhæfir allt ferlið við leit, rökhugsun og samþættingu
Mynd í meginmáli

3. Yfirlit yfir uppbyggingu og samanburður

Til að draga þetta saman tekur Semantic DB við gögnum á ýmsu formi (tali, texta, myndum, myndskeiðum o.fl.) og flokkar þekkingu með því að tengja ekki aðeins einföld Chunk heldur einnig merkingarfræðileg tengsl milli gagna (samhengi, stigveldi, orsakatengsl o.fl.).

Þar sem kerfið byggir á þessu og framkvæmir leit og rökhugsun með merkingarfræðilegum tengslum, fremur en leitarorða- eða líkindamiðaðri leit eins og í RAG, er hægt að fá nákvæmari upplýsingaleit og svör frá AI.

Þar sem gögnin eru einnig geymd á formi þekkingargrafs eða merkingarfræðilegs nets er auðvelt að stækka þau og bæta við þau stöðugt.

CLEVI uppgötvaði takmarkanir RAG-kerfa á tímum mikilla umskipta yfir í AI og hefur, með merkingarfræðilegum gagnagrunni og eigin AI-líkani sem geta leyst úr þessum takmörkunum, gert viðskiptavinum kleift að fá nákvæmari og áreiðanlegri gögn hratt.

AI-kerfi CLEVI geta, í hvaða umhverfi sem er og óháð gerð lénsins, gert verðmætar upplýsingar úr mikilvægum gögnum viðskiptavina okkar.

CLEVI mun einnig framvegis leggja sig fram um að hámarka verðmæti gagna viðskiptavina og veita nýstárlega AI-upplifun.

Upplifið framtíð nýrrar AI-tækni með CLEVI.

Fyrirspurnir og beiðnir um kynningu: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Til baka í fréttastofu
CLEVI

Tungumál og svæði

Tungumál sem hafa verið þýdd með vélþýðingu eru merkt. Aðgengi fylgir útgefnum vefpakka.

136 tungumál

Mælt með

1

Austur-Asía

7

Suðaustur-Asía

11

Suður-Asía

18

Mið-Asía

5

Miðausturlönd og Kákasus

10

Vestur-Evrópa og Suður-Evrópa

16

Bretland og Írland

4

Norður-Evrópa

10

Mið-Evrópa og Balkanskaginn

14

Austur-Evrópa

5

Austur-Afríka

8

Vestur-Afríka og Mið-Afríka

9

Suðurhluti Afríku

8

Ameríka

5

Eyjaálfa

5
Merkingarfræðilegur gagnagrunnur CLEVI — CLEVI