1. Catastrophic Forgetting-ի և RAG-ի սահմանափակումները
Երբ AI-ն ներդրվում է իրական աշխատանքային գործընթացներում, ամենամեծ մտահոգություններից մեկը Կործանարար մոռացության (Catastrophic Forgetting) երևույթն է, որն առաջանում է գոյություն ունեցող գիտելիքը նոր տվյալներով ֆայնթյունինգի ենթարկելիս։
Սա այն երևույթն է, երբ նեյրոնային ցանցերի վրա հիմնված AI-ն նոր տեղեկություններ սովորելու ընթացքում կտրուկ կորցնում է նախկինում յուրացրած գիտելիքը կամ օրինաչափությունները։
Օրինակ՝ եթե բաց կոդով LLM-ը ֆայնթյունինգի ենթարկվի որևէ ընկերության տվյալներով, կարող են վատանալ ընդհանուր գիտելիքները կամ լեզվական կարողությունները։
Այս խնդրից խուսափելու համար լայնորեն կիրառվում է RAG(Retrieval-Augmented Generation) տեխնոլոգիան, սակայն RAG-ն նույնպես ունի սահմանափակումներ։
RAG-ի հիմնական սահմանափակումները
- Կառուցվածքային տվյալների անբավարար մշակում (Structured Data QA). RAG համակարգերը հիմնականում օպտիմիզացված են չկառուցված տեքստային փաստաթղթերի համար, ուստի չեն կարողանում պատշաճ կերպով հասկանալ կամ օգտագործել կառուցվածքային տվյալների (աղյուսակներ, տվյալների բազաներ, աղյուսակային ֆայլեր և այլն) իմաստն ու փոխհարաբերությունները։
- Բարդ PDF/չկառուցված փաստաթղթերի սահմանափակումներ (Complex PDFs). Բարդ PDF փաստաթղթերի (աղյուսակներ, բազմասյունակ դասավորություն, պատկերներ և այլն) chunking (բաժանման) գործընթացում տեղեկատվությունը կարող է կորչել կամ համատեքստը՝ խեղաթյուրվել։ Արդյունքում կարևոր տվյալները կարող են չինդեքսավորվել կամ դժվար որոնելի դառնալ։
- Fallback (պահուստային) մոդելի բացակայություն (Fallback Model(s)). Երբ RAG համակարգը չի գտնում համապատասխան պատասխան, այլընտրանքային (պահուստային) մոդելի անցնելու տրամաբանությունը կարող է լինել անբավարար կամ անարդյունավետ։ Դրա հետևանքով պատասխանի ձախողման դեպքում օգտատիրոջը չի տրամադրվում բավարար այլընտրանք։
- Անվտանգության խոցելիություններ (LLM Security). LLM-ի սեփական անվտանգության խոցելիություններից (prompt injection, տվյալների արտահոսք և այլն) պաշտպանությունը կարող է անբավարար լինել, ինչի հետևանքով առկա է զգայուն տեղեկատվության բացահայտման վտանգ։
- Ընդլայնելիության պակաս (Data Ingestion Scalability). Մեծածավալ տվյալների ինդեքսավորման և պահպանման գործընթացում առաջանում են ընդլայնելիության խնդիրներ։ Տվյալների ծավալի մեծացմանը զուգահեռ դանդաղում են chunking-ի, պահպանման և որոնման գործընթացները, իսկ համակարգի ծանրաբեռնվածությունն աճում է։
- Կարևոր տեղեկատվության բացթողում (Missing Content). Փաստաթղթում կարևոր բովանդակությունը հաճախ բաց է թողնվում chunking-ի գործընթացում կամ չի ինդեքսավորվում։ Դրա հետևանքով օգտատերը չի կարողանում որոնել իրեն անհրաժեշտ տեղեկատվությունը։
- Վերևի վարկանիշային արդյունքի բացթողում (Missed Top Ranked). Որոնման արդյունքներում իրականում ամենաարդիական chunk-ը (վերևի վարկանիշային արդյունքը) կարող է բացակայել։ Պատճառները ներառում են որոնման ալգորիթմի սահմանափակումները, embedding-ի որակի նվազումը և վարկանիշավորման սխալները։
- Համատեքստի անհամապատասխանություն (Not in Context). Հաճախ որոնված chunk-ը չի համապատասխանում հարցի իրական համատեքստին։ Սա պարզ նմանության վրա հիմնված որոնման սահմանափակման հետևանք է, որի պատճառով իմաստային կապը բավարար չէ։
- Ձևաչափի սխալ (Wrong Format). Որոնված chunk-ի ձևաչափը կարող է անհարմար լինել LLM-ի մշակման համար կամ չհամապատասխանել օգտատիրոջ ակնկալած պատասխանի ձևաչափին։ Օրինակ՝ աղյուսակը կարող է վերածվել տեքստի, ինչի հետևանքով տեղեկատվությունը կխեղաթյուրվի։
- Տեղեկատվության արդյունահանման ձախողում (Not Extracted). Անհրաժեշտ տեղեկատվությունը կարող է պատշաճ կերպով չարդյունահանվել chunk-ից, կամ LLM-ը կարող է չճանաչել այն։ Սա հաճախ տեղի է ունենում բարդ նախադասությունների կառուցվածքների, աղյուսակների և պատկերների դեպքում։
- Տեղեկատվության շրջանակի/խորության անհամապատասխանություն (Incorrect Specificity). Պատասխանը կարող է լինել հարցի համար չափազանց ընդհանուր կամ, հակառակը, չափազանց կոնկրետ և չհամապատասխանել օգտատիրոջ իրական պահանջներին։ Դժվար է կարգավորել տեղեկատվության շրջանակն ու խորությունը։
- Թերի պատասխան (Incomplete). Ի վերջո ստեղծված պատասխանը կարող է լինել թերի կամ տրամադրել միայն տեղեկատվության մի մասը՝ ամբողջությամբ չբավարարելով օգտատիրոջ պահանջները։ Պատճառ կարող է լինել տարբեր chunk-երից տեղեկատվությունը չհամադրելը կամ LLM-ի կողմից դրա միայն մի մասի օգտագործումը։
Այսպիսով, քանի որ RAG-ը չափազանց մեծապես կախված է պարզ վեկտորային նմանության որոնումից և chunk-ի վրա հիմնված ինդեքսավորումից, իրական աշխատանքային միջավայրում դրա սահմանափակումները հստակ են՝ հուսալիության, մասշտաբայնության և ճշգրտության տեսանկյուններից։
2. CLEVI-ի սեմանտիկ տվյալների բազան, որը հաղթահարում է RAG-ի սահմանափակումները
Այս սահմանափակումները հաղթահարելու համար CLEVI-ն մշակել է հաջորդ սերնդի AI գիտելիքի ենթակառուցվածք՝ իմաստային կապերի, բարդ եզրահանգումների և հիմնավորված պատասխանների համար օպտիմիզացված Clevi Semantic Database։
Սա հնարավոր դարձած լուծում է, քանի որ մենք ունենք սեփական Reasoning մոդելներ, մուլտիմոդալ AI և գործակալային AI մոդելներ, և CLEVI-ի հզոր տեխնոլոգիաներից մեկն է, որը հնարավորություն է տալիս AI-ին իրականում օգտակար լինել իրական աշխարհում։
Պատկերավոր ասած՝ եթե տեղեկությունները պահող տվյալների բազան համարենք գրադարան, ապա CLEVI-ի սեմանտիկ տվյալների բազան կարելի է պատկերացնել որպես չափազանց հմուտ գրադարանավար։ (Գրադարանավարից անհրաժեշտ տեղեկությունը խնդրելու դեպքում հնարավոր է ստանալ ճշգրիտ և արագ պատասխան։)
Օգտատերը ցանկացած պահի կարող է գրադարանին նոր տեղեկություններ ավելացնել և ստանալ անհրաժեշտ տեղեկությունները։
Բացի այդ, տվյալների տարբերակների կառավարումն ու հասանելիության թույլտվությունները կարող են սահմանվել ըստ ցանկության։
Գրադարանավարի յուրաքանչյուր գործողություն պահպանվում է որպես լոգ (գրանցում), ուստի նույնիսկ սխալի դեպքում այն հնարավոր է ուղղել։
<Clevi Semantic Database Structure>
Հիմնական առանձնահատկություններ և տեխնիկական կառուցվածք
Իմաստային տվյալների պահպանում
- Պարզ chunk վեկտորային DB-ի փոխարեն տվյալների միջև իմաստային կապերը (համատեքստ, հիերարխիա, պատճառահետևանքային կապեր և այլն) պահվում են գրաֆային DB-ում
- Հեշտ է ընդլայնել և լրացնել գիտելիքի գրաֆիկի/սեմանտիկ ցանցի ձևաչափով
Հիբրիդային որոնում և եզրահանգում
- CTA+Context Query: հարցման համատեքստն (Context) ու CTA-ն արտացոլվում են միասին
- Hybrid Retrieval: վեկտորային նմանության որոնման և կանոնների/գրաֆի վրա հիմնված որոնման համադրում
- Intelligent Folder Hits: իմաստային առումով առնչվող թղթապանակների/կատեգորիաների ավտոմատ որոնում
Մուլտիմոդալ միաժամանակյա մշակում
- TextReader Pool, VisionReader Pool և այլ համակարգեր միաժամանակ մեկնաբանում են տարբեր տեսակի տվյալներ՝ տեքստ, պատկերներ, աղյուսակներ, ձայն և այլն
- Մինչդեռ առկա RAG-ը հիմնականում կարող է մշակել միայն տեքստ, սեմանտիկ տվյալների բազան առանձնանում է մուլտիմոդալ մշակման բարձր հնարավորություններով
Հիմնավորված պատասխաններ և հուսալիության ստուգում
- Փաստաթղթերի ամփոփումներ և հղումներ, աղյուսակներում հայտնաբերված տվյալներ և այլն՝ փաստաթղթերի ամփոփումների ու աղբյուրների ավտոմատ ստեղծում
- Միավորում և ստուգում՝ տարբեր աղբյուրներից ստացված տեղեկատվության իմաստային ինտեգրում և հուսալիության ստուգում
- Ապացույցների փաթեթ՝ ապացույցների վրա հիմնված պատասխանների փաթեթի տրամադրում
Բարդ դատողություն և պլանավորող
- Planner/DAG՝ բարդ հարցումների համար փուլային պլանավորում և DAG-ի (Directed Acyclic Graph) վրա հիմնված դատողություն
Ինտեգրված գործակալների ճարտարապետություն
- cip-5-agent Supervisor՝ ամբողջ որոնման, դատողության և ինտեգրման գործընթացը կառավարող ու համակարգող բարձրագույն գործակալ
3. Կառուցվածքի ամփոփում և համեմատություն
Ամփոփելով՝ Semantic DB-ն ստանում է տարբեր ձևաչափերի (ձայն, տեքստ, պատկեր, տեսանյութ և այլն) տվյալներ և դասակարգում գիտելիքը՝ միացնելով ոչ թե պարզապես Chunk-երը, այլ նաև տվյալների միջև առկա իմաստային հարաբերությունները (համատեքստ, հիերարխիա, պատճառահետևանքային կապեր և այլն):
Դրա հիման վրա, RAG-ի նման հիմնաբառերի կամ նմանության վրա հիմնված որոնման փոխարեն, այն իրականացնում է որոնում և դատողություն՝ օգտագործելով իմաստային կապերը, ինչի շնորհիվ AI-ից հնարավոր է ստանալ ավելի ճշգրիտ տեղեկատվության որոնման արդյունքներ և պատասխաններ:
Բացի այդ, քանի որ տվյալները պահպանվում են գիտելիքի գրաֆիկի կամ իմաստային ցանցի ձևաչափով, դրանք հեշտ է շարունակաբար ընդլայնել և լրացնել:
Մենք՝ CLEVI-ն, AI-ի համընդհանուր վերափոխման դարաշրջանում բացահայտել ենք RAG համակարգերի սահմանափակումները և Semantic DB-ի ու մեր սեփական AI մոդելի միջոցով հնարավորություն ենք ստացել հաճախորդներին արագ տրամադրել ավելի ճշգրիտ և հուսալի տվյալներ:
Մեր՝ CLEVI-ի AI համակարգը ցանկացած միջավայրում և անկախ տիրույթի տեսակից կարող է արժեքավոր դարձնել մեր հաճախորդների թանկարժեք տվյալները:
CLEVI-ն նաև ապագայում կանի հնարավորը՝ առավելագույնի հասցնելու հաճախորդների տվյալների արժեքը և տրամադրելու նորարարական AI փորձառություն:
CLEVI-ի հետ միասին փորձեք նոր AI-ի ապագան:
Հարցումներ և դեմոյի հայտեր՝ [email protected]
Copyright© 2025 Clevi Inc. Բոլոր իրավունքները պաշտպանված են:
