अनुसंधान

Clevi Semantic Database

जब AI को वास्तविक कार्यों में लागू किया जाता है, तो सबसे बड़ी चिंताओं में से एक मौजूदा सीखी हुई जानकारी को नए डेटा के साथ फाइन-ट्यून करते समय होने वाली विनाशकारी विस्मृति (Catastrophic Forgetting) की घटना है।

1. Catastrophic Forgetting और RAG की सीमाएँ

जब AI को वास्तविक कार्यों में लागू किया जाता है, तो सबसे बड़ी चिंताओं में से एक मौजूदा सीखी हुई जानकारी को नए डेटा के साथ फाइन-ट्यून करते समय होने वाली विनाशकारी विस्मृति (Catastrophic Forgetting) की घटना है।

यह वह घटना है जिसमें न्यूरल नेटवर्क-आधारित AI नई जानकारी सीखने की प्रक्रिया के दौरान पहले सीखी हुई जानकारी या पैटर्न को तेजी से खो देता है।

उदाहरण के लिए, किसी ओपन-सोर्स LLM को किसी विशिष्ट कंपनी के डेटा के साथ फाइन-ट्यून करने पर सामान्य ज्ञान या भाषा संबंधी क्षमता कम हो सकती है।

इस समस्या से बचने के लिए RAG(Retrieval-Augmented Generation) तकनीक का व्यापक रूप से उपयोग किया जाता है, लेकिन RAG की भी कुछ सीमाएँ हैं।

मुख्य भाग की छवि

RAG की प्रमुख सीमाएँ

  • संरचित डेटा संसाधन में कमी (Structured Data QA): RAG सिस्टम मुख्य रूप से असंरचित पाठ दस्तावेज़ों के लिए अनुकूलित होते हैं, इसलिए वे संरचित डेटा (तालिकाएँ, डेटाबेस, स्प्रेडशीट आदि) के अर्थ और संबंधों को ठीक से समझ या उपयोग नहीं कर पाते।
  • जटिल PDF/असंरचित दस्तावेज़ों की सीमाएँ (Complex PDFs): जटिल PDF दस्तावेज़ों (तालिकाएँ, बहु-स्तंभीय लेआउट, चित्र आदि सहित) में chunking (विभाजन) प्रक्रिया के दौरान जानकारी छूट सकती है या संदर्भ विकृत हो सकता है। इसके कारण महत्वपूर्ण डेटा इंडेक्स नहीं हो पाता या उसे खोजना कठिन हो जाता है।
  • Fallback (बैकअप) मॉडल का अभाव (Fallback Model(s)): जब RAG सिस्टम उपयुक्त उत्तर नहीं खोज पाता, तो वैकल्पिक (बैकअप) मॉडल पर स्विच करने का लॉजिक अपर्याप्त या अप्रभावी होता है। इसके कारण उत्तर विफल होने पर उपयोगकर्ता को संतोषजनक विकल्प उपलब्ध नहीं कराया जाता।
  • सुरक्षा कमजोरियाँ (LLM Security): LLM की अपनी सुरक्षा कमजोरियों (प्रॉम्प्ट इंजेक्शन, डेटा लीक आदि) से बचाव अपर्याप्त होने के कारण संवेदनशील जानकारी उजागर होने का जोखिम रहता है।
  • स्केलेबिलिटी की कमी (Data Ingestion Scalability): बड़ी मात्रा में डेटा के इंडेक्सिंग और भंडारण की प्रक्रिया में स्केलेबिलिटी संबंधी समस्याएँ उत्पन्न होती हैं। डेटा बढ़ने के साथ chunking, भंडारण और खोज की गति कम हो जाती है तथा सिस्टम पर भार बढ़ता है।
  • महत्वपूर्ण जानकारी का छूट जाना (Missing Content): दस्तावेज़ों की महत्वपूर्ण सामग्री अक्सर chunking प्रक्रिया के दौरान छूट जाती है या इंडेक्स नहीं हो पाती। इसके कारण उपयोगकर्ता अपनी इच्छित जानकारी खोज नहीं पाता।
  • शीर्ष रैंक वाले परिणाम का छूट जाना (Missed Top Ranked): खोज परिणामों में वास्तव में सबसे अधिक प्रासंगिक chunk (शीर्ष रैंक वाला) छूट सकता है। इसके कारणों में खोज एल्गोरिदम की सीमाएँ, एम्बेडिंग की गुणवत्ता में कमी और रैंकिंग संबंधी त्रुटियाँ शामिल हैं।
  • संदर्भ में असंगति (Not in Context): खोजा गया chunk अक्सर वास्तविक प्रश्न के संदर्भ से मेल नहीं खाता। यह केवल समानता-आधारित खोज की सीमा है, जिसमें अर्थगत संबंध कमज़ोर होता है।
  • गलत प्रारूप (Wrong Format): खोजे गए chunk का प्रारूप LLM द्वारा संसाधित किए जाने के लिए अनुपयुक्त हो सकता है या उपयोगकर्ता द्वारा अपेक्षित उत्तर के प्रारूप से भिन्न हो सकता है। उदाहरण के लिए, तालिका को पाठ में बदलने पर जानकारी विकृत हो सकती है।
  • जानकारी निकालने में विफलता (Not Extracted): आवश्यक जानकारी chunk से ठीक से नहीं निकाली जा पाती या LLM जानकारी को पहचान नहीं पाता। यह समस्या अक्सर जटिल वाक्य संरचनाओं, तालिकाओं और चित्रों में उत्पन्न होती है।
  • जानकारी का अनुपयुक्त दायरा/गहराई (Incorrect Specificity): उत्तर प्रश्न के लिए बहुत व्यापक या इसके विपरीत अत्यधिक विशिष्ट हो सकता है, जिसके कारण वह उपयोगकर्ता की वास्तविक आवश्यकता से मेल नहीं खाता। जानकारी के दायरे और गहराई को समायोजित करना कठिन होता है।
  • अपूर्ण उत्तर (Incomplete): अंततः तैयार किया गया उत्तर अपूर्ण हो सकता है या केवल कुछ जानकारी प्रदान कर सकता है, जिससे उपयोगकर्ता की आवश्यकता पूरी तरह पूरी नहीं होती। इसके कारणों में कई chunk से जानकारी को एकीकृत न कर पाना या LLM द्वारा केवल कुछ जानकारी का उपयोग करना शामिल हैं।

इस प्रकार, RAG केवल वेक्टर समानता खोज और chunk-आधारित इंडेक्सिंग पर अत्यधिक निर्भर करता है, इसलिए वास्तविक कार्यों में विश्वसनीयता, स्केलेबिलिटी और सटीकता के संदर्भ में इसकी सीमाएँ स्पष्ट हैं।

2. RAG की सीमाओं को दूर करने वाला CLEVI का सिमेंटिक डेटाबेस

इन सीमाओं को दूर करने के लिए, CLEVI ने अर्थपूर्ण कनेक्शन·जटिल तर्क·साक्ष्य-आधारित प्रतिक्रियाओं के लिए अनुकूलित अगली पीढ़ी का AI नॉलेज इंफ्रास्ट्रक्चर, Clevi Semantic Database विकसित किया है।

यह ऐसा समाधान है जो केवल इसलिए संभव है क्योंकि CLEVI के पास अपने Reasoning मॉडल, मल्टीमॉडल AI और एजेंट-आधारित AI मॉडल सभी मौजूद हैं। यह CLEVI की शक्तिशाली तकनीकों में से एक है, जो AI को वास्तविक दुनिया में सचमुच उपयोगी बनाती है।

उदाहरण के लिए, यदि जानकारी संग्रहीत डेटाबेस को एक पुस्तकालय मानें, तो CLEVI के सिमेंटिक डेटाबेस को एक अत्यंत कुशल पुस्तकालयाध्यक्ष के रूप में समझा जा सकता है। (जब आप पुस्तकालयाध्यक्ष से आवश्यक जानकारी माँगते हैं, तो आपको सटीक और तेज़ उत्तर मिल सकता है।)

उपयोगकर्ता किसी भी समय पुस्तकालय में नई जानकारी जोड़ सकते हैं और आवश्यक जानकारी प्राप्त कर सकते हैं।

इसके अलावा, डेटा का संस्करण प्रबंधन और एक्सेस अनुमतियाँ भी अपनी आवश्यकता के अनुसार सेट की जा सकती हैं।

पुस्तकालयाध्यक्ष की प्रत्येक कार्रवाई लॉग (रिकॉर्ड) के रूप में दर्ज रहती है, इसलिए गलती होने पर भी उसे सुधारा जा सकता है।

मुख्य पाठ की छवि

<Clevi Semantic Database Structure>

मुख्य विशेषताएँ और तकनीकी संरचना

अर्थपूर्ण डेटा संग्रहण

  • साधारण chunk वेक्टरDB के बजाय, डेटा के बीच अर्थपूर्ण संबंधों (संदर्भ, पदानुक्रम, कारण-कार्य संबंध आदि) को ग्राफ DB में संग्रहीत करना
  • नॉलेज ग्राफ/सिमेंटिक नेटवर्क के रूप में विस्तार और पूरकता आसान

हाइब्रिड खोज और तर्क

  • CTA+Context Query: क्वेरी के संदर्भ (Context) और CTA को एक साथ प्रतिबिंबित करना
  • Hybrid Retrieval: वेक्टर समानता + नियम/ग्राफ-आधारित खोज का संयोजन
  • Intelligent Folder Hits: अर्थपूर्ण रूप से संबंधित फ़ोल्डर/श्रेणियों की स्वचालित खोज

मल्टीमॉडल समवर्ती प्रसंस्करण

  • TextReader Pool, VisionReader Pool आदि के माध्यम से टेक्स्ट, छवियों, तालिकाओं, आवाज़ और अन्य विभिन्न डेटा की एक साथ व्याख्या
  • जहाँ मौजूदा RAG मुख्य रूप से केवल टेक्स्ट संसाधित कर सकता है, वहीं सिमेंटिक डेटाबेस में मल्टीमॉडल प्रसंस्करण की उत्कृष्ट क्षमता है

साक्ष्य-आधारित प्रतिक्रियाएँ और विश्वसनीयता सत्यापन

  • दस्तावेज़ सारांश और उद्धरण, तालिका निष्कर्ष आदि का स्वचालित निर्माण
  • Merge & Verify: अनेक स्रोतों की जानकारी का अर्थगत एकीकरण और विश्वसनीयता सत्यापन
  • Evidence Pack: साक्ष्य-आधारित उत्तर पैकेज प्रदान करना

जटिल तर्क और प्लानर

  • Planner/DAG: जटिल प्रश्नों के लिए चरण-दर-चरण योजना और DAG(Directed Acyclic Graph)-आधारित तर्क

एकीकृत एजेंट संरचना

  • cip-5-agent Supervisor: संपूर्ण खोज/तर्क/एकीकरण प्रक्रिया का प्रबंधन और समन्वय करने वाला सर्वोच्च एजेंट
मुख्य भाग की छवि

3. संरचना का सारांश और तुलना

संक्षेप में, Semantic DB विभिन्न प्रकार के डेटा (आवाज़, टेक्स्ट, छवि, वीडियो आदि) इनपुट के रूप में प्राप्त करके, उन्हें केवल Chunk के रूप में नहीं बल्कि डेटा के बीच के अर्थगत संबंधों (संदर्भ, पदानुक्रम, कारण-कार्य संबंध आदि) को भी जोड़ते हुए ज्ञान के रूप में वर्गीकृत करता है।

इसके आधार पर, RAG की तरह कीवर्ड/समानता-आधारित खोज के बजाय अर्थगत संबंधों का उपयोग करके खोज और तर्क किया जाता है, इसलिए AI से अधिक सटीक जानकारी की खोज और उत्तर प्राप्त किए जा सकते हैं।

इसके अलावा, चूंकि इसे ज्ञान ग्राफ/सिमेंटिक नेटवर्क के रूप में संग्रहीत किया जाता है, इसलिए इसका निरंतर विस्तार और पूरककरण आसान होता है।

CLEVI ने AI परिवर्तन के युग में RAG सिस्टम की सीमाओं का पता लगाया और इन्हें हल करने वाले सिमेंटिक डेटाबेस तथा अपने विशिष्ट AI मॉडल के माध्यम से ग्राहकों को अधिक सटीक और विश्वसनीय डेटा तेज़ी से उपलब्ध कराने में सक्षम बनाया है।

CLEVI का AI सिस्टम किसी भी वातावरण में, डोमेन के प्रकार की परवाह किए बिना, ग्राहकों के मूल्यवान डेटा को उपयोगी बना सकता है।

आगे भी CLEVI ग्राहकों के डेटा के मूल्य को अधिकतम करने और नवोन्मेषी AI अनुभव प्रदान करने के लिए अपना सर्वश्रेष्ठ प्रयास करता रहेगा।

CLEVI के साथ नए AI के भविष्य का अनुभव करें।

पूछताछ और डेमो अनुरोध: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

न्यूज़रूम पर वापस जाएँ
CLEVI

भाषा और क्षेत्र

मशीन-अनुवादित भाषाओं पर चिह्न लगा है। उपलब्धता प्रकाशित साइट बंडल के अनुसार है।

136 भाषाएँ

अनुशंसित

1

पूर्वी एशिया

7

दक्षिण-पूर्व एशिया

11

दक्षिणी एशिया

18

मध्य एशिया

5

मध्य पूर्व और काकेशस

10

पश्चिमी यूरोप और दक्षिणी यूरोप

16

यूनाइटेड किंगडम और आयरलैंड

4

उत्तरी यूरोप

10

मध्य यूरोप और बाल्कन

14

पूर्वी यूरोप

5

पूर्वी अफ़्रीका

8

पश्चिमी अफ़्रीका और मध्य अफ़्रीका

9

दक्षिणी अफ़्रीका

8

अमेरिकाज़

5

ओशिआनिया

5