ഗവേഷണം

Clevi സെമാന്റിക് ഡാറ്റാബേസ്

AI യഥാർത്ഥ ജോലികളിൽ പ്രയോഗിക്കുമ്പോൾ, മുമ്പ് പഠിച്ച അറിവിനെ പുതിയ ഡാറ്റ ഉപയോഗിച്ച് ഫൈൻ-ട്യൂൺ ചെയ്യുമ്പോൾ ഉണ്ടാകുന്ന ദുരന്തകരമായ മറവിയാണ് (Catastrophic Forgetting) ഏറ്റവും വലിയ ആശങ്കകളിലൊന്ന്.

1. Catastrophic Forgetting-ന്റെയും RAG-ന്റെയും പരിമിതികൾ

AI യഥാർത്ഥ ജോലികളിൽ പ്രയോഗിക്കുമ്പോൾ, മുമ്പ് പഠിച്ച അറിവിനെ പുതിയ ഡാറ്റ ഉപയോഗിച്ച് ഫൈൻ-ട്യൂൺ ചെയ്യുമ്പോൾ ഉണ്ടാകുന്ന ദുരന്തകരമായ മറവി (Catastrophic Forgetting) യാണ് ഏറ്റവും വലിയ ആശങ്കകളിലൊന്ന്.

ന്യൂറൽ നെറ്റ്‌വർക്ക് അധിഷ്ഠിത AI പുതിയ വിവരങ്ങൾ പഠിക്കുന്ന പ്രക്രിയയിൽ, മുമ്പ് പഠിച്ച അറിവുകളോ മാതൃകകളോ പെട്ടെന്ന് നഷ്ടപ്പെടുന്ന പ്രതിഭാസമാണിത്.

ഉദാഹരണത്തിന്, ഒരു ഓപ്പൺ സോഴ്‌സ് LLM-നെ ഒരു പ്രത്യേക സ്ഥാപനത്തിന്റെ ഡാറ്റ ഉപയോഗിച്ച് ഫൈൻ-ട്യൂൺ ചെയ്യുമ്പോൾ, പൊതുവായ അറിവോ ഭാഷാപരമായ കഴിവുകളോ കുറയാം.

ഈ പ്രശ്നം ഒഴിവാക്കാൻ RAG (Retrieval-Augmented Generation) സാങ്കേതികവിദ്യ വ്യാപകമായി ഉപയോഗിക്കപ്പെടുന്നു. എന്നാൽ RAG-നും പരിമിതികളുണ്ട്.

പ്രധാന ഉള്ളടക്ക ചിത്രം

RAG-ന്റെ പ്രധാന പരിമിതികൾ

  • ഘടനാപരമായ ഡാറ്റ കൈകാര്യം ചെയ്യുന്നതിലെ അപര്യാപ്തത (Structured Data QA): RAG സിസ്റ്റങ്ങൾ പ്രധാനമായും ഘടനയില്ലാത്ത ടെക്സ്റ്റ് രേഖകൾക്കായി ഒപ്റ്റിമൈസ് ചെയ്തിരിക്കുന്നതിനാൽ, ഘടനാപരമായ ഡാറ്റയുടെ (പട്ടികകൾ, ഡാറ്റാബേസുകൾ, സ്പ്രെഡ്‌ഷീറ്റുകൾ മുതലായവ) അർത്ഥവും ബന്ധങ്ങളും ശരിയായി മനസ്സിലാക്കാനോ പ്രയോജനപ്പെടുത്താനോ കഴിയുന്നില്ല.
  • സങ്കീർണ്ണമായ PDF/ഘടനയില്ലാത്ത രേഖകളുടെ പരിമിതികൾ (Complex PDFs): സങ്കീർണ്ണമായ PDF രേഖകളിൽ (പട്ടികകൾ, ഒന്നിലധികം കോളങ്ങൾ, ചിത്രങ്ങൾ എന്നിവ ഉൾപ്പെടെ) chunking (വിഭജിക്കൽ) പ്രക്രിയയ്ക്കിടെ വിവരങ്ങൾ നഷ്ടപ്പെടുകയോ സന്ദർഭം വളച്ചൊടിക്കപ്പെടുകയോ ചെയ്യാം. ഇതുമൂലം പ്രധാനപ്പെട്ട ഡാറ്റ ഇൻഡക്സ് ചെയ്യപ്പെടാതിരിക്കുകയോ തിരയാൻ ബുദ്ധിമുട്ടാകുകയോ ചെയ്യുന്നു.
  • Fallback(ബാക്കപ്പ്) മോഡലിന്റെ അഭാവം (Fallback Model(s)): RAG സിസ്റ്റത്തിന് അനുയോജ്യമായ ഉത്തരം കണ്ടെത്താൻ കഴിയാത്തപ്പോൾ, പകരം (ബാക്കപ്പ്) മോഡലിലേക്ക് മാറുന്നതിനുള്ള ലജിക് അപര്യാപ്തമോ കാര്യക്ഷമമല്ലാത്തതോ ആണ്. ഇതുമൂലം ഉത്തരം പരാജയപ്പെടുമ്പോൾ ഉപയോക്താവിന് തൃപ്തികരമായൊരു ബദൽ നൽകാൻ കഴിയുന്നില്ല.
  • സുരക്ഷാ ദൗർബല്യങ്ങൾ (LLM Security): LLM-ന്റെ തന്നെ സുരക്ഷാ ദൗർബല്യങ്ങളിൽ (പ്രോംപ്റ്റ് ഇൻജക്ഷൻ, ഡാറ്റ ചോർച്ച മുതലായവ) നിന്നുള്ള സംരക്ഷണം അപര്യാപ്തമായതിനാൽ, സെൻസിറ്റീവ് വിവരങ്ങൾ പുറത്താകാനുള്ള സാധ്യതയുണ്ട്.
  • സ്കെയിലബിലിറ്റിയുടെ അഭാവം (Data Ingestion Scalability): വലിയ അളവിലുള്ള ഡാറ്റ ഇൻഡക്സ് ചെയ്യുകയും സംഭരിക്കുകയും ചെയ്യുന്ന പ്രക്രിയയിൽ സ്കെയിലബിലിറ്റി പ്രശ്നങ്ങൾ ഉണ്ടാകുന്നു. ഡാറ്റ വർധിക്കുന്നതനുസരിച്ച് chunking, സംഭരണം, തിരച്ചിൽ എന്നിവയുടെ വേഗത കുറയുകയും സിസ്റ്റത്തിലെ ലോഡ് വർധിക്കുകയും ചെയ്യുന്നു.
  • പ്രധാനപ്പെട്ട വിവരങ്ങൾ നഷ്ടപ്പെടൽ (Missing Content): രേഖയിലെ പ്രധാനപ്പെട്ട ഉള്ളടക്കം chunking പ്രക്രിയയ്ക്കിടെ നഷ്ടപ്പെടുകയോ ഇൻഡക്സ് ചെയ്യപ്പെടാതിരിക്കുകയോ ചെയ്യുന്നത് പതിവാണ്. ഇതുമൂലം ഉപയോക്താവിന് ആവശ്യമായ വിവരങ്ങൾ തിരയാൻ കഴിയുന്നില്ല.
  • മുകളിലെ റാങ്കിലുള്ള ഫലങ്ങൾ നഷ്ടപ്പെടൽ (Missed Top Ranked): തിരച്ചിൽ ഫലങ്ങളിൽ യഥാർത്ഥത്തിൽ ഏറ്റവും പ്രസക്തമായ chunk (മുകളിലെ റാങ്കിലുള്ളത്) നഷ്ടപ്പെടാം. തിരച്ചിൽ ആൽഗരിതത്തിന്റെ പരിമിതികൾ, എംബെഡ്ഡിംഗ് ഗുണനിലവാരത്തിലെ കുറവ്, റാങ്കിംഗ് പിശകുകൾ എന്നിവയാണ് കാരണങ്ങൾ.
  • സന്ദർഭ പൊരുത്തക്കേട് (Not in Context): തിരച്ചിലിലൂടെ ലഭിച്ച chunk യഥാർത്ഥ ചോദ്യത്തിന്റെ സന്ദർഭവുമായി പൊരുത്തപ്പെടാത്തത് പതിവാണ്. ലളിതമായ സാമ്യതയെ അടിസ്ഥാനമാക്കിയുള്ള തിരച്ചിലിന്റെ പരിമിതിയാൽ അർത്ഥപരമായ ബന്ധം കുറവായിരിക്കും.
  • ഫോർമാറ്റ് പിശക് (Wrong Format): തിരച്ചിലിലൂടെ ലഭിച്ച chunk-ന്റെ ഫോർമാറ്റ് LLM-ന് പ്രോസസ് ചെയ്യാൻ അനുയോജ്യമല്ലാതിരിക്കുകയോ ഉപയോക്താവ് ആഗ്രഹിക്കുന്ന ഉത്തരത്തിന്റെ ഫോർമാറ്റിൽ നിന്ന് വ്യത്യസ്തമായിരിക്കുകയോ ചെയ്യാം. ഉദാഹരണത്തിന്, പട്ടിക ടെക്സ്റ്റായി പരിവർത്തനം ചെയ്യപ്പെടുകയും അതുവഴി വിവരങ്ങൾ വളച്ചൊടിക്കപ്പെടുകയും ചെയ്യാം.
  • വിവരങ്ങൾ എക്‌സ്‌ട്രാക്ട് ചെയ്യുന്നതിലെ പരാജയം (Not Extracted): ആവശ്യമായ വിവരങ്ങൾ chunk-ൽ നിന്ന് ശരിയായി എക്‌സ്‌ട്രാക്ട് ചെയ്യപ്പെടാതിരിക്കുകയോ LLM വിവരങ്ങൾ തിരിച്ചറിയാതിരിക്കുകയോ ചെയ്യുന്ന സാഹചര്യമാണ് ഇത്. സങ്കീർണ്ണമായ വാക്യഘടന, പട്ടികകൾ, ചിത്രങ്ങൾ തുടങ്ങിയവയിൽ ഇത് പതിവായി സംഭവിക്കുന്നു.
  • വിവരങ്ങളുടെ പരിധി/ആഴം അനുയോജ്യമല്ലാത്തത് (Incorrect Specificity): ചോദ്യത്തിനുള്ള ഉത്തരം വളരെ പൊതുവായതോ, മറിച്ച് അമിതമായി വിശദമായതോ ആയതിനാൽ ഉപയോക്താവിന്റെ യഥാർത്ഥ ആവശ്യവുമായി പൊരുത്തപ്പെടാത്ത സാഹചര്യമാണിത്. വിവരങ്ങളുടെ പരിധിയും ആഴവും ക്രമീകരിക്കുന്നത് ബുദ്ധിമുട്ടാണ്.
  • അപൂർണ്ണമായ ഉത്തരം (Incomplete): അവസാനം സൃഷ്ടിക്കപ്പെടുന്ന ഉത്തരം അപൂർണ്ണമായിരിക്കുകയോ ചില വിവരങ്ങൾ മാത്രം നൽകുന്നതിനാൽ ഉപയോക്താവിന്റെ ആവശ്യം മതിയായ രീതിയിൽ നിറവേറ്റാതിരിക്കുകയോ ചെയ്യുന്ന സാഹചര്യമാണിത്. ഒന്നിലധികം chunk-കളിൽ നിന്നുള്ള വിവരങ്ങൾ സമന്വയിപ്പിക്കാൻ കഴിയാത്തതോ LLM അവയിൽ ചിലത് മാത്രമേ പ്രയോജനപ്പെടുത്തുന്നുള്ളൂവെന്നതോ ആണ് കാരണങ്ങൾ.

ഈ രീതിയിൽ, RAG ലളിതമായ വെക്ടർ സാമ്യം അടിസ്ഥാനമാക്കിയുള്ള തിരച്ചിലിനെയും chunk അടിസ്ഥാനമാക്കിയുള്ള ഇൻഡക്സിംഗിനെയും അമിതമായി ആശ്രയിക്കുന്നതിനാൽ, യഥാർത്ഥ പ്രവർത്തനങ്ങളിൽ വിശ്വാസ്യത, സ്കെയിലബിലിറ്റി, കൃത്യത എന്നിവയുടെ കാര്യത്തിൽ അതിന്റെ പരിമിതികൾ വ്യക്തമാണ്.

2. RAG-യുടെ പരിമിതികളെ മറികടന്ന ക്ലെവിയുടെ സിമാന്റിക് ഡാറ്റാബേസ്

ഈ പരിമിതികളെ മറികടക്കുന്നതിനായി, അർത്ഥപരമായ ബന്ധം, സങ്കീർണ്ണമായ അനുമാനം, തെളിവ് അടിസ്ഥാനമാക്കിയുള്ള പ്രതികരണം എന്നിവയ്ക്കായി ഒപ്റ്റിമൈസ് ചെയ്ത അടുത്ത തലമുറ AI വിജ്ഞാന അടിസ്ഥാനസൗകര്യമായ Clevi Semantic Database ക്ലെവി വികസിപ്പിച്ചു.

സ്വന്തം Reasoning മോഡലുകൾ, മൾട്ടിമോഡൽ AI, ഏജന്റ് അധിഷ്ഠിത AI മോഡലുകൾ എന്നിവയെല്ലാം സ്വന്തമായുള്ളതിനാൽ സാധ്യമായ ഈ പരിഹാരം, AI-യെ യാഥാർഥ്യത്തിൽ യഥാർത്ഥമായി സഹായകരമാക്കുന്ന ക്ലെവിയുടെ സവിശേഷമായ ശക്തമായ സാങ്കേതികവിദ്യകളിലൊന്നാണ്.

ഒരു ഉപമയായി പറയുകയാണെങ്കിൽ, വിവരങ്ങൾ സംഭരിച്ചിരിക്കുന്ന ഡാറ്റാബേസിനെ ഒരു ലൈബ്രറിയായി കണക്കാക്കുമ്പോൾ, ക്ലെവിയുടെ സിമാന്റിക് ഡാറ്റാബേസിൽ വളരെ കഴിവുള്ള ഒരു ലൈബ്രേറിയൻ ഉണ്ടെന്ന് കരുതാം. (ലൈബ്രേറിയനോട് ആവശ്യമായ വിവരങ്ങൾ ചോദിച്ചാൽ കൃത്യവും വേഗത്തിലുള്ളതുമായ പ്രതികരണം ലഭിക്കും.)

ഉപയോക്താക്കൾക്ക് എപ്പോൾ വേണമെങ്കിലും ലൈബ്രറിയിലേക്ക് പുതിയ വിവരങ്ങൾ ചേർക്കാനും ആവശ്യമായ വിവരങ്ങൾ വിളിച്ചെടുക്കാനും കഴിയും.

കൂടാതെ, ഡാറ്റയുടെ പതിപ്പ് നിയന്ത്രണവും ആക്സസ് അനുമതികളും ആവശ്യാനുസരണം സജ്ജീകരിക്കാം.

ലൈബ്രേറിയന്റെ എല്ലാ പ്രവർത്തനങ്ങളും ലോഗിൽ (രേഖയായി) സൂക്ഷിക്കുന്നതിനാൽ, പിഴവുകൾ സംഭവിച്ചാലും അവ തിരുത്താൻ കഴിയും.

പ്രധാന വാചകത്തിലെ ചിത്രം

<Clevi Semantic Database Structure>

പ്രധാന സവിശേഷതകളും സാങ്കേതിക ഘടനയും

അർത്ഥപരമായ ഡാറ്റ സംഭരണം

  • ലളിതമായ chunk വെക്ടർ DB അല്ല, ഡാറ്റകൾ തമ്മിലുള്ള അർത്ഥപരമായ ബന്ധങ്ങൾ (സന്ദർഭം, ശ്രേണി, കാരണബന്ധം തുടങ്ങിയവ) ഗ്രാഫ് DB-യിൽ സംഭരിക്കുന്നു
  • വിജ്ഞാന ഗ്രാഫ്/സിമാന്റിക് നെറ്റ്‌വർക്ക് രൂപത്തിൽ എളുപ്പത്തിൽ വികസിപ്പിക്കാനും പൂരിപ്പിക്കാനും കഴിയും

ഹൈബ്രിഡ് തിരച്ചിലും അനുമാനവും

  • CTA+Context Query: ചോദ്യത്തിന്റെ സന്ദർഭവും (Context) CTA-യും ഒരുമിച്ച് പരിഗണിക്കുന്നു
  • Hybrid Retrieval: വെക്ടർ സാമ്യം + റൂൾ/ഗ്രാഫ് അടിസ്ഥാനമാക്കിയുള്ള തിരച്ചിൽ സംയോജിപ്പിക്കുന്നു
  • Intelligent Folder Hits: അർത്ഥപരമായി ബന്ധപ്പെട്ട ഫോൾഡറുകൾ/വിഭാഗങ്ങൾ സ്വയമേവ കണ്ടെത്തുന്നു

മൾട്ടിമോഡൽ ഒരേസമയം പ്രോസസ്സിംഗ്

  • TextReader Pool, VisionReader Pool മുതലായവ ഉപയോഗിച്ച് ടെക്സ്റ്റ്, ചിത്രങ്ങൾ, പട്ടികകൾ, ശബ്ദം തുടങ്ങിയ വിവിധ ഡാറ്റകൾ ഒരേസമയം വ്യാഖ്യാനിക്കുന്നു
  • നിലവിലുള്ള RAG-യ്ക്ക് പ്രധാനമായും ടെക്സ്റ്റ് മാത്രമേ പ്രോസസ്സ് ചെയ്യാൻ കഴിയൂ, അതേസമയം സിമാന്റിക് ഡാറ്റാബേസിന്റെ മൾട്ടിമോഡൽ പ്രോസസ്സിംഗ് കഴിവ് മികച്ചതാണ്

തെളിവ് അടിസ്ഥാനമാക്കിയുള്ള പ്രതികരണവും വിശ്വാസ്യതാ പരിശോധനയും

  • ഡോക്യുമെന്റ് സംഗ്രഹങ്ങളും ഉറവിട പരാമർശങ്ങളും, പട്ടികയിലെ കണ്ടെത്തലുകൾ മുതലായവ ഉൾപ്പെടെയുള്ള ഡോക്യുമെന്റ് സംഗ്രഹങ്ങളും ഉറവിടങ്ങളും സ്വയമേവ സൃഷ്ടിക്കൽ
  • Merge & Verify: വിവിധ ഉറവിടങ്ങളിൽ നിന്നുള്ള വിവരങ്ങളുടെ അർത്ഥപരമായ ഏകീകരണവും വിശ്വാസ്യതാ പരിശോധനയും
  • Evidence Pack: തെളിവ് അധിഷ്ഠിത പ്രതികരണ പാക്കേജ് നൽകൽ

സങ്കീർണ്ണമായ നിഗമനവും പ്ലാനറും

  • Planner/DAG: സങ്കീർണ്ണമായ ചോദ്യങ്ങൾക്ക് ഘട്ടംഘട്ടമായ ആസൂത്രണവും DAG(Directed Acyclic Graph) അധിഷ്ഠിതമായ നിഗമനവും

സംയോജിത ഏജന്റ് ഘടന

  • cip-5-agent Supervisor: മുഴുവൻ തിരച്ചിൽ/നിഗമനം/സംയോജന പ്രക്രിയയും നിയന്ത്രിക്കുകയും ഏകോപിപ്പിക്കുകയും ചെയ്യുന്ന പരമോന്നത ഏജന്റ്
പ്രധാന ഉള്ളടക്കത്തിലെ ചിത്രം

3. ഘടനയുടെ സംഗ്രഹവും താരതമ്യവും

ചുരുക്കത്തിൽ, Semantic DB വിവിധ രൂപങ്ങളിലുള്ള (ശബ്ദം, ടെക്സ്റ്റ്, ചിത്രം, വീഡിയോ മുതലായവ) ഡാറ്റ സ്വീകരിച്ച്, ലളിതമായ Chunk-ുകൾക്ക് പകരം ഡാറ്റകൾ തമ്മിലുള്ള അർത്ഥപരമായ ബന്ധങ്ങളും (സന്ദർഭം, ശ്രേണി, കാരണബന്ധം മുതലായവ) ബന്ധിപ്പിച്ച് അറിവിനെ വർഗീകരിക്കുന്നു.

ഇതിന്റെ അടിസ്ഥാനത്തിൽ, RAG-നെപ്പോലെ കീവേഡ്/സാദൃശ്യത്തെ അടിസ്ഥാനമാക്കിയുള്ള തിരച്ചിലിനു പകരം അർത്ഥപരമായ ബന്ധങ്ങൾ പ്രയോജനപ്പെടുത്തി തിരച്ചിലും നിഗമനവും നടത്തുന്നതിനാൽ, AI-യിൽ നിന്ന് കൂടുതൽ കൃത്യമായ വിവര തിരച്ചിലും ഉത്തരങ്ങളും നേടാനാകും.

കൂടാതെ, അറിവ് ഗ്രാഫ്/സെമാന്റിക് നെറ്റ്‌വർക്ക് രൂപത്തിൽ സംഭരിക്കുന്നതിനാൽ തുടർച്ചയായ വിപുലീകരണവും പരിഷ്‌കരണവും എളുപ്പമാണ്.

AI പരിവർത്തനത്തിന്റെ കാലഘട്ടത്തിൽ, RAG സിസ്റ്റങ്ങളുടെ പരിമിതികൾ കണ്ടെത്തിയ ഞങ്ങളുടെ CLEVI, അവ പരിഹരിക്കാൻ കഴിയുന്ന സെമാന്റിക് ഡാറ്റാബേസും സ്വന്തം AI മോഡലും ഉപയോഗിച്ച് ഉപഭോക്താക്കൾക്ക് കൂടുതൽ കൃത്യവും വിശ്വാസ്യതയുള്ളതുമായ ഡാറ്റ വേഗത്തിൽ ലഭ്യമാക്കാൻ സാധിച്ചു.

ഞങ്ങളുടെ CLEVI-യുടെ AI സിസ്റ്റത്തിന് ഏത് പരിസ്ഥിതിയിലും, ഡൊമെയ്ൻ ഏതുതരത്തിലുള്ളതായാലും, ഉപഭോക്താക്കളുടെ വിലപ്പെട്ട ഡാറ്റയെ മൂല്യമുള്ളതാക്കാൻ കഴിയും.

ഇനിയും ഉപഭോക്താക്കളുടെ ഡാറ്റയുടെ മൂല്യം പരമാവധി വർധിപ്പിക്കുകയും നവീനമായ AI അനുഭവം നൽകുകയും ചെയ്യുന്നതിനായി CLEVI പരമാവധി ശ്രമിച്ചുകൊണ്ടിരിക്കും.

CLEVI-യോടൊപ്പം AI-യുടെ പുതിയ ഭാവി അനുഭവിച്ചറിയുക.

ബന്ധപ്പെടാനും ഡെമോ അഭ്യർത്ഥിക്കാനും: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

വാർത്താമുറിയിലേക്ക് മടങ്ങുക
CLEVI

ഭാഷയും പ്രദേശവും

മെഷീൻ വിവർത്തനം ചെയ്ത ഭാഷകൾ അടയാളപ്പെടുത്തിയിരിക്കുന്നു. ലഭ്യത പ്രസിദ്ധീകരിച്ച സൈറ്റ് ബണ്ടിലിനെ ആശ്രയിച്ചിരിക്കുന്നു.

136 ഭാഷകൾ

ശുപാർശ ചെയ്തത്

1

കിഴക്കൻ ഏഷ്യ

7

തെക്ക്-കിഴക്കൻ ഏഷ്യ

11

തെക്കേ ഏഷ്യ

18

മദ്ധ്യേഷ്യ

5

മധ്യപൂർവ ദേശവും കോക്കസസും

10

പശ്ചിമ യൂറോപ്പ് കൂടാതെ തെക്കേ യൂറോപ്പ്

16

യുണൈറ്റഡ് കിംഗ്ഡം കൂടാതെ അയർലൻഡ്

4

വടക്കേ യൂറോപ്പ്

10

മധ്യ യൂറോപ്പും ബാൽക്കണും

14

കിഴക്കൻ യൂറോപ്പ്

5

കിഴക്കൻ ആഫ്രിക്ക

8

പശ്ചിമ ആഫ്രിക്ക കൂടാതെ മദ്ധ്യ ആഫ്രിക്ക

9

തെക്കേ ആഫ്രിക്ക

8

അമേരിക്കകൾ

5

ഓഷ്യാനിയ

5
Clevi സെമാന്റിക് ഡാറ്റാബേസ് — CLEVI