গৱেষণা

Clevi ছেমান্টিক ডেটাবেছ

AIক বাস্তৱ কামত প্ৰয়োগ কৰাৰ সময়ত, আটাইতকৈ ডাঙৰ চিন্তাসমূহৰ এটা হৈছে পূৰ্বে শিকা জ্ঞানক নতুন ডেটাৰে ফাইন-টিউনিং কৰাৰ সময়ত উদ্ভৱ হোৱা বিপৰ্যয়জনক বিস্মৃতি (Catastrophic Forgetting) পৰিঘটনা।

1. Catastrophic Forgetting আৰু RAGৰ সীমাবদ্ধতা

AIক বাস্তৱ কামত প্ৰয়োগ কৰাৰ সময়ত, আটাইতকৈ ডাঙৰ চিন্তাসমূহৰ এটা হৈছে পূৰ্বে শিকা জ্ঞানক নতুন ডেটাৰে ফাইন-টিউনিং কৰাৰ সময়ত উদ্ভৱ হোৱা বিপৰ্যয়জনক বিস্মৃতি (Catastrophic Forgetting) পৰিঘটনা।

এইটো হৈছে স্নায়ু-জালিকা-ভিত্তিক AIয়ে নতুন তথ্য শিকাৰ প্ৰক্ৰিয়াত পূৰ্বে শিকা জ্ঞান বা আৰ্হিসমূহ দ্ৰুতগতিত হেৰুৱাই পেলোৱা পৰিঘটনা।

উদাহৰণস্বৰূপে, এটা মুক্ত-উৎস LLMক কোনো নিৰ্দিষ্ট প্ৰতিষ্ঠানৰ ডেটাৰে ফাইন-টিউনিং কৰিলে, সাধাৰণ জ্ঞান বা ভাষাগত সামৰ্থ্য হ্ৰাস পাব পাৰে।

এই সমস্যাৰ পৰা হাত সাৰিবলৈ RAG(Retrieval-Augmented Generation) প্ৰযুক্তি ব্যাপকভাৱে ব্যৱহাৰ কৰা হয়, কিন্তু RAGৰো সীমাবদ্ধতা আছে।

মূল পাঠৰ ছবি

RAGৰ প্ৰধান সীমাবদ্ধতা

  • গাঁথনিবদ্ধ তথ্য প্ৰক্ৰিয়াকৰণত অপৰ্যাপ্ততা (Structured Data QA): RAG ছিষ্টেমসমূহ মূলতঃ অসংগঠিত লিখনী নথিৰ বাবে অনুকূলিত হোৱা বাবে, গাঁথনিবদ্ধ তথ্য (তালিকা, ডাটাবেছ, স্প্ৰেডশ্বীট আদি)-ৰ অৰ্থ আৰু সম্পৰ্ক সঠিকভাৱে বুজি পোৱা বা ব্যৱহাৰ কৰিব নোৱাৰে।
  • জটিল PDF/অসংগঠিত নথিৰ সীমাবদ্ধতা (Complex PDFs): জটিল PDF নথি (তালিকা, একাধিক স্তম্ভ, ছবি আদি অন্তৰ্ভুক্ত) chunking(বিভাজন) প্ৰক্ৰিয়াত তথ্য হেৰাই যাব পাৰে বা প্ৰসংগ বিকৃত হ’ব পাৰে। ফলত গুৰুত্বপূৰ্ণ তথ্য index কৰা নহ’ব পাৰে বা অনুসন্ধান কৰাটো কঠিন হৈ পৰে।
  • Fallback(বেকআপ) মডেলৰ অনুপস্থিতি (Fallback Model(s)): RAG ছিষ্টেমে উপযুক্ত উত্তৰ বিচাৰি নোপোৱাৰ সময়ত বিকল্প (বেকআপ) মডেললৈ সলনি হোৱাৰ যুক্তি অপৰ্যাপ্ত বা অদক্ষ হয়। ফলত উত্তৰ বিফল হ’লে ব্যৱহাৰকাৰীক সন্তুষ্ট কৰিব পৰা বিকল্প প্ৰদান কৰা নহয়।
  • নিৰাপত্তাজনিত দুৰ্বলতা (LLM Security): LLM-ৰ নিজা নিৰাপত্তাজনিত দুৰ্বলতা (প্ৰম্প্ট ইনজেকচন, তথ্য ফাদ আদি)-ৰ বিৰুদ্ধে প্ৰতিৰোধ অপৰ্যাপ্ত হোৱাৰ ফলত সংবেদনশীল তথ্য প্ৰকাশ পোৱাৰ আশংকা থাকে।
  • সম্প্ৰসাৰণযোগ্যতাৰ অভাৱ (Data Ingestion Scalability): বৃহৎ পৰিমাণৰ তথ্য index আৰু সংৰক্ষণ কৰাৰ প্ৰক্ৰিয়াত সম্প্ৰসাৰণযোগ্যতাৰ সমস্যা দেখা দিয়ে। তথ্যৰ পৰিমাণ বাঢ়ি যোৱাৰ লগে লগে chunking, সংৰক্ষণ আৰু অনুসন্ধানৰ গতি হ্ৰাস পায়, আৰু ছিষ্টেমৰ ওপৰত বোজা বৃদ্ধি পায়।
  • গুৰুত্বপূৰ্ণ তথ্য বাদ পৰে (Missing Content): নথিৰ গুৰুত্বপূৰ্ণ বিষয়বস্তু chunking প্ৰক্ৰিয়াত বাদ পৰিব পাৰে বা index নোহোৱাকৈ থাকিব পাৰে। ফলত ব্যৱহাৰকাৰীয়ে বিচৰা তথ্য অনুসন্ধান কৰিব নোৱাৰে।
  • শীৰ্ষ ৰেংকৰ বাদ পৰিব পৰা সমস্যা (Missed Top Ranked): অনুসন্ধানৰ ফলাফলত প্ৰকৃততে সৰ্বাধিক প্ৰাসংগিক chunk(শীৰ্ষ ৰেংক) বাদ পৰিব পাৰে। ইয়াৰ কাৰণ অনুসন্ধান এলগৰিদমৰ সীমাবদ্ধতা, embedding-ৰ মান হ্ৰাস আৰু ৰেংকিংৰ ভুল আদি হ’ব পাৰে।
  • প্ৰসংগৰ সৈতে অসামঞ্জস্য (Not in Context): অনুসন্ধান কৰা chunk প্ৰকৃত প্ৰশ্নৰ প্ৰসংগৰ সৈতে মিল নোখোৱাৰ ঘটনা প্ৰায়ে ঘটে। সৰল সাদৃশ্য-ভিত্তিক অনুসন্ধানৰ সীমাবদ্ধতাৰ বাবে অৰ্থগত সংযোগ অপৰ্যাপ্ত হয়।
  • ফৰ্মেটৰ ভুল (Wrong Format): অনুসন্ধান কৰা chunk-ৰ ফৰ্মেট LLM-এ প্ৰক্ৰিয়াকৰণ কৰিব পৰাকৈ উপযুক্ত নহ’ব পাৰে বা ব্যৱহাৰকাৰীয়ে বিচৰা উত্তৰৰ ফৰ্মেটৰ সৈতে পৃথক হ’ব পাৰে। উদাহৰণস্বৰূপে, তালিকাক লিখনীলৈ ৰূপান্তৰ কৰোঁতে তথ্য বিকৃত হ’ব পাৰে।
  • তথ্য আহৰণত বিফলতা (Not Extracted): প্ৰয়োজনীয় তথ্য chunk-ৰ পৰা সঠিকভাৱে আহৰণ নোহোৱা বা LLM-এ তথ্য চিনাক্ত কৰিব নোৱাৰা ঘটনা ঘটে। জটিল বাক্য গঠন, তালিকা আৰু ছবিৰ ক্ষেত্ৰত এনে সমস্যা সঘনাই দেখা যায়।
  • তথ্যৰ পৰিসৰ/গভীৰতাৰ অনুপযুক্ততা (Incorrect Specificity): উত্তৰটো প্ৰশ্নটোৰ তুলনাত অত্যধিক সাধাৰণ বা বিপৰীতে অত্যধিক নিৰ্দিষ্ট হোৱাৰ ফলত ব্যৱহাৰকাৰীৰ প্ৰকৃত প্ৰয়োজনৰ সৈতে মিল নাখাব পাৰে। তথ্যৰ পৰিসৰ আৰু গভীৰতা নিয়ন্ত্ৰণ কৰাটো কঠিন।
  • অসম্পূৰ্ণ উত্তৰ (Incomplete): অৱশেষত সৃষ্টি হোৱা উত্তৰটো অসম্পূৰ্ণ হ’ব পাৰে বা কেৱল কিছু তথ্য প্ৰদান কৰিব পাৰে, যাৰ ফলত ব্যৱহাৰকাৰীৰ প্ৰয়োজন সম্পূৰ্ণৰূপে পূৰণ নহয়। একাধিক chunk-ৰ তথ্য একত্ৰিত কৰিব নোৱাৰা বা LLM-এ কেৱল কিছু অংশ ব্যৱহাৰ কৰাটো ইয়াৰ কাৰণ হ’ব পাৰে।

এইদৰে RAG-এ কেৱল ভেক্টৰ সাদৃশ্য অনুসন্ধান আৰু chunk-ভিত্তিক ইনডেক্সিঙৰ ওপৰত অত্যধিক নিৰ্ভৰ কৰাৰ বাবে, বাস্তৱ কামত নিৰ্ভৰযোগ্যতা·স্কেলযোগ্যতা·শুদ্ধতাৰ ক্ষেত্ৰত ইয়াৰ সীমাবদ্ধতা স্পষ্ট।

2. RAG-ৰ সীমাবদ্ধতা অতিক্ৰম কৰা ক্লেভিৰ ছেমাণ্টিক ডেটাবেছ

এই সীমাবদ্ধতাসমূহ অতিক্ৰম কৰিবলৈ ক্লেভিয়ে, অৰ্থগত সংযোগ·জটিল অনুমান·প্ৰমাণ-ভিত্তিক উত্তৰৰ বাবে অনুকূলিত পৰৱৰ্তী প্ৰজন্মৰ AI জ্ঞান আন্তঃগাঁথনি, Clevi Semantic Database বিকশিত কৰিছে।

নিজস্ব Reasoning মডেল, মাল্টিম’ডেল AI আৰু এজেণ্ট-ধৰনৰ AI মডেল—এই সকলোবোৰ থকাৰ বাবেই এই সমাধান সম্ভৱ হৈছে; AI-ক বাস্তৱ জগতত সঁচাকৈ সহায়ক কৰি তোলা ক্লেভিৰ অন্যতম শক্তিশালী প্ৰযুক্তি এয়া।

উপমা হিচাপে, তথ্য সংৰক্ষিত থকা ডেটাবেছক যদি এটা পুথিভঁৰাল বুলি ধৰা হয়, তেন্তে ক্লেভিৰ ছেমাণ্টিক ডেটাবেছত এজন অতি দক্ষ পুথিভঁৰালী আছে বুলি ভাবিব পাৰি। (পুথিভঁৰালীজনক প্ৰয়োজনীয় তথ্য বিচাৰিলে সঠিক আৰু দ্ৰুত উত্তৰ পাব পাৰি।)

ব্যৱহাৰকাৰীয়ে যিকোনো সময়তে পুথিভঁৰালত নতুন তথ্য যোগ কৰিব পাৰে আৰু প্ৰয়োজনীয় তথ্য উলিয়াই আনিব পাৰে।

ইয়াৰ উপৰি, তথ্যৰ সংস্কৰণ নিয়ন্ত্ৰণ বা প্ৰৱেশাধিকাৰো ইচ্ছানুসৰি নিৰ্ধাৰণ কৰিব পাৰে।

পুথিভঁৰালীৰ প্ৰতিটো কাৰ্য লগ (ৰেকৰ্ড) হিচাপে সংৰক্ষিত হয়, সেয়েহে ভুল হ’লেও সংশোধন কৰিব পাৰি।

মূল পাঠৰ ছবি

<Clevi Semantic Database Structure>

মুখ্য বৈশিষ্ট্য আৰু প্ৰযুক্তিগত গাঁথনি

অৰ্থগত তথ্য সংৰক্ষণ

  • কেৱল সাধাৰণ chunk ভেক্টৰ DB নহয়, তথ্যসমূহৰ মাজৰ অৰ্থগত সম্পৰ্ক (প্ৰসংগ, স্তৰবিন্যাস, কাৰণ-ফল আদি) গ্ৰাফ DB-ত সংৰক্ষণ কৰা হয়
  • জ্ঞান গ্ৰাফ/ছেমাণ্টিক নেটৱৰ্কৰ ৰূপত সহজে সম্প্ৰসাৰণ আৰু পৰিপূৰক সংযোজন কৰিব পাৰি

হাইব্ৰিড অনুসন্ধান আৰু অনুমান

  • CTA+Context Query: প্ৰশ্নৰ প্ৰসংগ (Context) আৰু CTA একেলগে বিবেচনা কৰা হয়
  • Hybrid Retrieval: ভেক্টৰ সাদৃশ্য + নিয়ম/গ্ৰাফ-ভিত্তিক অনুসন্ধানৰ সংমিশ্ৰণ
  • Intelligent Folder Hits: অৰ্থগতভাৱে সম্পৰ্কিত ফোল্ডাৰ/শ্ৰেণীসমূহ স্বয়ংক্ৰিয়ভাৱে বিচাৰি উলিওৱা

একেলগে মাল্টিম’ডেল প্ৰক্ৰিয়াকৰণ

  • TextReader Pool, VisionReader Pool আদিৰ জৰিয়তে টেক্সট, ছবি, তালিকা, অডিঅ’ আদি বিভিন্ন ধৰণৰ তথ্য একেলগে ব্যাখ্যা কৰা
  • য’ত প্ৰচলিত RAG-এ সাধাৰণতে কেৱল টেক্সট প্ৰক্ৰিয়াকৰণ কৰিব পাৰে, তাত ছেমাণ্টিক ডেটাবেছৰ মাল্টিম’ডেল প্ৰক্ৰিয়াকৰণ ক্ষমতা অসাধাৰণ

প্ৰমাণ-ভিত্তিক উত্তৰ আৰু নিৰ্ভৰযোগ্যতা যাচাই

  • ডকুমেণ্টৰ সাৰাংশ আৰু উদ্ধৃতি, তালিকাৰ অনুসন্ধান আদি—ডকুমেণ্টৰ সাৰাংশ আৰু উৎস স্বয়ংক্ৰিয়ভাৱে সৃষ্টি
  • Merge & Verify: একাধিক উৎসৰ তথ্যৰ অৰ্থগত একত্ৰীকৰণ আৰু নিৰ্ভৰযোগ্যতা যাচাই
  • Evidence Pack: প্ৰমাণভিত্তিক উত্তৰৰ পেকেজ প্ৰদান

জটিল যুক্তি আৰু পৰিকল্পনাকাৰী

  • Planner/DAG: জটিল প্ৰশ্নৰ বাবে পৰ্যায়ভিত্তিক পৰিকল্পনা আৰু DAG(Directed Acyclic Graph)-ভিত্তিক যুক্তি

সমন্বিত এজেণ্ট গাঁথনি

  • cip-5-agent Supervisor: সম্পূৰ্ণ অনুসন্ধান/যুক্তি/সমন্বয় প্ৰক্ৰিয়া পৰিচালনা আৰু সমন্বয় কৰা সৰ্বোচ্চ স্তৰৰ এজেণ্ট
মূল পাঠৰ ছবি

3. গাঁথনিৰ সাৰাংশ আৰু তুলনা

সাৰাংশত, Semantic DB-য়ে বিভিন্ন ৰূপৰ (কণ্ঠ, পাঠ, ছবি, ভিডিঅ' আদি) তথ্য ইনপুট হিচাপে গ্ৰহণ কৰি কেৱল সৰল Chunk নহয়, তথ্যসমূহৰ মাজৰ অৰ্থগত সম্পৰ্ক (প্ৰসংগ, স্তৰবিন্যাস, কাৰণ-ফল আদি) সংযোগ কৰি জ্ঞানক শ্ৰেণীবদ্ধ কৰে।

ইয়াৰ ভিত্তিত RAG-ৰ দৰে কীৱৰ্ড/সাদৃশ্যভিত্তিক অনুসন্ধানৰ পৰিৱৰ্তে অৰ্থগত সংযোগ ব্যৱহাৰ কৰি অনুসন্ধান আৰু যুক্তি সম্পন্ন কৰে, সেয়েহে AI-ৰ পৰা অধিক সঠিক তথ্য অনুসন্ধান আৰু উত্তৰ লাভ কৰিব পাৰি।

ইয়াৰ উপৰি, জ্ঞান গ্ৰাফ/ছেমাণ্টিক নেটৱৰ্কৰ ৰূপত সংৰক্ষণ কৰা হয় বাবে ইয়াক নিৰন্তৰ সম্প্ৰসাৰণ আৰু পৰিপূৰক কৰাটো সহজ।

AI ৰূপান্তৰৰ যুগত আমি ক্লেভিয়ে RAG ব্যৱস্থাৰ সীমাবদ্ধতা আৱিষ্কাৰ কৰি, সেইবোৰ সমাধান কৰিব পৰা ছেমাণ্টিক ডেটাবেছ আৰু নিজস্ব AI মডেলৰ জৰিয়তে গ্ৰাহকসকলক অধিক সঠিক আৰু নিৰ্ভৰযোগ্য তথ্য দ্ৰুতভাৱে প্ৰদান কৰিবলৈ সক্ষম হৈছোঁ।

আমাৰ ক্লেভিৰ AI ব্যৱস্থাই যিকোনো পৰিৱেশতে, ডমেইনৰ ধৰণ নিৰ্বিশেষে, গ্ৰাহকৰ মূল্যৱান তথ্যক মূল্যৱান কৰি তুলিব পাৰে।

আগলৈও ক্লেভিয়ে গ্ৰাহকৰ তথ্যৰ মূল্য সৰ্বাধিক কৰা আৰু উদ্ভাৱনীমূলক AI অভিজ্ঞতা প্ৰদান কৰাৰ বাবে সৰ্বশক্তিৰে কাম কৰি যাব।

ক্লেভিৰ সৈতে নতুন AI-ৰ ভৱিষ্যৎ অনুভৱ কৰক।

যোগাযোগ আৰু ডেমোৰ অনুৰোধ: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

বাতৰি কক্ষলৈ উভতি যাওক
CLEVI

ভাষা আৰু অঞ্চল

যন্ত্ৰ-অনূদিত ভাষাসমূহ চিহ্নিত কৰা হৈছে। উপলব্ধতা প্ৰকাশিত ছাইট বাণ্ডল অনুসৰি।

১৩৬ ভাষা

পৰামৰ্শিত

1

প্ৰাচ্য এছিয়া

7

দক্ষিণ-পূব এছিয়া

11

দাক্ষিণাত্য এছিয়া

18

মধ্য এছিয়া

5

মধ্যপ্ৰাচ্য আৰু ককেছাছ

10

পাশ্চাত্য ইউৰোপ আৰু দাক্ষিণাত্য ইউৰোপ

16

সংযুক্ত ৰাজ্য আৰু আয়াৰলেণ্ড

4

উদীচ্য ইউৰোপ

10

মধ্য ইউৰোপ আৰু বাল্কান

14

প্ৰাচ্য ইউৰোপ

5

প্ৰাচ্য আফ্ৰিকা

8

পাশ্চাত্য আফ্ৰিকা আৰু মধ্য আফ্ৰিকা

9

দাক্ষিণাত্য আফ্ৰিকা

8

আমেৰিকাছ্

5

অ’চেনীয়া

5