پژوهش

پایگاه داده معنایی Clevi

هنگامی که هوش مصنوعی در محیط‌های کاری واقعی به کار گرفته می‌شود، یکی از بزرگ‌ترین نگرانی‌ها پدیده فراموشی فاجعه‌بار (Catastrophic Forgetting) است که هنگام ریزتنظیم دانش موجود با داده‌های جدید رخ می‌دهد.

۱. محدودیت‌های فراموشی فاجعه‌بار (Catastrophic Forgetting) و RAG

هنگامی که هوش مصنوعی در محیط‌های کاری واقعی به کار گرفته می‌شود، یکی از بزرگ‌ترین نگرانی‌ها پدیده فراموشی فاجعه‌بار (Catastrophic Forgetting) است که هنگام ریزتنظیم دانش موجود با داده‌های جدید رخ می‌دهد.

این پدیده‌ای است که در فرایند یادگیری اطلاعات جدید توسط هوش مصنوعی مبتنی بر شبکه عصبی، دانش یا الگوهای آموخته‌شده قبلی به‌سرعت از دست می‌روند.

برای مثال، اگر یک LLM متن‌باز را با داده‌های یک شرکت خاص ریزتنظیم کنید، ممکن است دانش عمومی یا توانایی زبانی آن کاهش یابد.

برای جلوگیری از این مشکل، فناوری RAG (Retrieval-Augmented Generation) به‌طور گسترده استفاده می‌شود، اما RAG نیز محدودیت‌هایی دارد.

تصویر متن اصلی

محدودیت‌های اصلی RAG

  • پردازش ناکافی داده‌های ساختاریافته (Structured Data QA): سیستم‌های RAG عمدتاً برای اسناد متنیِ بدون ساختار بهینه‌سازی شده‌اند؛ بنابراین ممکن است نتوانند معنا و روابط داده‌های ساختاریافته (مانند جداول، پایگاه‌های داده و صفحات گسترده) را به‌درستی درک یا استفاده کنند.
  • محدودیت در PDFهای پیچیده/اسناد بدون ساختار (Complex PDFs): اسناد PDF پیچیده (شامل جدول، ستون‌های متعدد، تصویر و غیره) ممکن است در فرایند chunking(تقسیم‌بندی) با از دست رفتن اطلاعات یا تحریف زمینه مواجه شوند. در نتیجه، داده‌های مهم نمایه‌سازی نمی‌شوند یا جست‌وجوی آن‌ها دشوار می‌شود.
  • نبود مدل Fallback(پشتیبان) (Fallback Model(s)): هنگامی که سیستم RAG نمی‌تواند پاسخ مناسبی پیدا کند، منطق تغییر به مدل جایگزین (پشتیبان) ممکن است ناکافی یا ناکارآمد باشد. در نتیجه، هنگام شکست در ارائه پاسخ، جایگزین رضایت‌بخشی برای کاربر ارائه نمی‌شود.
  • آسیب‌پذیری امنیتی (LLM Security): دفاع در برابر آسیب‌پذیری‌های امنیتی خود LLM (مانند تزریق پرامپت و نشت داده) ناکافی است و خطر افشای اطلاعات حساس وجود دارد.
  • کمبود مقیاس‌پذیری (Data Ingestion Scalability): در فرایند نمایه‌سازی و ذخیره‌سازی حجم زیادی از داده‌ها، مشکلات مقیاس‌پذیری ایجاد می‌شود. با افزایش حجم داده، سرعت chunking، ذخیره‌سازی و جست‌وجو کاهش می‌یابد و بار سیستم افزایش پیدا می‌کند.
  • حذف اطلاعات مهم (Missing Content): محتوای مهم اسناد اغلب در فرایند chunking حذف می‌شود یا نمایه‌سازی نمی‌گردد. در نتیجه، کاربر نمی‌تواند اطلاعات موردنظر خود را جست‌وجو کند.
  • حذف رتبه‌های برتر (Missed Top Ranked): ممکن است مرتبط‌ترین chunk(رتبه برتر) در نتایج جست‌وجو حذف شود. محدودیت‌های الگوریتم جست‌وجو، کاهش کیفیت embedding و خطاهای رتبه‌بندی از عوامل آن هستند.
  • عدم تطابق زمینه (Not in Context): chunk بازیابی‌شده اغلب با زمینه واقعی پرسش مطابقت ندارد. این مشکل ناشی از محدودیت جست‌وجوی مبتنی بر شباهت صرف و نبود ارتباط معنایی کافی است.
  • خطای قالب (Wrong Format): قالب chunk بازیابی‌شده ممکن است برای پردازش توسط LLM نامناسب باشد یا با قالب پاسخ موردنظر کاربر تفاوت داشته باشد. برای مثال، ممکن است جدول به متن تبدیل شود و اطلاعات تحریف گردد.
  • شکست در استخراج اطلاعات (Not Extracted): ممکن است اطلاعات موردنیاز به‌درستی از chunk استخراج نشود یا LLM نتواند اطلاعات را تشخیص دهد. این مشکل اغلب در ساختارهای پیچیده جمله، جدول‌ها و تصاویر رخ می‌دهد.
  • نامتناسب بودن دامنه/عمق اطلاعات (Incorrect Specificity): پاسخ ممکن است برای پرسش بیش از حد کلی یا برعکس، بیش از اندازه جزئی باشد و با نیاز واقعی کاربر مطابقت نداشته باشد. تنظیم دامنه و عمق اطلاعات دشوار است.
  • پاسخ ناقص (Incomplete): پاسخ نهایی تولیدشده ممکن است ناقص باشد یا تنها بخشی از اطلاعات را ارائه دهد و در نتیجه نیاز کاربر را به‌طور کامل برآورده نکند. ناتوانی در ترکیب اطلاعات از چندین chunk یا استفاده LLM از تنها بخشی از اطلاعات، از عوامل این مشکل هستند.

از آنجا که RAG بیش از حد به جست‌وجوی صرفاً مبتنی بر شباهت برداری و نمایه‌سازی مبتنی بر chunk وابسته است، محدودیت‌های آن از نظر قابلیت اطمینان، مقیاس‌پذیری و دقت در محیط‌های واقعی کسب‌وکار کاملاً آشکار است.

۲. پایگاه داده معنایی کلِوی که بر محدودیت‌های RAG غلبه کرده است

کلِوی برای غلبه بر این محدودیت‌ها، زیرساخت نسل بعدی دانش هوش مصنوعی، یعنی Clevi Semantic Database را توسعه داده است که برای ارتباطات معنایی، استدلال ترکیبی و پاسخ‌گویی مبتنی بر شواهد بهینه‌سازی شده است.

این راهکار به لطف برخورداری از مدل Reasoning اختصاصی، هوش مصنوعی چندوجهی و مدل‌های هوش مصنوعی عامل‌محور امکان‌پذیر شده و یکی از فناوری‌های قدرتمند منحصربه‌فرد کلِوی است که به هوش مصنوعی امکان می‌دهد در دنیای واقعی واقعاً مفید باشد.

به‌عنوان یک تشبیه، اگر پایگاه داده‌ای را که اطلاعات در آن ذخیره شده است به یک کتابخانه تشبیه کنیم، می‌توان پایگاه داده معنایی کلِوی را به‌عنوان کتابخانه‌ای با یک کتابدار بسیار توانمند در نظر گرفت. (اگر اطلاعات موردنیاز خود را از کتابدار درخواست کنید، پاسخی دقیق و سریع دریافت خواهید کرد.)

کاربر می‌تواند هر زمان اطلاعات جدیدی را به کتابخانه اضافه کند و اطلاعات موردنیاز خود را بازیابی کند.

همچنین می‌توان مدیریت نسخه‌ها و مجوزهای دسترسی به داده‌ها را مطابق نیاز تنظیم کرد.

تمام اقدامات کتابدار به‌صورت گزارش (ثبت سوابق) ثبت می‌شود؛ بنابراین حتی در صورت بروز اشتباه نیز می‌توان آن را اصلاح کرد.

تصویر متن اصلی

<Clevi Semantic Database Structure>

ویژگی‌های اصلی و ساختار فنی

ذخیره‌سازی معنایی داده‌ها

  • ذخیره‌سازی روابط معنایی میان داده‌ها (مانند زمینه، سلسله‌مراتب و علیت) در پایگاه داده گرافی، نه یک Vector DB ساده مبتنی بر chunk
  • امکان گسترش و تکمیل آسان در قالب گراف دانش/شبکه معنایی

جست‌وجو و استدلال ترکیبی

  • CTA+Context Query: در نظر گرفتن هم‌زمان زمینه (Context) و CTA پرس‌وجو
  • Hybrid Retrieval: ترکیب شباهت برداری با جست‌وجوی مبتنی بر قوانین/گراف
  • Intelligent Folder Hits: جست‌وجوی خودکار پوشه‌ها/دسته‌بندی‌های مرتبط از نظر معنایی

پردازش هم‌زمان چندوجهی

  • تفسیر هم‌زمان داده‌های متنوعی مانند متن، تصویر، جدول و صوت با استفاده از TextReader Pool، VisionReader Pool و سایر موارد
  • در حالی که RAG سنتی عمدتاً قادر به پردازش متن است، پایگاه داده معنایی در پردازش چندوجهی توانمندی برجسته‌ای دارد

پاسخ‌گویی مبتنی بر شواهد و اعتبارسنجی قابلیت اطمینان

  • خلاصه‌سازی و استناد به اسناد، یافته‌های جدول و موارد دیگر؛ تولید خودکار خلاصه و منابع اسناد
  • ادغام و راستی‌آزمایی: یکپارچه‌سازی معنایی اطلاعات از چندین منبع و اعتبارسنجی قابلیت اعتماد
  • بسته شواهد: ارائه بسته پاسخ مبتنی بر شواهد

استدلال ترکیبی و برنامه‌ریز

  • Planner/DAG: برنامه‌ریزی مرحله‌به‌مرحله و استدلال مبتنی بر DAG (Directed Acyclic Graph) برای پرس‌وجوهای پیچیده

ساختار عامل یکپارچه

  • cip-5-agent Supervisor: عامل ارشد برای مدیریت و هماهنگی کل فرایند جست‌وجو/استدلال/یکپارچه‌سازی
تصویر اصلی

۳. خلاصه ساختار و مقایسه

به‌طور خلاصه، Semantic DB داده‌ها را در قالب‌های مختلف (صوت، متن، تصویر، ویدئو و غیره) دریافت می‌کند و دانش را نه به‌صورت Chunkهای ساده، بلکه با اتصال روابط معنایی میان داده‌ها (مانند زمینه، سلسله‌مراتب و علیت) دسته‌بندی می‌کند.

بر این اساس، از آنجا که به‌جای جست‌وجوی مبتنی بر کلیدواژه/شباهت مانند RAG، از جست‌وجو و استدلال مبتنی بر ارتباطات معنایی استفاده می‌کند، می‌توانید اطلاعات و پاسخ‌های دقیق‌تری را از AI دریافت کنید.

همچنین، از آنجا که داده‌ها در قالب گراف دانش/شبکه معنایی ذخیره می‌شوند، گسترش و تکمیل مستمر آن‌ها آسان است.

CLEVI با شناسایی محدودیت‌های سیستم‌های RAG در عصر تحول بزرگ AI، از طریق پایگاه داده معنایی و مدل AI اختصاصی خود، امکان ارائه سریع‌تر داده‌هایی دقیق‌تر و قابل‌اعتمادتر به مشتریان را فراهم کرده است.

سیستم AI شرکت CLEVI می‌تواند در هر محیط و صرف‌نظر از نوع حوزه، داده‌های ارزشمند مشتریان را به دارایی‌هایی ارزشمند تبدیل کند.

CLEVI همچنان تمام تلاش خود را برای به حداکثر رساندن ارزش داده‌های مشتریان و ارائه تجربه‌ای نوآورانه از AI به کار خواهد گرفت.

لطفاً آینده جدید AI را همراه با CLEVI تجربه کنید.

درخواست اطلاعات و دمو: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

بازگشت به اتاق خبر
CLEVI

زبان و منطقه

زبان‌های ترجمه‌شده با ماشین علامت‌گذاری شده‌اند. دسترس‌پذیری بر اساس بسته منتشرشده سایت است.

۱۳۶ زبان

پیشنهادی

1

شرق آسیا

7

جنوب شرق آسیا

11

جنوب آسیا

18

آسیای مرکزی

5

خاورمیانه و قفقاز

10

غرب اروپا و جنوب اروپا

16

بریتانیا و ایرلند

4

شمال اروپا

10

اروپای مرکزی و بالکان

14

شرق اروپا

5

شرق افریقا

8

غرب افریقا و مرکز افریقا

9

جنوب افریقا

8

امریکا

5

اقیانوسیه

5