1. حدود النسيان الكارثي (Catastrophic Forgetting) وRAG
عند تطبيق الذكاء الاصطناعي في الأعمال الفعلية، يتمثل أحد أكبر مصادر القلق في ظاهرة النسيان الكارثي (Catastrophic Forgetting) التي تحدث عند ضبط المعرفة التي تم تعلمها سابقًا باستخدام بيانات جديدة.
وهي ظاهرة يفقد فيها الذكاء الاصطناعي القائم على الشبكات العصبية المعرفة أو الأنماط التي تعلمها سابقًا بشكل مفاجئ أثناء عملية تعلم معلومات جديدة.
على سبيل المثال، إذا تم ضبط نموذج لغوي كبير مفتوح المصدر باستخدام بيانات شركة معينة، فقد تتراجع قدرته على تقديم المعرفة العامة أو استخدام اللغة.
ولتجنب هذه المشكلة، تُستخدم تقنية RAG (Retrieval-Augmented Generation) على نطاق واسع، إلا أن تقنية RAG لها حدودها أيضًا.
أبرز قيود RAG
- قصور في معالجة البيانات المهيكلة (Structured Data QA): تم تحسين أنظمة RAG بشكل أساسي للتعامل مع مستندات النصوص غير المهيكلة، ولذلك قد لا تتمكن من فهم أو استخدام معنى وعلاقات البيانات المهيكلة (الجداول وقواعد البيانات وجداول البيانات الإلكترونية وما إلى ذلك) بشكل صحيح.
- قيود ملفات PDF المعقدة/المستندات غير المهيكلة (Complex PDFs): قد تُفقد المعلومات أو يُشوَّه السياق أثناء عملية chunking (التقسيم) للمستندات المعقدة بصيغة PDF (بما في ذلك الجداول والأعمدة المتعددة والصور وما إلى ذلك). ونتيجة لذلك، قد لا تتم فهرسة البيانات المهمة أو قد يصعب البحث عنها.
- غياب نموذج Fallback (الاحتياطي) (Fallback Model(s)): عندما يتعذر على نظام RAG العثور على إجابة مناسبة، قد تكون آلية التحويل إلى نموذج بديل (احتياطي) غير كافية أو غير فعالة. ونتيجة لذلك، لا يتم توفير بديل مُرضٍ للمستخدم عند فشل الإجابة.
- الثغرات الأمنية (LLM Security): نظرًا لعدم كفاية الحماية من الثغرات الأمنية في LLM نفسه (مثل حقن التعليمات وتسريب البيانات وما إلى ذلك)، فهناك خطر انكشاف المعلومات الحساسة.
- قصور قابلية التوسع (Data Ingestion Scalability): تحدث مشكلات في قابلية التوسع أثناء فهرسة كميات كبيرة من البيانات وتخزينها. فكلما زادت البيانات، انخفضت سرعة chunking والتخزين والبحث، وازداد حمل النظام.
- فقدان المعلومات المهمة (Missing Content): غالبًا ما يُفقد المحتوى المهم من المستند أثناء عملية chunking أو لا تتم فهرسته. ونتيجة لذلك، لا يستطيع المستخدم البحث عن المعلومات التي يريدها.
- فقدان النتائج ذات الترتيب الأعلى (Missed Top Ranked): قد لا يتم تضمين chunk الأكثر صلة فعليًا (ذو الترتيب الأعلى) في نتائج البحث. وتشمل الأسباب محدودية خوارزمية البحث، وانخفاض جودة التضمينات، وأخطاء الترتيب، وغير ذلك.
- عدم تطابق السياق (Not in Context): غالبًا لا يتوافق chunk الذي تم العثور عليه مع سياق السؤال الفعلي. ويرجع ذلك إلى محدودية البحث القائم على التشابه البسيط، إذ يفتقر إلى الترابط الدلالي.
- خطأ في التنسيق (Wrong Format): قد يكون تنسيق chunk الذي تم العثور عليه غير مناسب لمعالجة LLM، أو قد يختلف عن تنسيق الإجابة الذي يريده المستخدم. على سبيل المثال، قد تتحول الجداول إلى نص، مما يؤدي إلى تشويه المعلومات.
- فشل استخراج المعلومات (Not Extracted): قد لا تُستخرج المعلومات المطلوبة من chunk بشكل صحيح، أو قد لا يتمكن LLM من التعرف على المعلومات. ويحدث ذلك غالبًا في الجمل ذات البنية المعقدة والجداول والصور وما إلى ذلك.
- عدم ملاءمة نطاق/عمق المعلومات (Incorrect Specificity): قد تكون الإجابة شاملة أكثر من اللازم بالنسبة إلى السؤال، أو على العكس محددة بشكل مفرط، وبالتالي لا تتوافق مع احتياجات المستخدم الفعلية. كما يصعب ضبط نطاق المعلومات وعمقها.
- إجابة غير مكتملة (Incomplete): قد تكون الإجابة المُنشأة نهائيًا غير مكتملة، أو قد تقدم بعض المعلومات فقط، فلا تلبي احتياجات المستخدم بشكل كافٍ. ومن أسباب ذلك عدم تجميع المعلومات من عدة chunk، أو استخدام LLM جزءًا من المعلومات فقط.
كما أن RAG يعتمد بشكل مفرط على البحث القائم على تشابه المتجهات والفهرسة القائمة على المقاطع، فإن حدوده من حيث الموثوقية وقابلية التوسع والدقة في الأعمال الفعلية واضحة.
2. قاعدة البيانات الدلالية من كليفي التي تتغلب على حدود RAG
للتغلب على هذه الحدود، طوّرت كليفي بنية تحتية معرفية للذكاء الاصطناعي من الجيل التالي، محسّنة للترابط الدلالي والاستدلال المركب والاستجابات القائمة على الأدلة، وهي Clevi Semantic Database.
إنه حل ممكن بفضل امتلاكنا جميعًا لنماذج Reasoning الخاصة بنا، والذكاء الاصطناعي متعدد الوسائط، ونماذج الذكاء الاصطناعي الوكيلة، وهو أحد تقنيات كليفي القوية والفريدة التي تجعل الذكاء الاصطناعي مفيدًا فعليًا في العالم الحقيقي.
على سبيل التشبيه، إذا اعتبرنا قاعدة البيانات التي تُخزَّن فيها المعلومات مكتبة، فيمكننا القول إن قاعدة البيانات الدلالية من كليفي تضم أمين مكتبة بارعًا للغاية. (عند طلب المعلومات المطلوبة من أمين المكتبة، يمكن الحصول على استجابة دقيقة وسريعة.)
يمكن للمستخدمين إضافة معلومات جديدة إلى المكتبة واستدعاء المعلومات المطلوبة في أي وقت.
كما يمكنهم ضبط إدارة إصدارات البيانات وأذونات الوصول حسب رغبتهم.
تُسجَّل جميع تصرفات أمين المكتبة في سجل، ولذلك يمكن تصحيحها حتى في حال حدوث خطأ.
<Clevi Semantic Database Structure>
الميزات الرئيسية والبنية التقنية
تخزين البيانات الدلالية
- تخزين العلاقات الدلالية بين البيانات (السياق، والتسلسل الهرمي، والسببية، وغيرها) في قاعدة بيانات رسومية، بدلًا من قاعدة بيانات متجهات بسيطة قائمة على المقاطع
- سهولة التوسّع والاستكمال في شكل رسم بياني للمعرفة/شبكة دلالية
البحث والاستدلال الهجينان
- CTA+Context Query: عكس سياق الاستعلام (Context) وCTA معًا
- Hybrid Retrieval: دمج البحث القائم على تشابه المتجهات مع البحث القائم على القواعد/الرسوم البيانية
- Intelligent Folder Hits: الاستكشاف التلقائي للمجلدات/الفئات المرتبطة دلاليًا
المعالجة المتزامنة متعددة الوسائط
- تفسير متزامن لمختلف أنواع البيانات، مثل النصوص والصور والجداول والصوت، باستخدام TextReader Pool وVisionReader Pool وغيرها
- في حين أن RAG التقليدي لا يستطيع معالجة سوى النصوص بشكل أساسي، تتميز قاعدة البيانات الدلالية بقدرة فائقة على معالجة البيانات متعددة الوسائط
الاستجابات القائمة على الأدلة والتحقق من الموثوقية
- ملخصات المستندات والاستشهادات، وإنشاء نتائج الجداول والمصادر تلقائيًا
- الدمج والتحقق: التكامل الدلالي للمعلومات من مصادر متعددة والتحقق من موثوقيتها
- حزمة الأدلة: تقديم حزم استجابات قائمة على الأدلة
الاستدلال المركب والمخطط
- Planner/DAG: وضع خطط مرحلية واستدلال قائم على DAG (الرسم البياني غير الدوري الموجّه) للاستفسارات المعقدة
بنية الوكيل المتكامل
- المشرف cip-5-agent: الوكيل الأعلى الذي يدير وينسّق عمليات البحث والاستدلال والتكامل بأكملها
3. ملخص البنية والمقارنة
باختصار، تستقبل قاعدة البيانات الدلالية بيانات بأشكال متنوعة (الصوت، والنص، والصور، والفيديو، وغير ذلك)، ولا تكتفي بتقسيمها إلى مقاطع بسيطة، بل تصنّف المعرفة من خلال ربط العلاقات الدلالية بين البيانات (مثل السياق والتسلسل الهرمي والسببية).
وبناءً على ذلك، يمكن الحصول من الذكاء الاصطناعي على استرجاع معلومات وإجابات أكثر دقة، لأنه يستخدم البحث والاستدلال القائمين على الروابط الدلالية، بدلًا من البحث القائم على الكلمات المفتاحية أو التشابه كما في RAG.
وبما أنها تُخزَّن في شكل رسم بياني للمعرفة أو شبكة دلالية، فمن السهل توسيعها واستكمالها باستمرار.
اكتشفت كليفي حدود أنظمة RAG في عصر التحول الكبير نحو الذكاء الاصطناعي، ومن خلال قاعدة بيانات دلالية ونموذج ذكاء اصطناعي خاصين بها، أصبحت قادرة على تزويد العملاء ببيانات أكثر دقة وموثوقية وبسرعة أكبر.
يمكن لنظام الذكاء الاصطناعي الخاص بكليفي أن يجعل بيانات العملاء القيّمة ذات قيمة حقيقية، بصرف النظر عن نوع المجال وفي أي بيئة كانت.
وستواصل كليفي بذل قصارى جهدها لتعظيم قيمة بيانات العملاء وتقديم تجارب مبتكرة في مجال الذكاء الاصطناعي.
نرجو منكم خوض مستقبل الذكاء الاصطناعي الجديد مع كليفي.
للاستفسارات وطلبات العروض التوضيحية: [email protected]
حقوق النشر© 2025 Clevi Inc. جميع الحقوق محفوظة.
