الأخبار

كليفي، باستخدام نموذجها الخاص المطوَّر from scratch، تحقق 79.07% في GAIA... ضمن أعلى 2.5% من بين 3,090 نموذجًا

المصدر: صحيفة إلكترونية، الصحفي لي وون-جي

المصدر: صحيفة إلكترونية، الصحفي لي وون-جي

اقتباس كامل لمقال «كليفي، باستخدام نموذجها الخاص المطوَّر from scratch، تحقق 79.07% في GAIA... ضمن أعلى 2.5% من بين 3,090 نموذجًا»

تاريخ النشر: 2026-04-07

الرابط: https://www.etnews.com/20260407000203

مجموعة نماذج مستقلة من cip-5.5-agent·cip-5.5-mm، وجميع الوكلاء الخمسة يسجلون أكثر من 70 نقطة

دقة إجابات تتجاوز 98% عند مراعاة فقدان المعلومات، متفوقةً على البشر (92%)

صورة المحتوى

سجّلت شركة الذكاء الاصطناعي الناشئة «كليفي» دقة إجابات بلغت 79.07% في معيار وكلاء الذكاء الاصطناعي العالمي «GAIA»، باستخدام نموذجها الخاص المطوَّر from scratch، واحتلت مكانًا ضمن أعلى 2.5% وفقًا لإجمالي 3,090 نموذجًا مسجلًا.

وفقًا لتوضيحات القطاع، يُقيَّم معيار GAIA في سوق معايير الذكاء الاصطناعي على أنه يعكس بأمانة قدرات «وكلاء الذكاء الاصطناعي العمليين». وقد طوّرت Meta AI وHuggingFace وجامعة باريس-ساكلاي وغيرها هذا المعيار بصورة مشتركة، وكُشف عنه لأول مرة في نوفمبر 2023.

تتمثل النقاط الرئيسية الثلاث التي تميز GAIA عن المعايير الأخرى فيما يلي. أولًا، لا يمكن الإفراط في ملاءمة النموذج لأن الإجابات الصحيحة غير معلنة. ثانيًا، لا يمكن تحقيق نتيجة مرتفعة من خلال مطابقة الأنماط البسيطة، لأنه يتطلب استدلالًا مركبًا متعدد الخطوات ومتعدد الوسائط. ثالثًا، تتنافس أكثر من 3,090 نموذجًا من جميع أنحاء العالم في ظل الشروط نفسها عبر لوحة المتصدرين الرسمية على HuggingFace.

تتكون مجموعة الاختبار من 301 سؤالًا إجمالًا. يتضمن المستوى 1 استخدام أداة واحدة والاستدلال البسيط، بينما يتضمن المستوى 2 الجمع بين أدوات متعددة والاستدلال متوسط المستوى، أما المستوى 3 فيتكون من أسئلة بالغة الصعوبة تتطلب تخطيط الوكيل وتنفيذه عبر خمس خطوات أو أكثر. عند الإعلان عن المعيار، بلغت النسبة نحو 15% استنادًا إلى نماذج GPT (المزوّدة بإضافات)، بينما رفعتها الفرق المتصدرة حاليًا إلى نطاق 70–80%.

وفي هذا السياق، شددت كليفي على أن الجانب الأكثر أهمية تقنيًا في هذا الإنجاز هو أنها لم تستخدم إطلاقًا واجهات برمجة نماذج LLM الخارجية مثل GPT وClaude وGemini. وتتميز كليفي باستخدام نموذجين طوّرتهما بصورة مستقلة وفق أسلوب from scratch.

يُعدّ cip-5.5-agent نموذجًا للذكاء الاصطناعي الوكيلي، ويؤدي دور العقل الأساسي في خط أنابيب الوكلاء الذي يخطط للمهام المعقدة (planning) وينفذها (execution) ويتحقق منها (verification) بشكل مستقل. أما cip-5.5-mm فهو نموذج متعدد الوسائط عام عالي الأداء يفهم ويستدل على تنسيقات ملفات متنوعة، مثل الصوت والصور ومقاطع الفيديو. ونظرًا إلى أن جزءًا كبيرًا من أسئلة GAIA يتضمن مدخلات غير نصية، مثل ملفات PDF والصور والملفات الصوتية، فقد أصبحت هذه القدرة متعددة الوسائط عاملًا أساسيًا في تحقيق النتائج المرتفعة.

اعتمدت كليفي على هذين النموذجين المطورين داخليًا وأشركت خمسة تكوينات مختلفة من الوكلاء في GAIA، وقد سجلت جميعها أكثر من 70 نقطة.

وفقًا لشرح الشركة، ظهرت نتائج مثيرة للاهتمام خلال المراجعة اللاحقة الداخلية التي أجرتها كليفي. فمن بين إجمالي 301 سؤالًا، كانت الأدلة التي تثبت الإجابات الصحيحة لبعضها قد اختفت من الويب العام المتاح حاليًا. ويحدث ذلك عندما تُحذف المعلومات التي كان يمكن التحقق منها سابقًا عبر الإنترنت أو محركات البحث أو تُعدّل، بحيث يتعذر الوصول إليها بعد الآن. وعند إعادة التقييم ضمن نطاق المعلومات التي يمكن للبشر التحقق منها علنًا حاليًا، تبيّن أن معدل إجابات كليفي الصحيحة يتجاوز 98%. وهذه نسبة تفوق بالفعل المتوسط البشري البالغ 92%.

أوضح مسؤول في كليفي قائلًا: «سجلت كليفي أكثر من 70 نقطة لجميع الوكلاء الخمسة، ودخلت ضمن أعلى 2.5% في المعيار المعلن، باستخدام نماذجها الخاصة المطورة from scratch وحلول وكلاء الذكاء الاصطناعي الخاصة بها فقط، من دون مزج نماذج خارجية. ويبدو أنه سيكون من الممكن تحسين النتيجة الرسمية أكثر مستقبلًا من خلال تطوير النماذج والحلول الوكيلة الخاصة بها. وتكتسب هذه النتيجة أهمية كبيرة لأنها تُظهر “ثقة مُثبتة” من خلال قياسها في معيار عالمي معلن، ولأنها إنجاز لشركة تطوير ذكاء اصطناعي محلية قائم على نماذجها الخاصة المطورة from scratch، ولأنها نتيجة مكدس نماذج مستقل لا يعتمد على مزج نماذج خارجية، فضلًا عن أن فقدان المعلومات في بعض الأسئلة يمنحها قيمة تفسيرية تتجاوز النتيجة نفسها».

العودة إلى غرفة الأخبار
CLEVI

اللغة والمنطقة

تم وضع علامة على اللغات المترجمة آليًا. ويعتمد التوفر على حزمة الموقع المنشورة.

136 لغة

موصى به

1

شرق آسيا

7

جنوب شرق آسيا

11

جنوب آسيا

18

وسط آسيا

5

الشرق الأوسط والقوقاز

10

غرب أوروبا وجنوب أوروبا

16

المملكة المتحدة وأيرلندا

4

شمال أوروبا

10

أوروبا الوسطى والبلقان

14

شرق أوروبا

5

شرق أفريقيا

8

غرب أفريقيا ووسط أفريقيا

9

أفريقيا الجنوبية

8

الأمريكتان

5

أوقيانوسيا

5