منبع: خبرنگار لی وونجی از روزنامه الکترونیک
استناد کامل به مقاله «CLEVI با مدل اختصاصی خود که از from scratch توسعه داده شده است، در GAIA به امتیاز 79.07٪ دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر قرار گرفت»
تاریخ انتشار: 2026-04-07
لینک: https://www.etnews.com/20260407000203
پشته مدلهای اختصاصی cip-5.5-agent·cip-5.5-mm؛ هر 5 ایجنت امتیازی بالاتر از 70 کسب کردند
با در نظر گرفتن از دست رفتن اطلاعات، دقت پاسخگویی بیش از 98٪ و بالاتر از انسانها (92٪)
استارتاپ هوش مصنوعی «CLEVI» با استفاده از مدل اختصاصی خود که از from scratch توسعه داده شده است، در بنچمارک جهانی ایجنتهای هوش مصنوعی «GAIA» به دقت پاسخگویی 79.07٪ دست یافت و بر اساس کل 3,090 مدل ثبتشده، در جمع 2.5٪ برتر قرار گرفت.
بر اساس توضیحات صنعت، در بازار بنچمارکهای هوش مصنوعی، GAIA بهعنوان بنچمارکی ارزیابی میشود که توانایی «ایجنتهای هوش مصنوعی کاربردی» را بهخوبی بازتاب میدهد. این بنچمارک که بهصورت مشترک توسط Meta AI، HuggingFace و دانشگاه پاری-ساکله توسعه یافته است، نخستینبار در نوامبر 2023 منتشر شد.
سه ویژگی، GAIA را از سایر بنچمارکها متمایز میکند. نخست، از آنجا که پاسخهای صحیح عمومی نیستند، بیشبرازش امکانپذیر نیست. دوم، از آنجا که به استدلال ترکیبی چندمرحلهای و چندوجهی نیاز دارد، کسب امتیاز بالا با تطبیق ساده الگوها امکانپذیر نیست. سوم، بیش از 3,090 مدل از سراسر جهان از طریق رتبهبندی رسمی HuggingFace، در شرایط یکسان با یکدیگر رقابت میکنند.
مجموعه آزمون از 301 پرسش تشکیل شده است. Level 1 شامل استفاده از یک ابزار و استدلال ساده است؛ Level 2 به ترکیب چند ابزار و استدلال در سطح متوسط نیاز دارد؛ و Level 3 شامل دشوارترین پرسشهاست که به برنامهریزی و اجرای ایجنت در 5 مرحله یا بیشتر نیاز دارند. در زمان معرفی این بنچمارک، امتیاز مدلهای GPT (با افزونه) حدود 15٪ بود و تیمهای برتر اکنون آن را به محدوده 70 تا 80٪ رساندهاند.
در این میان، CLEVI تأکید کرد که از نظر فنی، مهمترین نکته در این دستاورد آن است که بههیچوجه از API مدلهای LLM خارجی مانند GPT، Claude و Gemini استفاده نشده است. ویژگی متمایز CLEVI استفاده از دو مدل است که بهصورت مستقل و با روش from scratch توسعه داده شدهاند.
cip-5.5-agent یک مدل هوش مصنوعی عاملمحور است که بهعنوان مغز اصلی خط لوله عامل برای برنامهریزی (planning)، اجرا (execution) و راستیآزمایی (verification) مستقلِ وظایف پیچیده عمل میکند. cip-5.5-mm یک مدل چندوجهی عمومیِ قدرتمند است که فرمتهای مختلف فایل، از جمله صدا، تصویر و ویدئو، را درک و استدلال میکند. از آنجا که بخش قابلتوجهی از پرسشهای GAIA شامل ورودیهای غیرمتنی مانند فایلهای PDF، تصویر و صوت است، این توانایی چندوجهی به عامل اصلی کسب امتیاز بالا تبدیل شد.
کلِوی با تکیه بر این دو مدل اختصاصی، ۵ پیکربندی عامل متفاوت را در GAIA شرکت داد و همه آنها امتیاز بالاتر از ۷۰ کسب کردند.
طبق توضیحات این شرکت، در بررسی پس از ارزیابی داخلی کلِوی نتایج جالبی مشخص شد. از مجموع ۳۰۱ پرسش، برای برخی از آنها در حال حاضر شواهد پاسخ صحیح در وب عمومی از بین رفته بود. در این موارد، اطلاعاتی که پیشتر بهصورت آنلاین یا از طریق موتورهای جستوجو قابل بررسی بود، حذف یا تغییر کرده و دیگر قابل دسترسی نیست. هنگام ارزیابی مجدد بر اساس محدوده اطلاعاتی که در حال حاضر برای انسانها بهصورت عمومی قابل بررسی است، نرخ پاسخ صحیح کلِوی بیش از ۹۸٪ به دست آمد. این رقم در حال حاضر از میانگین انسانی، یعنی ۹۲٪، بالاتر است.
یکی از مسئولان کلِوی توضیح داد: «کلِوی بدون ترکیب مدلهای خارجی و تنها با استفاده از مدلهای اختصاصی خود از from scratch و راهکارهای عامل هوش مصنوعی اختصاصی خود، با ثبت امتیاز 70+ برای هر ۵ عامل، وارد ۲.۵٪ برتر در بنچمارک عمومی شد. به نظر میرسد با بهبود مدلهای اختصاصی و راهکارهای عامل خود در آینده، امکان افزایش بیشتر امتیاز رسمی نیز وجود داشته باشد. این دستاورد از این جهت اهمیت عمیقی دارد که عملکرد آن در یک بنچمارک عمومی جهانی بهصورت واقعی اندازهگیری شده و «اعتماد تأییدشده» را نشان میدهد؛ دستاوردی مبتنی بر مدل اختصاصی from scratch یک شرکت توسعهدهنده هوش مصنوعی داخلی است؛ نتیجه پشته مدل مستقل خود شرکت، نه ترکیبی از مدلهای خارجی، محسوب میشود؛ و با در نظر گرفتن از بین رفتن اطلاعات برخی پرسشها، ارزش تفسیری آن فراتر از امتیاز ثبتشده است.»
