منبع: روزنامه الکترونیک، خبرنگار لی وونجی
نقل کامل مقاله «CLEVI، با مدل اختصاصی from scratch، به دقت 79.07٪ در GAIA دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر»
تاریخ انتشار: 2026-04-07
لینک: https://www.etnews.com/20260407000203
پشته مدل اختصاصی cip-5.5-agent·cip-5.5-mm؛ هر 5 ایجنت امتیازی بالاتر از 70 کسب کردند
با در نظر گرفتن از دست رفتن اطلاعات، دقت پاسخ صحیح بیش از 98٪ است و از انسانها (92٪) بالاتر است
استارتاپ هوش مصنوعی «CLEVI» با استفاده از مدل اختصاصی from scratch خود، در بنچمارک جهانی ایجنتهای هوش مصنوعی «GAIA» به دقت پاسخ صحیح 79.07٪ دست یافت و بر اساس مجموع 3,090 مدل ثبتشده، در میان 2.5٪ برتر قرار گرفت.
طبق توضیحات فعالان این صنعت، در بازار بنچمارکهای هوش مصنوعی، GAIA بهعنوان معیاری ارزیابی میشود که توانایی «ایجنتهای هوش مصنوعی کاربردی» را بهخوبی منعکس میکند. این بنچمارک که بهطور مشترک توسط Meta AI، HuggingFace و دانشگاه پاری-ساکله توسعه یافته است، نخستین بار در نوامبر 2023 منتشر شد.
GAIA از سه جهت اصلی با سایر بنچمارکها متمایز است. نخست، از آنجا که پاسخهای صحیح منتشر نمیشوند، امکان بیشبرازش وجود ندارد. دوم، از آنجا که به استدلال ترکیبی چندمرحلهای و چندوجهی نیاز دارد، کسب امتیاز بالا با تطبیق ساده الگوها ممکن نیست. سوم، بیش از 3,090 مدل از سراسر جهان از طریق جدول رتبهبندی رسمی HuggingFace، در شرایط یکسان با یکدیگر رقابت میکنند.
مجموعه آزمون دربرگیرنده 301 پرسش است. Level 1 شامل استفاده از یک ابزار و استدلال ساده، Level 2 شامل ترکیب چند ابزار و استدلال در سطح متوسط، و Level 3 شامل پرسشهایی با بالاترین درجه دشواری است که به برنامهریزی و اجرای ایجنت در پنج مرحله یا بیشتر نیاز دارند. در زمان معرفی این بنچمارک، امتیاز مدلهای GPT (مجهز به پلاگین) حدود 15٪ بود و تیمهای برتر اکنون آن را به محدوده 70 تا 80٪ رساندهاند.
در این میان، CLEVI تأکید کرد که از نظر فنی، مهمترین نکته در این دستاورد آن است که بههیچوجه از API مدلهای زبانی بزرگ خارجی مانند GPT، Claude و Gemini استفاده نکرده است. ویژگی متمایز CLEVI استفاده از دو مدل است که بهصورت اختصاصی و با روش from scratch توسعه داده شدهاند.
cip-5.5-agent یک مدل هوش مصنوعی عاملمحور است که بهعنوان مغز اصلی خط لوله عامل برای برنامهریزی (planning)، اجرای (execution) و راستیآزمایی (verification) مستقلانه وظایف پیچیده عمل میکند. cip-5.5-mm یک مدل چندوجهی عمومی و قدرتمند است که قالبهای مختلف فایل، از جمله صوت، تصویر و ویدئو، را درک و درباره آنها استدلال میکند. از آنجا که بخش قابلتوجهی از پرسشهای GAIA شامل ورودیهای غیرمتنی مانند فایلهای PDF، تصویر و صوت است، این قابلیت چندوجهی به عامل اصلی کسب امتیاز بالا تبدیل شد.
CLEVI با تکیه بر این دو مدل اختصاصی، ۵ پیکربندی عامل متفاوت را در GAIA شرکت داد و همه آنها امتیاز بالاتر از ۷۰ کسب کردند.
طبق توضیحات این شرکت، در بررسی پس از ارزیابی داخلی CLEVI نتایج جالبی شناسایی شد. از میان مجموع ۳۰۱ پرسش، برای برخی از آنها در حال حاضر شواهد پاسخ صحیح در وب عمومی از بین رفته بود. در این موارد، اطلاعاتی که پیشتر بهصورت آنلاین یا از طریق موتورهای جستوجو قابل تأیید بود، حذف یا تغییر کرده و دیگر قابل دسترسی نیست. هنگامی که این پرسشها بر اساس اطلاعاتی که در حال حاضر برای انسانها بهصورت عمومی قابل تأیید است دوباره ارزیابی شدند، دقت CLEVI بیش از ۹۸٪ به دست آمد. این رقم از میانگین انسانی ۹۲٪ نیز فراتر است.
یکی از مسئولان CLEVI توضیح داد: «CLEVI بدون ترکیب مدلهای خارجی و تنها با مدلهای اختصاصی خود که از from scratch ساخته شدهاند و راهکارهای عامل هوش مصنوعی اختصاصی خود، با کسب امتیاز 70+ برای هر ۵ عامل، وارد ۲.۵٪ برتر در بنچمارک عمومی شد. به نظر میرسد با بهبود مدلها و راهکارهای عامل اختصاصی، امکان افزایش بیشتر امتیاز رسمی نیز در آینده وجود داشته باشد. اهمیت این دستاورد در آن است که در یک بنچمارک عمومی جهانی بهصورت واقعی اندازهگیری شده و «اعتماد تأییدشده» را نشان میدهد؛ دستاوردی مبتنی بر مدل اختصاصی from scratch یک شرکت توسعهدهنده هوش مصنوعی داخلی است؛ نتیجه پشته مدل مستقل، نه ترکیب مدلهای خارجی، محسوب میشود؛ و با در نظر گرفتن از بین رفتن اطلاعات برخی پرسشها، ارزش تفسیری آن فراتر از امتیاز صرف است.»
