اخبار

CLEVI، با مدل اختصاصی from scratch، به دقت 79.07٪ در GAIA دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر

منبع: روزنامه الکترونیک، خبرنگار لی وون‌جی

منبع: روزنامه الکترونیک، خبرنگار لی وون‌جی

نقل کامل مقاله «CLEVI، با مدل اختصاصی from scratch، به دقت 79.07٪ در GAIA دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر»

تاریخ انتشار: 2026-04-07

لینک: https://www.etnews.com/20260407000203

پشته مدل اختصاصی cip-5.5-agent·cip-5.5-mm؛ هر 5 ایجنت امتیازی بالاتر از 70 کسب کردند

با در نظر گرفتن از دست رفتن اطلاعات، دقت پاسخ صحیح بیش از 98٪ است و از انسان‌ها (92٪) بالاتر است

تصویر متن اصلی

استارتاپ هوش مصنوعی «CLEVI» با استفاده از مدل اختصاصی from scratch خود، در بنچمارک جهانی ایجنت‌های هوش مصنوعی «GAIA» به دقت پاسخ صحیح 79.07٪ دست یافت و بر اساس مجموع 3,090 مدل ثبت‌شده، در میان 2.5٪ برتر قرار گرفت.

طبق توضیحات فعالان این صنعت، در بازار بنچمارک‌های هوش مصنوعی، GAIA به‌عنوان معیاری ارزیابی می‌شود که توانایی «ایجنت‌های هوش مصنوعی کاربردی» را به‌خوبی منعکس می‌کند. این بنچمارک که به‌طور مشترک توسط Meta AI، HuggingFace و دانشگاه پاری-ساکله توسعه یافته است، نخستین بار در نوامبر 2023 منتشر شد.

GAIA از سه جهت اصلی با سایر بنچمارک‌ها متمایز است. نخست، از آنجا که پاسخ‌های صحیح منتشر نمی‌شوند، امکان بیش‌برازش وجود ندارد. دوم، از آنجا که به استدلال ترکیبی چندمرحله‌ای و چندوجهی نیاز دارد، کسب امتیاز بالا با تطبیق ساده الگوها ممکن نیست. سوم، بیش از 3,090 مدل از سراسر جهان از طریق جدول رتبه‌بندی رسمی HuggingFace، در شرایط یکسان با یکدیگر رقابت می‌کنند.

مجموعه آزمون دربرگیرنده 301 پرسش است. Level 1 شامل استفاده از یک ابزار و استدلال ساده، Level 2 شامل ترکیب چند ابزار و استدلال در سطح متوسط، و Level 3 شامل پرسش‌هایی با بالاترین درجه دشواری است که به برنامه‌ریزی و اجرای ایجنت در پنج مرحله یا بیشتر نیاز دارند. در زمان معرفی این بنچمارک، امتیاز مدل‌های GPT (مجهز به پلاگین) حدود 15٪ بود و تیم‌های برتر اکنون آن را به محدوده 70 تا 80٪ رسانده‌اند.

در این میان، CLEVI تأکید کرد که از نظر فنی، مهم‌ترین نکته در این دستاورد آن است که به‌هیچ‌وجه از API مدل‌های زبانی بزرگ خارجی مانند GPT، Claude و Gemini استفاده نکرده است. ویژگی متمایز CLEVI استفاده از دو مدل است که به‌صورت اختصاصی و با روش from scratch توسعه داده شده‌اند.

cip-5.5-agent یک مدل هوش مصنوعی عامل‌محور است که به‌عنوان مغز اصلی خط لوله عامل برای برنامه‌ریزی (planning)، اجرای (execution) و راستی‌آزمایی (verification) مستقلانه وظایف پیچیده عمل می‌کند. cip-5.5-mm یک مدل چندوجهی عمومی و قدرتمند است که قالب‌های مختلف فایل، از جمله صوت، تصویر و ویدئو، را درک و درباره آن‌ها استدلال می‌کند. از آنجا که بخش قابل‌توجهی از پرسش‌های GAIA شامل ورودی‌های غیرمتنی مانند فایل‌های PDF، تصویر و صوت است، این قابلیت چندوجهی به عامل اصلی کسب امتیاز بالا تبدیل شد.

CLEVI با تکیه بر این دو مدل اختصاصی، ۵ پیکربندی عامل متفاوت را در GAIA شرکت داد و همه آن‌ها امتیاز بالاتر از ۷۰ کسب کردند.

طبق توضیحات این شرکت، در بررسی پس از ارزیابی داخلی CLEVI نتایج جالبی شناسایی شد. از میان مجموع ۳۰۱ پرسش، برای برخی از آن‌ها در حال حاضر شواهد پاسخ صحیح در وب عمومی از بین رفته بود. در این موارد، اطلاعاتی که پیش‌تر به‌صورت آنلاین یا از طریق موتورهای جست‌وجو قابل تأیید بود، حذف یا تغییر کرده و دیگر قابل دسترسی نیست. هنگامی که این پرسش‌ها بر اساس اطلاعاتی که در حال حاضر برای انسان‌ها به‌صورت عمومی قابل تأیید است دوباره ارزیابی شدند، دقت CLEVI بیش از ۹۸٪ به دست آمد. این رقم از میانگین انسانی ۹۲٪ نیز فراتر است.

یکی از مسئولان CLEVI توضیح داد: «CLEVI بدون ترکیب مدل‌های خارجی و تنها با مدل‌های اختصاصی خود که از from scratch ساخته شده‌اند و راهکارهای عامل هوش مصنوعی اختصاصی خود، با کسب امتیاز 70+ برای هر ۵ عامل، وارد ۲.۵٪ برتر در بنچمارک عمومی شد. به نظر می‌رسد با بهبود مدل‌ها و راهکارهای عامل اختصاصی، امکان افزایش بیشتر امتیاز رسمی نیز در آینده وجود داشته باشد. اهمیت این دستاورد در آن است که در یک بنچمارک عمومی جهانی به‌صورت واقعی اندازه‌گیری شده و «اعتماد تأییدشده» را نشان می‌دهد؛ دستاوردی مبتنی بر مدل اختصاصی from scratch یک شرکت توسعه‌دهنده هوش مصنوعی داخلی است؛ نتیجه پشته مدل مستقل، نه ترکیب مدل‌های خارجی، محسوب می‌شود؛ و با در نظر گرفتن از بین رفتن اطلاعات برخی پرسش‌ها، ارزش تفسیری آن فراتر از امتیاز صرف است.»

بازگشت به اتاق خبر
CLEVI

زبان و منطقه

زبان‌های ترجمه‌شده با ماشین علامت‌گذاری شده‌اند. دسترس‌پذیری بر اساس بسته منتشرشده سایت است.

۱۳۶ زبان

پیشنهادی

1

شرق آسیا

7

جنوب شرق آسیا

11

جنوب آسیا

18

آسیای مرکزی

5

خاورمیانه و قفقاز

10

غرب اروپا و جنوب اروپا

16

بریتانیا و ایرلند

4

شمال اروپا

10

اروپای مرکزی و بالکان

14

شرق اروپا

5

شرق افریقا

8

غرب افریقا و مرکز افریقا

9

جنوب افریقا

8

امریکا

5

اقیانوسیه

5
CLEVI، با مدل اختصاصی from scratch، به دقت 79.07٪ در GAIA دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر — CLEVI