خبرونه

CLEVI با مدل اختصاصی خود که از from scratch توسعه داده شده است، در GAIA به امتیاز 79.07٪ دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر قرار گرفت

منبع: خبرنگار لی وون‌جی از روزنامه الکترونیک

منبع: خبرنگار لی وون‌جی از روزنامه الکترونیک

استناد کامل به مقاله «CLEVI با مدل اختصاصی خود که از from scratch توسعه داده شده است، در GAIA به امتیاز 79.07٪ دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر قرار گرفت»

تاریخ انتشار: 2026-04-07

لینک: https://www.etnews.com/20260407000203

پشته مدل‌های اختصاصی cip-5.5-agent·cip-5.5-mm؛ هر 5 ایجنت امتیازی بالاتر از 70 کسب کردند

با در نظر گرفتن از دست رفتن اطلاعات، دقت پاسخ‌گویی بیش از 98٪ و بالاتر از انسان‌ها (92٪)

تصویر متن اصلی

استارتاپ هوش مصنوعی «CLEVI» با استفاده از مدل اختصاصی خود که از from scratch توسعه داده شده است، در بنچمارک جهانی ایجنت‌های هوش مصنوعی «GAIA» به دقت پاسخ‌گویی 79.07٪ دست یافت و بر اساس کل 3,090 مدل ثبت‌شده، در جمع 2.5٪ برتر قرار گرفت.

بر اساس توضیحات صنعت، در بازار بنچمارک‌های هوش مصنوعی، GAIA به‌عنوان بنچمارکی ارزیابی می‌شود که توانایی «ایجنت‌های هوش مصنوعی کاربردی» را به‌خوبی بازتاب می‌دهد. این بنچمارک که به‌صورت مشترک توسط Meta AI، HuggingFace و دانشگاه پاری-ساکله توسعه یافته است، نخستین‌بار در نوامبر 2023 منتشر شد.

سه ویژگی، GAIA را از سایر بنچمارک‌ها متمایز می‌کند. نخست، از آنجا که پاسخ‌های صحیح عمومی نیستند، بیش‌برازش امکان‌پذیر نیست. دوم، از آنجا که به استدلال ترکیبی چندمرحله‌ای و چندوجهی نیاز دارد، کسب امتیاز بالا با تطبیق ساده الگوها امکان‌پذیر نیست. سوم، بیش از 3,090 مدل از سراسر جهان از طریق رتبه‌بندی رسمی HuggingFace، در شرایط یکسان با یکدیگر رقابت می‌کنند.

مجموعه آزمون از 301 پرسش تشکیل شده است. Level 1 شامل استفاده از یک ابزار و استدلال ساده است؛ Level 2 به ترکیب چند ابزار و استدلال در سطح متوسط نیاز دارد؛ و Level 3 شامل دشوارترین پرسش‌هاست که به برنامه‌ریزی و اجرای ایجنت در 5 مرحله یا بیشتر نیاز دارند. در زمان معرفی این بنچمارک، امتیاز مدل‌های GPT (با افزونه) حدود 15٪ بود و تیم‌های برتر اکنون آن را به محدوده 70 تا 80٪ رسانده‌اند.

در این میان، CLEVI تأکید کرد که از نظر فنی، مهم‌ترین نکته در این دستاورد آن است که به‌هیچ‌وجه از API مدل‌های LLM خارجی مانند GPT، Claude و Gemini استفاده نشده است. ویژگی متمایز CLEVI استفاده از دو مدل است که به‌صورت مستقل و با روش from scratch توسعه داده شده‌اند.

cip-5.5-agent یک مدل هوش مصنوعی عامل‌محور است که به‌عنوان مغز اصلی خط لوله عامل برای برنامه‌ریزی (planning)، اجرا (execution) و راستی‌آزمایی (verification) مستقلِ وظایف پیچیده عمل می‌کند. cip-5.5-mm یک مدل چندوجهی عمومیِ قدرتمند است که فرمت‌های مختلف فایل، از جمله صدا، تصویر و ویدئو، را درک و استدلال می‌کند. از آنجا که بخش قابل‌توجهی از پرسش‌های GAIA شامل ورودی‌های غیرمتنی مانند فایل‌های PDF، تصویر و صوت است، این توانایی چندوجهی به عامل اصلی کسب امتیاز بالا تبدیل شد.

کلِوی با تکیه بر این دو مدل اختصاصی، ۵ پیکربندی عامل متفاوت را در GAIA شرکت داد و همه آن‌ها امتیاز بالاتر از ۷۰ کسب کردند.

طبق توضیحات این شرکت، در بررسی پس از ارزیابی داخلی کلِوی نتایج جالبی مشخص شد. از مجموع ۳۰۱ پرسش، برای برخی از آن‌ها در حال حاضر شواهد پاسخ صحیح در وب عمومی از بین رفته بود. در این موارد، اطلاعاتی که پیش‌تر به‌صورت آنلاین یا از طریق موتورهای جست‌وجو قابل بررسی بود، حذف یا تغییر کرده و دیگر قابل دسترسی نیست. هنگام ارزیابی مجدد بر اساس محدوده اطلاعاتی که در حال حاضر برای انسان‌ها به‌صورت عمومی قابل بررسی است، نرخ پاسخ صحیح کلِوی بیش از ۹۸٪ به دست آمد. این رقم در حال حاضر از میانگین انسانی، یعنی ۹۲٪، بالاتر است.

یکی از مسئولان کلِوی توضیح داد: «کلِوی بدون ترکیب مدل‌های خارجی و تنها با استفاده از مدل‌های اختصاصی خود از from scratch و راهکارهای عامل هوش مصنوعی اختصاصی خود، با ثبت امتیاز 70+ برای هر ۵ عامل، وارد ۲.۵٪ برتر در بنچمارک عمومی شد. به نظر می‌رسد با بهبود مدل‌های اختصاصی و راهکارهای عامل خود در آینده، امکان افزایش بیشتر امتیاز رسمی نیز وجود داشته باشد. این دستاورد از این جهت اهمیت عمیقی دارد که عملکرد آن در یک بنچمارک عمومی جهانی به‌صورت واقعی اندازه‌گیری شده و «اعتماد تأییدشده» را نشان می‌دهد؛ دستاوردی مبتنی بر مدل اختصاصی from scratch یک شرکت توسعه‌دهنده هوش مصنوعی داخلی است؛ نتیجه پشته مدل مستقل خود شرکت، نه ترکیبی از مدل‌های خارجی، محسوب می‌شود؛ و با در نظر گرفتن از بین رفتن اطلاعات برخی پرسش‌ها، ارزش تفسیری آن فراتر از امتیاز ثبت‌شده است.»

خبریالۍ خونې ته بېرته ستنېدل
CLEVI

ژبه او سیمه

زبان‌های ترجمه‌شده با ماشین علامت‌گذاری شده‌اند. دسترس‌پذیری مطابق بسته منتشرشده سایت است.

۱۳۶ ژبې

وړاندیز شوی

1

ختیځ آسیا

7

سويلي ختيځ آسيا

11

سويلي آسيا

18

منځنۍ آسيا

5

منځني ختیځ او قفقاز

10

لوېديځ اروپا او سويلي اروپا

16

برتانیه او آيرلېنډ

4

شمالي اروپا

10

مرکزي اروپا او بالکان

14

ختيځ اروپا

5

ختیځ افریقا

8

لویدیځ افریقا او منځنۍ افریقا

9

سويلي افريقا

8

امريکې

5

اوقيانوسيه

5
CLEVI با مدل اختصاصی خود که از from scratch توسعه داده شده است، در GAIA به امتیاز 79.07٪ دست یافت... در میان 3,090 مدل، در جمع 2.5٪ برتر قرار گرفت — CLEVI