خبرونه

استارتاپ هوش مصنوعی Clevi وارد ۲.۵٪ برتر GAIA شد… اعتبار عمومی تأییدشده را نشان می‌دهد

منبع: دیجیتال‌تایمز، گو بون‌گیو، خبرنگار

منبع: دیجیتال‌تایمز، گو بون‌گیو، خبرنگار

نقل‌قول کامل از مقاله «استارتاپ هوش مصنوعی Clevi وارد ۲.۵٪ برتر GAIA شد… اعتبار عمومی تأییدشده را نشان می‌دهد»

تاریخ انتشار ۲۰۲۶-۰۴-۰۸

لینک: https://n.news.naver.com/article/029/0003020511?sid=105

استارتاپ هوش مصنوعی داخلی Clevi اعلام کرد که در حالی که مدل اختصاصی و راهکار ایجنت اختصاصی خود را از from scratch ساخته است، برای نخستین بار در کره جنوبی، بر اساس معیار GAIA و در میان ۳٬۰۹۰ مدل ثبت‌شده، وارد ۲.۵٪ برتر شده است.

بر اساس توضیحات صنعت، GAIA که توسط Meta AI طراحی و توسط Hugging Face اداره می‌شود، از هوش مصنوعی نه «توانایی انجام یک کار به‌خوبی»، بلکه «توانایی حل مسائل واقعی با ترکیب چندین توانایی» را می‌سنجد. هوش مصنوعی باید اطلاعات را در وب پیدا کند، جدول‌های داخل PDF را بخواند، تصاویر را تحلیل کند، با اجرای کد محاسبات انجام دهد و نتایج را ترکیب کرده و یک پاسخ نهایی ارائه کند. این ساختار، با ۳۰۱ پرسش محرمانه، سه سطح دشواری و اصل محرمانه‌بودن پاسخ‌ها، امکان بیش‌برازش یا تقلب را از بین می‌برد.

برای کسب امتیاز بالا در این آزمون، دو چیز لازم است. نخست، توانایی استدلال مدل زبانی زیربنایی و دوم، راهکار ایجنتی که مدل را به ابزارهای دنیای واقعی متصل کرده و امکان انجام خودکار وظایف را فراهم کند. هرچقدر مدل خوب باشد، اگر ایجنت ضعیف باشد، حل Level 3 ممکن نیست؛ و هرچقدر ایجنت پیشرفته باشد، اگر توانایی استدلال مدل کافی نباشد، پاسخ‌های نادرست از مراحل میانی به بعد منتقل می‌شوند.

با نگاهی به ساختار فعلی رتبه‌بندی GAIA، الگوی جالبی دیده می‌شود. بیشتر ایجنت‌های رتبه‌های برتر، راهبرد «ترکیب چندمدلی» را اتخاذ کرده‌اند که در آن چندین مدل بزرگ فناوری، مانند GPT، Claude و Gemini، با یکدیگر ترکیب می‌شوند. این رویکردی منطقی برای ترکیب نقاط قوت هر مدل و جلوگیری از کاهش امتیاز ناشی از مواردی مانند از دست رفتن اطلاعات است.

در مقابل، Clevi به این جریان نپیوسته است. cip-5.5-agent (هوش مصنوعی ایجنتی) که به روش from scratch توسعه یافته، برنامه‌ریزی، اجرا و اعتبارسنجی وظایف پیچیده را به‌صورت خودکار انجام می‌دهد و cip-5.5-mm (مدل چندوجهی عمومی با عملکرد بالا) فایل‌های مختلفی مانند صوت، تصویر و ویدیو را درک و استدلال می‌کند. هر دو مدل به‌طور مستقل در داخل Clevi توسعه یافته‌اند و هیچ‌گونه LLM API خارجی استفاده نشده است.

و با اعزام ۵ ایجنت به GAIA با استفاده از این پشتهٔ مدل اختصاصی، همهٔ آن‌ها امتیاز بالاتر از ۷۰ کسب کردند. از بالاترین امتیاز ۷۹.۰۷٪ تا ۷۰.۷۶٪، این نتیجه نشان داد که نه شانسِ یک نتیجهٔ منفرد، بلکه پایداری کل پشته اثبات شده است.

تصویر متن اصلی

طبق توضیحات این شرکت، پشت امتیاز رسمی ۷۹.۰۷٪ عدد دیگری نیز وجود دارد. در بررسی پس از آزمون داخلی CLEVI مشخص شد که در میان ۳۰۱ پرسش، تعداد قابل‌توجهی از پرسش‌ها وجود دارد که شواهد پاسخ صحیح آن‌ها در وب عمومی فعلی از بین رفته است. هنگام ارزیابی مجدد بر اساس پرسش‌هایی که پاسخ صحیح آن‌ها همچنان در وب وجود دارد، نرخ پاسخ صحیح CLEVI بیش از ۹۸٪ بود. این رقم از میانگین انسانی (۹۲٪) نیز فراتر رفته است.

البته اگر مدل‌های عمومی قدرتمند شرکت‌های دیگر را ترکیب می‌کرد، می‌توانست امتیاز رسمی را بیش از این افزایش دهد. بااین‌حال، CLEVI عمداً این راهبرد را انتخاب نکرد. زیرا هدف این بنچمارک رقابت بر سر بالاترین امتیاز نبود، بلکه بررسی این بود که آیا مدل اختصاصی from scratch به سطحی رسیده است که بتواند در صحنهٔ جهانی رقابت کند یا خیر.

قرار گرفتن نام در جدول رتبه‌بندی GAIA اهمیت زیادی دارد، زیرا به معنای برخورداری از اعتبار تأییدشده‌ای است که توسط یک ارزیابی مستقل شخص ثالث اعطا شده است. این موضوع در همهٔ مراحل جذب سرمایه، ورود به بازارهای خارجی و فروش B2B، مبنایی عینی و قابل‌استفاده به شمار می‌رود.

یکی از مسئولان CLEVI گفت: «تعداد قابل‌توجهی از ۶۳ پاسخ رسمی نادرست، ناشی از ناسازگاری قالب خروجی، خطا در تفسیر محتوای بصری و پرسش‌هایی بود که به دلیل از بین رفتن اطلاعات امکان پاسخ‌گویی به آن‌ها وجود نداشت. این مسئله بیش از آنکه ناشی از محدودیت بنیادین استدلال منطقی باشد، به دقت پس‌پردازش و در دسترس بودن اطلاعات خارجی مربوط است. از آنجا که مدل اختصاصی است، CLEVI می‌تواند خودش آن را بهبود دهد. این دقیقاً مزیت ساختاری مدل اختصاصی from scratch است. دستاورد اخیر CLEVI این پرسش را برای صنعت هوش مصنوعی کره مطرح می‌کند: «تا چه زمانی به “مغزهای قرضی” وابسته خواهیم بود؟» CLEVI مسیر دشوارتر from scratch را انتخاب کرده و می‌خواهد پاسخ آن را در صحنهٔ جهانی اثبات کند.»

خبریالۍ خونې ته بېرته ستنېدل
CLEVI

ژبه او سیمه

زبان‌های ترجمه‌شده با ماشین علامت‌گذاری شده‌اند. دسترس‌پذیری مطابق بسته منتشرشده سایت است.

۱۳۶ ژبې

وړاندیز شوی

1

ختیځ آسیا

7

سويلي ختيځ آسيا

11

سويلي آسيا

18

منځنۍ آسيا

5

منځني ختیځ او قفقاز

10

لوېديځ اروپا او سويلي اروپا

16

برتانیه او آيرلېنډ

4

شمالي اروپا

10

مرکزي اروپا او بالکان

14

ختيځ اروپا

5

ختیځ افریقا

8

لویدیځ افریقا او منځنۍ افریقا

9

سويلي افريقا

8

امريکې

5

اوقيانوسيه

5
استارتاپ هوش مصنوعی Clevi وارد ۲.۵٪ برتر GAIA شد… اعتبار عمومی تأییدشده را نشان می‌دهد — CLEVI