اخبار

استارتاپ هوش مصنوعی CLEVI وارد ۲.۵٪ برتر GAIA شد… نمایش اعتبار تأییدشده

منبع: خبرنگار گو بون‌گیو از دیجیتال‌تایمز

منبع: خبرنگار گو بون‌گیو از دیجیتال‌تایمز

نقل‌قول کامل از مقاله «استارتاپ هوش مصنوعی CLEVI وارد ۲.۵٪ برتر GAIA شد… نمایش اعتبار تأییدشده»

تاریخ انتشار ۲۰۲۶-۰۴-۰۸

لینک: https://n.news.naver.com/article/029/0003020511?sid=105

استارتاپ هوش مصنوعی داخلی «CLEVI (Clevi)» اعلام کرد که در حالی‌که مدل اختصاصی و راهکار Coding Agent اختصاصی خود را از from scratch ساخته است، برای نخستین بار در کره، در بنچمارک GAIA بر اساس مجموع ۳٬۰۹۰ مدل ثبت‌شده، وارد ۲.۵٪ برتر شده است.

بر اساس توضیحات این صنعت، GAIA که توسط متا AI طراحی و توسط Hugging Face اداره می‌شود، از هوش مصنوعی نه «توانایی انجام یک کار به‌خوبی»، بلکه «توانایی حل مسائل واقعی با ترکیب چندین توانایی» را می‌سنجد. هوش مصنوعی باید اطلاعات را در وب پیدا کند، جدول‌های داخل PDF را بخواند، تصاویر را تحلیل کند، با اجرای کد محاسبه انجام دهد و نتایج را ترکیب کرده و یک پاسخ نهایی ارائه دهد. این ساختار، با ۳۰۱ پرسش محرمانه، سه سطح دشواری و اصل محرمانه‌بودن پاسخ‌ها، امکان بیش‌برازش یا تقلب را از بین می‌برد.

برای کسب امتیاز بالا در این آزمون، دو چیز لازم است. نخست، توانایی استدلال مدل زبانی پایه و دوم، راهکار SVCE که آن مدل را به ابزارهای دنیای واقعی متصل می‌کند تا بتواند به‌صورت خودکار وظایف را انجام دهد. هرقدر مدل خوب باشد، اگر SVCE ضعیف باشد، حل Level 3 ممکن نیست؛ و هرقدر SVCE پیشرفته باشد، اگر توانایی استدلال مدل کافی نباشد، پاسخ‌های نادرست از مراحل میانی منتقل می‌شوند.

با نگاهی به ساختار فعلی جدول رتبه‌بندی GAIA، الگوی جالبی دیده می‌شود. بیشتر SVCEهای رده‌های بالا، راهبرد «ترکیب چندمدلی» را در پیش گرفته‌اند که در آن چندین مدل بزرگ فناوری مانند GPT، Claude و Gemini با یکدیگر ترکیب می‌شوند. این رویکردی منطقی برای ترکیب نقاط قوت هر مدل و جلوگیری از کاهش امتیاز ناشی از از دست رفتن اطلاعات و عوامل مشابه است.

در مقابل، CLEVI به این جریان نپیوسته است. cip-5.5-agent (هوش مصنوعی عامل‌محور) که با روش from scratch توسعه یافته، برنامه‌ریزی، اجرا و بررسی وظایف پیچیده را به‌صورت خودکار انجام می‌دهد و cip-5.5-mm (مدل چندوجهی عمومی با عملکرد بالا) فرمت‌های مختلف فایل، از جمله صدا، تصویر و ویدیو، را درک و استدلال می‌کند. هر دو مدل به‌صورت مستقل در داخل CLEVI توسعه یافته‌اند و هیچ‌گونه API مدل زبانی بزرگ خارجی استفاده نشده است.

و با اعزام ۵ عامل به GAIA با استفاده از این پشته مدل اختصاصی، همه آن‌ها امتیاز بالاتر از ۷۰ کسب کردند. از بالاترین امتیاز ۷۹٫۰۷٪ تا ۷۰٫۷۶٪، این نتیجه نشان داد که ثبات کل پشته، نه شانس یک نتیجه منفرد، عامل موفقیت بوده است.

تصویر متن اصلی

طبق توضیحات شرکت، پشت امتیاز رسمی ۷۹٫۰۷٪، عدد دیگری نیز وجود دارد. بررسی پس از آزمون داخلی CLEVI نشان داد که در میان ۳۰۱ پرسش، تعداد قابل‌توجهی از پرسش‌ها شواهد پاسخ صحیح خود را در وب عمومی فعلی از دست داده‌اند. در ارزیابی مجدد، با در نظر گرفتن تنها پرسش‌هایی که پاسخ صحیح آن‌ها همچنان در وب موجود است، نرخ پاسخ صحیح CLEVI بیش از ۹۸٪ بود. این رقم پیش‌تر از میانگین انسانی (۹۲٪) فراتر رفته است.

البته اگر مدل‌های عمومی قدرتمند شرکت‌های دیگر را ترکیب می‌کرد، احتمالاً می‌توانست امتیاز رسمی را بیشتر افزایش دهد. بااین‌حال، CLEVI عمداً این راهبرد را انتخاب نکرد. زیرا هدف این بنچمارک رقابت برای کسب بالاترین امتیاز نبود، بلکه بررسی این بود که آیا مدل اختصاصی from scratch به سطحی رسیده است که بتواند در عرصه جهانی رقابت کند یا خیر.

قرار گرفتن نام در جدول رتبه‌بندی GAIA اهمیت زیادی دارد، زیرا به معنای برخورداری از اعتبار تأییدشده‌ای است که توسط یک ارزیابی مستقل و شخص ثالث اعطا شده است. این امر در تمامی مراحل جذب سرمایه، ورود به بازارهای خارجی و فروش B2B، مبنایی عینی و قابل استفاده فراهم می‌کند.

یکی از مسئولان CLEVI گفت: «بخش قابل‌توجهی از ۶۳ پاسخ رسمی نادرست، ناشی از ناهماهنگی قالب خروجی، خطا در تفسیر داده‌های بصری و پرسش‌هایی بود که به دلیل از دست رفتن اطلاعات، امکان پاسخ‌گویی به آن‌ها وجود نداشت. مسئله، بیش از آنکه محدودیت بنیادین در استدلال منطقی باشد، به دقت پس‌پردازش و در دسترس بودن اطلاعات خارجی مربوط می‌شود. از آنجا که این مدل اختصاصی است، CLEVI می‌تواند خودش آن را بهبود دهد. این مزیت ساختاری مدل اختصاصی from scratch است. دستاورد اخیر CLEVI این پرسش را برای صنعت هوش مصنوعی کره جنوبی مطرح می‌کند: «تا چه زمانی به “مغزهای قرضی” وابسته خواهیم بود؟» CLEVI مسیر دشوارتر from scratch را انتخاب کرده و می‌خواهد پاسخ این پرسش را در صحنه جهانی اثبات کند.»

بازگشت به اتاق خبر
CLEVI

زبان و منطقه

زبان‌های ترجمه‌شده با ماشین علامت‌گذاری شده‌اند. دسترس‌پذیری بر اساس بسته منتشرشده سایت است.

۱۳۶ زبان

پیشنهادی

1

شرق آسیا

7

جنوب شرق آسیا

11

جنوب آسیا

18

آسیای مرکزی

5

خاورمیانه و قفقاز

10

غرب اروپا و جنوب اروپا

16

بریتانیا و ایرلند

4

شمال اروپا

10

اروپای مرکزی و بالکان

14

شرق اروپا

5

شرق افریقا

8

غرب افریقا و مرکز افریقا

9

جنوب افریقا

8

امریکا

5

اقیانوسیه

5
استارتاپ هوش مصنوعی CLEVI وارد ۲.۵٪ برتر GAIA شد… نمایش اعتبار تأییدشده — CLEVI