منبع: خبرنگار گو بونگیو از دیجیتالتایمز
نقلقول کامل از مقاله «استارتاپ هوش مصنوعی CLEVI وارد ۲.۵٪ برتر GAIA شد… نمایش اعتبار تأییدشده»
تاریخ انتشار ۲۰۲۶-۰۴-۰۸
لینک: https://n.news.naver.com/article/029/0003020511?sid=105
استارتاپ هوش مصنوعی داخلی «CLEVI (Clevi)» اعلام کرد که در حالیکه مدل اختصاصی و راهکار Coding Agent اختصاصی خود را از from scratch ساخته است، برای نخستین بار در کره، در بنچمارک GAIA بر اساس مجموع ۳٬۰۹۰ مدل ثبتشده، وارد ۲.۵٪ برتر شده است.
بر اساس توضیحات این صنعت، GAIA که توسط متا AI طراحی و توسط Hugging Face اداره میشود، از هوش مصنوعی نه «توانایی انجام یک کار بهخوبی»، بلکه «توانایی حل مسائل واقعی با ترکیب چندین توانایی» را میسنجد. هوش مصنوعی باید اطلاعات را در وب پیدا کند، جدولهای داخل PDF را بخواند، تصاویر را تحلیل کند، با اجرای کد محاسبه انجام دهد و نتایج را ترکیب کرده و یک پاسخ نهایی ارائه دهد. این ساختار، با ۳۰۱ پرسش محرمانه، سه سطح دشواری و اصل محرمانهبودن پاسخها، امکان بیشبرازش یا تقلب را از بین میبرد.
برای کسب امتیاز بالا در این آزمون، دو چیز لازم است. نخست، توانایی استدلال مدل زبانی پایه و دوم، راهکار SVCE که آن مدل را به ابزارهای دنیای واقعی متصل میکند تا بتواند بهصورت خودکار وظایف را انجام دهد. هرقدر مدل خوب باشد، اگر SVCE ضعیف باشد، حل Level 3 ممکن نیست؛ و هرقدر SVCE پیشرفته باشد، اگر توانایی استدلال مدل کافی نباشد، پاسخهای نادرست از مراحل میانی منتقل میشوند.
با نگاهی به ساختار فعلی جدول رتبهبندی GAIA، الگوی جالبی دیده میشود. بیشتر SVCEهای ردههای بالا، راهبرد «ترکیب چندمدلی» را در پیش گرفتهاند که در آن چندین مدل بزرگ فناوری مانند GPT، Claude و Gemini با یکدیگر ترکیب میشوند. این رویکردی منطقی برای ترکیب نقاط قوت هر مدل و جلوگیری از کاهش امتیاز ناشی از از دست رفتن اطلاعات و عوامل مشابه است.
در مقابل، CLEVI به این جریان نپیوسته است. cip-5.5-agent (هوش مصنوعی عاملمحور) که با روش from scratch توسعه یافته، برنامهریزی، اجرا و بررسی وظایف پیچیده را بهصورت خودکار انجام میدهد و cip-5.5-mm (مدل چندوجهی عمومی با عملکرد بالا) فرمتهای مختلف فایل، از جمله صدا، تصویر و ویدیو، را درک و استدلال میکند. هر دو مدل بهصورت مستقل در داخل CLEVI توسعه یافتهاند و هیچگونه API مدل زبانی بزرگ خارجی استفاده نشده است.
و با اعزام ۵ عامل به GAIA با استفاده از این پشته مدل اختصاصی، همه آنها امتیاز بالاتر از ۷۰ کسب کردند. از بالاترین امتیاز ۷۹٫۰۷٪ تا ۷۰٫۷۶٪، این نتیجه نشان داد که ثبات کل پشته، نه شانس یک نتیجه منفرد، عامل موفقیت بوده است.
طبق توضیحات شرکت، پشت امتیاز رسمی ۷۹٫۰۷٪، عدد دیگری نیز وجود دارد. بررسی پس از آزمون داخلی CLEVI نشان داد که در میان ۳۰۱ پرسش، تعداد قابلتوجهی از پرسشها شواهد پاسخ صحیح خود را در وب عمومی فعلی از دست دادهاند. در ارزیابی مجدد، با در نظر گرفتن تنها پرسشهایی که پاسخ صحیح آنها همچنان در وب موجود است، نرخ پاسخ صحیح CLEVI بیش از ۹۸٪ بود. این رقم پیشتر از میانگین انسانی (۹۲٪) فراتر رفته است.
البته اگر مدلهای عمومی قدرتمند شرکتهای دیگر را ترکیب میکرد، احتمالاً میتوانست امتیاز رسمی را بیشتر افزایش دهد. بااینحال، CLEVI عمداً این راهبرد را انتخاب نکرد. زیرا هدف این بنچمارک رقابت برای کسب بالاترین امتیاز نبود، بلکه بررسی این بود که آیا مدل اختصاصی from scratch به سطحی رسیده است که بتواند در عرصه جهانی رقابت کند یا خیر.
قرار گرفتن نام در جدول رتبهبندی GAIA اهمیت زیادی دارد، زیرا به معنای برخورداری از اعتبار تأییدشدهای است که توسط یک ارزیابی مستقل و شخص ثالث اعطا شده است. این امر در تمامی مراحل جذب سرمایه، ورود به بازارهای خارجی و فروش B2B، مبنایی عینی و قابل استفاده فراهم میکند.
یکی از مسئولان CLEVI گفت: «بخش قابلتوجهی از ۶۳ پاسخ رسمی نادرست، ناشی از ناهماهنگی قالب خروجی، خطا در تفسیر دادههای بصری و پرسشهایی بود که به دلیل از دست رفتن اطلاعات، امکان پاسخگویی به آنها وجود نداشت. مسئله، بیش از آنکه محدودیت بنیادین در استدلال منطقی باشد، به دقت پسپردازش و در دسترس بودن اطلاعات خارجی مربوط میشود. از آنجا که این مدل اختصاصی است، CLEVI میتواند خودش آن را بهبود دهد. این مزیت ساختاری مدل اختصاصی from scratch است. دستاورد اخیر CLEVI این پرسش را برای صنعت هوش مصنوعی کره جنوبی مطرح میکند: «تا چه زمانی به “مغزهای قرضی” وابسته خواهیم بود؟» CLEVI مسیر دشوارتر from scratch را انتخاب کرده و میخواهد پاسخ این پرسش را در صحنه جهانی اثبات کند.»
