منبع: دیجیتالتایمز، گو بونگیو، خبرنگار
نقلقول کامل از مقاله «استارتاپ هوش مصنوعی Clevi وارد ۲.۵٪ برتر GAIA شد… اعتبار عمومی تأییدشده را نشان میدهد»
تاریخ انتشار ۲۰۲۶-۰۴-۰۸
لینک: https://n.news.naver.com/article/029/0003020511?sid=105
استارتاپ هوش مصنوعی داخلی Clevi اعلام کرد که در حالی که مدل اختصاصی و راهکار ایجنت اختصاصی خود را از from scratch ساخته است، برای نخستین بار در کره جنوبی، بر اساس معیار GAIA و در میان ۳٬۰۹۰ مدل ثبتشده، وارد ۲.۵٪ برتر شده است.
بر اساس توضیحات صنعت، GAIA که توسط Meta AI طراحی و توسط Hugging Face اداره میشود، از هوش مصنوعی نه «توانایی انجام یک کار بهخوبی»، بلکه «توانایی حل مسائل واقعی با ترکیب چندین توانایی» را میسنجد. هوش مصنوعی باید اطلاعات را در وب پیدا کند، جدولهای داخل PDF را بخواند، تصاویر را تحلیل کند، با اجرای کد محاسبات انجام دهد و نتایج را ترکیب کرده و یک پاسخ نهایی ارائه کند. این ساختار، با ۳۰۱ پرسش محرمانه، سه سطح دشواری و اصل محرمانهبودن پاسخها، امکان بیشبرازش یا تقلب را از بین میبرد.
برای کسب امتیاز بالا در این آزمون، دو چیز لازم است. نخست، توانایی استدلال مدل زبانی زیربنایی و دوم، راهکار ایجنتی که مدل را به ابزارهای دنیای واقعی متصل کرده و امکان انجام خودکار وظایف را فراهم کند. هرچقدر مدل خوب باشد، اگر ایجنت ضعیف باشد، حل Level 3 ممکن نیست؛ و هرچقدر ایجنت پیشرفته باشد، اگر توانایی استدلال مدل کافی نباشد، پاسخهای نادرست از مراحل میانی به بعد منتقل میشوند.
با نگاهی به ساختار فعلی رتبهبندی GAIA، الگوی جالبی دیده میشود. بیشتر ایجنتهای رتبههای برتر، راهبرد «ترکیب چندمدلی» را اتخاذ کردهاند که در آن چندین مدل بزرگ فناوری، مانند GPT، Claude و Gemini، با یکدیگر ترکیب میشوند. این رویکردی منطقی برای ترکیب نقاط قوت هر مدل و جلوگیری از کاهش امتیاز ناشی از مواردی مانند از دست رفتن اطلاعات است.
در مقابل، Clevi به این جریان نپیوسته است. cip-5.5-agent (هوش مصنوعی ایجنتی) که به روش from scratch توسعه یافته، برنامهریزی، اجرا و اعتبارسنجی وظایف پیچیده را بهصورت خودکار انجام میدهد و cip-5.5-mm (مدل چندوجهی عمومی با عملکرد بالا) فایلهای مختلفی مانند صوت، تصویر و ویدیو را درک و استدلال میکند. هر دو مدل بهطور مستقل در داخل Clevi توسعه یافتهاند و هیچگونه LLM API خارجی استفاده نشده است.
و با اعزام ۵ ایجنت به GAIA با استفاده از این پشتهٔ مدل اختصاصی، همهٔ آنها امتیاز بالاتر از ۷۰ کسب کردند. از بالاترین امتیاز ۷۹.۰۷٪ تا ۷۰.۷۶٪، این نتیجه نشان داد که نه شانسِ یک نتیجهٔ منفرد، بلکه پایداری کل پشته اثبات شده است.
طبق توضیحات این شرکت، پشت امتیاز رسمی ۷۹.۰۷٪ عدد دیگری نیز وجود دارد. در بررسی پس از آزمون داخلی CLEVI مشخص شد که در میان ۳۰۱ پرسش، تعداد قابلتوجهی از پرسشها وجود دارد که شواهد پاسخ صحیح آنها در وب عمومی فعلی از بین رفته است. هنگام ارزیابی مجدد بر اساس پرسشهایی که پاسخ صحیح آنها همچنان در وب وجود دارد، نرخ پاسخ صحیح CLEVI بیش از ۹۸٪ بود. این رقم از میانگین انسانی (۹۲٪) نیز فراتر رفته است.
البته اگر مدلهای عمومی قدرتمند شرکتهای دیگر را ترکیب میکرد، میتوانست امتیاز رسمی را بیش از این افزایش دهد. بااینحال، CLEVI عمداً این راهبرد را انتخاب نکرد. زیرا هدف این بنچمارک رقابت بر سر بالاترین امتیاز نبود، بلکه بررسی این بود که آیا مدل اختصاصی from scratch به سطحی رسیده است که بتواند در صحنهٔ جهانی رقابت کند یا خیر.
قرار گرفتن نام در جدول رتبهبندی GAIA اهمیت زیادی دارد، زیرا به معنای برخورداری از اعتبار تأییدشدهای است که توسط یک ارزیابی مستقل شخص ثالث اعطا شده است. این موضوع در همهٔ مراحل جذب سرمایه، ورود به بازارهای خارجی و فروش B2B، مبنایی عینی و قابلاستفاده به شمار میرود.
یکی از مسئولان CLEVI گفت: «تعداد قابلتوجهی از ۶۳ پاسخ رسمی نادرست، ناشی از ناسازگاری قالب خروجی، خطا در تفسیر محتوای بصری و پرسشهایی بود که به دلیل از بین رفتن اطلاعات امکان پاسخگویی به آنها وجود نداشت. این مسئله بیش از آنکه ناشی از محدودیت بنیادین استدلال منطقی باشد، به دقت پسپردازش و در دسترس بودن اطلاعات خارجی مربوط است. از آنجا که مدل اختصاصی است، CLEVI میتواند خودش آن را بهبود دهد. این دقیقاً مزیت ساختاری مدل اختصاصی from scratch است. دستاورد اخیر CLEVI این پرسش را برای صنعت هوش مصنوعی کره مطرح میکند: «تا چه زمانی به “مغزهای قرضی” وابسته خواهیم بود؟» CLEVI مسیر دشوارتر from scratch را انتخاب کرده و میخواهد پاسخ آن را در صحنهٔ جهانی اثبات کند.»
