ရင်းမြစ် : အီလက်ထရွန်းနစ်သတင်းစာ၊ သတင်းထောက် အီဝန်ဂျီ
“CLEVI၊ from scratch ကိုယ်ပိုင်မော်ဒယ်ဖြင့် GAIA 79.07%... မော်ဒယ် ၃,၀၉၀ ခုအနက် ထိပ်တန်း ၂.၅%” ဆောင်းပါးအပြည့်အစုံကို ကိုးကားထားသည်
ထုတ်ဝေသည့်ရက်စွဲ : 2026-04-07
လင့်ခ် : https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm သီးခြားမော်ဒယ်စတက်ခ်၊ အေးဂျင့် ၅ ခုစလုံး ၇၀ မှတ်အထက်
အချက်အလက်ဆုံးရှုံးမှုကို ထည့်သွင်းစဉ်းစားပါက မှန်ကန်မှုနှုန်း ၉၈%+ ဖြစ်ပြီး လူသားများ (၉၂%) ထက် ကျော်လွန်
AI စတားတ်အပ် 'CLEVI' သည် from scratch ကိုယ်ပိုင်မော်ဒယ်ကို အသုံးပြု၍ ကမ္ဘာလုံးဆိုင်ရာ AI အေးဂျင့် စံနှုန်းစမ်းသပ်မှု 'GAIA' တွင် မှန်ကန်မှုနှုန်း 79.07% ရရှိခဲ့ပြီး မှတ်ပုံတင်ထားသော မော်ဒယ်စုစုပေါင်း ၃,၀၉၀ ခုအနက် ထိပ်တန်း ၂.၅% အတွင်း ဝင်ရောက်ခဲ့သည်။
စက်မှုလုပ်ငန်း၏ ရှင်းလင်းချက်များအရ AI စံနှုန်းစမ်းသပ်မှုဈေးကွက်တွင် GAIA သည် 'လက်တွေ့အသုံးချ AI အေးဂျင့်' များ၏ စွမ်းရည်ကို သစ္စာရှိစွာ ထင်ဟပ်စေသည်ဟု သုံးသပ်ခံရသည်။ Meta AI၊ HuggingFace နှင့် ပဲရစ်-ဆက်ကလေတက္ကသိုလ်တို့ ပူးပေါင်းဖန်တီးခဲ့သည့် ဤစံနှုန်းစမ်းသပ်မှုကို ၂၀၂၃ ခုနှစ် နိုဝင်ဘာလတွင် ပထမဆုံး ထုတ်ပြန်ခဲ့သည်။
GAIA ကို အခြားစံနှုန်းစမ်းသပ်မှုများနှင့် ခွဲခြားပေးသည့် အဓိကအချက် သုံးချက်ရှိသည်။ ပထမအချက်မှာ အဖြေမှန်များကို လျှို့ဝှက်ထားသောကြောင့် overfitting မဖြစ်နိုင်ခြင်း ဖြစ်သည်။ ဒုတိယအချက်မှာ အဆင့်များစွာပါဝင်သော·မော်ဒယ်မျိုးစုံပါဝင်သော ပေါင်းစပ်ဆင်ခြင်မှုကို လိုအပ်သောကြောင့် ရိုးရှင်းသော ပုံစံကိုက်ညီမှုဖြင့် ရမှတ်မြင့်မရနိုင်ခြင်း ဖြစ်သည်။ တတိယအချက်မှာ HuggingFace တရားဝင် အဆင့်သတ်မှတ်ဇယားမှတစ်ဆင့် ကမ္ဘာတစ်ဝန်းရှိ မော်ဒယ် ၃,၀၉၀ ကျော်သည် တူညီသောအခြေအနေများအောက်တွင် ယှဉ်ပြိုင်ကြခြင်း ဖြစ်သည်။
စမ်းသပ်မှုဒေတာအစုတွင် မေးခွန်းစုစုပေါင်း ၃၀၁ ခု ပါဝင်သည်။ Level 1 တွင် ကိရိယာတစ်ခုတည်း အသုံးပြုခြင်းနှင့် ရိုးရှင်းသော ဆင်ခြင်မှု၊ Level 2 တွင် ကိရိယာများစွာ ပေါင်းစပ်အသုံးပြုခြင်းနှင့် အလယ်အလတ်အဆင့် ဆင်ခြင်မှု၊ Level 3 တွင် အဆင့် ၅ ဆင့်နှင့်အထက်ရှိသော အေးဂျင့်စီမံကိန်းရေးဆွဲခြင်းနှင့် အကောင်အထည်ဖော်ခြင်းတို့ လိုအပ်သည့် အခက်ခဲဆုံးမေးခွန်းများ ပါဝင်သည်။ စံနှုန်းစမ်းသပ်မှု ထုတ်ပြန်ချိန်တွင် GPT မော်ဒယ် (ပလပ်အင်တပ်ဆင်ထားသော) များအတွက် ၁၅% ခန့်သာ ရရှိခဲ့သော်လည်း လက်ရှိတွင် ထိပ်တန်းအဖွဲ့များက ၇၀–၈၀% အထိ မြှင့်တင်ထားနိုင်ပြီဖြစ်သည်။
ဤအောင်မြင်မှုတွင် နည်းပညာပိုင်းအရ အထူးအာရုံစိုက်သင့်သည့်အချက်မှာ GPT၊ Claude၊ Gemini စသည့် ပြင်ပ LLM API များကို လုံးဝအသုံးမပြုခဲ့ခြင်း ဖြစ်သည်ဟု CLEVI က အလေးပေးပြောကြားခဲ့သည်။ CLEVI ၏ ထူးခြားချက်မှာ from scratch နည်းလမ်းဖြင့် သီးခြားဖန်တီးထားသော မော်ဒယ်နှစ်မျိုးကို အသုံးပြုခဲ့ခြင်း ဖြစ်သည်။
cip-5.5-agent သည် agentic AI မော်ဒယ်ဖြစ်ပြီး ရှုပ်ထွေးသောလုပ်ငန်းများကို အလိုအလျောက် စီမံကိန်းရေးဆွဲခြင်း(planning)၊ အကောင်အထည်ဖော်ခြင်း(execution)နှင့် အတည်ပြုစစ်ဆေးခြင်း(verification) ပြုလုပ်သည့် agent pipeline ၏ အဓိကဦးနှောက်အဖြစ် ဆောင်ရွက်သည်။ cip-5.5-mm သည် အသံ၊ ရုပ်ပုံ၊ ဗီဒီယို စသည့် ဖိုင်ဖော်မတ်အမျိုးမျိုးကို နားလည်ပြီး အကြောင်းပြချက်ထုတ်နိုင်သည့် စွမ်းဆောင်ရည်မြင့် အထွေထွေသုံး multimodal မော်ဒယ်ဖြစ်သည်။ GAIA မေးခွန်းများ၏ အများအပြားတွင် PDF၊ ရုပ်ပုံ၊ အသံဖိုင် စသည့် စာသားမဟုတ်သော input များ ပါဝင်သောကြောင့် ဤ multimodal စွမ်းရည်သည် ရမှတ်မြင့်မားစေရန် အဓိကအချက်ဖြစ်လာခဲ့သည်။
CLEVI သည် ဤကိုယ်ပိုင်မော်ဒယ်နှစ်ခုကို အခြေခံ၍ GAIA တွင် မတူညီသော agent ဖွဲ့စည်းပုံ ၅ မျိုးဖြင့် ဝင်ရောက်ယှဉ်ပြိုင်ခဲ့ပြီး အားလုံးက ၇၀ ကျော် ရမှတ်ရရှိခဲ့သည်။
ကုမ္ပဏီဘက်မှ ရှင်းပြချက်အရ CLEVI ၏ အတွင်းပိုင်း နောက်ဆက်တွဲသုံးသပ်မှုတွင် စိတ်ဝင်စားဖွယ်ရလဒ်များကို တွေ့ရှိခဲ့သည်။ မေးခွန်းစုစုပေါင်း ၃၀၁ ခုအနက် အချို့မှာ လက်ရှိအများပြည်သူကြည့်ရှုနိုင်သော ဝဘ်ပေါ်တွင် အဖြေမှန်အတွက် အထောက်အထားများ ပျောက်ဆုံးနေပြီဖြစ်သည်။ ယခင်က အွန်လိုင်း သို့မဟုတ် ရှာဖွေရေးအင်ဂျင်များမှတစ်ဆင့် အတည်ပြုနိုင်ခဲ့သော အချက်အလက်များကို ဖျက်ပစ်ခြင်း သို့မဟုတ် ပြောင်းလဲခြင်းများ ပြုလုပ်ထားသဖြင့် နောက်ထပ်ဝင်ရောက်ကြည့်ရှု၍ မရနိုင်တော့သည့် အခြေအနေဖြစ်သည်။ လက်ရှိ လူသားများ အများပြည်သူအနေဖြင့် အတည်ပြုနိုင်သော အချက်အလက်အတိုင်းအတာအတွင်း ပြန်လည်အကဲဖြတ်သည့်အခါ CLEVI ၏ အဖြေမှန်နှုန်းမှာ ၉၈% ကျော်ရှိကြောင်း တွေ့ရသည်။ ယင်းသည် လူသားများ၏ ပျမ်းမျှ ၉၂% ထက်ပင် ကျော်လွန်နေပြီဖြစ်သည်။
CLEVI ကိုယ်စားလှယ်က “CLEVI သည် ပြင်ပမော်ဒယ်များကို ရောနှောအသုံးမပြုဘဲ from scratch ကိုယ်ပိုင်မော်ဒယ်များနှင့် ကိုယ်ပိုင် AI agent solution များကိုသာ အသုံးပြု၍ agent ၅ ခုစလုံးတွင် 70+ ရမှတ်ရရှိကာ အများပြည်သူဆိုင်ရာ benchmark တွင် ထိပ်တန်း 2.5% အတွင်း ဝင်ရောက်ခဲ့သည်။ အနာဂတ်တွင် ကိုယ်ပိုင်မော်ဒယ်များနှင့် agent solution များကို ပိုမိုကောင်းမွန်အောင် ပြုလုပ်ခြင်းဖြင့် တရားဝင်ရမှတ်ကိုလည်း ထပ်မံမြှင့်တင်နိုင်မည်ဟု ယူဆရသည်။ ဤအောင်မြင်မှုသည် ကမ္ဘာလုံးဆိုင်ရာ အများပြည်သူဆိုင်ရာ benchmark တွင် လက်တွေ့တိုင်းတာအတည်ပြုထားပြီး ‘အတည်ပြုထားသော ယုံကြည်စိတ်ချရမှု’ ကို ပြသနိုင်ခြင်း၊ ပြည်တွင်း AI ဖွံ့ဖြိုးရေးကုမ္ပဏီတစ်ခု၏ from scratch ကိုယ်ပိုင်မော်ဒယ်အခြေပြု အောင်မြင်မှုဖြစ်ခြင်း၊ ပြင်ပမော်ဒယ်များကို ရောနှောအသုံးပြုခြင်းမဟုတ်ဘဲ သီးခြားကိုယ်ပိုင်မော်ဒယ် stack ၏ ရလဒ်ဖြစ်ခြင်းနှင့် မေးခွန်းအချို့တွင် အချက်အလက်များ ပျောက်ဆုံးနေမှုကို ထည့်သွင်းစဉ်းစားပါက ရမှတ်ထက်ပိုမိုသော အဓိပ္ပာယ်ဖွင့်ဆိုချက်တန်ဖိုးရှိခြင်းတို့ကြောင့် အလွန်အဓိပ္ပာယ်ရှိသည်” ဟု ရှင်းပြခဲ့သည်။
