သုတေသန

Clevi အဓိပ္ပာယ်ဆိုင်ရာ ဒေတာဘေ့စ်

AI ကို လက်တွေ့လုပ်ငန်းများတွင် အသုံးချသည့်အခါ အကြီးမားဆုံးစိုးရိမ်စရာများထဲမှ တစ်ခုမှာ ယခင်က သင်ယူထားသော အသိပညာကို ဒေတာအသစ်များဖြင့် ဖိုင်န်တျူနင်းပြုလုပ်ရာတွင် ဖြစ်ပေါ်သည့် ကပ်ဘေးဆန်သော မေ့လျော့မှု (Catastrophic Forgetting) ဖြစ်စဉ်ဖြစ်သည်။

၁။ Catastrophic Forgetting နှင့် RAG ၏ ကန့်သတ်ချက်များ

AI ကို လက်တွေ့လုပ်ငန်းများတွင် အသုံးချသည့်အခါ အကြီးမားဆုံးစိုးရိမ်စရာများထဲမှ တစ်ခုမှာ ယခင်က သင်ယူထားသော အသိပညာကို ဒေတာအသစ်များဖြင့် ဖိုင်န်တျူနင်းပြုလုပ်ရာတွင် ဖြစ်ပေါ်သည့် ကပ်ဘေးဆန်သော မေ့လျော့မှု (Catastrophic Forgetting) ဖြစ်စဉ်ဖြစ်သည်။

၎င်းသည် အာရုံကြောကွန်ရက်အခြေပြု AI က အချက်အလက်အသစ်များကို သင်ယူသည့်လုပ်ငန်းစဉ်အတွင်း ယခင်က သင်ယူထားသော အသိပညာ သို့မဟုတ် ပုံစံများကို လျင်မြန်စွာ ဆုံးရှုံးသွားသည့် ဖြစ်စဉ်ဖြစ်သည်။

ဥပမာအားဖြင့် Open-source LLM ကို သီးခြားကုမ္ပဏီဒေတာများဖြင့် ဖိုင်န်တျူနင်းပြုလုပ်ပါက ယေဘုယျအသိပညာ သို့မဟုတ် ဘာသာစကားစွမ်းရည် ကျဆင်းသွားနိုင်သည်။

ဤပြဿနာကို ရှောင်ရှားရန် RAG (Retrieval-Augmented Generation) နည်းပညာကို ကျယ်ကျယ်ပြန့်ပြန့် အသုံးပြုကြသော်လည်း RAG တွင်လည်း ကန့်သတ်ချက်များ ရှိနေသည်။

အကြောင်းအရာပုံ

RAG ၏ အဓိကကန့်သတ်ချက်များ

  • ဖွဲ့စည်းတည်ဆောက်ထားသော ဒေတာကို ကိုင်တွယ်ရာတွင် မလုံလောက်ခြင်း (Structured Data QA): RAG စနစ်များသည် အများအားဖြင့် ဖွဲ့စည်းတည်ဆောက်ထားခြင်းမရှိသော စာသားစာရွက်စာတမ်းများအတွက် အကောင်းဆုံးပြုလုပ်ထားသောကြောင့် ဖွဲ့စည်းတည်ဆောက်ထားသော ဒေတာ (ဇယားများ၊ ဒေတာဘေ့စ်များ၊ စပရက်ဒ်ရှိများ စသည်တို့) ၏ အဓိပ္ပာယ်နှင့် ဆက်နွှယ်မှုများကို မှန်ကန်စွာ နားလည်သဘောပေါက်ခြင်း သို့မဟုတ် အသုံးချခြင်း မပြုနိုင်ပါ။
  • ရှုပ်ထွေးသော PDF/ဖွဲ့စည်းတည်ဆောက်ထားခြင်းမရှိသော စာရွက်စာတမ်းများ၏ ကန့်သတ်ချက် (Complex PDFs): ရှုပ်ထွေးသော PDF စာရွက်စာတမ်းများ (ဇယားများ၊ ကော်လံများစွာ၊ ပုံများ စသည်တို့ ပါဝင်သော) တွင် chunking(ခွဲခြမ်းခြင်း) လုပ်ငန်းစဉ်အတွင်း အချက်အလက်များ ပျောက်ဆုံးခြင်း သို့မဟုတ် အကြောင်းအရာအဓိပ္ပာယ် ကွဲလွဲခြင်းများ ဖြစ်ပေါ်နိုင်ပါသည်။ ထို့ကြောင့် အရေးကြီးသောဒေတာများကို အညွှန်းတပ်၍ မရခြင်း သို့မဟုတ် ရှာဖွေရန် ခက်ခဲခြင်းများ ဖြစ်ပေါ်နိုင်ပါသည်။
  • Fallback(အရန်) မော်ဒယ် မရှိခြင်း (Fallback Model(s)): RAG စနစ်သည် သင့်လျော်သောအဖြေကို ရှာမတွေ့သောအခါ အစားထိုး(အရန်) မော်ဒယ်သို့ ပြောင်းလဲအသုံးပြုရန် လော့ဂျစ် မလုံလောက်ခြင်း သို့မဟုတ် ထိရောက်မှုမရှိခြင်း ဖြစ်ပေါ်နိုင်ပါသည်။ ထို့ကြောင့် အဖြေမအောင်မြင်သောအခါ အသုံးပြုသူ စိတ်ကျေနပ်နိုင်မည့် အခြားရွေးချယ်စရာကို မပေးနိုင်ပါ။
  • လုံခြုံရေး အားနည်းချက် (LLM Security): LLM ကိုယ်တိုင်၏ လုံခြုံရေးအားနည်းချက်များ (prompt injection၊ ဒေတာပေါက်ကြားမှု စသည်တို့) ကို ကာကွယ်မှု မလုံလောက်သောကြောင့် အရေးကြီးသောအချက်အလက်များ ပေါက်ကြားနိုင်သည့် အန္တရာယ်ရှိပါသည်။
  • ချဲ့ထွင်နိုင်စွမ်း မလုံလောက်ခြင်း (Data Ingestion Scalability): ဒေတာအမြောက်အမြားကို အညွှန်းတပ်ခြင်းနှင့် သိမ်းဆည်းခြင်း လုပ်ငန်းစဉ်များတွင် ချဲ့ထွင်နိုင်စွမ်းဆိုင်ရာ ပြဿနာများ ဖြစ်ပေါ်ပါသည်။ ဒေတာများလာသည်နှင့်အမျှ chunking၊ သိမ်းဆည်းခြင်းနှင့် ရှာဖွေခြင်း အမြန်နှုန်းများ ကျဆင်းပြီး စနစ်ပေါ်ရှိ ဝန်အား ပိုမိုမြင့်တက်လာပါသည်။
  • အရေးကြီးသော အချက်အလက်များ ပျောက်ဆုံးခြင်း (Missing Content): စာရွက်စာတမ်းမှ အရေးကြီးသောအကြောင်းအရာများသည် chunking လုပ်ငန်းစဉ်အတွင်း ပျောက်ဆုံးခြင်း သို့မဟုတ် အညွှန်းတပ်မခံရခြင်းများ မကြာခဏ ဖြစ်ပေါ်ပါသည်။ ထို့ကြောင့် အသုံးပြုသူ လိုချင်သောအချက်အလက်ကို ရှာဖွေနိုင်ခြင်း မရှိပါ။
  • အထက်ဆုံးအဆင့် ရလဒ် ပျောက်ဆုံးခြင်း (Missed Top Ranked): ရှာဖွေမှုရလဒ်များတွင် အမှန်တကယ် ဆက်စပ်မှုအမြင့်ဆုံးဖြစ်သော chunk(အထက်ဆုံးအဆင့်) ပျောက်ဆုံးနိုင်ပါသည်။ ရှာဖွေမှု အယ်လဂိုရီသမ်၏ ကန့်သတ်ချက်များ၊ embedding အရည်အသွေး ကျဆင်းခြင်းနှင့် အဆင့်သတ်မှတ်မှု အမှားများသည် အကြောင်းရင်းများ ဖြစ်ပါသည်။
  • အကြောင်းအရာနှင့် မကိုက်ညီခြင်း (Not in Context): ရှာဖွေတွေ့ရှိသော chunk သည် မေးခွန်း၏ အမှန်တကယ်အကြောင်းအရာနှင့် မကိုက်ညီသည့်အခါများ မကြာခဏ ဖြစ်ပေါ်ပါသည်။ ရိုးရှင်းသော ဆင်တူမှုအခြေပြု ရှာဖွေမှု၏ ကန့်သတ်ချက်ကြောင့် အဓိပ္ပာယ်ဆိုင်ရာ ဆက်စပ်မှု မလုံလောက်ပါ။
  • ဖော်မတ် အမှား (Wrong Format): ရှာဖွေတွေ့ရှိသော chunk ၏ ဖော်မတ်သည် LLM က ကိုင်တွယ်ရန် မသင့်လျော်ခြင်း သို့မဟုတ် အသုံးပြုသူ လိုချင်သော အဖြေဖော်မတ်နှင့် ကွဲပြားခြင်း ဖြစ်နိုင်ပါသည်။ ဥပမာအားဖြင့် ဇယားကို စာသားအဖြစ် ပြောင်းလဲရာတွင် အချက်အလက်များ ပုံပျက်သွားခြင်း ဖြစ်ပါသည်။
  • အချက်အလက် ထုတ်ယူမရခြင်း (Not Extracted): လိုအပ်သော အချက်အလက်ကို chunk မှ မှန်ကန်စွာ ထုတ်ယူမရခြင်း သို့မဟုတ် LLM က အချက်အလက်ကို မသိရှိနိုင်ခြင်း ဖြစ်ပါသည်။ ရှုပ်ထွေးသော ဝါကျဖွဲ့စည်းပုံများ၊ ဇယားများနှင့် ပုံများတွင် မကြာခဏ ဖြစ်ပေါ်ပါသည်။
  • အချက်အလက် အကျယ်အဝန်း/နက်ရှိုင်းမှု မသင့်လျော်ခြင်း (Incorrect Specificity): အဖြေသည် မေးခွန်းအတွက် အလွန်ကျယ်ပြန့်ခြင်း သို့မဟုတ် ပြောင်းပြန်အားဖြင့် အလွန်အသေးစိတ်လွန်းခြင်းကြောင့် အသုံးပြုသူ၏ အမှန်တကယ်လိုအပ်ချက်နှင့် မကိုက်ညီသည့် အခြေအနေ ဖြစ်ပါသည်။ အချက်အလက်၏ အကျယ်အဝန်းနှင့် နက်ရှိုင်းမှုကို ချိန်ညှိရန် ခက်ခဲပါသည်။
  • မပြည့်စုံသော အဖြေ (Incomplete): နောက်ဆုံးထုတ်လုပ်ထားသော အဖြေသည် မပြည့်စုံခြင်း သို့မဟုတ် အချက်အလက်အချို့ကိုသာ ပေးခြင်းကြောင့် အသုံးပြုသူ၏ လိုအပ်ချက်ကို လုံလောက်စွာ မဖြည့်ဆည်းနိုင်သည့် အခြေအနေ ဖြစ်ပါသည်။ chunk များစွာမှ အချက်အလက်များကို ပေါင်းစပ်မရခြင်း သို့မဟုတ် LLM က အချက်အလက်အချို့ကိုသာ အသုံးချခြင်းတို့သည် အကြောင်းရင်းများ ဖြစ်ပါသည်။

ဤသို့ဖြင့် RAG သည် ရိုးရှင်းသော vector similarity ရှာဖွေမှုနှင့် chunk အခြေပြု indexing တို့အပေါ် အလွန်အမင်း မှီခိုနေသောကြောင့် လက်တွေ့လုပ်ငန်းများတွင် ယုံကြည်စိတ်ချရမှု၊ ချဲ့ထွင်နိုင်မှုနှင့် တိကျမှန်ကန်မှုတို့၌ ကန့်သတ်ချက်များ ထင်ရှားစွာ ရှိနေပါသည်။

2. RAG ၏ ကန့်သတ်ချက်များကို ကျော်လွှားထားသည့် CLEVI ၏ Semantic Database

CLEVI သည် ဤကန့်သတ်ချက်များကို ကျော်လွှားရန် အဓိပ္ပာယ်ဆိုင်ရာ ချိတ်ဆက်မှု၊ ရှုပ်ထွေးသော အကြောင်းပြချက်ပေးမှုနှင့် အထောက်အထားအခြေပြု တုံ့ပြန်မှု တို့အတွက် အကောင်းဆုံးဖြစ်အောင် ပြုလုပ်ထားသော မျိုးဆက်သစ် AI အသိပညာအခြေခံအဆောက်အအုံဖြစ်သည့် Clevi Semantic Database ကို တီထွင်ခဲ့ပါသည်။

၎င်းသည် ကိုယ်ပိုင် Reasoning မော်ဒယ်များ၊ multimodal AI နှင့် agentic AI မော်ဒယ်များအားလုံးကို ပိုင်ဆိုင်ထားသောကြောင့် ဖြစ်နိုင်သည့် ဖြေရှင်းချက်ဖြစ်ပြီး AI ကို လက်တွေ့ကမ္ဘာတွင် အမှန်တကယ် အထောက်အကူပြုနိုင်စေရန် ဖန်တီးပေးသည့် CLEVI ၏ ထူးခြားပြီး အစွမ်းထက်သော နည်းပညာများအနက် တစ်ခုဖြစ်ပါသည်။

ဥပမာပေးရလျှင် အချက်အလက်များ သိမ်းဆည်းထားသည့် ဒေတာဘေ့စ်ကို စာကြည့်တိုက်ဟု သတ်မှတ်ပါက CLEVI ၏ Semantic Database တွင် အလွန်ကျွမ်းကျင်သော စာကြည့်တိုက်မှူးတစ်ဦး ရှိနေသည်ဟု စဉ်းစားနိုင်ပါသည်။ (စာကြည့်တိုက်မှူးထံ လိုအပ်သော အချက်အလက်ကို တောင်းဆိုပါက တိကျပြီး မြန်ဆန်သော တုံ့ပြန်မှုကို ရရှိနိုင်ပါသည်။)

အသုံးပြုသူများသည် အချိန်မရွေး စာကြည့်တိုက်တွင် အချက်အလက်အသစ်များ ထည့်သွင်းနိုင်သကဲ့သို့ လိုအပ်သော အချက်အလက်များကိုလည်း ပြန်လည်ရယူနိုင်ပါသည်။

ထို့အပြင် ဒေတာဗားရှင်းစီမံခန့်ခွဲမှုနှင့် ဝင်ရောက်အသုံးပြုခွင့်များကိုလည်း မိမိတို့လိုသလို သတ်မှတ်နိုင်ပါသည်။

စာကြည့်တိုက်မှူး၏ လုပ်ဆောင်မှုတိုင်းကို log (မှတ်တမ်း) အဖြစ် သိမ်းဆည်းထားသောကြောင့် အမှားအယွင်း ဖြစ်ပေါ်ခဲ့လျှင်ပင် ပြင်ဆင်နိုင်ပါသည်။

အကြောင်းအရာပုံ

<Clevi Semantic Database Structure>

အဓိကအင်္ဂါရပ်များနှင့် နည်းပညာဖွဲ့စည်းပုံ

အဓိပ္ပာယ်ဆိုင်ရာ ဒေတာသိမ်းဆည်းမှု

  • ရိုးရှင်းသော chunk vector DB မဟုတ်ဘဲ ဒေတာများအကြား အဓိပ္ပာယ်ဆိုင်ရာ ဆက်နွှယ်မှုများ (အကြောင်းအရာ၊ အဆင့်ဆင့်ဖွဲ့စည်းပုံ၊ အကြောင်းရင်းနှင့် အကျိုးဆက် စသည်) ကို graph DB တွင် သိမ်းဆည်းခြင်း
  • Knowledge graph/semantic network ပုံစံဖြင့် ချဲ့ထွင်ခြင်းနှင့် ဖြည့်စွက်ခြင်းတို့ကို လွယ်ကူစွာ ပြုလုပ်နိုင်ခြင်း

Hybrid ရှာဖွေမှုနှင့် အကြောင်းပြချက်ပေးမှု

  • CTA+Context Query: မေးမြန်းချက်၏ အကြောင်းအရာ (Context) နှင့် CTA ကို တစ်ပြိုင်နက် ထည့်သွင်းစဉ်းစားခြင်း
  • Hybrid Retrieval: vector similarity နှင့် rule/graph အခြေပြု ရှာဖွေမှုတို့ကို ပေါင်းစပ်ခြင်း
  • Intelligent Folder Hits: အဓိပ္ပာယ်ဆိုင်ရာ ဆက်နွှယ်မှုရှိသော ဖိုလ်ဒါ/အမျိုးအစားများကို အလိုအလျောက် ရှာဖွေခြင်း

Multimodal တစ်ပြိုင်နက် လုပ်ဆောင်မှု

  • TextReader Pool၊ VisionReader Pool စသည်တို့ဖြင့် စာသား၊ ပုံ၊ ဇယား၊ အသံ စသည့် ဒေတာအမျိုးမျိုးကို တစ်ပြိုင်နက် အဓိပ္ပာယ်ဖော်ခြင်း
  • ယခင် RAG သည် အဓိကအားဖြင့် စာသားကိုသာ လုပ်ဆောင်နိုင်သော်လည်း Semantic Database သည် multimodal လုပ်ဆောင်နိုင်စွမ်း ထူးချွန်ခြင်း

အထောက်အထားအခြေပြု တုံ့ပြန်မှုနှင့် ယုံကြည်စိတ်ချရမှု စစ်ဆေးခြင်း

  • Doc Summaries & Citations၊ Table Findings စသည့် စာရွက်စာတမ်းအကျဉ်းချုပ်နှင့် အရင်းအမြစ်များကို အလိုအလျောက်ဖန်တီးခြင်း
  • Merge & Verify: ရင်းမြစ်များစွာမှ အချက်အလက်များကို အဓိပ္ပာယ်အရ ပေါင်းစည်းခြင်းနှင့် ယုံကြည်စိတ်ချရမှုကို အတည်ပြုခြင်း
  • Evidence Pack: အထောက်အထားအခြေပြု တုံ့ပြန်မှုအထုပ်ကို ပေးအပ်ခြင်း

ရှုပ်ထွေးသော ဆင်ခြင်သုံးသပ်မှုနှင့် Planner

  • Planner/DAG: ရှုပ်ထွေးသော မေးမြန်းချက်များအတွက် အဆင့်လိုက်အစီအစဉ်နှင့် DAG(Directed Acyclic Graph) အခြေပြု ဆင်ခြင်သုံးသပ်မှု

ပေါင်းစည်းထားသော အေးဂျင့်ဖွဲ့စည်းပုံ

  • cip-5-agent Supervisor: ရှာဖွေခြင်း/ဆင်ခြင်သုံးသပ်ခြင်း/ပေါင်းစည်းခြင်း လုပ်ငန်းစဉ်တစ်ခုလုံးကို စီမံခန့်ခွဲပြီး ညှိနှိုင်းပေးသည့် အမြင့်ဆုံးအဆင့် အေးဂျင့်
အကြောင်းအရာပုံ

3. ဖွဲ့စည်းပုံအကျဉ်းချုပ်နှင့် နှိုင်းယှဉ်ချက်

အကျဉ်းချုပ်ရလျှင် Semantic DB သည် အသံ၊ စာသား၊ ပုံ၊ ဗီဒီယို စသည်တို့ကဲ့သို့ ပုံစံအမျိုးမျိုးရှိသော ဒေတာများကို လက်ခံပြီး ရိုးရှင်းသော Chunk များအဖြစ်သာမက ဒေတာများအကြားရှိ အဓိပ္ပာယ်ဆိုင်ရာ ဆက်နွယ်မှုများ (အကြောင်းအရာ၊ အဆင့်ဆင့်ဖွဲ့စည်းပုံ၊ အကြောင်းရင်းနှင့် အကျိုးဆက် စသည်တို့) ကိုပါ ချိတ်ဆက်ကာ အသိပညာကို အမျိုးအစားခွဲပေးပါသည်။

၎င်းအပေါ် အခြေခံ၍ RAG ကဲ့သို့ သော့ချက်စာလုံး/ဆင်တူမှုအခြေပြု ရှာဖွေခြင်းမဟုတ်ဘဲ အဓိပ္ပာယ်ဆိုင်ရာ ဆက်နွယ်မှုများကို အသုံးပြု၍ ရှာဖွေခြင်းနှင့် ဆင်ခြင်သုံးသပ်ခြင်းကို ပြုလုပ်သောကြောင့် AI ထံမှ ပိုမိုတိကျသော အချက်အလက်ရှာဖွေမှုနှင့် အဖြေများကို ရရှိနိုင်ပါသည်။

ထို့အပြင် အသိပညာဂရပ်/semantic network ပုံစံဖြင့် သိမ်းဆည်းထားသောကြောင့် ဆက်လက်ချဲ့ထွင်ခြင်းနှင့် ဖြည့်စွက်ပြင်ဆင်ခြင်းများကို လွယ်ကူစွာ ပြုလုပ်နိုင်ပါသည်။

AI အသွင်ကူးပြောင်းမှုခေတ်တွင် ကျွန်ုပ်တို့ Clevi သည် RAG စနစ်များ၏ ကန့်သတ်ချက်များကို ရှာဖွေတွေ့ရှိခဲ့ပြီး ၎င်းတို့ကို ဖြေရှင်းနိုင်သည့် semantic database နှင့် ကိုယ်ပိုင် AI မော်ဒယ်များမှတစ်ဆင့် သုံးစွဲသူများထံ ပိုမိုတိကျပြီး ယုံကြည်စိတ်ချရသော ဒေတာများကို လျင်မြန်စွာ တုံ့ပြန်ပေးနိုင်လာပါသည်။

ကျွန်ုပ်တို့ Clevi ၏ AI စနစ်သည် မည်သည့်ပတ်ဝန်းကျင်တွင်မဆို ဒိုမိန်းအမျိုးအစားနှင့် မသက်ဆိုင်ဘဲ သုံးစွဲသူများ၏ တန်ဖိုးရှိသော ဒေတာများကို တန်ဖိုးရှိစွာ အသုံးချနိုင်အောင် ကူညီပေးနိုင်ပါသည်။

အနာဂတ်တွင်လည်း Clevi သည် သုံးစွဲသူများ၏ ဒေတာတွင်ရှိသော တန်ဖိုးကို အမြင့်ဆုံးဖြစ်စေရန်နှင့် ဆန်းသစ်တီထွင်သော AI အတွေ့အကြုံကို ပေးအပ်ရန် အကောင်းဆုံးကြိုးပမ်းသွားပါမည်။

Clevi နှင့်အတူ AI ၏ အနာဂတ်အသစ်ကို ခံစားကြည့်ရှုလိုက်ပါ။

ဆက်သွယ်ရန်နှင့် ဒီမိုတောင်းဆိုရန်: [email protected]

Copyright© 2025 Clevi Inc. မူပိုင်ခွင့်အားလုံးကို လက်ဝယ်ထားရှိသည်။

သတင်းခန်းသို့ ပြန်သွားရန်
CLEVI

ဘာသာစကားနှင့် ဒေသ

Bahasa yang diterjemahkan oleh mesin ditandakan. Ketersediaan mengikut pakej laman yang diterbitkan.

ဘာသာစကား ၁၃၆ ခု

အကြံပြုထားသည်

1

အရှေ့အာရှ

7

အရှေ့တောင်အာရှ

11

တောင်အာရှ

18

အလယ်အာရှ

5

အလယ်ပိုင်းအရှေ့တိုင်းနှင့် ကော့ကေးဆပ်စ်

10

အနောက် ဥရောပနှင့် တောင်ဥရောပ

16

ယူနိုက်တက်ကင်းဒမ်းနှင့် အိုင်ယာလန်

4

မြောက် ဥရောပ

10

အလယ်ပိုင်းဥရောပနှင့် ဘော်လကန်

14

အရှေ့ ဥရောပ

5

အရှေ့ အာဖရိက

8

အနောက် အာဖရိကနှင့် အလယ် အာဖရိက

9

အာဖရိက တောင်ပိုင်း

8

အမေရိကန်

5

သမုဒ္ဒရာဒေသ

5
Clevi အဓိပ္ပာယ်ဆိုင်ရာ ဒေတာဘေ့စ် — CLEVI