ការស្រាវជ្រាវ

Clevi មូលដ្ឋានទិន្នន័យសេម៉ង់ទិក

នៅពេល AI ត្រូវបានដាក់ឱ្យប្រើប្រាស់ក្នុងការងារជាក់ស្តែង បញ្ហាដ៏ធំបំផុតមួយគឺបាតុភូតបំភ្លេចចំណេះដឹងយ៉ាងមហន្តរាយ (Catastrophic Forgetting) ដែលកើតឡើងនៅពេលធ្វើការកែសម្រួលការបណ្តុះបណ្តាល (fine-tuning) ចំណេះដឹងដែលបានរៀនពីមុនជាមួយទិន្នន័យថ្មី។

1. ដែនកំណត់របស់ Catastrophic Forgetting និង RAG

នៅពេល AI ត្រូវបានដាក់ឱ្យប្រើប្រាស់ក្នុងការងារជាក់ស្តែង បញ្ហាដ៏ធំបំផុតមួយគឺបាតុភូត បំភ្លេចចំណេះដឹងយ៉ាងមហន្តរាយ (Catastrophic Forgetting) ដែលកើតឡើងនៅពេលធ្វើការកែសម្រួលការបណ្តុះបណ្តាល (fine-tuning) ចំណេះដឹងដែលបានរៀនពីមុនជាមួយទិន្នន័យថ្មី។

នេះគឺជាបាតុភូតដែល AI ផ្អែកលើបណ្តាញសរសៃប្រសាទ បាត់បង់ចំណេះដឹង ឬលំនាំដែលបានរៀនពីមុនយ៉ាងឆាប់រហ័ស ក្នុងអំឡុងពេលរៀនព័ត៌មានថ្មី។

ឧទាហរណ៍ ប្រសិនបើធ្វើការកែសម្រួលការបណ្តុះបណ្តាល (fine-tuning) LLM ប្រភពបើកចំហដោយប្រើទិន្នន័យរបស់ក្រុមហ៊ុនជាក់លាក់ សុភវិនិច្ឆ័យទូទៅ ឬសមត្ថភាពភាសា អាចនឹងធ្លាក់ចុះ។

ដើម្បីជៀសវាងបញ្ហានេះ បច្ចេកវិទ្យា RAG (Retrieval-Augmented Generation) ត្រូវបានប្រើប្រាស់យ៉ាងទូលំទូលាយ ប៉ុន្តែ RAG ក៏មានដែនកំណត់ផងដែរ។

រូបភាពក្នុងអត្ថបទ

ដែនកំណត់សំខាន់ៗរបស់ RAG

  • ការដំណើរការទិន្នន័យមានរចនាសម្ព័ន្ធមិនគ្រប់គ្រាន់ (Structured Data QA): ប្រព័ន្ធ RAG ត្រូវបានធ្វើឱ្យប្រសើរជាចម្បងសម្រាប់ឯកសារអត្ថបទគ្មានរចនាសម្ព័ន្ធ ដូច្នេះវាមិនអាចយល់ ឬប្រើប្រាស់អត្ថន័យ និងទំនាក់ទំនងនៃទិន្នន័យមានរចនាសម្ព័ន្ធ (តារាង មូលដ្ឋានទិន្នន័យ សៀវភៅបញ្ជីជាដើម) បានត្រឹមត្រូវទេ។
  • ដែនកំណត់នៃ PDF ស្មុគស្មាញ/ឯកសារគ្មានរចនាសម្ព័ន្ធ (Complex PDFs): ឯកសារ PDF ស្មុគស្មាញ (រួមមានតារាង ជួរឈរច្រើន រូបភាពជាដើម) អាចបាត់បង់ព័ត៌មាន ឬបំភ្លៃបរិបទក្នុងដំណើរការ chunking(ការបែងចែក)។ ដោយសារហេតុនេះ ទិន្នន័យសំខាន់អាចមិនត្រូវបានធ្វើលិបិក្រម ឬពិបាកស្វែងរក។
  • អវត្តមានម៉ូដែល Fallback(បម្រុងទុក) (Fallback Model(s)): នៅពេលប្រព័ន្ធ RAG មិនអាចស្វែងរកចម្លើយសមស្របបាន តក្កវិជ្ជាសម្រាប់ប្តូរទៅម៉ូដែលជំនួស (បម្រុងទុក) អាចមានភាពមិនគ្រប់គ្រាន់ ឬមិនមានប្រសិទ្ធភាព។ ដោយសារហេតុនេះ នៅពេលចម្លើយបរាជ័យ អ្នកប្រើមិនទទួលបានជម្រើសជំនួសដែលអាចបំពេញចិត្តបានទេ។
  • ចំណុចខ្សោយផ្នែកសុវត្ថិភាព (LLM Security): ការការពារប្រឆាំងនឹងចំណុចខ្សោយផ្នែកសុវត្ថិភាពរបស់ LLM ផ្ទាល់ (ដូចជា prompt injection ការលេចធ្លាយទិន្នន័យជាដើម) មិនគ្រប់គ្រាន់ ដែលបង្កហានិភ័យនៃការលាតត្រដាងព័ត៌មានរសើប។
  • កង្វះសមត្ថភាពពង្រីក (Data Ingestion Scalability): បញ្ហាសមត្ថភាពពង្រីកកើតឡើងក្នុងដំណើរការធ្វើលិបិក្រម និងរក្សាទុកទិន្នន័យបរិមាណច្រើន។ នៅពេលទិន្នន័យកាន់តែច្រើន ល្បឿន chunking ការរក្សាទុក និងការស្វែងរកថយចុះ ហើយបន្ទុកលើប្រព័ន្ធកើនឡើង។
  • ការខកខានព័ត៌មានសំខាន់ (Missing Content): ខ្លឹមសារសំខាន់ក្នុងឯកសារជាញឹកញាប់ត្រូវបានខកខានក្នុងដំណើរការ chunking ឬមិនត្រូវបានធ្វើលិបិក្រម។ ដោយសារហេតុនេះ អ្នកប្រើមិនអាចស្វែងរកព័ត៌មានដែលខ្លួនចង់បានទេ។
  • ការខកខានចំណាត់ថ្នាក់កំពូល (Missed Top Ranked): chunk ដែលពាក់ព័ន្ធបំផុតជាក់ស្តែង (ចំណាត់ថ្នាក់កំពូល) អាចត្រូវបានខកខានក្នុងលទ្ធផលស្វែងរក។ មូលហេតុរួមមានដែនកំណត់នៃក្បួនដោះស្រាយស្វែងរក គុណភាព embedding ថយចុះ និងកំហុសក្នុងការចាត់ចំណាត់ថ្នាក់។
  • មិនស្របតាមបរិបទ (Not in Context): ជាញឹកញាប់ chunk ដែលបានស្វែងរកមិនស្របនឹងបរិបទជាក់ស្តែងនៃសំណួរទេ។ ដោយសារដែនកំណត់នៃការស្វែងរកផ្អែកលើភាពស្រដៀងគ្នាសាមញ្ញ វាខ្វះការតភ្ជាប់ផ្នែកអត្ថន័យ។
  • កំហុសទម្រង់ (Wrong Format): ទម្រង់របស់ chunk ដែលបានស្វែងរកអាចមិនសមស្របសម្រាប់ LLM ដំណើរការ ឬអាចខុសពីទម្រង់ចម្លើយដែលអ្នកប្រើចង់បាន។ ឧទាហរណ៍ តារាងត្រូវបានបម្លែងទៅជាអត្ថបទ បណ្តាលឱ្យព័ត៌មានត្រូវបានបំភ្លៃ។
  • បរាជ័យក្នុងការស្រង់ព័ត៌មាន (Not Extracted): ព័ត៌មានចាំបាច់អាចមិនត្រូវបានស្រង់ចេញពី chunk បានត្រឹមត្រូវ ឬ LLM មិនអាចស្គាល់ព័ត៌មានបាន។ បញ្ហានេះកើតឡើងជាញឹកញាប់នៅក្នុងរចនាសម្ព័ន្ធប្រយោគស្មុគស្មាញ តារាង និងរូបភាព។
  • វិសាលភាព/ជម្រៅព័ត៌មានមិនសមស្រប (Incorrect Specificity): ចម្លើយអាចទូលំទូលាយពេក ឬផ្ទុយទៅវិញជាក់លាក់ពេកសម្រាប់សំណួរ ដែលធ្វើឱ្យវាមិនស្របនឹងតម្រូវការជាក់ស្តែងរបស់អ្នកប្រើ។ វាពិបាកក្នុងការកែតម្រូវវិសាលភាព និងជម្រៅនៃព័ត៌មាន។
  • ចម្លើយមិនពេញលេញ (Incomplete): ចម្លើយដែលបានបង្កើតចុងក្រោយអាចមិនពេញលេញ ឬផ្តល់តែព័ត៌មានមួយផ្នែក ដូច្នេះមិនអាចបំពេញតម្រូវការរបស់អ្នកប្រើបានគ្រប់គ្រាន់ទេ។ មូលហេតុអាចបណ្តាលមកពីការមិនអាចសំយោគព័ត៌មានពី chunk ជាច្រើន ឬ LLM ប្រើប្រាស់តែព័ត៌មានមួយផ្នែក។

ដូច្នេះ ដោយសារ RAG ពឹងផ្អែកខ្លាំងពេកលើការស្វែងរកភាពស្រដៀងគ្នារបស់វ៉ិចទ័រដ៏សាមញ្ញ និងការធ្វើអ៊ីនដិចផ្អែកលើ chunk វាមានកម្រិតច្បាស់លាស់នៅក្នុងការងារជាក់ស្តែង ទាក់ទងនឹងភាពជឿជាក់ ការពង្រីកសមត្ថភាព និងភាពត្រឹមត្រូវ។

2. មូលដ្ឋានទិន្នន័យសេម៉ង់ទិករបស់ CLEVI ដែលបានយកឈ្នះលើកម្រិតរបស់ RAG

ដើម្បីយកឈ្នះលើកម្រិតទាំងនេះ CLEVI បានបង្កើត ហេដ្ឋារចនាសម្ព័ន្ធចំណេះដឹង AI ជំនាន់ក្រោយ ដែលត្រូវបានធ្វើឱ្យប្រសើរសម្រាប់ការតភ្ជាប់តាមន័យ ការសន្និដ្ឋានស្មុគស្មាញ និងការឆ្លើយតបផ្អែកលើភស្តុតាង គឺ Clevi Semantic Database

នេះគឺជាដំណោះស្រាយដែលអាចធ្វើទៅបាន ដោយសារយើងមាន Reasoning model ផ្ទាល់ខ្លួន ម៉ូដែល AI ពហុមធ្យោបាយ និងម៉ូដែល AI ប្រភេទភ្នាក់ងារទាំងអស់ ហើយវាជាបច្ចេកវិទ្យាដ៏មានឥទ្ធិពលមួយរបស់ CLEVI ដែលធ្វើឱ្យ AI អាចជួយបានជាក់ស្តែងក្នុងពិភពលោកពិត។

បើប្រៀបធៀប ទិន្នន័យដែលត្រូវបានរក្សាទុកអាចចាត់ទុកជាបណ្ណាល័យ ហើយមូលដ្ឋានទិន្នន័យសេម៉ង់ទិករបស់ CLEVI គឺដូចជាមានបណ្ណារក្សដ៏ឆ្នើមម្នាក់។ (នៅពេលស្នើសុំព័ត៌មានដែលត្រូវការពីបណ្ណារក្ស អ្នកអាចទទួលបានការឆ្លើយតបយ៉ាងត្រឹមត្រូវ និងរហ័ស។)

អ្នកប្រើប្រាស់អាចបន្ថែមព័ត៌មានថ្មីទៅក្នុងបណ្ណាល័យ និងហៅយកព័ត៌មានដែលត្រូវការបានគ្រប់ពេល។

លើសពីនេះ អ្នកអាចកំណត់ការគ្រប់គ្រងកំណែទិន្នន័យ និងសិទ្ធិចូលប្រើតាមតម្រូវការរបស់អ្នកបាន។

សកម្មភាពទាំងអស់របស់បណ្ណារក្សត្រូវបានរក្សាទុកជាកំណត់ហេតុ ដូច្នេះ ទោះបីមានកំហុសកើតឡើងក៏ដោយ ក៏អាចកែតម្រូវបាន។

រូបភាពក្នុងអត្ថបទ

<Clevi Semantic Database Structure>

លក្ខណៈសំខាន់ៗ និងរចនាសម្ព័ន្ធបច្ចេកវិទ្យា

ការរក្សាទុកទិន្នន័យតាមន័យ

  • រក្សាទុកទំនាក់ទំនងតាមន័យរវាងទិន្នន័យ (បរិបទ ឋានានុក្រម បុព្វហេតុ-ផលវិបាក ជាដើម) ក្នុងក្រាហ្វ DB មិនមែនជា vector DB ផ្អែកលើ chunk ដ៏សាមញ្ញទេ
  • ងាយស្រួលពង្រីក និងបំពេញបន្ថែមជាទម្រង់ក្រាហ្វចំណេះដឹង/បណ្តាញសេម៉ង់ទិក

ការស្វែងរក និងការសន្និដ្ឋានបែបហៃប្រ៊ីដ

  • CTA+Context Query៖ ឆ្លុះបញ្ចាំងទាំងបរិបទ (Context) និង CTA របស់សំណួរ
  • Hybrid Retrieval៖ បញ្ចូលការស្វែងរកផ្អែកលើភាពស្រដៀងគ្នារបស់វ៉ិចទ័រ + ច្បាប់/ក្រាហ្វ
  • Intelligent Folder Hits៖ ស្វែងរកថត/ប្រភេទដែលពាក់ព័ន្ធតាមន័យដោយស្វ័យប្រវត្តិ

ការដំណើរការពហុមធ្យោបាយក្នុងពេលដំណាលគ្នា

  • បកស្រាយទិន្នន័យជាច្រើនប្រភេទក្នុងពេលដំណាលគ្នា ដូចជា អត្ថបទ រូបភាព តារាង និងសំឡេង តាមរយៈ TextReader Pool, VisionReader Pool ជាដើម
  • ខណៈដែល RAG ប្រពៃណីអាចដំណើរការជាចម្បងតែអត្ថបទ មូលដ្ឋានទិន្នន័យសេម៉ង់ទិកមានសមត្ថភាពដំណើរការពហុមធ្យោបាយដ៏ល្អប្រសើរ

ការឆ្លើយតបផ្អែកលើភស្តុតាង និងការផ្ទៀងផ្ទាត់ភាពជឿជាក់

  • ការសង្ខេបឯកសារ និងការដកស្រង់ប្រភព, ការរកឃើញតារាង និងការបង្កើតស្វ័យប្រវត្តិនូវសេចក្តីសង្ខេបឯកសារ និងប្រភពជាដើម
  • Merge & Verify: ការរួមបញ្ចូលព័ត៌មានពីប្រភពជាច្រើនតាមន័យ និងការផ្ទៀងផ្ទាត់ភាពគួរឱ្យទុកចិត្ត
  • Evidence Pack: ផ្តល់កញ្ចប់ចម្លើយផ្អែកលើភស្តុតាង

ការវែកញែកស្មុគស្មាញ និងអ្នករៀបចំផែនការ

  • Planner/DAG: ការរៀបចំផែនការជាជំហានៗ និងការវែកញែកផ្អែកលើ DAG (Directed Acyclic Graph) សម្រាប់សំណួរស្មុគស្មាញ

រចនាសម្ព័ន្ធភ្នាក់ងាររួមបញ្ចូល

  • cip-5-agent Supervisor: ភ្នាក់ងារកម្រិតខ្ពស់បំផុតដែលគ្រប់គ្រង និងសម្របសម្រួលដំណើរការស្វែងរក/វែកញែក/រួមបញ្ចូលទាំងមូល
រូបភាពក្នុងខ្លឹមសារ

3. សេចក្តីសង្ខេប និងការប្រៀបធៀបរចនាសម្ព័ន្ធ

សរុបមក Semantic DB ទទួលទិន្នន័យក្នុងទម្រង់ផ្សេងៗ (សំឡេង អត្ថបទ រូបភាព វីដេអូ ជាដើម) ហើយចាត់ថ្នាក់ចំណេះដឹងដោយភ្ជាប់មិនត្រឹមតែ Chunk សាមញ្ញទេ ប៉ុន្តែថែមទាំងទំនាក់ទំនងតាមន័យរវាងទិន្នន័យ (បរិបទ ឋានានុក្រម បុព្វហេតុ និងផលវិបាក ជាដើម) ផងដែរ។

ដោយផ្អែកលើចំណុចនេះ វាធ្វើការស្វែងរក និងវែកញែកដោយប្រើការតភ្ជាប់តាមន័យ មិនមែនការស្វែងរកផ្អែកលើពាក្យគន្លឹះ/ភាពស្រដៀងគ្នាដូចជា RAG ទេ ដូច្នេះអ្នកអាចទទួលបានការស្វែងរកព័ត៌មាន និងចម្លើយពី AI ដែលមានភាពត្រឹមត្រូវជាងមុន។

លើសពីនេះ ដោយសារវាត្រូវបានរក្សាទុកជាទម្រង់ក្រាហ្វចំណេះដឹង/បណ្តាញស៊ីម៉ង់ទិក វាងាយស្រួលក្នុងការពង្រីក និងបំពេញបន្ថែមជាបន្តបន្ទាប់។

CLEVI បានរកឃើញដែនកំណត់នៃប្រព័ន្ធ RAG ក្នុងយុគសម័យ AI Transformation ហើយតាមរយៈមូលដ្ឋានទិន្នន័យស៊ីម៉ង់ទិក និងម៉ូដែល AI ផ្ទាល់ខ្លួនដែលអាចដោះស្រាយបញ្ហានេះ យើងអាចផ្តល់ទិន្នន័យដែលមានភាពត្រឹមត្រូវ និងគួរឱ្យទុកចិត្តជាងមុនដល់អតិថិជនបានយ៉ាងឆាប់រហ័ស។

ប្រព័ន្ធ AI របស់ CLEVI អាចធ្វើឱ្យទិន្នន័យដ៏មានតម្លៃរបស់អតិថិជនក្លាយជាទ្រព្យសម្បត្តិដែលមានតម្លៃ ដោយមិនគិតពីប្រភេទដែនជំនាញ និងក្នុងបរិស្ថានណាមួយក៏ដោយ។

CLEVI នឹងបន្តខិតខំអស់ពីសមត្ថភាព ដើម្បីបង្កើនតម្លៃទិន្នន័យរបស់អតិថិជនឱ្យបានអតិបរមា និងផ្តល់បទពិសោធន៍ AI ប្រកបដោយនវានុវត្តន៍។

សូមអញ្ជើញមកទទួលបទពិសោធន៍អនាគតថ្មីនៃ AI ជាមួយ CLEVI។

សាកសួរ និងស្នើសុំការបង្ហាញផលិតផល៖ [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

ត្រឡប់ទៅបន្ទប់ព័ត៌មាន
CLEVI

ភាសា និងតំបន់

ភាសាដែលបកប្រែដោយម៉ាស៊ីនត្រូវបានសម្គាល់។ ភាពអាចប្រើបានអាស្រ័យលើកញ្ចប់គេហទំព័រដែលបានបោះពុម្ពផ្សាយ។

ភាសា 136

បានណែនាំ

1

អាស៊ី​ខាង​កើត

7

អាស៊ីអាគ្នេយ៍

11

អាស៊ី​ខាង​ត្បូង

18

អាស៊ី​កណ្ដាល

5

មជ្ឈិមបូព៌ា និងកូកាស៊ុស

10

អឺរ៉ុប​ខាង​លិច និង​អឺរ៉ុប​ខាង​ត្បូង

16

ចក្រភព​អង់គ្លេស និង​អៀរឡង់

4

អឺរ៉ុប​ខាង​ជើង

10

អឺរ៉ុបកណ្ដាល និងបាល់កង់

14

អឺរ៉ុប​ខាង​កើត

5

អាហ្វ្រិកខាងកើត

8

អាហ្វ្រិក​ខាង​លិច និង​អាហ្វ្រិក​កណ្តាល

9

អាហ្វ្រិកភាគខាងត្បូង

8

អាមេរិក

5

អូសេអានី

5