Судалгаа

Clevi семантик өгөгдлийн сан

AI-г бодит ажлын үйл явцад нэвтрүүлэхэд тулгардаг хамгийн том асуудлуудын нэг нь өмнө нь сурсан мэдлэгийг шинэ өгөгдлөөр нарийн тохируулах үед үүсдэг сүйрлийн марталт(Catastrophic Forgetting) үзэгдэл юм.

1. Catastrophic Forgetting ба RAG-ийн хязгаарлалтууд

AI-г бодит ажлын үйл явцад нэвтрүүлэхэд тулгардаг хамгийн том асуудлуудын нэг нь өмнө нь сурсан мэдлэгийг шинэ өгөгдлөөр нарийн тохируулах үед үүсдэг сүйрлийн марталт(Catastrophic Forgetting) үзэгдэл юм.

Энэ нь мэдрэлийн сүлжээнд суурилсан AI шинэ мэдээлэл сурах явцдаа өмнө нь эзэмшсэн мэдлэг, хэв шинжүүдээ огцом алдах үзэгдэл юм.

Жишээлбэл, нээлттэй эхийн LLM-ийг тодорхой нэг байгууллагын өгөгдлөөр нарийн тохируулбал ерөнхий мэдлэг эсвэл хэлний чадвар буурч болзошгүй.

Ийм асуудлаас зайлсхийхийн тулд RAG(Retrieval-Augmented Generation) технологийг өргөнөөр ашигладаг боловч RAG-д мөн хязгаарлалтууд бий.

Үндсэн агуулгын зураг

RAG-ийн гол хязгаарлалтууд

  • Бүтэцлэгдсэн өгөгдөл боловсруулах хангалтгүй байдал (Structured Data QA): RAG системүүд нь голчлон бүтэцгүй текстэн баримт бичигт оновчлогдсон байдаг тул бүтэцлэгдсэн өгөгдлийн (хүснэгт, өгөгдлийн сан, хүснэгтэн файл зэрэг) утга болон харилцан хамаарлыг зөв ойлгож, ашиглаж чаддаггүй.
  • Нарийн төвөгтэй PDF/бүтэцгүй баримт бичгийн хязгаарлалт (Complex PDFs): Нарийн төвөгтэй PDF баримт бичгүүдийг (хүснэгт, олон багана, зураг агуулсан гэх мэт) chunking (хэсэглэх) явцад мэдээлэл дутуу болох эсвэл агуулгын уялдаа алдагдах магадлалтай. Үүний улмаас чухал өгөгдөл индексжүүлэгдэхгүй эсвэл хайхад хүндрэлтэй болдог.
  • Fallback (нөөц) загвар байхгүй (Fallback Model(s)): RAG систем тохирох хариулт олж чадахгүй үед орлуулах (нөөц) загварт шилжих логик хангалтгүй эсвэл үр ашиггүй байдаг. Үүний улмаас хариулт амжилтгүй болсон үед хэрэглэгчид сэтгэл ханамжтай хувилбар санал болгож чаддаггүй.
  • Аюулгүй байдлын эмзэг байдал (LLM Security): LLM өөрийн аюулгүй байдлын эмзэг байдлуудаас (prompt injection, өгөгдөл алдагдах зэрэг) хамгаалах арга хэмжээ хангалтгүй тул нууц мэдээлэл ил гарах эрсдэлтэй.
  • Өргөтгөх боломж хангалтгүй (Data Ingestion Scalability): Их хэмжээний өгөгдлийг индексжүүлэх болон хадгалах явцад өргөтгөх боломжийн асуудал үүсдэг. Өгөгдлийн хэмжээ нэмэгдэхийн хэрээр chunking, хадгалалт, хайлтын хурд буурч, системийн ачаалал нэмэгддэг.
  • Чухал мэдээлэл дутуу болох (Missing Content): Баримт бичгийн чухал агуулга chunking явцад дутуу болох эсвэл индексжүүлэгдэхгүй байх тохиолдол элбэг. Үүний улмаас хэрэглэгч хүссэн мэдээллээ хайж олж чаддаггүй.
  • Дээд эрэмбийн үр дүн дутуу болох (Missed Top Ranked): Хайлтын үр дүнд бодитоор хамгийн их хамааралтай chunk (дээд эрэмбийн үр дүн) орхигдож болзошгүй. Үүний шалтгаан нь хайлтын алгоритмын хязгаарлалт, embedding-ийн чанар буурах, эрэмбэлэлтийн алдаа зэрэг юм.
  • Агуулгын нийцгүй байдал (Not in Context): Хайлтаар олдсон chunk нь тухайн асуултын бодит агуулгатай нийцэхгүй байх тохиолдол элбэг. Энэ нь зөвхөн төстэй байдлыг үндэслэсэн хайлтын хязгаарлалт бөгөөд утгын холбоос хангалтгүй байдаг.
  • Форматын алдаа (Wrong Format): Хайлтаар олдсон chunk-ийн формат нь LLM боловсруулахад тохиромжгүй эсвэл хэрэглэгчийн хүссэн хариултын форматаас өөр байж болно. Жишээлбэл, хүснэгтийг текст болгон хөрвүүлэх явцад мэдээлэл гажих зэрэг орно.
  • Мэдээлэл задлан авах боломжгүй байх (Not Extracted): Шаардлагатай мэдээлэл chunk-ээс зөв задлан авагдахгүй эсвэл LLM мэдээллийг таньж чадахгүй байх тохиолдол юм. Энэ нь нарийн төвөгтэй өгүүлбэрийн бүтэц, хүснэгт, зураг зэрэгт түгээмэл тохиолддог.
  • Мэдээллийн хүрээ/гүн тохиромжгүй байх (Incorrect Specificity): Хариулт нь асуултад хэт ерөнхий эсвэл эсрэгээрээ хэт нарийвчилсан тул хэрэглэгчийн бодит хэрэгцээнд нийцэхгүй байх тохиолдол юм. Мэдээллийн хүрээ болон гүнийг тохируулахад хүндрэлтэй байдаг.
  • Бүрэн бус хариулт (Incomplete): Эцэст нь үүссэн хариулт бүрэн бус байх эсвэл зөвхөн зарим мэдээллийг өгснөөр хэрэглэгчийн шаардлагыг хангалттай биелүүлж чадахгүй байх тохиолдол юм. Үүний шалтгаан нь олон chunk-ээс мэдээллийг нэгтгэж чадахгүй байх эсвэл LLM мэдээллийн зөвхөн зарим хэсгийг ашиглах явдал юм.

Ийнхүү RAG нь зөвхөн векторын ижил төстэй байдлын хайлт болон chunk-д суурилсан индексжүүлэлтэд хэт их найддаг тул бодит ажлын орчинд найдвартай байдал, өргөтгөх боломж, нарийвчлалын хувьд хязгаарлалтууд нь тодорхой харагддаг.

2. RAG-ийн хязгаарлалтыг даван туулсан CLEVI-ийн семантик өгөгдлийн сан

CLEVI эдгээр хязгаарлалтыг даван туулахын тулд утгын холбоос, нийлмэл дүгнэлт, нотолгоонд суурилсан хариулт-д оновчлогдсон дараагийн үеийн AI мэдлэгийн дэд бүтэц болох Clevi Semantic Database-ийг хөгжүүлсэн.

Энэ нь өөрийн Reasoning загвар, мультимодал AI, агент хэлбэрийн AI загваруудыг бүгдийг эзэмшдэг учраас боломжтой болсон шийдэл бөгөөд AI-г бодит амьдралд үнэхээр хэрэгтэй болгодог CLEVI-ийн хүчирхэг технологийн нэг юм.

Зүйрлэвэл, мэдээлэл хадгалагддаг өгөгдлийн санг номын сан гэж үзвэл CLEVI-ийн семантик өгөгдлийн сан нь маш чадварлаг номын санчтай гэж ойлгож болно. (Номын санчаас шаардлагатай мэдээллээ хүсэхэд үнэн зөв бөгөөд хурдан хариулт авах боломжтой.)

Хэрэглэгч хүссэн үедээ номын санд шинэ мэдээлэл нэмж, шаардлагатай мэдээллээ дуудаж авах боломжтой.

Мөн өгөгдлийн хувилбарын удирдлага болон хандах эрхийг хүссэнээрээ тохируулах боломжтой.

Номын санчийн бүх үйлдэл логт (бүртгэлд) хадгалагддаг тул алдаа гарсан ч засах боломжтой.

Үндсэн текстийн зураг

<Clevi Semantic Database Structure>

Гол онцлог ба технологийн бүтэц

Семантик өгөгдөл хадгалалт

  • Энгийн chunk вектор DB бус, өгөгдөл хоорондын утгын харилцааг (контекст, шатлал, шалтгаан-үр дагавар гэх мэт) граф DB-д хадгална
  • Мэдлэгийн график/семантик сүлжээний хэлбэрээр өргөтгөж, баяжуулахад хялбар

Хосолсон хайлт ба дүгнэлт

  • CTA+Context Query: Асуулгын контекст (Context) болон CTA-г хамтад нь тусгана
  • Hybrid Retrieval: Векторын ижил төстэй байдал + дүрэм/графикт суурилсан хайлтыг хослуулна
  • Intelligent Folder Hits: Утгын хувьд холбоотой хавтас/ангиллыг автоматаар хайна

Мультимодал зэрэг боловсруулалт

  • TextReader Pool, VisionReader Pool зэрэг текст, зураг, хүснэгт, дуу хоолой зэрэг төрөл бүрийн өгөгдлийг зэрэг тайлбарлана
  • Уламжлалт RAG нь ихэвчлэн зөвхөн текст боловсруулах боломжтой байдаг бол семантик өгөгдлийн сан мультимодал боловсруулах чадвараараа давуу

Нотолгоонд суурилсан хариулт ба найдвартай байдлын баталгаажуулалт

  • Баримтын хураангуй ба эшлэл, хүснэгтийн дүгнэлт зэрэг баримтын хураангуй болон эх сурвалжийг автоматаар үүсгэх
  • Merge & Verify: Олон эх сурвалжийн мэдээллийг утгын хувьд нэгтгэж, найдвартай байдлыг баталгаажуулах
  • Evidence Pack: Нотолгоонд суурилсан хариултын багц хүргэх

Нарийн төвөгтэй дүгнэлт ба төлөвлөгч

  • Planner/DAG: Нарийн төвөгтэй асуулгад үе шаттай төлөвлөгөө гаргаж, DAG (Directed Acyclic Graph)-д суурилсан дүгнэлт хийх

Нэгдсэн агентын бүтэц

  • cip-5-agent Supervisor: Хайлт, дүгнэлт, нэгтгэлийн бүх үйл явцыг удирдаж, зохицуулах дээд түвшний агент
Үндсэн хэсгийн зураг

3. Бүтцийн хураангуй ба харьцуулалт

Дүгнэж хэлбэл, Semantic DB нь дуу хоолой, текст, зураг, видео зэрэг олон төрлийн өгөгдлийг хүлээн авч, тэдгээрийг энгийн Chunk болгон хуваахаас гадна өгөгдөл хоорондын утгын харилцаа (контекст, шатлал, шалтгаан-үр дагавар зэрэг)-г холбон мэдлэгийг ангилдаг.

Үүний үндсэн дээр RAG шиг түлхүүр үг болон төстэй байдлаар хайхын оронд утгын холбоосыг ашиглан хайлт, дүгнэлт хийдэг тул AI-аас илүү үнэн зөв мэдээллийн хайлт болон хариулт авах боломжтой.

Мөн мэдлэгийн график/семантик сүлжээний хэлбэрээр хадгалагддаг тул тасралтгүй өргөжүүлж, нөхөн баяжуулахад хялбар байдаг.

CLEVI нь AI-ийн их өөрчлөлтийн эрин үед RAG системийн хязгаарлалтыг олж илрүүлж, үүнийг шийдвэрлэх семантик өгөгдлийн сан болон өөрийн AI загвараар дамжуулан хэрэглэгчдэд илүү үнэн зөв, найдвартай өгөгдлийг хурдан хүргэх боломжтой болсон.

CLEVI-ийн AI систем нь ямар ч орчинд, домэйны төрлөөс үл хамааран хэрэглэгчийн үнэ цэнтэй өгөгдлийг үнэ цэнтэй болгох боломжтой.

Цаашид ч CLEVI хэрэглэгчдийн өгөгдлийн үнэ цэнийг дээд зэргээр нэмэгдүүлж, шинэлэг AI туршлагыг бий болгохын төлөө бүх хүчээ дайчлан ажиллах болно.

CLEVI-тэй хамт AI-ийн шинэ ирээдүйг мэдрээрэй.

Лавлагаа болон демо хүсэлт: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Мэдээллийн төв рүү буцах
CLEVI

Хэл, бүс нутаг

Машинаар орчуулсан хэлүүдийг тэмдэглэсэн. Боломжтой байдал нь нийтэлсэн сайтын багцыг дагана.

136 хэл

Санал болгосон

1

Зүүн Ази

7

Зүүн өмнөд Ази

11

Өмнөд Ази

18

Төв Ази

5

Ойрхи Дорнод ба Кавказ

10

Баруун Европ, Өмнөд Европ

16

Их Британи, Ирланд

4

Хойд Европ

10

Төв Европ ба Балкан

14

Зүүн Европ

5

Зүүн Африк

8

Баруун Африк, Төв Африк

9

Өмнөд Африк тив

8

Америк

5

Номхон далайн орнууд

5
Clevi семантик өгөгдлийн сан — CLEVI