1. Catastrophic Forgetting과 RAG의 한계
AI가 실제 업무에 도입될 때, 가장 큰 고민 중 하나는 기존에 학습한 지식을 새로운 데이터로 파인튜닝할 때 발생하는 재앙적 망각(Catastrophic Forgetting) 현상입니다.
이는 신경망 기반의 AI가 새로운 정보를 학습하는 과정에서, 이전에 익힌 지식이나 패턴을 급격히 잃어버리는 현상입니다.
예를 들어, 오픈소스 LLM을 특정 기업 데이터로 파인튜닝하면, 범용적 상식이나 언어 능력이 저하될 수 있습니다.
이러한 문제를 피하기 위해 RAG(Retrieval-Augmented Generation) 기술이 널리 사용되고 있지만, RAG 역시 한계가 존재합니다.
RAG의 대표적 한계
- 구조화 데이터 처리 미흡(Structured Data QA): RAG 시스템은 주로 비정형 텍스트 문서에 최적화되어 있어, 구조화된 데이터(표, 데이터베이스, 스프레드시트 등)의 의미와 관계를 제대로 파악하거나 활용하지 못합니다.
- 복잡한 PDF/비정형 문서 한계(Complex PDFs): 복잡한 PDF 문서(표, 다단, 이미지 포함 등)는 chunking(분할) 과정에서 정보가 누락되거나, 문맥이 왜곡될 수 있습니다. 이로 인해 중요한 데이터가 인덱싱되지 않거나, 검색이 어렵게 됩니다.
- Fallback(백업) 모델 부재(Fallback Model(s)): RAG 시스템이 적절한 답변을 찾지 못할 때, 대체(백업) 모델로 전환하는 로직이 부족하거나 비효율적입니다. 이로 인해 답변 실패 시 사용자가 만족할 만한 대안이 제공되지 않습니다.
- 보안 취약점(LLM Security): LLM 자체의 보안 취약점(프롬프트 인젝션, 데이터 유출 등)에 대한 방어가 미흡해 민감 정보가 노출될 위험이 있습니다.
- 확장성 부족(Data Ingestion Scalability): 대용량 데이터의 인덱싱 및 저장 과정에서 확장성 문제가 발생합니다. 데이터가 많아질수록 chunking, 저장, 검색 속도가 저하되고, 시스템 부하가 커집니다.
- 중요한 정보 누락(Missing Content): 문서에서 중요한 내용이 chunking 과정에서 누락되거나, 인덱싱되지 않는 경우가 많습니다. 이로 인해 사용자가 원하는 정보를 검색할 수 없습니다.
- 상위 랭크 누락(Missed Top Ranked): 검색 결과에서 실제로 가장 관련성이 높은 chunk(상위 랭크)가 누락될 수 있습니다. 검색 알고리즘의 한계, 임베딩 품질 저하, 랭킹 오류 등이 원인입니다.
- 문맥 불일치 (Not in Context): 검색된 chunk가 실제 질문의 맥락과 맞지 않는 경우가 많습니다. 단순 유사도 기반 검색의 한계로, 의미적 연결성이 부족합니다.
- 포맷 오류 (Wrong Format): 검색된 chunk의 형식이 LLM이 처리하기에 부적합하거나, 사용자가 원하는 답변 형식과 다를 수 있습니다. 예를 들어, 표가 텍스트로 변환되어 정보가 왜곡되는 경우 등입니다.
- 정보 추출 실패 (Not Extracted): 필요한 정보가 chunk에서 제대로 추출되지 않거나, LLM이 정보를 인식하지 못하는 경우입니다. 복잡한 문장 구조, 표, 이미지 등에서 자주 발생합니다.
- 정보 범위/깊이 부적합 (Incorrect Specificity): 답변이 질문에 대해 너무 포괄적이거나, 반대로 지나치게 구체적이어서 실제 사용자의 요구와 맞지 않는 경우입니다. 정보의 범위와 깊이 조절이 어렵습니다.
- 불완전한 답변 (Incomplete): 최종적으로 생성된 답변이 불완전하거나, 일부 정보만 제공되어 사용자의 요구를 충분히 충족하지 못하는 경우입니다. 여러 chunk에서 정보를 종합하지 못하거나, LLM이 일부만 활용하는 경우가 원인입니다.
이처럼 RAG는 단순 벡터 유사도 검색과 chunk 기반 인덱싱에 지나치게 의존하기 때문에, 실제 업무에서 신뢰성·확장성·정확성 측면에서 한계가 명확합니다.
2. RAG의 한계를 극복한 클레비의 시맨틱 데이터베이스
클레비는 이러한 한계를 극복하기 위해, 의미적 연결·복합 추론·근거 기반 응답에 최적화된 차세대 AI 지식 인프라, Clevi Semantic Database를 개발했습니다.
자체 Reasoning 모델, 멀티모달 AI, 에이전트형 AI 모델을 모두 보유하고 있기 때문에 가능한 솔루션이며, AI가 현실에서 실제로 도움이 될 수 있게 만드는 클레비만의 강력한 기술 중 하나입니다.
비유하자면, 정보가 저장된 데이터베이스를 도서관이라고 할 때, 클레비의 시맨틱 데이터베이스는 아주 뛰어난 사서가 있다고 생각하면 됩니다. (사서에게 필요한 정보를 요청하면 정확하고 빠른 응답을 받을 수 있습니다.)
사용자는 언제든 도서관에서 새로운 정보를 추가하고, 필요한 정보를 불러올 수 있습니다.
또한 데이터의 버전 관리나 접근 권한도 원하는대로 설정할 수 있습니다.
사서의 모든 행동은 로그(기록)로 남기 때문에, 실수가 발생하더라도 수정할 수 있습니다.
<Clevi Semantic Database Structure>
주요 특징 및 기술 구조
의미적 데이터 저장
- 단순 chunk 벡터DB가 아닌, 데이터 간 의미적 관계(맥락, 계층, 인과 등)를 그래프 DB에 저장
- 지식 그래프/시맨틱 네트워크 형태로 확장·보완이 용이
하이브리드 검색 및 추론
- CTA+Context Query: 질의의 맥락(Context)과 CTA를 함께 반영
- Hybrid Retrieval: 벡터 유사도 + 룰/그래프 기반 검색 결합
- Intelligent Folder Hits: 의미적으로 연관된 폴더/카테고리 자동 탐색
멀티모달 동시 처리
- TextReader Pool, VisionReader Pool 등 텍스트, 이미지, 표, 음성 등 다양한 데이터 동시 해석
- 기존 RAG는 주로 텍스트만 처리할 수 있는 반면 시맨틱 데이터베이스는 멀티모달 처리 능력 탁월
근거 기반 응답 및 신뢰성 검증
- Doc Summaries & Citations, Table Findings 등 문서 요약·출처 자동 생성
- Merge & Verify: 여러 소스 정보 의미적 통합 및 신뢰성 검증
- Evidence Pack: 근거 기반 응답 패키지 제공
복합 추론 및 플래너
- Planner/DAG: 복잡한 질의에 대해 단계별 계획 및 DAG(Directed Acyclic Graph) 기반 추론
통합 에이전트 구조
- cip-5-agent Supervisor: 전체 검색/추론/통합 과정을 관리·조정하는 최상위 에이전트
3. 구조 요약 및 비교
정리하자면, Semantic DB는 다양한 형태(음성, 텍스트, 이미지, 비디오 등)의 데이터를 입력받아 단순 Chunk가 아니라, 데이터 간 의미적 관계(맥락, 계층, 인과 등)까지 연결하여 지식을 분류합니다.
이를 기반으로 RAG처럼 키워드/유사도 기반의 검색이 아니라 의미적 연결을 활용한 검색과 추론을 하기 때문에 더욱 정확한 정보 검색과 답변을 AI로부터 얻을 수 있습니다.
또한 지식 그래프/시맨틱 네트워크 형태로 저장되기 때문에 지속적 확장 및 보완이 용이합니다.
저희 클레비는 AI 대전환의 시대에서 RAG 시스템의 한계를 발견하고, 이를 해결할 수 있는 시맨틱 데이터베이스와 독자적인 AI 모델을 통해 고객에게 더 정확하고 신뢰성 높은 데이터를 빠르게 응답할 수 있게 되었습니다.
저희 클레비의 AI 시스템은 어떠한 환경에서도 도메인의 종류에 상관없이 고객의 소중한 데이터를 가치 있게 만들어 드릴 수 있습니다.
앞으로도 클레비는 고객의 데이터가 가진 가치를 극대화하고, 혁신적인 AI 경험을 제공하기 위해 최선을 다하겠습니다.
클레비와 함께 새로운 AI의 미래를 경험해보시기 바랍니다.
문의 및 데모 요청: [email protected]
Copyright© 2025 Clevi Inc. All rights reserved.

