1. Catastrophic ForgettingとRAGの限界
AIを実際の業務に導入する際、最も大きな懸念の一つは、既に学習した知識を新しいデータでファインチューニングする際に発生する 壊滅的忘却(Catastrophic Forgetting) 現象です。
これは、ニューラルネットワークベースのAIが新しい情報を学習する過程で、以前に習得した知識やパターンを急激に失ってしまう現象です。
例えば、オープンソースLLMを特定の企業データでファインチューニングすると、一般的な常識や言語能力が低下する可能性があります。
この問題を回避するために RAG(Retrieval-Augmented Generation) 技術が広く使用されていますが、RAGにも限界があります。
RAGの代表的な限界
- 構造化データの処理不足(Structured Data QA):RAGシステムは主に非構造化テキスト文書向けに最適化されているため、構造化データ(表、データベース、スプレッドシートなど)の意味や関係を適切に把握・活用できません。
- 複雑なPDF/非構造化文書の限界(Complex PDFs):複雑なPDF文書(表、段組み、画像を含むなど)は、chunking(分割)処理の際に情報が欠落したり、文脈が歪んだりする可能性があります。その結果、重要なデータがインデックス化されなかったり、検索が困難になったりします。
- Fallback(バックアップ)モデルの不在(Fallback Model(s)):RAGシステムが適切な回答を見つけられない場合に、代替(バックアップ)モデルへ切り替えるロジックが不足しているか、非効率的です。そのため、回答に失敗した際に、ユーザーが満足できる代替案を提供できません。
- セキュリティ脆弱性(LLM Security):LLM自体のセキュリティ脆弱性(プロンプトインジェクション、データ漏えいなど)に対する防御が不十分で、機密情報が露出するリスクがあります。
- 拡張性の不足(Data Ingestion Scalability):大量データのインデックス化および保存処理において、拡張性の問題が発生します。データ量が増えるほど、chunking、保存、検索の速度が低下し、システム負荷が増大します。
- 重要な情報の欠落(Missing Content):文書内の重要な内容がchunking処理中に欠落したり、インデックス化されなかったりすることがよくあります。その結果、ユーザーが求める情報を検索できません。
- 上位ランクの欠落(Missed Top Ranked):検索結果から、実際に最も関連性の高いchunk(上位ランク)が欠落する可能性があります。原因として、検索アルゴリズムの限界、埋め込み品質の低下、ランキングエラーなどが挙げられます。
- 文脈の不一致(Not in Context):検索されたchunkが、実際の質問の文脈に合っていないことがよくあります。単純な類似度ベースの検索の限界により、意味的なつながりが不足しています。
- フォーマットエラー(Wrong Format):検索されたchunkの形式がLLMによる処理に適していなかったり、ユーザーが求める回答形式と異なったりする場合があります。たとえば、表がテキストに変換されて情報が歪む場合などです。
- 情報抽出の失敗(Not Extracted):必要な情報がchunkから適切に抽出されなかったり、LLMが情報を認識できなかったりする場合です。複雑な文構造、表、画像などでよく発生します。
- 情報の範囲/深さが不適切(Incorrect Specificity):回答が質問に対して包括的すぎたり、反対に具体的すぎたりして、実際のユーザーの要求に合わない場合です。情報の範囲と深さを調整することは困難です。
- 不完全な回答(Incomplete):最終的に生成された回答が不完全であったり、一部の情報しか提供されず、ユーザーの要求を十分に満たせなかったりする場合です。複数のchunkから情報を統合できないことや、LLMが一部しか活用しないことが原因です。
このように、RAGは単純なベクトル類似度検索とチャンクベースのインデックス作成に過度に依存しているため、実際の業務において信頼性・拡張性・正確性の面で明確な限界があります。
2. RAGの限界を克服したCLEVIのセマンティックデータベース
CLEVIはこれらの限界を克服するため、意味的な接続・複合推論・根拠に基づく応答に最適化された次世代AIナレッジインフラ、Clevi Semantic Databaseを開発しました。
独自のReasoningモデル、マルチモーダルAI、エージェント型AIモデルをすべて保有しているからこそ実現できるソリューションであり、AIが現実の中で実際に役立つようにするCLEVI独自の強力な技術の一つです。
たとえるなら、情報が保存されたデータベースを図書館とすると、CLEVIのセマンティックデータベースには非常に優れた司書がいると考えることができます。(司書に必要な情報を依頼すれば、正確かつ迅速な回答を得られます。)
ユーザーはいつでも図書館に新しい情報を追加し、必要な情報を呼び出すことができます。
また、データのバージョン管理やアクセス権限も、希望どおりに設定できます。
司書のすべての行動はログ(記録)として残るため、ミスが発生しても修正できます。
<Clevi Semantic Database Structure>
主な特徴と技術構造
意味的なデータ保存
- 単純なチャンクベクトルDBではなく、データ間の意味的な関係(コンテキスト、階層、因果関係など)をグラフDBに保存
- ナレッジグラフ/セマンティックネットワーク形式への拡張・補完が容易
ハイブリッド検索および推論
- CTA+Context Query:クエリのコンテキスト(Context)とCTAを同時に反映
- Hybrid Retrieval:ベクトル類似度+ルール/グラフベースの検索を組み合わせる
- Intelligent Folder Hits:意味的に関連するフォルダー/カテゴリーを自動探索
マルチモーダル同時処理
- TextReader Pool、VisionReader Poolなど、テキスト、画像、表、音声など多様なデータを同時に解釈
- 従来のRAGは主にテキストしか処理できない一方、セマンティックデータベースはマルチモーダル処理能力に優れている
根拠に基づく応答および信頼性検証
- Doc Summaries & Citations, Table Findingsなどの文書要約・出典の自動生成
- Merge & Verify:複数ソースの情報を意味的に統合し、信頼性を検証
- Evidence Pack:根拠に基づく回答パッケージを提供
複合推論およびプランナー
- Planner/DAG:複雑なクエリに対して段階的な計画を立て、DAG(Directed Acyclic Graph)に基づいて推論
統合エージェント構造
- cip-5-agent Supervisor:検索・推論・統合の全プロセスを管理・調整する最上位エージェント
3. 構造の要約および比較
要約すると、Semantic DBは音声、テキスト、画像、動画など、さまざまな形式のデータを入力として受け取り、単なるChunkではなく、データ間の意味的関係(コンテキスト、階層、因果関係など)までつなげて知識を分類します。
これに基づき、RAGのようにキーワードや類似度を基盤とした検索ではなく、意味的なつながりを活用して検索・推論を行うため、AIからより正確な情報検索結果と回答を得ることができます。
また、知識グラフやセマンティックネットワークの形で保存されるため、継続的な拡張や補完も容易です。
CLEVIはAIトランスフォーメーションの時代においてRAGシステムの限界を見いだし、それを解決できるセマンティックデータベースと独自のAIモデルを通じて、お客様により正確で信頼性の高いデータを迅速に提供できるようになりました。
CLEVIのAIシステムは、どのような環境でも、ドメインの種類を問わず、お客様の大切なデータを価値あるものに変えることができます。
今後もCLEVIは、お客様のデータが持つ価値を最大化し、革新的なAI体験を提供するために最善を尽くしてまいります。
CLEVIとともに、新しいAIの未来を体験してください。
お問い合わせおよびデモのご依頼:[email protected]
Copyright© 2025 Clevi Inc. All rights reserved.
