Recherche

Base de données sémantique Clevi

Lorsqu’une IA est introduite dans des activités professionnelles réelles, l’une des préoccupations majeures est le phénomène de l’oubli catastrophique (Catastrophic Forgetting) qui survient lors de l’affinage des connaissances acquises avec de nouvelles données.

1. Les limites du Catastrophic Forgetting et du RAG

Lorsqu’une IA est introduite dans des activités professionnelles réelles, l’une des préoccupations majeures est le phénomène de l’oubli catastrophique (Catastrophic Forgetting) qui survient lors de l’affinage des connaissances acquises avec de nouvelles données.

Il s’agit d’un phénomène au cours duquel une IA basée sur un réseau neuronal perd rapidement les connaissances ou les schémas appris précédemment lorsqu’elle apprend de nouvelles informations.

Par exemple, si un LLM open source est affiné à l’aide des données d’une entreprise spécifique, ses connaissances générales ou ses capacités linguistiques peuvent se dégrader.

Pour éviter ce problème, la technologie RAG (Retrieval-Augmented Generation) est largement utilisée, mais le RAG présente lui aussi certaines limites.

Image de l’article

Principales limites du RAG

  • Traitement insuffisant des données structurées (Structured Data QA) : les systèmes RAG sont principalement optimisés pour les documents textuels non structurés et ne parviennent pas à comprendre ou à exploiter correctement la signification et les relations des données structurées (tableaux, bases de données, feuilles de calcul, etc.).
  • Limites des PDF complexes/documents non structurés (Complex PDFs) : les documents PDF complexes (incluant des tableaux, plusieurs colonnes, des images, etc.) peuvent subir des pertes d’informations ou des déformations du contexte lors du processus de chunking (segmentation). Par conséquent, des données importantes peuvent ne pas être indexées ou devenir difficiles à rechercher.
  • Absence de modèle Fallback (Fallback Model(s)) : lorsque le système RAG ne trouve pas de réponse appropriée, la logique de basculement vers un modèle de remplacement (de secours) est insuffisante ou inefficace. Ainsi, aucune alternative satisfaisante pour l’utilisateur n’est fournie en cas d’échec de la réponse.
  • Vulnérabilités de sécurité (LLM Security) : les mesures de défense contre les vulnérabilités de sécurité du LLM lui-même (injection de prompt, fuite de données, etc.) sont insuffisantes, ce qui présente un risque d’exposition d’informations sensibles.
  • Manque d’évolutivité (Data Ingestion Scalability) : des problèmes d’évolutivité surviennent lors de l’indexation et du stockage de grands volumes de données. À mesure que le volume de données augmente, la vitesse de chunking, de stockage et de recherche diminue, tandis que la charge du système augmente.
  • Omission d’informations importantes (Missing Content) : il arrive fréquemment que des informations importantes d’un document soient omises lors du processus de chunking ou ne soient pas indexées. L’utilisateur ne peut alors pas rechercher les informations souhaitées.
  • Omission des éléments les mieux classés (Missed Top Ranked) : le chunk réellement le plus pertinent (classé en tête) peut être absent des résultats de recherche. Les causes peuvent inclure les limites de l’algorithme de recherche, la dégradation de la qualité des embeddings ou des erreurs de classement.
  • Incohérence du contexte (Not in Context) : le chunk récupéré ne correspond souvent pas au contexte réel de la question. En raison des limites de la recherche fondée uniquement sur la similarité, la connexion sémantique est insuffisante.
  • Erreur de format (Wrong Format) : le format du chunk récupéré peut être inadapté au traitement par le LLM ou différer du format de réponse souhaité par l’utilisateur. Par exemple, un tableau peut être converti en texte, ce qui entraîne une déformation des informations.
  • Échec de l’extraction des informations (Not Extracted) : les informations nécessaires ne sont pas correctement extraites du chunk ou le LLM ne parvient pas à les reconnaître. Cela se produit fréquemment avec les structures de phrases complexes, les tableaux et les images.
  • Portée/profondeur des informations inadéquate (Incorrect Specificity) : la réponse peut être trop générale par rapport à la question ou, au contraire, excessivement spécifique, et ne pas correspondre aux besoins réels de l’utilisateur. Il est difficile d’ajuster la portée et la profondeur des informations.
  • Réponse incomplète (Incomplete) : la réponse finalement générée peut être incomplète ou ne fournir qu’une partie des informations, ne satisfaisant ainsi pas pleinement les besoins de l’utilisateur. Cela peut être dû à l’incapacité à synthétiser les informations provenant de plusieurs chunks ou au fait que le LLM n’en exploite qu’une partie.

Ainsi, le RAG présente des limites claires en matière de fiabilité, d’évolutivité et de précision dans les applications professionnelles réelles, car il dépend excessivement de la recherche par simple similarité vectorielle et de l’indexation fondée sur des chunks.

2. La base de données sémantique de Clevi, qui surmonte les limites du RAG

Pour surmonter ces limites, Clevi a développé Clevi Semantic Database, une infrastructure de connaissances IA de nouvelle génération optimisée pour la connexion sémantique, le raisonnement complexe et les réponses fondées sur des preuves.

Cette solution est rendue possible par le fait que Clevi possède ses propres modèles de raisonnement, des IA multimodales et des modèles d’IA agentique. Il s’agit de l’une des technologies puissantes propres à Clevi, qui permet à l’IA d’être réellement utile dans le monde réel.

Par analogie, si la base de données contenant les informations est une bibliothèque, on peut considérer que la base de données sémantique de Clevi dispose d’un bibliothécaire exceptionnel. (En lui demandant les informations nécessaires, vous pouvez obtenir une réponse précise et rapide.)

Les utilisateurs peuvent à tout moment ajouter de nouvelles informations à la bibliothèque et récupérer les informations dont ils ont besoin.

Ils peuvent également configurer à leur guise la gestion des versions des données et les droits d’accès.

Toutes les actions du bibliothécaire sont conservées sous forme de journaux (enregistrements), ce qui permet de les corriger même en cas d’erreur.

Image du corps du texte

<Clevi Semantic Database Structure>

Principales caractéristiques et structure technologique

Stockage sémantique des données

  • Stockage dans une base de données graphe des relations sémantiques entre les données (contexte, hiérarchie, causalité, etc.), plutôt que dans une simple base de données vectorielle fondée sur des chunks
  • Facile à étendre et à compléter sous forme de graphe de connaissances ou de réseau sémantique

Recherche et raisonnement hybrides

  • CTA+Context Query : prise en compte conjointe du contexte de la requête (Context) et du CTA
  • Hybrid Retrieval : combinaison de la recherche par similarité vectorielle et de la recherche fondée sur des règles ou des graphes
  • Intelligent Folder Hits : exploration automatique des dossiers et catégories sémantiquement associés

Traitement multimodal simultané

  • Interprétation simultanée de divers types de données, notamment le texte, les images, les tableaux et la voix, avec TextReader Pool, VisionReader Pool, etc.
  • Alors que le RAG traditionnel peut principalement traiter du texte, la base de données sémantique excelle dans le traitement multimodal

Réponses fondées sur des preuves et vérification de la fiabilité

  • Résumés de documents et citations, conclusions de tableaux, etc. — génération automatique de résumés et de sources
  • Fusion et vérification : intégration sémantique des informations provenant de plusieurs sources et vérification de leur fiabilité
  • Pack de preuves : fourniture de réponses fondées sur des éléments probants

Raisonnement complexe et planificateur

  • Planner/DAG : planification étape par étape et raisonnement fondé sur un DAG (graphe orienté acyclique) pour les requêtes complexes

Architecture d’agent intégrée

  • Supervisor cip-5-agent : agent de niveau supérieur qui gère et coordonne l’ensemble du processus de recherche, de raisonnement et d’intégration
Images du corps du texte

3. Résumé et comparaison de la structure

En résumé, la base de données sémantique reçoit des données sous diverses formes (voix, texte, images, vidéos, etc.) et ne se contente pas de les diviser en simples fragments : elle classe les connaissances en reliant également les relations sémantiques entre les données (contexte, hiérarchie, causalité, etc.).

Grâce à cela, elle permet d’effectuer des recherches et des raisonnements fondés sur les connexions sémantiques, plutôt que des recherches basées sur des mots-clés ou la similarité comme avec le RAG, ce qui permet d’obtenir de l’IA des recherches d’informations et des réponses plus précises.

De plus, comme les données sont stockées sous la forme d’un graphe de connaissances ou d’un réseau sémantique, leur extension et leur enrichissement continus sont facilités.

Chez Clevi, nous avons identifié les limites des systèmes RAG à l’ère de la grande transformation de l’IA et, grâce à une base de données sémantique capable de les résoudre ainsi qu’à nos modèles d’IA propriétaires, nous permettons à nos clients d’obtenir rapidement des données plus précises et plus fiables.

Le système d’IA de Clevi peut, dans n’importe quel environnement et quel que soit le domaine, transformer les précieuses données de ses clients en une véritable valeur.

Clevi continuera à tout mettre en œuvre pour maximiser la valeur des données de ses clients et leur offrir une expérience d’IA innovante.

Nous vous invitons à découvrir l’avenir de la nouvelle IA avec Clevi.

Demandes de renseignements et de démonstration : [email protected]

Copyright© 2025 Clevi Inc. Tous droits réservés.

Retour à la salle de presse
CLEVI

Langue et région

Les langues traduites automatiquement sont signalées. La disponibilité suit le module publié du site.

136 langues

Recommandé

1

Asie de l’Est

7

Asie du Sud-Est

11

Asie du Sud

18

Asie centrale

5

Moyen-Orient et Caucase

10

Europe de l’Ouest et Europe du Sud

16

Royaume-Uni et Irlande

4

Europe du Nord

10

Europe centrale et Balkans

14

Europe de l’Est

5

Afrique orientale

8

Afrique occidentale et Afrique centrale

9

Afrique australe

8

Amériques

5

Océanie

5
Base de données sémantique Clevi — CLEVI