Recherche

Base de données sémantique de Clevi

Lorsque l’IA est adoptée dans les opérations réelles, l’une des principales préoccupations est le phénomène de l’oubli catastrophique (Catastrophic Forgetting) qui survient lors de l’affinage des connaissances acquises avec de nouvelles données.

1. Les limites de Catastrophic Forgetting et de RAG

Lorsque l’IA est adoptée dans les opérations réelles, l’une des principales préoccupations est le phénomène d’oubli catastrophique (Catastrophic Forgetting) qui survient lors de l’affinage des connaissances acquises avec de nouvelles données.

Il s’agit d’un phénomène au cours duquel l’IA fondée sur un réseau neuronal perd rapidement les connaissances ou les schémas appris précédemment en assimilant de nouvelles informations.

Par exemple, l’affinage d’un LLM open source avec les données d’une entreprise donnée peut entraîner une diminution des connaissances générales ou des capacités linguistiques.

Pour éviter ce problème, la technologie RAG(Retrieval-Augmented Generation) est largement utilisée, mais RAG présente également certaines limites.

Image du corps du texte

Principales limites de RAG

  • Traitement inadéquat des données structurées (Structured Data QA) : les systèmes RAG sont principalement optimisés pour les documents textuels non structurés et ne parviennent pas à comprendre ou à exploiter correctement le sens et les relations des données structurées (tableaux, bases de données, feuilles de calcul, etc.).
  • Limites des PDF complexes et des documents non structurés (Complex PDFs) : les documents PDF complexes (comprenant des tableaux, plusieurs colonnes, des images, etc.) peuvent entraîner une perte d’information ou une déformation du contexte lors du processus de chunking (segmentation). Par conséquent, des données importantes peuvent ne pas être indexées ou devenir difficiles à rechercher.
  • Absence de modèle Fallback (Fallback Model(s)) : lorsque le système RAG ne trouve pas de réponse appropriée, la logique de basculement vers un modèle de remplacement (de secours) est insuffisante ou inefficace. Ainsi, lorsqu’une réponse échoue, aucune solution de rechange satisfaisante n’est proposée à l’utilisateur.
  • Vulnérabilités de sécurité (LLM Security) : les mesures de protection contre les vulnérabilités de sécurité propres aux LLM (injection de prompt, fuite de données, etc.) sont insuffisantes, ce qui présente un risque d’exposition d’informations sensibles.
  • Évolutivité insuffisante (Data Ingestion Scalability) : des problèmes d’évolutivité surviennent lors de l’indexation et du stockage de volumes importants de données. À mesure que le volume de données augmente, les vitesses de chunking, de stockage et de recherche diminuent, tandis que la charge du système augmente.
  • Omission d’informations importantes (Missing Content) : le contenu important des documents est souvent omis pendant le processus de chunking ou n’est pas indexé. L’utilisateur ne peut alors pas rechercher les informations souhaitées.
  • Omission des éléments les mieux classés (Missed Top Ranked) : le chunk réellement le plus pertinent (le mieux classé) peut être omis des résultats de recherche. Les causes comprennent les limites de l’algorithme de recherche, la baisse de la qualité des embeddings et les erreurs de classement.
  • Incohérence du contexte (Not in Context) : le chunk trouvé ne correspond souvent pas au contexte réel de la question. Cette situation découle des limites de la recherche fondée uniquement sur la similarité, qui manque de liens sémantiques.
  • Erreur de format (Wrong Format) : le format du chunk trouvé peut être inadéquat pour le traitement par le LLM ou différer du format de réponse souhaité par l’utilisateur. Par exemple, un tableau peut être converti en texte, ce qui déforme l’information.
  • Échec de l’extraction d’informations (Not Extracted) : les informations nécessaires ne sont pas correctement extraites du chunk, ou le LLM ne parvient pas à les reconnaître. Ce problème survient fréquemment avec les structures de phrases complexes, les tableaux, les images, etc.
  • Portée ou niveau de détail inadéquat (Incorrect Specificity) : la réponse peut être trop générale par rapport à la question ou, au contraire, trop précise, et ne pas correspondre aux besoins réels de l’utilisateur. Il est difficile d’ajuster la portée et le niveau de détail de l’information.
  • Réponse incomplète (Incomplete) : la réponse générée au final peut être incomplète ou ne fournir qu’une partie des informations, ne répondant ainsi pas entièrement aux besoins de l’utilisateur. Les causes comprennent l’incapacité à synthétiser les informations provenant de plusieurs chunks ou le fait que le LLM n’en utilise qu’une partie.

Ainsi, puisque le RAG dépend excessivement de la recherche fondée uniquement sur la similarité vectorielle et de l’indexation par chunks, ses limites en matière de fiabilité, d’évolutivité et de précision sont évidentes dans les activités professionnelles réelles.

2. La base de données sémantique de CLEVI, qui surmonte les limites du RAG

Pour surmonter ces limites, CLEVI a développé une infrastructure de connaissances IA de nouvelle génération optimisée pour les connexions sémantiques, le raisonnement complexe et les réponses fondées sur des preuves : Clevi Semantic Database.

Cette solution est rendue possible par le fait que CLEVI possède ses propres modèles de raisonnement, des modèles d’IA multimodale et des modèles d’IA agentique. Il s’agit de l’une des technologies puissantes qui lui sont propres et qui permettent à l’IA d’être réellement utile dans le monde réel.

Par analogie, si la base de données où sont stockées les informations est une bibliothèque, imaginez que la base de données sémantique de CLEVI dispose d’un bibliothécaire exceptionnel. (Lorsque vous demandez les informations nécessaires au bibliothécaire, vous obtenez une réponse précise et rapide.)

Les utilisateurs peuvent à tout moment ajouter de nouvelles informations à la bibliothèque et récupérer les informations dont ils ont besoin.

Ils peuvent également configurer à leur convenance la gestion des versions des données et les autorisations d’accès.

Toutes les actions du bibliothécaire sont conservées dans des journaux (registres), ce qui permet d’apporter des corrections même en cas d’erreur.

Image du contenu

<Clevi Semantic Database Structure>

Principales caractéristiques et structure technique

Stockage sémantique des données

  • Stockage dans une base de données graphique des relations sémantiques entre les données (contexte, hiérarchie, causalité, etc.), plutôt que dans une simple base de données vectorielle fondée sur des chunks
  • Facile à étendre et à enrichir sous forme de graphe de connaissances ou de réseau sémantique

Recherche et raisonnement hybrides

  • CTA+Context Query : prise en compte simultanée du contexte (Context) de la requête et du CTA
  • Hybrid Retrieval : combinaison de la similarité vectorielle et de la recherche fondée sur des règles ou des graphes
  • Intelligent Folder Hits : exploration automatique des dossiers et catégories sémantiquement associés

Traitement multimodal simultané

  • Interprétation simultanée de divers types de données, notamment le texte, les images, les tableaux et la voix, avec TextReader Pool, VisionReader Pool, etc.
  • Alors que le RAG traditionnel peut principalement traiter du texte, la base de données sémantique se distingue par ses capacités de traitement multimodal

Réponses fondées sur des preuves et vérification de la fiabilité

  • Résumés et citations de documents, résultats de tableaux, etc. — génération automatique de résumés et de sources
  • Merge & Verify : intégration sémantique de l’information provenant de plusieurs sources et vérification de sa fiabilité
  • Evidence Pack : fourniture de réponses fondées sur des éléments probants

Raisonnement complexe et planificateur

  • Planner/DAG : planification étape par étape et raisonnement fondé sur un DAG (graphe orienté acyclique) pour les requêtes complexes

Architecture d’agent intégré

  • Superviseur cip-5-agent : agent de plus haut niveau qui gère et coordonne l’ensemble du processus de recherche, de raisonnement et d’intégration
Images du corps du texte

3. Résumé et comparaison de la structure

En résumé, la base de données sémantique reçoit des données sous diverses formes (voix, texte, images, vidéos, etc.) et classe les connaissances en reliant non seulement des segments simples, mais aussi les relations sémantiques entre les données (contexte, hiérarchie, causalité, etc.).

Ainsi, contrairement à une recherche fondée sur des mots-clés ou la similarité comme dans le RAG, elle permet d’effectuer des recherches et des raisonnements fondés sur des connexions sémantiques, ce qui permet d’obtenir de l’IA des recherches d’information et des réponses plus précises.

De plus, comme les connaissances sont stockées sous forme de graphe de connaissances ou de réseau sémantique, leur expansion et leur enrichissement continus sont facilités.

Chez CLEVI, nous avons découvert les limites des systèmes RAG à l’ère de la grande transformation de l’IA. Grâce à une base de données sémantique et à nos propres modèles d’IA capables de résoudre ces problèmes, nous pouvons désormais fournir rapidement à nos clients des données plus précises et plus fiables.

Le système d’IA de CLEVI peut valoriser les données précieuses de ses clients dans n’importe quel environnement, quels que soient les domaines concernés.

À l’avenir, CLEVI continuera de faire tout son possible pour maximiser la valeur des données de ses clients et offrir des expériences d’IA innovantes.

Nous vous invitons à découvrir l’avenir de l’IA avec CLEVI.

Demandes d’information et de démonstration : [email protected]

Copyright© 2025 Clevi Inc. Tous droits réservés.

Retour à la salle de presse
CLEVI

Langue et région

Les langues traduites automatiquement sont indiquées. La disponibilité suit la version publiée du site.

136 langues

Recommandé

1

Asie orientale

7

Asie du Sud-Est

11

Asie du Sud

18

Asie centrale

5

Moyen-Orient et Caucase

10

Europe occidentale et Europe méridionale

16

Royaume-Uni et Irlande

4

Europe septentrionale

10

Europe centrale et Balkans

14

Europe orientale

5

Afrique orientale

8

Afrique occidentale et Afrique centrale

9

Afrique australe

8

Amériques

5

Océanie

5
Base de données sémantique de Clevi — CLEVI