Recerca

Clevi Semantic Database

Quan la IA s’introdueix en les tasques reals, una de les preocupacions més importants és el fenomen de l’oblit catastròfic (Catastrophic Forgetting) que es produeix quan s’ajusta el coneixement après prèviament amb dades noves.

1. Els límits de l’oblit catastròfic (Catastrophic Forgetting) i del RAG

Quan la IA s’introdueix en les tasques reals, una de les preocupacions més importants és el fenomen de l’oblit catastròfic (Catastrophic Forgetting) que es produeix quan s’ajusta el coneixement après prèviament amb dades noves.

És el fenomen pel qual una IA basada en xarxes neuronals perd ràpidament els coneixements o patrons apresos anteriorment durant el procés d’aprenentatge d’informació nova.

Per exemple, si s’ajusta un LLM de codi obert amb dades específiques d’una empresa, es poden veure afectats el coneixement general o les capacitats lingüístiques.

Per evitar aquest problema, la tecnologia RAG(Retrieval-Augmented Generation) s’utilitza àmpliament, però el RAG també té limitacions.

Imatge del text

Principals limitacions del RAG

  • Processament insuficient de dades estructurades (Structured Data QA): els sistemes RAG estan optimitzats principalment per a documents de text no estructurat, de manera que no poden comprendre ni utilitzar adequadament el significat i les relacions de les dades estructurades (taules, bases de dades, fulls de càlcul, etc.).
  • Limitacions amb PDF complexos/documents no estructurats (Complex PDFs): els documents PDF complexos (que inclouen taules, diverses columnes, imatges, etc.) poden patir pèrdues d’informació o distorsions del context durant el procés de chunking (segmentació). Com a conseqüència, dades importants poden no indexar-se o ser difícils de recuperar.
  • Absència d’un model de reserva (Fallback Model(s)): quan el sistema RAG no troba una resposta adequada, la lògica per canviar a un model alternatiu (de reserva) pot ser insuficient o ineficient. Com a conseqüència, quan falla la resposta, no s’ofereix una alternativa satisfactòria a l’usuari.
  • Vulnerabilitats de seguretat (LLM Security): la protecció contra les vulnerabilitats de seguretat del mateix LLM (injecció de prompts, filtració de dades, etc.) és insuficient, cosa que comporta el risc d’exposar informació sensible.
  • Manca d’escalabilitat (Data Ingestion Scalability): es produeixen problemes d’escalabilitat durant la indexació i l’emmagatzematge de grans volums de dades. A mesura que augmenta la quantitat de dades, disminueixen la velocitat de chunking, d’emmagatzematge i de cerca, i augmenta la càrrega del sistema.
  • Omissió d’informació important (Missing Content): sovint es perd informació important dels documents durant el procés de chunking o aquesta no s’indexa. Com a conseqüència, l’usuari no pot cercar la informació que necessita.
  • Omissió dels resultats més ben classificats (Missed Top Ranked): el chunk que realment és més rellevant (el més ben classificat) pot quedar omès dels resultats de cerca. Les causes poden ser les limitacions de l’algoritme de cerca, una qualitat deficient dels embeddings, errors de classificació, etc.
  • Manca de coherència amb el context (Not in Context): sovint el chunk recuperat no coincideix amb el context real de la pregunta. A causa de les limitacions de la cerca basada simplement en la similitud, manca connexió semàntica.
  • Format incorrecte (Wrong Format): el format del chunk recuperat pot ser inadequat perquè el LLM el processi o pot diferir del format de resposta que vol l’usuari. Per exemple, una taula pot convertir-se en text i distorsionar la informació.
  • Fracàs en l’extracció de la informació (Not Extracted): la informació necessària no s’extreu correctament del chunk o el LLM no la pot reconèixer. Això passa sovint amb estructures de frases complexes, taules, imatges, etc.
  • Abast/profunditat de la informació inadequats (Incorrect Specificity): la resposta pot ser massa general per a la pregunta o, al contrari, excessivament específica, i per tant no ajustar-se a les necessitats reals de l’usuari. És difícil regular l’abast i la profunditat de la informació.
  • Resposta incompleta (Incomplete): la resposta generada finalment pot ser incompleta o proporcionar només una part de la informació, de manera que no satisfà prou les necessitats de l’usuari. Les causes poden ser la incapacitat de combinar la informació de diversos chunks o que el LLM només n’utilitzi una part.

Així, com que RAG depèn excessivament de la cerca per similitud vectorial simple i de la indexació basada en chunks, les seves limitacions en termes de fiabilitat, escalabilitat i precisió són evidents en l’àmbit laboral real.

2. La base de dades semàntica de Clevi, que supera les limitacions de RAG

Per superar aquestes limitacions, Clevi ha desenvolupat una infraestructura de coneixement d’IA de nova generació, optimitzada per a la connexió semàntica, el raonament complex i les respostes basades en evidències: Clevi Semantic Database.

És una solució possible perquè disposa dels seus propis models de Reasoning, models d’IA multimodal i models d’IA basats en agents, i és una de les potents tecnologies exclusives de Clevi que fan possible que la IA sigui realment útil en el món real.

Per fer una analogia, si considerem que la base de dades on s’emmagatzema la informació és una biblioteca, la base de dades semàntica de Clevi es pot entendre com una biblioteca amb un bibliotecari excel·lent. (Si demaneu al bibliotecari la informació que necessiteu, rebreu una resposta precisa i ràpida.)

Els usuaris poden afegir informació nova a la biblioteca i recuperar la informació que necessitin en qualsevol moment.

També poden configurar com vulguin la gestió de versions de les dades i els permisos d’accés.

Com que totes les accions del bibliotecari queden registrades als registres (logs), es poden corregir encara que es produeixi un error.

Imatge del cos del text

<Clevi Semantic Database Structure>

Característiques principals i estructura tecnològica

Emmagatzematge semàntic de dades

  • Emmagatzema a una base de dades de grafs les relacions semàntiques entre les dades (context, jerarquia, causalitat, etc.), en lloc de fer-ho en una base de dades vectorial de chunks simples
  • Fàcil d’ampliar i complementar en forma de graf de coneixement o xarxa semàntica

Cerca i inferència híbrides

  • CTA+Context Query: reflecteix conjuntament el context (Context) de la consulta i el CTA
  • Hybrid Retrieval: combina la cerca per similitud vectorial amb la cerca basada en regles i grafs
  • Intelligent Folder Hits: explora automàticament carpetes i categories relacionades semànticament

Processament multimodal simultani

  • Interpreta simultàniament diversos tipus de dades, com ara text, imatges, taules i àudio, mitjançant TextReader Pool, VisionReader Pool, etc.
  • Mentre que el RAG tradicional pot processar principalment només text, la base de dades semàntica destaca per la seva capacitat de processament multimodal

Respostes basades en evidències i verificació de la fiabilitat

  • Resums i cites de documents, conclusions de taules i generació automàtica de fonts
  • Merge & Verify: integració semàntica de la informació de diverses fonts i verificació de la fiabilitat
  • Evidence Pack:提供 de paquets de respostes basades en evidències

Raonament complex i planificador

  • Planner/DAG: planificació pas a pas i raonament basat en DAG (Directed Acyclic Graph) per a consultes complexes

Arquitectura d’agents integrats

  • Supervisor cip-5-agent: agent de nivell superior que gestiona i coordina tot el procés de cerca, raonament i integració
Imatge del cos del text

3. Resum i comparació de l’estructura

En resum, la Semantic DB rep dades de diverses formes (veu, text, imatges, vídeos, etc.) i classifica el coneixement connectant no només fragments simples, sinó també les relacions semàntiques entre les dades (context, jerarquia, causalitat, etc.).

A partir d’això, com que permet fer cerques i raonaments utilitzant connexions semàntiques en lloc de cerques basades en paraules clau o similitud, com en el cas de RAG, es poden obtenir de la IA cerques d’informació i respostes més precises.

A més, com que s’emmagatzema en forma de graf de coneixement o xarxa semàntica, és fàcil ampliar-lo i complementar-lo contínuament.

A Clevi, en l’era de la gran transformació de la IA, hem descobert les limitacions dels sistemes RAG i, mitjançant una base de dades semàntica i un model d’IA propi capaços de resoldre-les, podem oferir als nostres clients dades més precises i fiables amb més rapidesa.

El sistema d’IA de Clevi pot convertir les dades valuoses dels nostres clients en valor, independentment del domini i en qualsevol entorn.

Clevi continuarà treballant amb determinació per maximitzar el valor de les dades dels nostres clients i oferir experiències d’IA innovadores.

Us convidem a experimentar el futur de la nova IA amb Clevi.

Consultes i sol·licituds de demostració: [email protected]

Copyright© 2025 Clevi Inc. Tots els drets reservats.

Torna a la sala de premsa
CLEVI

Llengua i regió

Les llengües traduïdes automàticament estan marcades. La disponibilitat segueix el paquet del lloc publicat.

136 llengües

Recomanat

1

Àsia oriental

7

Àsia sud-oriental

11

Àsia meridional

18

Àsia central

5

Orient Mitjà i el Caucas

10

Europa occidental i Europa meridional

16

Regne Unit i Irlanda

4

Europa septentrional

10

Europa Central i els Balcans

14

Europa oriental

5

Àfrica oriental

8

Àfrica occidental i Àfrica central

9

Àfrica meridional

8

Amèrica

5

Oceania

5