Recèrca

Clevi, basa de donadas semantica

Quand l’IA es integrada dins lo trabalh real, una de las preocupacions màgers es lo fenomèn de l’oblit catastrofic (Catastrophic Forgetting) que se produtz al moment d’afinar un coneissença anteriorament apresa amb de donadas novèlas.

1. Las limitas de Catastrophic Forgetting e de RAG

Quand l’IA es integrada dins lo trabalh real, una de las preocupacions màgers es lo fenomèn de l’oblit catastrofic (Catastrophic Forgetting) que se produtz al moment d’afinar un coneissença anteriorament apresa amb de donadas novèlas.

Es un fenomèn que se produtz quand una IA basada sus una ret neuronal apren d’informacions novèlas e pèrd rapidament las coneissenças o los modèls qu’aviá aprés anteriorament.

Per exemple, se fasètz una afinacion d’un LLM de còdi font dobèrt amb las donadas d’una empresa especifica, las coneissenças comunas generalas o las capacitats lingüisticas pòdon se degradar.

Per evitar aqueste problèma, la tecnologia RAG(Retrieval-Augmented Generation) es largament utilizada, mas RAG tanben presenta de limitas.

Imatge del tèxte principal

Limitas representativas de RAG

  • Tractament insufisant de las donadas estructuradas (Structured Data QA): los sistèmas RAG son principalament optimizats per als documents de tèxtes non estructurats e pòdon pas comprene ni utilizar corrèctament lo sens e las relacions de las donadas estructuradas (tablèus, basas de donadas, fuèlhas de calcul, etc.).
  • Limitacions dels PDF complèxes e dels documents non estructurats (Complex PDFs): los documents PDF complèxes (que contenon de tablèus, mai d’una colomna, d’imatges, etc.) pòdon pèrdre d’informacions o deformar lo contèxte pendent lo processus de chunking (division). Per aquò, de donadas importantas pòdon pas èsser indexadas o pòdon èsser dificilas de recuperar.
  • Abséncia de modèl Fallback (Fallback Model(s)): quand lo sistèma RAG tròba pas una responsa apropriada, la logica de basculament cap a un modèl de substitucion (sauvagarda) es insufisenta o ineficaça. Per aquò, cap d’alternativa satisfasenta es pas prepausada a l’utilizaire en cas d’escac de la responsa.
  • Vulnerabilitats de seguretat (LLM Security): la proteccion contra las vulnerabilitats de seguretat del LLM el meteis (injeccion de prompts, fugida de donadas, etc.) es insufisanta, çò que crea un risc d’exposicion d’informacions sensiblas.
  • Mancança d’escalabilitat (Data Ingestion Scalability): de problèmas d’escalabilitat apareisson pendent l’indexacion e l’emmagazinatge de grandas quantitats de donadas. A mesura que lo volum de donadas aumenta, la velocitat de chunking, d’emmagazinatge e de recèrca demesís, e la carga del sistèma aumenta.
  • Omission d’informacions importantas (Missing Content): de contenguts importants dels documents son sovent omeses pendent lo processus de chunking o son pas indexats. Per aquò, l’utilizaire pòt pas trobar l’informacion volguda.
  • Omission del classament superior (Missed Top Ranked): lo chunk mai pertinent en realitat (classat al nivèl superior) pòt èsser omés dels resultats de la recèrca. Las causas ne pòdon èsser las limitacions de l’algoritme de recèrca, la degradacion de la qualitat dels embeddings o d’errors de classament.
  • Incoeréncia de contèxte (Not in Context): lo chunk recuperat correspond sovent pas al contèxte real de la question. Es una limitacion de la recèrca basada simplament sus la similitud, amb una connectivitat semantica insufisanta.
  • Format incorrècte (Wrong Format): lo format del chunk recuperat pòt èsser inapropriat per lo tractament pel LLM o diferir del format de responsa volgut per l’utilizaire. Per exemple, un tablèu pòt èsser convertit en tèxte, çò que desforma l’informacion.
  • Fracàs de l’extraccion d’informacions (Not Extracted): l’informacion necessària es pas corrèctament extracha del chunk o lo LLM la reconeis pas. Aquò se produtz sovent amb d’estructuras de frasas complèxas, de tablèus, d’imatges, etc.
  • Especificitat inapropriada de la portada e de la prigondor de l’informacion (Incorrect Specificity): la responsa pòt èsser tròp generala per la question o, al contrari, tròp precisa, e doncas correspondre pas a las besonhs reals de l’utilizaire. Es dificil d’ajustar la portada e la prigondor de l’informacion.
  • Responsa incompleta (Incomplete): la responsa finalament generada pòt èsser incompleta o fornir pas que d’informacions parcialas, e satisfar pas pro las demandas de l’utilizaire. Las causas ne pòdon èsser l’incapacitat de combinar las informacions de mantun chunk o lo fach que lo LLM n’utiliza pas qu’una partida.

Atal coma aquò, RAG depend tròp de la recèrca basada simplament sus la similitud vectoriala e de l’indexacion per chunks, çò que revela de limitas claras en matèria de fisabilitat, d’escalabilitat e de precision dins los trabalhs reals.

2. La basa de donadas semantica de CLEVI, que venç las limitas de RAG

Per superar aquelas limitas, CLEVI a desvolopat Clevi Semantic Database, una infrastructura de coneissenças IA de generacion novèla optimizada per las connexions semanticas, lo rasonament complèxe e las responsas basadas sus de justificacions.

Es una solucion renduda possibla pel fach que possedís sos pròpris modèls de rasonament, d’IA multimodala e de modèls d’IA agentiva. Es tanben una de las tecnologias poderosas pròprias de CLEVI, que permeton a l’IA d’èsser vertadièrament utila dins la realitat.

Per far una comparason, se la basa de donadas qu’emmagazina l’informacion es una bibliotèca, podètz considerar que la basa de donadas semantica de CLEVI dispausa d’un bibliotecari fòrça competent. (Se demandatz al bibliotecari l’informacion que vos cal, obtendretz una responsa precisa e rapida.)

Los utilizaires pòdon a tot moment apondre d’informacions novèlas a la bibliotèca e recuperar las informacions necessàrias.

Pòdon tanben configurar coma o desiran la gestion de las versions de las donadas e los dreches d’accès.

Totas las accions del bibliotecari son conservadas dins de jornals (enregistraments), çò que permet de las corregir quitament en cas d’error.

Imatge del tèxte principal

<Clevi Semantic Database Structure>

Caracteristicas principalas e estructura tecnologica

Emmagazinatge semantic de las donadas

  • Emmagazinatge dins una basa de donadas de graf de las relacions semanticas entre las donadas (contèxte, ierarquia, causalitat, etc.), e non pas dins una simpla basa de donadas vectoriala basada sus de chunks
  • Facilitat d’extension e d’enriquiment jos la forma d’un graf de coneissenças o d’una ret semantica

Recèrca e rasonament ibrids

  • CTA+Context Query: pren en compte ensems lo contèxte (Context) de la requèsta e lo CTA
  • Hybrid Retrieval: combinason de la recèrca basada sus la similitud vectoriala e de la recèrca basada sus de règlas o de graf
  • Intelligent Folder Hits: exploracion automatica dels dorsièrs e de las categorias semanticament ligats

Tractament simultanèu multimodal

  • Interpretacion simultanèa de divèrses tipes de donadas, coma lo tèxte, las imatges, los tablèus e la votz, amb de pooles coma TextReader Pool e VisionReader Pool
  • Alara que RAG tradicional pòt principalament tractar lo tèxte, la basa de donadas semantica excellís dins lo tractament multimodal

Responsas basadas sus de justificacions e verificacion de la fisabilitat

  • Resums de documents e citacions, descobèrta de resultats dins de taulas e autra generacion automatica de resums e fonts
  • Fusionar e verificar : integracion semantica d’informacions de mantuna font e verificacion de la fisabilitat
  • Paquet de pròvas : proves de responsas fondadas sus d’elements justificatius

Rasonament complex e planificador

  • Planner/DAG : planificacion per etapas e rasonament basat sus un DAG (Directed Acyclic Graph) per de requèstas complèxas

Arquitectura d’agent integrada

  • cip-5-agent Supervisor : agent de mai naut nivèl que gerís e coordona tot lo procès de recèrca, de rasonament e d’integracion
Imatge del còs del tèxte

3. Resumit e comparason de l’estructura

En resum, Semantic DB recep de donadas de formas divèrsas (votz, tèxte, imatges, vidèos, etc.) e classifica las coneissenças en religant non pas solament de Chunk, mas tanben las relacions semanticas entre las donadas (contèxt, ierarquia, causalitat, etc.).

Sus aquesta basa, permet d’efectuar de recèrcas e de rasonaments en utilizant de ligams semantics, e non pas de recèrcas fondadas sus de mots-claus o sus la similitud coma RAG, çò que permet d’obténer de l’IA d’informacions e de responsas mai precisas.

En mai, coma las coneissenças son enregistradas jos la forma de grafes de coneissenças o de malhums semantics, lor extension e lor complementacion continus son aisits.

Clevi a identificat las limits dels sistèmas RAG a l’epòca de la granda transformacion per l’IA e, mercé a una banca de donadas semantica e a de modèls d’IA proprietaris capables de resòlvre aqueles problèmas, permet ara a sos clients d’obténer rapidament de donadas mai precisas e mai fisablas.

Lo sistèma d’IA de Clevi pòt donar de valor a las donadas precioses de sos clients dins quin environament que siá, independentament del domeni concernit.

Clevi contunharà de far tot son possible per maximizar la valor de las donadas de sos clients e lor ofrir d’experiéncias d’IA innovantas.

Vos convidam a descobrir lo futur novèl de l’IA amb Clevi.

Contacte e demanda de demostracion : [email protected]

Copyright© 2025 Clevi Inc. Totes los dreches reservats.

Tornar a la sala de premsa
CLEVI

Lenga e region

Las lengas tradusidas automaticament son marcadas. La disponibilitat seguís lo paquet del site publicat.

136 lengas

Recomandat

1

Asia Orientala

7

Asia del Sud-Èst

11

Asia del Sud

18

Asia Centrala

5

Orient Mejan e Caucàs

10

Euròpa Occidentala e Meridionala

16

Bretanha e Irlanda

4

Euròpa del Nòrd e Baltic

10

Euròpa Centrala e Balcans

14

Euròpa Orientala

5

Àfrica Orientala e la Bana

8

Àfrica Occidentala e Centrala

9

Àfrica Australa

8

Las Americas

5

Lo Pacific

5