Investigación

Base de datos semántica de Clevi

Cuando la IA se implementa en el trabajo real, una de las mayores preocupaciones es el fenómeno del olvido catastrófico (Catastrophic Forgetting) que ocurre al ajustar con nuevos datos los conocimientos aprendidos previamente.

1. Las limitaciones de Catastrophic Forgetting y RAG

Cuando la IA se implementa en el trabajo real, una de las mayores preocupaciones es el fenómeno del olvido catastrófico (Catastrophic Forgetting) que ocurre al ajustar con nuevos datos los conocimientos aprendidos previamente.

Este es un fenómeno en el que la IA basada en redes neuronales pierde rápidamente los conocimientos o patrones aprendidos anteriormente mientras aprende información nueva.

Por ejemplo, si se ajusta un LLM de código abierto con datos específicos de una empresa, pueden deteriorarse los conocimientos generales o las capacidades lingüísticas.

Para evitar este problema, la tecnología RAG (Retrieval-Augmented Generation) se utiliza ampliamente, pero RAG también tiene limitaciones.

Imagen del cuerpo del texto

Principales limitaciones de RAG

  • Procesamiento insuficiente de datos estructurados (Structured Data QA): Los sistemas RAG están optimizados principalmente para documentos de texto no estructurado, por lo que no logran comprender ni utilizar adecuadamente el significado y las relaciones de los datos estructurados (tablas, bases de datos, hojas de cálculo, etc.).
  • Limitaciones con PDF complejos y documentos no estructurados (Complex PDFs): En documentos PDF complejos (que incluyen tablas, varias columnas, imágenes, etc.), puede perderse información o distorsionarse el contexto durante el proceso de chunking (segmentación). Como resultado, datos importantes pueden no indexarse o ser difíciles de buscar.
  • Ausencia de un modelo Fallback (Fallback Model(s)): Cuando el sistema RAG no encuentra una respuesta adecuada, la lógica para cambiar a un modelo alternativo (de respaldo) puede ser insuficiente o ineficiente. Como resultado, cuando falla la respuesta, no se ofrece al usuario una alternativa satisfactoria.
  • Vulnerabilidades de seguridad (LLM Security): La protección contra las vulnerabilidades de seguridad del propio LLM (inyección de prompts, filtración de datos, etc.) es insuficiente, lo que genera el riesgo de exposición de información confidencial.
  • Escalabilidad insuficiente (Data Ingestion Scalability): Se presentan problemas de escalabilidad durante la indexación y el almacenamiento de grandes volúmenes de datos. A medida que aumenta la cantidad de datos, disminuye la velocidad de chunking, almacenamiento y búsqueda, y aumenta la carga del sistema.
  • Omisión de información importante (Missing Content): Con frecuencia, el contenido importante de los documentos se omite durante el proceso de chunking o no se indexa. Como resultado, los usuarios no pueden buscar la información que necesitan.
  • Omisión de los resultados mejor posicionados (Missed Top Ranked): En los resultados de búsqueda puede omitirse el chunk (resultado mejor posicionado) que en realidad es más relevante. Las causas incluyen las limitaciones de los algoritmos de búsqueda, la baja calidad de los embeddings y errores de clasificación.
  • Fuera de contexto (Not in Context): Con frecuencia, el chunk recuperado no coincide con el contexto real de la pregunta. Esto se debe a las limitaciones de la búsqueda basada únicamente en similitud, que carece de conexión semántica suficiente.
  • Formato incorrecto (Wrong Format): El formato del chunk recuperado puede no ser adecuado para que el LLM lo procese o puede diferir del formato de respuesta que desea el usuario. Por ejemplo, una tabla puede convertirse en texto y distorsionar la información.
  • Falla en la extracción de información (Not Extracted): La información necesaria no se extrae correctamente del chunk o el LLM no logra reconocerla. Esto ocurre con frecuencia en estructuras de oración complejas, tablas, imágenes, etc.
  • Especificidad incorrecta (Incorrect Specificity): La respuesta puede ser demasiado general para la pregunta o, por el contrario, excesivamente específica, por lo que no coincide con las necesidades reales del usuario. Es difícil ajustar el alcance y la profundidad de la información.
  • Respuesta incompleta (Incomplete): La respuesta generada finalmente puede estar incompleta o proporcionar solo parte de la información, por lo que no satisface plenamente las necesidades del usuario. Las causas incluyen no lograr combinar información de varios chunks o que el LLM utilice solo una parte de ella.

De este modo, debido a que RAG depende excesivamente de la búsqueda basada únicamente en la similitud vectorial y la indexación basada en chunks, sus limitaciones en términos de confiabilidad, escalabilidad y precisión son claras en las operaciones reales.

2. La base de datos semántica de CLEVI, que supera las limitaciones de RAG

Para superar estas limitaciones, CLEVI desarrolló la infraestructura de conocimiento de IA de próxima generación, optimizada para la conexión semántica, el razonamiento complejo y las respuestas basadas en evidencia: Clevi Semantic Database.

Es una solución posible gracias a que cuenta con modelos propios de Reasoning, IA multimodal y modelos de IA agéntica, y constituye una de las potentes tecnologías exclusivas de CLEVI que hacen posible que la IA sea realmente útil en el mundo real.

A modo de analogía, si consideramos una biblioteca la base de datos donde se almacena la información, la base de datos semántica de CLEVI puede entenderse como una biblioteca con un bibliotecario excepcional. (Si solicitas al bibliotecario la información que necesitas, recibirás una respuesta precisa y rápida).

Los usuarios pueden agregar nueva información a la biblioteca y consultar la información que necesitan en cualquier momento.

Además, pueden configurar como deseen la gestión de versiones de los datos y los permisos de acceso.

Todas las acciones del bibliotecario quedan registradas en logs (registros), por lo que pueden corregirse incluso si ocurre un error.

Imagen del cuerpo principal

<Clevi Semantic Database Structure>

Características principales y estructura tecnológica

Almacenamiento semántico de datos

  • Almacena en una base de datos de grafos las relaciones semánticas entre los datos (contexto, jerarquía, causalidad, etc.), en lugar de utilizar una base de datos vectorial simple basada en chunks
  • Fácil de ampliar y complementar en forma de grafo de conocimiento/red semántica

Búsqueda e inferencia híbridas

  • CTA+Context Query: refleja conjuntamente el contexto (Context) de la consulta y la CTA
  • Hybrid Retrieval: combina la similitud vectorial con la búsqueda basada en reglas/grafos
  • Intelligent Folder Hits: explora automáticamente carpetas/categorías relacionadas semánticamente

Procesamiento multimodal simultáneo

  • Interpreta simultáneamente diversos tipos de datos, como texto, imágenes, tablas y voz, mediante TextReader Pool, VisionReader Pool, etc.
  • Mientras que el RAG tradicional puede procesar principalmente texto, la base de datos semántica destaca por su capacidad de procesamiento multimodal

Respuestas basadas en evidencia y verificación de confiabilidad

  • Generación automática de resúmenes y citas de documentos, hallazgos en tablas, etc.
  • Merge & Verify: integración semántica de información de varias fuentes y verificación de confiabilidad
  • Evidence Pack: entrega de paquetes de respuestas basadas en evidencia

Razonamiento compuesto y planificador

  • Planner/DAG: planificación paso a paso y razonamiento basado en DAG (Directed Acyclic Graph) para consultas complejas

Arquitectura de agente integrado

  • cip-5-agent Supervisor: agente de nivel superior que administra y coordina todo el proceso de búsqueda, razonamiento e integración
Imagen del cuerpo del texto

3. Resumen y comparación de la estructura

En resumen, Semantic DB recibe datos de diversos formatos (voz, texto, imágenes, video, etc.) y clasifica el conocimiento conectando no solo fragmentos simples, sino también las relaciones semánticas entre los datos (contexto, jerarquía, causalidad, etc.).

Con base en esto, en lugar de realizar búsquedas basadas en palabras clave o similitud como RAG, permite realizar búsquedas y razonamiento aprovechando las conexiones semánticas, por lo que es posible obtener de la IA información y respuestas más precisas.

Además, como se almacena en forma de grafo de conocimiento o red semántica, es fácil expandirlo y complementarlo continuamente.

En la era de la gran transformación de la IA, en CLEVI identificamos las limitaciones de los sistemas RAG y, mediante una base de datos semántica y modelos de IA propios capaces de resolverlas, ahora podemos responder rápidamente a nuestros clientes con datos más precisos y confiables.

El sistema de IA de CLEVI puede convertir los valiosos datos de nuestros clientes en activos útiles, independientemente del tipo de dominio y en cualquier entorno.

En adelante, CLEVI seguirá esforzándose al máximo para aprovechar el valor de los datos de nuestros clientes y ofrecer experiencias innovadoras de IA.

Lo invitamos a experimentar el futuro de la nueva IA junto con CLEVI.

Contacto y solicitud de demostración: [email protected]

Copyright© 2025 Clevi Inc. Todos los derechos reservados.

Volver a la sala de prensa
CLEVI

Idioma y región

Los idiomas traducidos automáticamente están marcados. La disponibilidad depende del paquete publicado del sitio.

136 idiomas

Recomendado

1

Asia Oriental

7

Sudeste Asiático

11

Asia meridional

18

Asia central

5

Medio Oriente y el Cáucaso

10

Europa Occidental y Europa meridional

16

Reino Unido e Irlanda

4

Europa septentrional

10

Europa Central y los Balcanes

14

Europa Oriental

5

África Oriental

8

África Occidental y África central

9

África meridional

8

América

5

Oceanía

5
Base de datos semántica de Clevi — CLEVI