Investigación

Clevi Semantic Database

Cando a IA se introduce no traballo real, unha das maiores preocupacións é o fenómeno do esquecemento catastrófico (Catastrophic Forgetting) que se produce ao facer un axuste fino do coñecemento aprendido previamente con datos novos.

1. Catastrophic Forgetting e as limitacións de RAG

Cando a IA se introduce no traballo real, unha das maiores preocupacións é o fenómeno do esquecemento catastrófico (Catastrophic Forgetting) que se produce ao facer un axuste fino do coñecemento aprendido previamente con datos novos.

Trátase dun fenómeno no que a IA baseada en redes neuronais perde rapidamente o coñecemento ou os patróns aprendidos anteriormente durante o proceso de aprendizaxe de nova información.

Por exemplo, ao facer un axuste fino dun LLM de código aberto con datos específicos dunha empresa, poden deteriorarse o coñecemento xeral ou as capacidades lingüísticas.

Para evitar este problema, a tecnoloxía RAG(Retrieval-Augmented Generation) utilízase amplamente, pero RAG tamén ten limitacións.

Imaxe do corpo do texto

Principais limitacións de RAG

  • სტრუქტურირებული მონაცემების არასათანადო დამუშავება (Structured Data QA): RAG სისტემები ძირითადად არასტრუქტურირებულ ტექსტურ დოკუმენტებზეა ოპტიმიზებული, ამიტომ ვერ აღიქვამს ან ვერ იყენებს სათანადოდ სტრუქტურირებული მონაცემების (ცხრილები, მონაცემთა ბაზები, ელცხრილები და სხვ.) მნიშვნელობასა და ურთიერთკავშირებს.
  • რთული PDF/არასტრუქტურირებული დოკუმენტების შეზღუდვები (Complex PDFs): რთული PDF დოკუმენტების (ცხრილებით, მრავალსვეტიანი განლაგებით, სურათებით და სხვ.) chunking (დაყოფის) პროცესში ინფორმაცია შეიძლება დაიკარგოს ან კონტექსტი დამახინჯდეს. შედეგად, მნიშვნელოვანი მონაცემები შეიძლება არ დაინდექსირდეს ან მათი მოძიება გართულდეს.
  • Fallback(სარეზერვო) მოდელის არარსებობა (Fallback Model(s)): როდესაც RAG სისტემა შესაბამის პასუხს ვერ პოულობს, ალტერნატიულ (სარეზერვო) მოდელზე გადართვის ლოგიკა არასაკმარისი ან არაეფექტურია. ამის გამო, პასუხის წარუმატებლობისას მომხმარებელს მისაღები ალტერნატივა არ მიეწოდება.
  • უსაფრთხოების სისუსტეები (LLM Security): თავად LLM-ის უსაფრთხოების სისუსტეების (prompt injection, მონაცემთა გაჟონვა და სხვ.) წინააღმდეგ დაცვა არასაკმარისია, რის გამოც არსებობს მგრძნობიარე ინფორმაციის გამჟღავნების რისკი.
  • მასშტაბირების ნაკლებობა (Data Ingestion Scalability): დიდი მოცულობის მონაცემების ინდექსირებისა და შენახვის პროცესში მასშტაბირების პრობლემები წარმოიქმნება. მონაცემთა რაოდენობის ზრდასთან ერთად უარესდება chunking-ის, შენახვისა და ძიების სიჩქარე და იზრდება სისტემის დატვირთვა.
  • მნიშვნელოვანი ინფორმაციის გამოტოვება (Missing Content): დოკუმენტში არსებული მნიშვნელოვანი შინაარსი ხშირად იკარგება chunking-ის პროცესში ან არ ინდექსირდება. ამის გამო მომხმარებელი სასურველ ინფორმაციას ვერ ეძებს.
  • უმაღლესი რანგის შედეგის გამოტოვება (Missed Top Ranked): ძიების შედეგებში შეიძლება გამოტოვებული იყოს რეალურად ყველაზე რელევანტური chunk (უმაღლესი რანგის შედეგი). მიზეზი შეიძლება იყოს ძიების ალგორითმის შეზღუდვები, embedding-ის დაბალი ხარისხი, რანგირების შეცდომები და სხვ.
  • კონტექსტთან შეუსაბამობა (Not in Context): მოძიებული chunk ხშირად არ შეესაბამება რეალური კითხვის კონტექსტს. ეს გამოწვეულია მხოლოდ მსგავსებაზე დაფუძნებული ძიების შეზღუდვებით, რის გამოც სემანტიკური კავშირი არასაკმარისია.
  • ფორმატის შეცდომა (Wrong Format): მოძიებული chunk-ის ფორმატი შეიძლება არ იყოს შესაფერისი LLM-ის დასამუშავებლად ან განსხვავდებოდეს მომხმარებლისთვის სასურველი პასუხის ფორმატისგან. მაგალითად, როდესაც ცხრილი ტექსტად გარდაიქმნება და ინფორმაცია დამახინჯდება.
  • ინფორმაციის ამოღების წარუმატებლობა (Not Extracted): საჭირო ინფორმაცია chunk-იდან სათანადოდ ვერ ამოიღება ან LLM ვერ აღიქვამს ინფორმაციას. ეს ხშირად ხდება რთული წინადადების სტრუქტურის, ცხრილებისა და სურათების შემთხვევაში.
  • ინფორმაციის მასშტაბი/სიღრმე შეუსაბამოა (Incorrect Specificity): პასუხი კითხვასთან მიმართებით შეიძლება ზედმეტად ზოგადი ან, პირიქით, ზედმეტად კონკრეტული იყოს და მომხმარებლის რეალურ მოთხოვნას არ შეესაბამებოდეს. რთულია ინფორმაციის მასშტაბისა და სიღრმის სათანადოდ რეგულირება.
  • არასრული პასუხი (Incomplete): საბოლოოდ გენერირებული პასუხი შეიძლება არასრული იყოს ან მხოლოდ გარკვეული ინფორმაცია მიაწოდოს, რის გამოც მომხმარებლის მოთხოვნას სრულად ვერ აკმაყოფილებს. ამის მიზეზი შეიძლება იყოს რამდენიმე chunk-იდან ინფორმაციის გაერთიანების შეუძლებლობა ან LLM-ის მიერ ინფორმაციის მხოლოდ ნაწილის გამოყენება.

Deste xeito, dado que RAG depende en exceso da busca baseada unicamente na similitude vectorial e da indexación baseada en chunks, as súas limitacións en termos de fiabilidade, escalabilidade e precisión no traballo real son claras.

2. A Clevi Semantic Database, que supera as limitacións de RAG

Para superar estas limitacións, CLEVI desenvolveu a seguinte xeración de infraestrutura de coñecemento de IA, Clevi Semantic Database, optimizada para a conexión semántica, o razoamento complexo e as respostas baseadas en evidencias.

É unha solución posible porque conta con modelos propios de Reasoning, IA multimodal e modelos de IA baseados en axentes, e é unha das potentes tecnoloxías exclusivas de CLEVI que fan posible que a IA sexa realmente útil no mundo real.

A modo de comparación, se pensamos na base de datos onde se almacena a información como nunha biblioteca, a Clevi Semantic Database sería como contar cun bibliotecario excepcional. (Se lle solicitas ao bibliotecario a información que necesitas, recibirás unha resposta precisa e rápida.)

Os usuarios poden engadir nova información á biblioteca e recuperar a información que necesitan en calquera momento.

Ademais, poden configurar como desexen a xestión de versións dos datos e os permisos de acceso.

Todas as accións do bibliotecario quedan rexistradas nos logs (rexistros), polo que poden corrixirse aínda que se produza un erro.

Imaxe principal

<Clevi Semantic Database Structure>

Principais características e estrutura técnica

Almacenamento semántico de datos

  • Almacenamento das relacións semánticas entre os datos (contexto, xerarquía, causalidade, etc.) nunha base de datos de grafos, en lugar dunha simple base de datos vectorial baseada en chunks
  • Fácil de ampliar e complementar en forma de grafo de coñecemento ou rede semántica

Busca e razoamento híbridos

  • CTA+Context Query: reflexión conxunta sobre o contexto da consulta (Context) e o CTA
  • Hybrid Retrieval: combinación da similitude vectorial coa busca baseada en regras e grafos
  • Intelligent Folder Hits: exploración automática de cartafoles e categorías semanticamente relacionados

Procesamento multimodal simultáneo

  • Interpretación simultánea de diversos tipos de datos, como texto, imaxes, táboas e voz, mediante TextReader Pool, VisionReader Pool, etc.
  • Mentres que o RAG convencional pode procesar principalmente texto, a base de datos semántica destaca pola súa capacidade de procesamento multimodal

Respostas baseadas en evidencias e verificación da fiabilidade

  • Resumo de documentos e citas, xeración automática de conclusións e fontes de táboas, etc.
  • Merge & Verify: integración semántica da información de varias fontes e verificación da súa fiabilidade
  • Evidence Pack:提供 de paquetes de respostas baseados en evidencias

Razoamento complexo e planificador

  • Planner/DAG: planificación paso a paso e razoamento baseado en DAG (Directed Acyclic Graph) para consultas complexas

Arquitectura de axentes integrados

  • cip-5-agent Supervisor: axente de nivel superior que xestiona e coordina todo o proceso de busca, razoamento e integración
Imaxe do corpo principal

3. Resumo e comparación da estrutura

En resumo, a Semantic DB recibe datos de diversas formas (voz, texto, imaxes, vídeo, etc.) e clasifica o coñecemento conectando non só os datos en fragmentos simples, senón tamén as relacións semánticas entre os datos (contexto, xerarquía, causalidade, etc.).

A partir disto, permite realizar buscas e razoamentos baseados en conexións semánticas, en lugar de buscas baseadas en palabras clave ou similitude como RAG, polo que a IA pode ofrecer unha recuperación de información e respostas máis precisas.

Ademais, como se almacena en forma de grafo de coñecemento ou rede semántica, é fácil amplialo e complementalo continuamente.

En Clevi, na era da gran transformación da IA, descubrimos as limitacións dos sistemas RAG e, mediante unha base de datos semántica e modelos de IA propios capaces de resolver estes problemas, logramos responder rapidamente aos clientes con datos máis precisos e fiables.

O sistema de IA de Clevi pode converter os valiosos datos dos clientes en valor, independentemente do tipo de dominio e en calquera contorno.

Clevi seguirá esforzándose ao máximo para maximizar o valor dos datos dos clientes e ofrecer experiencias innovadoras de IA.

Convidámoslle a experimentar o futuro da nova IA xunto con Clevi.

Consultas e solicitudes de demostración: [email protected]

Copyright© 2025 Clevi Inc. Todos os dereitos reservados.

Volver á sala de prensa
CLEVI

Idioma e rexión

As linguas traducidas automaticamente están marcadas. A dispoñibilidade segue o paquete do sitio publicado.

136 idiomas

Recomendado

1

Asia Oriental

7

Sueste Asiático

11

Asia Meridional

18

Asia Central

5

Oriente Medio e o Cáucaso

10

Europa Occidental e Europa Meridional

16

Reino Unido e Irlanda

4

Europa Setentrional

10

Europa Central e os Balcáns

14

Europa do Leste

5

África Oriental

8

África Occidental e África Central

9

África Meridional

8

América

5

Oceanía

5
Clevi Semantic Database — CLEVI