Pesquisa

Banco de Dados Semântico da Clevi

Quando a IA é implementada em operações reais, uma das maiores preocupações é o fenômeno do esquecimento catastrófico (Catastrophic Forgetting), que ocorre ao ajustar o conhecimento aprendido anteriormente com novos dados.

1. As limitações do Catastrophic Forgetting e do RAG

Quando a IA é implementada em operações reais, uma das maiores preocupações é o fenômeno do esquecimento catastrófico (Catastrophic Forgetting), que ocorre ao ajustar o conhecimento aprendido anteriormente com novos dados.

Esse é o fenômeno em que a IA baseada em redes neurais perde rapidamente os conhecimentos ou padrões aprendidos anteriormente durante o processo de aprendizagem de novas informações.

Por exemplo, ao ajustar um LLM de código aberto com dados de uma empresa específica, o conhecimento geral ou a capacidade linguística podem ser prejudicados.

Para evitar esse problema, a tecnologia RAG (Retrieval-Augmented Generation) é amplamente utilizada, mas o RAG também tem limitações.

Imagem principal

Principais limitações do RAG

  • Processamento insuficiente de dados estruturados (Structured Data QA): os sistemas RAG são principalmente otimizados para documentos de texto não estruturados e, por isso, não conseguem compreender ou utilizar adequadamente o significado e as relações dos dados estruturados (tabelas, bancos de dados, planilhas etc.).
  • Limitações com PDFs complexos/documentos não estruturados (Complex PDFs): documentos PDF complexos (incluindo tabelas, múltiplas colunas, imagens etc.) podem sofrer perda de informações ou distorção de contexto durante o processo de chunking (divisão). Como resultado, dados importantes podem não ser indexados ou sua busca pode se tornar difícil.
  • Ausência de modelo de fallback (Fallback Model(s)): quando o sistema RAG não consegue encontrar uma resposta adequada, a lógica para alternar para um modelo alternativo (de backup) pode ser insuficiente ou ineficiente. Como resultado, quando ocorre uma falha na resposta, não é oferecida uma alternativa satisfatória ao usuário.
  • Vulnerabilidades de segurança (LLM Security): a proteção contra vulnerabilidades de segurança do próprio LLM (injeção de prompt, vazamento de dados etc.) é insuficiente, o que cria o risco de exposição de informações sensíveis.
  • Falta de escalabilidade (Data Ingestion Scalability): surgem problemas de escalabilidade durante a indexação e o armazenamento de grandes volumes de dados. À medida que a quantidade de dados aumenta, a velocidade de chunking, armazenamento e pesquisa diminui, e a carga sobre o sistema aumenta.
  • Omissão de informações importantes (Missing Content): conteúdos importantes dos documentos frequentemente são omitidos durante o processo de chunking ou não são indexados. Como resultado, o usuário não consegue pesquisar as informações desejadas.
  • Ausência dos primeiros colocados no ranking (Missed Top Ranked): o chunk mais relevante (de maior classificação) pode ser omitido nos resultados da pesquisa. As causas incluem limitações do algoritmo de pesquisa, baixa qualidade dos embeddings e erros de classificação.
  • Incompatibilidade de contexto (Not in Context): muitas vezes, o chunk recuperado não corresponde ao contexto real da pergunta. Isso ocorre devido às limitações da pesquisa baseada apenas em similaridade, que apresenta pouca conexão semântica.
  • Formato incorreto (Wrong Format): o formato do chunk recuperado pode ser inadequado para o processamento pelo LLM ou pode ser diferente do formato de resposta desejado pelo usuário. Por exemplo, uma tabela pode ser convertida em texto, distorcendo as informações.
  • Falha na extração de informações (Not Extracted): as informações necessárias podem não ser extraídas corretamente do chunk, ou o LLM pode não reconhecer as informações. Isso ocorre com frequência em estruturas de frases complexas, tabelas, imagens etc.
  • Escopo/profundidade das informações inadequados (Incorrect Specificity): a resposta pode ser muito abrangente ou, ao contrário, excessivamente específica em relação à pergunta, não correspondendo às necessidades reais do usuário. É difícil ajustar o escopo e a profundidade das informações.
  • Resposta incompleta (Incomplete): a resposta gerada finalmente pode estar incompleta ou fornecer apenas parte das informações, não atendendo suficientemente às necessidades do usuário. As causas incluem a incapacidade de combinar informações de vários chunks ou o uso apenas parcial das informações pelo LLM.

Dessa forma, como o RAG depende excessivamente da busca por similaridade vetorial simples e da indexação baseada em chunks, suas limitações em termos de confiabilidade, escalabilidade e precisão são claras em aplicações reais.

2. O banco de dados semântico da Clevi, que supera as limitações do RAG

Para superar essas limitações, a Clevi desenvolveu o Clevi Semantic Database, uma infraestrutura de conhecimento de IA de próxima geração otimizada para conexões semânticas, raciocínio complexo e respostas baseadas em evidências.

Essa é uma solução possível porque a Clevi possui seus próprios modelos de Reasoning, IA multimodal e modelos de IA baseados em agentes, sendo uma das poderosas tecnologias exclusivas da Clevi que tornam a IA realmente útil no mundo real.

Por analogia, se considerarmos a biblioteca como um banco de dados onde as informações estão armazenadas, o banco de dados semântico da Clevi pode ser entendido como uma biblioteca com um bibliotecário excelente. (Ao solicitar ao bibliotecário as informações necessárias, você pode receber respostas precisas e rápidas.)

Os usuários podem adicionar novas informações à biblioteca e recuperar as informações necessárias a qualquer momento.

Além disso, é possível configurar o gerenciamento de versões dos dados e as permissões de acesso conforme desejado.

Como todas as ações do bibliotecário ficam registradas em logs (registros), elas podem ser corrigidas mesmo quando ocorre um erro.

Imagem do corpo do texto

<Clevi Semantic Database Structure>

Principais características e estrutura tecnológica

Armazenamento semântico de dados

  • Armazena no banco de dados de grafos as relações semânticas entre os dados (contexto, hierarquia, causalidade etc.), em vez de usar apenas um banco de dados vetorial baseado em chunks
  • Fácil de expandir e complementar na forma de grafo de conhecimento/rede semântica

Busca e raciocínio híbridos

  • CTA+Context Query: considera conjuntamente o contexto (Context) da consulta e o CTA
  • Hybrid Retrieval: combina a similaridade vetorial com buscas baseadas em regras/grafos
  • Intelligent Folder Hits: explora automaticamente pastas/categorias semanticamente relacionadas

Processamento multimodal simultâneo

  • Interpreta simultaneamente diversos tipos de dados, como texto, imagens, tabelas e áudio, por meio de pools como TextReader Pool e VisionReader Pool
  • Enquanto o RAG tradicional geralmente processa apenas texto, o banco de dados semântico se destaca pela capacidade de processamento multimodal

Respostas baseadas em evidências e verificação de confiabilidade

  • Resumos e citações de documentos, descobertas em tabelas etc. geração automática de resumos e fontes de documentos
  • Merge & Verify: integração semântica de informações de várias fontes e verificação de confiabilidade
  • Evidence Pack: fornecimento de pacotes de respostas baseadas em evidências

Raciocínio complexo e planejador

  • Planner/DAG: planejamento passo a passo e raciocínio baseado em DAG (Directed Acyclic Graph) para consultas complexas

Estrutura integrada de agentes

  • Supervisor cip-5-agent: agente de mais alto nível que gerencia e coordena todo o processo de pesquisa, raciocínio e integração
Imagem do corpo do texto

3. Resumo e comparação da estrutura

Em resumo, o Semantic DB recebe dados de várias formas (áudio, texto, imagens, vídeos etc.) e classifica o conhecimento conectando não apenas os dados em simples Chunks, mas também as relações semânticas entre eles (contexto, hierarquia, causalidade etc.).

Com base nisso, como realiza pesquisas e inferências utilizando conexões semânticas, em vez de pesquisas baseadas em palavras-chave/similaridade como o RAG, é possível obter da IA pesquisas de informações e respostas ainda mais precisas.

Além disso, como é armazenado na forma de grafo de conhecimento/rede semântica, é fácil expandi-lo e complementá-lo continuamente.

A Clevi identificou as limitações dos sistemas RAG na era da grande transformação da IA e, por meio de um banco de dados semântico e de um modelo de IA próprio capazes de solucionar esses problemas, passou a responder rapidamente aos clientes com dados mais precisos e confiáveis.

O sistema de IA da Clevi pode transformar os valiosos dados dos clientes em valor, independentemente do tipo de domínio e em qualquer ambiente.

A Clevi continuará se empenhando para maximizar o valor dos dados dos clientes e oferecer experiências inovadoras de IA.

Experimente o futuro de uma nova IA junto com a Clevi.

Contato e solicitação de demonstração: [email protected]

Copyright© 2025 Clevi Inc. Todos os direitos reservados.

Voltar para a redação
CLEVI

Yezh ha rannvro

Os idiomas traduzidos automaticamente estão marcados. A disponibilidade segue o pacote do site publicado.

136 yezh

Erbedet

1

Azia ar Reter

7

Azia ar Gevred

11

Azia ar Su

18

Azia ar Cʼhreiz

5

Reter-Kreiz ha Kaokaz

10

Europa ar Cʼhornôg ha Europa ar Su

16

Rouantelezh-Unanet ha Iwerzhon

4

Europa an Norzh

10

Kreiz-Europa hag ar Balkanoù

14

Europa ar Reter

5

Afrika ar Reter

8

Afrika ar Cʼhornôg ha Afrika ar Cʼhreiz

9

Afrika ar Su

8

Amerikaoù

5

Oseania

5