Tutkimus

Clevi Semantic Database

Kun tekoäly otetaan käyttöön todellisissa työtehtävissä, yksi suurimmista huolenaiheista on katastrofaalinen unohtaminen (Catastrophic Forgetting), jota ilmenee, kun aiemmin opittua tietoa hienosäädetään uuden datan avulla.

1. Catastrophic Forgettingin ja RAG:n rajoitukset

Kun tekoäly otetaan käyttöön todellisissa työtehtävissä, yksi suurimmista huolenaiheista on katastrofaalinen unohtaminen (Catastrophic Forgetting), jota ilmenee, kun aiemmin opittua tietoa hienosäädetään uuden datan avulla.

Kyseessä on ilmiö, jossa neuroverkkoihin perustuva tekoäly menettää nopeasti aiemmin oppimaansa tietoa tai aiemmin oppimiaan malleja oppiessaan uutta tietoa.

Jos esimerkiksi avoimen lähdekoodin LLM hienosäädetään tietyn yrityksen datalla, yleinen tietämys tai kielelliset kyvyt voivat heikentyä.

Tämän ongelman välttämiseksi käytetään laajalti RAG (Retrieval-Augmented Generation) -tekniikkaa, mutta myös RAG:lla on rajoituksensa.

Artikkelin kuva

RAG:n keskeiset rajoitukset

  • Puutteellinen rakenteisen datan käsittely (Structured Data QA): RAG-järjestelmät on yleensä optimoitu ensisijaisesti rakenteettomille tekstidokumenteille, eivätkä ne siksi pysty kunnolla ymmärtämään tai hyödyntämään rakenteisen datan (taulukot, tietokannat, laskentataulukot jne.) merkityksiä ja suhteita.
  • Monimutkaisten PDF-/rakenteettomien dokumenttien rajoitteet (Complex PDFs): Monimutkaisten PDF-dokumenttien (mukaan lukien taulukot, monipalstaiset asettelut, kuvat jne.) chunking (jakaminen) -prosessin aikana tietoja voi kadota tai asiayhteys vääristyä. Tämän seurauksena tärkeää dataa ei ehkä indeksoida tai sitä on vaikea hakea.
  • Fallback-varamallin puuttuminen (Fallback Model(s)): Kun RAG-järjestelmä ei löydä sopivaa vastausta, siirtymiseen vaihtoehtoiseen (varamalliin) liittyvä logiikka voi olla puutteellinen tai tehoton. Tämän vuoksi käyttäjälle ei vastausten epäonnistuessa tarjota tyydyttävää vaihtoehtoa.
  • Tietoturva-aukot (LLM Security): LLM:n omien tietoturva-aukkojen (prompt-injektio, tietovuodot jne.) suojaus on puutteellista, mikä aiheuttaa riskin arkaluonteisten tietojen paljastumisesta.
  • Heikko skaalautuvuus (Data Ingestion Scalability): Suurten datamäärien indeksoinnin ja tallennuksen aikana ilmenee skaalautuvuusongelmia. Datan määrän kasvaessa chunking-, tallennus- ja hakunopeus heikkenevät ja järjestelmän kuormitus kasvaa.
  • Tärkeiden tietojen puuttuminen (Missing Content): Dokumentin tärkeää sisältöä jää usein pois chunking-prosessin aikana tai sitä ei indeksoida. Tämän vuoksi käyttäjä ei voi hakea haluamiaan tietoja.
  • Korkeimman sijoituksen puuttuminen (Missed Top Ranked): Hakutuloksista voi puuttua tosiasiassa olennaisin chunk (korkeimmalle sijoittunut). Syitä ovat hakualgoritmien rajoitteet, upotusten laadun heikkeneminen ja sijoitusvirheet.
  • Asiayhteyden yhteensopimattomuus (Not in Context): Haettu chunk ei usein vastaa kysymyksen todellista asiayhteyttä. Tämä johtuu yksinkertaiseen samankaltaisuuteen perustuvan haun rajoitteista, sillä semanttinen yhteys on puutteellinen.
  • Väärä muoto (Wrong Format): Haetun chunkin muoto ei ehkä sovellu LLM:n käsiteltäväksi tai se voi poiketa käyttäjän toivomasta vastausmuodosta. Esimerkiksi taulukon muuntaminen tekstiksi voi vääristää tietoja.
  • Tietojen poiminta epäonnistuu (Not Extracted): Tarvittavia tietoja ei ehkä poimita chunkista asianmukaisesti tai LLM ei tunnista tietoja. Tätä esiintyy usein monimutkaisten lauserakenteiden, taulukoiden ja kuvien yhteydessä.
  • Tietojen laajuus/syvyys ei vastaa tarpeita (Incorrect Specificity): Vastaus voi olla kysymykseen nähden liian yleisluontoinen tai päinvastoin liian yksityiskohtainen, eikä se tällöin vastaa käyttäjän todellisia tarpeita. Tietojen laajuuden ja syvyyden säätäminen on vaikeaa.
  • Puutteellinen vastaus (Incomplete): Lopullinen tuotettu vastaus voi olla puutteellinen tai sisältää vain osan tiedoista, jolloin se ei täytä käyttäjän tarpeita riittävästi. Syynä voi olla se, ettei tietoja pystytä yhdistämään useista chunkeista tai että LLM hyödyntää vain osaa niistä.

Näin ollen RAG:n liiallinen riippuvuus yksinkertaisesta vektorien samankaltaisuushausta ja chunk-pohjaisesta indeksoinnista aiheuttaa selkeitä rajoitteita luotettavuuden, skaalautuvuuden ja tarkkuuden suhteen todellisessa liiketoimintakäytössä.

2. CLEVI:n semanttinen tietokanta, joka ratkaisee RAG:n rajoitteet

Näiden rajoitteiden ratkaisemiseksi CLEVI kehitti seuraavan sukupolven AI-tietoinfrastruktuurin, semanttisiin yhteyksiin, monimutkaiseen päättelyyn ja perusteluihin perustuviin vastauksiin optimoidun Clevi Semantic Database -ratkaisun.

Ratkaisu on mahdollinen, koska CLEVI:llä on omat Reasoning-mallit sekä multimodaaliset AI- ja agenttipohjaiset AI-mallit, ja se on yksi CLEVI:n tehokkaista teknologioista, jotka mahdollistavat AI:n todellisen hyödyn käytännössä.

Jos tietokantaa, johon tiedot on tallennettu, verrataan kirjastoon, CLEVI:n semanttista tietokantaa voi ajatella kirjastona, jossa on erittäin taitava kirjastonhoitaja. (Kun kirjastonhoitajalta pyydetään tarvittavat tiedot, vastauksen saa tarkasti ja nopeasti.)

Käyttäjät voivat milloin tahansa lisätä kirjastoon uutta tietoa ja hakea tarvitsemansa tiedot.

Lisäksi tietojen versiohallinnan ja käyttöoikeudet voi määrittää haluamallaan tavalla.

Koska kaikki kirjastonhoitajan toimet tallennetaan lokiin (tietueeksi), virheet voidaan korjata, vaikka niitä tapahtuisi.

Päätekstin kuva

<Clevi Semantic Database Structure>

Keskeiset ominaisuudet ja tekninen rakenne

Semanttinen tietojen tallennus

  • Tietojen väliset semanttiset suhteet (konteksti, hierarkia, kausaliteetti jne.) tallennetaan graafitietokantaan, ei vain yksinkertaisena chunk-vektoritietokantana
  • Helppo laajentaa ja täydentää tietämysgraafin/semanttisen verkon muodossa

Hybridihaku ja päättely

  • CTA+Context Query: kyselyn konteksti (Context) ja CTA huomioidaan yhdessä
  • Hybrid Retrieval: vektorien samankaltaisuuteen perustuvan haun ja sääntö-/graafipohjaisen haun yhdistäminen
  • Intelligent Folder Hits: semanttisesti toisiinsa liittyvien kansioiden/kategorioiden automaattinen etsiminen

Samanaikainen multimodaalinen käsittely

  • TextReader Pool, VisionReader Pool ja muiden tekstin, kuvien, taulukoiden, puheen sekä muun datan samanaikainen tulkinta
  • Kun perinteinen RAG pystyy käsittelemään pääasiassa vain tekstiä, semanttinen tietokanta on erinomainen multimodaalisessa käsittelyssä

Perusteluihin perustuvat vastaukset ja luotettavuuden varmistus

  • Doc Summaries & Citations, automaattinen asiakirjojen yhteenvetojen ja lähteiden luonti
  • Merge & Verify: useiden lähteiden tietojen semanttinen yhdistäminen ja luotettavuuden varmistaminen
  • Evidence Pack: todisteisiin perustuvien vastauspakettien tarjoaminen

Monimutkainen päättely ja suunnittelija

  • Planner/DAG: vaiheittainen suunnittelu ja DAG-pohjainen (Directed Acyclic Graph) päättely monimutkaisia kyselyitä varten

Yhdistetty agenttirakenne

  • cip-5-agent Supervisor: ylin agentti, joka hallinnoi ja koordinoi koko haku-, päättely- ja yhdistämisprosessia
Tekstin kuva

3. Rakenteen yhteenveto ja vertailu

Yhteenvetona voidaan todeta, että Semantic DB luokittelee tietoa yhdistämällä erimuotoista dataa (ääni, teksti, kuvat, video jne.) ja yhdistämällä toisiinsa paitsi yksittäisiä Chunk-osia myös datan välisiä semanttisia suhteita (konteksti, hierarkia, kausaalisuus jne.).

Tämän ansiosta se mahdollistaa RAG:n kaltaisen avainsanoihin tai samankaltaisuuteen perustuvan haun sijaan semanttisiin yhteyksiin perustuvan haun ja päättelyn, minkä ansiosta AI:lta voidaan saada tarkempia tiedonhakuja ja vastauksia.

Lisäksi tieto tallennetaan tietämysgraafin tai semanttisen verkoston muodossa, joten sitä on helppo laajentaa ja täydentää jatkuvasti.

Clevi havaitsi AI:n suuren murroksen aikakaudella RAG-järjestelmien rajoitukset ja pystyy nyt tarjoamaan asiakkaille nopeammin tarkempaa ja luotettavampaa dataa semanttisen tietokannan ja oman AI-mallin avulla, jotka ratkaisevat nämä ongelmat.

Clevin AI-järjestelmä voi tehdä asiakkaidemme arvokkaasta datasta hyödyllistä missä tahansa ympäristössä ja toimialasta riippumatta.

Clevi jatkaa parhaansa tekemistä maksimoidakseen asiakkaidensa datan arvon ja tarjotakseen innovatiivisia AI-kokemuksia.

Koe AI:n uusi tulevaisuus yhdessä Clevin kanssa.

Yhteydenotot ja demosupyynnöt: [email protected]

Copyright© 2025 Clevi Inc. Kaikki oikeudet pidätetään.

Takaisin uutishuoneeseen
CLEVI

Kieli ja alue

Konekäännetyt kielet on merkitty. Saatavuus noudattaa julkaistua sivustopakettia.

136 kieltä

Suositeltu

1

Itä-Aasia

7

Kaakkois-Aasia

11

Etelä-Aasia

18

Keski-Aasia

5

Lähi-itä ja Kaukasia

10

Länsi-Eurooppa ja Etelä-Eurooppa

16

Iso-Britannia ja Irlanti

4

Pohjois-Eurooppa

10

Keski-Eurooppa ja Balkan

14

Itä-Eurooppa

5

Itä-Afrikka

8

Länsi-Afrikka ja Keski-Afrikka

9

eteläinen Afrikka

8

Amerikka

5

Oseania

5
Clevi Semantic Database — CLEVI