Έρευνα

Clevi Σημασιολογική Βάση Δεδομένων

Όταν η AI εφαρμόζεται σε πραγματικές επιχειρησιακές εργασίες, μία από τις μεγαλύτερες ανησυχίες είναι το φαινόμενο της καταστροφικής λήθης (Catastrophic Forgetting), το οποίο εμφανίζεται κατά τη λεπτομερή προσαρμογή της ήδη αποκτηθείσας γνώσης σε νέα δεδομένα.

1. Οι περιορισμοί του Catastrophic Forgetting και του RAG

Όταν η AI εφαρμόζεται σε πραγματικές επιχειρησιακές εργασίες, μία από τις μεγαλύτερες ανησυχίες είναι το φαινόμενο της καταστροφικής λήθης (Catastrophic Forgetting), το οποίο εμφανίζεται κατά τη λεπτομερή προσαρμογή της ήδη αποκτηθείσας γνώσης σε νέα δεδομένα.

Πρόκειται για ένα φαινόμενο κατά το οποίο η AI που βασίζεται σε νευρωνικά δίκτυα χάνει απότομα τη γνώση ή τα μοτίβα που είχε μάθει προηγουμένως, καθώς μαθαίνει νέες πληροφορίες.

Για παράδειγμα, όταν ένα LLM ανοιχτού κώδικα προσαρμόζεται λεπτομερώς σε δεδομένα μιας συγκεκριμένης επιχείρησης, μπορεί να υποβαθμιστούν οι γενικές γνώσεις κοινής λογικής ή οι γλωσσικές του ικανότητες.

Για την αποφυγή αυτού του προβλήματος, χρησιμοποιείται ευρέως η τεχνολογία RAG(Retrieval-Augmented Generation), όμως και το RAG έχει περιορισμούς.

Εικόνα κύριου κειμένου

Βασικοί περιορισμοί του RAG

  • Ανεπαρκής επεξεργασία δομημένων δεδομένων (Structured Data QA): Τα συστήματα RAG είναι κυρίως βελτιστοποιημένα για μη δομημένα έγγραφα κειμένου και, ως εκ τούτου, δεν μπορούν να κατανοήσουν ή να αξιοποιήσουν σωστά τη σημασία και τις σχέσεις των δομημένων δεδομένων (πινάκων, βάσεων δεδομένων, υπολογιστικών φύλλων κ.λπ.).
  • Περιορισμοί σε σύνθετα PDF/μη δομημένα έγγραφα (Complex PDFs): Σύνθετα έγγραφα PDF (με πίνακες, πολλαπλές στήλες, εικόνες κ.λπ.) ενδέχεται να παρουσιάσουν απώλεια πληροφοριών ή παραμόρφωση του πλαισίου κατά τη διαδικασία chunking (κατάτμησης). Ως αποτέλεσμα, σημαντικά δεδομένα ενδέχεται να μην ευρετηριαστούν ή να είναι δύσκολο να αναζητηθούν.
  • Απουσία μοντέλου Fallback (Fallback Model(s)): Όταν το σύστημα RAG δεν μπορεί να βρει την κατάλληλη απάντηση, η λογική μετάβασης σε εναλλακτικό (εφεδρικό) μοντέλο είναι ανεπαρκής ή μη αποδοτική. Ως αποτέλεσμα, όταν η απάντηση αποτυγχάνει, δεν παρέχεται στον χρήστη μια ικανοποιητική εναλλακτική.
  • Ευπάθειες ασφάλειας (LLM Security): Η ανεπαρκής προστασία από τις ευπάθειες ασφάλειας του ίδιου του LLM (όπως injection prompts και διαρροή δεδομένων) δημιουργεί κίνδυνο έκθεσης ευαίσθητων πληροφοριών.
  • Ανεπαρκής επεκτασιμότητα (Data Ingestion Scalability): Παρουσιάζονται προβλήματα επεκτασιμότητας κατά την ευρετηρίαση και αποθήκευση μεγάλων όγκων δεδομένων. Όσο αυξάνεται ο όγκος των δεδομένων, μειώνονται η ταχύτητα του chunking, της αποθήκευσης και της αναζήτησης και αυξάνεται το φορτίο του συστήματος.
  • Παράλειψη σημαντικών πληροφοριών (Missing Content): Συχνά σημαντικό περιεχόμενο από τα έγγραφα παραλείπεται κατά τη διαδικασία chunking ή δεν ευρετηριάζεται. Ως αποτέλεσμα, οι χρήστες δεν μπορούν να αναζητήσουν τις πληροφορίες που χρειάζονται.
  • Παράλειψη κορυφαίας κατάταξης (Missed Top Ranked): Το chunk με τη μεγαλύτερη πραγματική συνάφεια (κορυφαία κατάταξη) ενδέχεται να παραλειφθεί από τα αποτελέσματα αναζήτησης. Αιτίες μπορεί να είναι οι περιορισμοί του αλγορίθμου αναζήτησης, η χαμηλή ποιότητα των embeddings και τα σφάλματα κατάταξης.
  • Αναντιστοιχία πλαισίου (Not in Context): Συχνά το chunk που ανακτάται δεν ταιριάζει με το πραγματικό πλαίσιο της ερώτησης. Αυτό οφείλεται στους περιορισμούς της αναζήτησης που βασίζεται αποκλειστικά στην ομοιότητα, με αποτέλεσμα ανεπαρκή σημασιολογική σύνδεση.
  • Εσφαλμένη μορφή (Wrong Format): Η μορφή του ανακτημένου chunk ενδέχεται να είναι ακατάλληλη για επεξεργασία από το LLM ή να διαφέρει από τη μορφή απάντησης που επιθυμεί ο χρήστης. Για παράδειγμα, ένας πίνακας μπορεί να μετατραπεί σε κείμενο, με αποτέλεσμα την παραμόρφωση των πληροφοριών.
  • Αποτυχία εξαγωγής πληροφοριών (Not Extracted): Οι απαιτούμενες πληροφορίες ενδέχεται να μην εξαχθούν σωστά από το chunk ή το LLM να μην αναγνωρίσει τις πληροφορίες. Αυτό συμβαίνει συχνά σε σύνθετες δομές προτάσεων, πίνακες, εικόνες κ.λπ.
  • Ακατάλληλο εύρος/βάθος πληροφοριών (Incorrect Specificity): Η απάντηση μπορεί να είναι υπερβολικά γενική για την ερώτηση ή, αντίθετα, υπερβολικά συγκεκριμένη και να μην ανταποκρίνεται στις πραγματικές ανάγκες του χρήστη. Είναι δύσκολο να ρυθμιστούν το εύρος και το βάθος των πληροφοριών.
  • Ελλιπής απάντηση (Incomplete): Η τελικά παραγόμενη απάντηση ενδέχεται να είναι ελλιπής ή να παρέχει μόνο μέρος των πληροφοριών, με αποτέλεσμα να μην καλύπτει επαρκώς τις ανάγκες του χρήστη. Αιτίες μπορεί να είναι η αδυναμία σύνθεσης πληροφοριών από πολλά chunk ή η αξιοποίηση μόνο μέρους τους από το LLM.

Επειδή το RAG εξαρτάται υπερβολικά από την απλή αναζήτηση ομοιότητας διανυσμάτων και την ευρετηρίαση βάσει chunk, οι περιορισμοί του ως προς την αξιοπιστία, την επεκτασιμότητα και την ακρίβεια στην πραγματική εργασία είναι σαφείς.

2. Η Semantic Database της CLEVI, που ξεπερνά τους περιορισμούς του RAG

Για να ξεπεράσει αυτούς τους περιορισμούς, η CLEVI ανέπτυξε την επόμενη γενιά υποδομής γνώσης AI, τη Clevi Semantic Database, βελτιστοποιημένη για σημασιολογικές συνδέσεις, σύνθετη συλλογιστική και απαντήσεις βασισμένες σε τεκμήρια.

Πρόκειται για μια λύση που είναι δυνατή επειδή διαθέτει ταυτόχρονα δικά της Reasoning μοντέλα, πολυτροπικό AI και agentic AI μοντέλα, και αποτελεί μία από τις ισχυρές τεχνολογίες της CLEVI που κάνουν το AI πραγματικά χρήσιμο στον πραγματικό κόσμο.

Κατ’ αναλογία, αν η βάση δεδομένων όπου αποθηκεύονται οι πληροφορίες είναι μια βιβλιοθήκη, μπορείτε να φανταστείτε τη Semantic Database της CLEVI ως μια εξαιρετική βιβλιοθηκονόμο. (Αν ζητήσετε από τη βιβλιοθηκονόμο τις πληροφορίες που χρειάζεστε, θα λάβετε ακριβή και γρήγορη απάντηση.)

Οι χρήστες μπορούν ανά πάσα στιγμή να προσθέτουν νέες πληροφορίες στη βιβλιοθήκη και να ανακτούν τις πληροφορίες που χρειάζονται.

Μπορούν επίσης να ρυθμίζουν όπως επιθυμούν τη διαχείριση εκδόσεων των δεδομένων και τα δικαιώματα πρόσβασης.

Κάθε ενέργεια της βιβλιοθηκονόμου καταγράφεται σε log (αρχείο καταγραφής), ώστε να μπορεί να διορθωθεί ακόμη και αν προκύψει κάποιο σφάλμα.

Εικόνα κύριου κειμένου

<Clevi Semantic Database Structure>

Βασικά χαρακτηριστικά και τεχνολογική δομή

Σημασιολογική αποθήκευση δεδομένων

  • Αποθηκεύει στη graph DB τις σημασιολογικές σχέσεις μεταξύ των δεδομένων (πλαίσιο, ιεραρχία, αιτιότητα κ.λπ.), αντί για μια απλή chunk vector DB
  • Εύκολη επέκταση και συμπλήρωση σε μορφή knowledge graph/semantic network

Υβριδική αναζήτηση και συλλογιστική

  • CTA+Context Query: Συνδυασμένη αξιοποίηση του πλαισίου (Context) του ερωτήματος και του CTA
  • Hybrid Retrieval: Συνδυασμός αναζήτησης βάσει ομοιότητας διανυσμάτων και αναζήτησης βάσει κανόνων/γραφημάτων
  • Intelligent Folder Hits: Αυτόματος εντοπισμός φακέλων/κατηγοριών που σχετίζονται σημασιολογικά

Ταυτόχρονη πολυτροπική επεξεργασία

  • Ταυτόχρονη ερμηνεία διαφόρων τύπων δεδομένων, όπως κείμενο, εικόνες, πίνακες και φωνή, μέσω των TextReader Pool, VisionReader Pool κ.λπ.
  • Ενώ το υπάρχον RAG μπορεί να επεξεργάζεται κυρίως κείμενο, η Semantic Database διαθέτει εξαιρετικές δυνατότητες πολυτροπικής επεξεργασίας

Απαντήσεις βασισμένες σε τεκμήρια και επαλήθευση αξιοπιστίας

  • Σύνοψη εγγράφων και παραπομπές, ευρήματα πινάκων κ.λπ. Αυτόματη δημιουργία συνόψεων και πηγών εγγράφων
  • Merge & Verify: Σημασιολογική ενοποίηση πληροφοριών από πολλαπλές πηγές και επαλήθευση αξιοπιστίας
  • Evidence Pack: Παροχή πακέτων απαντήσεων βασισμένων σε τεκμήρια

Σύνθετη συλλογιστική και planner

  • Planner/DAG: Σχεδιασμός βήμα προς βήμα και συλλογιστική βάσει DAG (Directed Acyclic Graph) για σύνθετα ερωτήματα

Ενοποιημένη αρχιτεκτονική agent

  • cip-5-agent Supervisor: Ανώτατος agent που διαχειρίζεται και συντονίζει ολόκληρη τη διαδικασία αναζήτησης/συλλογιστικής/ενοποίησης
Εικόνα κύριου κειμένου

3. Σύνοψη και σύγκριση της δομής

Με λίγα λόγια, η Semantic DB λαμβάνει δεδομένα διαφόρων μορφών (φωνή, κείμενο, εικόνες, βίντεο κ.λπ.) και ταξινομεί τη γνώση συνδέοντας όχι μόνο απλά Chunk, αλλά και τις σημασιολογικές σχέσεις μεταξύ των δεδομένων (πλαίσιο, ιεραρχία, αιτιότητα κ.λπ.).

Με βάση αυτό, πραγματοποιεί αναζήτηση και συλλογιστική αξιοποιώντας σημασιολογικές συνδέσεις, αντί για αναζήτηση βάσει λέξεων-κλειδιών/ομοιότητας όπως στο RAG, επιτρέποντας έτσι την απόκτηση ακριβέστερων πληροφοριών και απαντήσεων από την AI.

Επιπλέον, επειδή αποθηκεύεται με τη μορφή γράφου γνώσης/σημασιολογικού δικτύου, είναι εύκολη η συνεχής επέκταση και συμπλήρωσή του.

Η CLEVI εντόπισε τους περιορισμούς των συστημάτων RAG στην εποχή του μεγάλου μετασχηματισμού της AI και, μέσω μιας σημασιολογικής βάσης δεδομένων και ιδιόκτητων μοντέλων AI που μπορούν να τους επιλύσουν, είναι πλέον σε θέση να παρέχει στους πελάτες ταχύτερες απαντήσεις με ακριβέστερα και πιο αξιόπιστα δεδομένα.

Το σύστημα AI της CLEVI μπορεί, σε οποιοδήποτε περιβάλλον και ανεξάρτητα από τον τύπο του τομέα, να μετατρέπει τα πολύτιμα δεδομένα των πελατών σε αξία.

Και στο μέλλον, η CLEVI θα καταβάλλει κάθε δυνατή προσπάθεια για να μεγιστοποιεί την αξία των δεδομένων των πελατών και να παρέχει καινοτόμες εμπειρίες AI.

Σας προσκαλούμε να βιώσετε το μέλλον της νέας AI μαζί με την CLEVI.

Επικοινωνία και αίτημα για επίδειξη: [email protected]

Copyright© 2025 Clevi Inc. All rights reserved.

Επιστροφή στην αίθουσα Τύπου
CLEVI

Γλώσσα και περιοχή

Οι γλώσσες που μεταφράζονται από μηχανή επισημαίνονται. Η διαθεσιμότητα ακολουθεί το δημοσιευμένο πακέτο ιστοτόπου.

136 γλώσσες

Προτεινόμενο

1

Ανατολική Ασία

7

Νοτιοανατολική Ασία

11

Νότια Ασία

18

Κεντρική Ασία

5

Μέση Ανατολή και Καύκασος

10

Δυτική Ευρώπη και Νότια Ευρώπη

16

Ηνωμένο Βασίλειο και Ιρλανδία

4

Βόρεια Ευρώπη

10

Κεντρική Ευρώπη και Βαλκάνια

14

Ανατολική Ευρώπη

5

Ανατολική Αφρική

8

Δυτική Αφρική και Μέση Αφρική

9

Νότιος Αφρική

8

Αμερική

5

Ωκεανία

5