Νέα

CLEVI, με ιδιόκτητα μοντέλα που αναπτύχθηκαν from scratch, 79,07% στο GAIA... Στο κορυφαίο 2,5% μεταξύ 3.090 μοντέλων

Πηγή: δημοσιογράφος Lee Won-ji, Electronic Times

Πηγή: δημοσιογράφος Lee Won-ji, Electronic Times

Πλήρης παράθεση του άρθρου «CLEVI, με ιδιόκτητα μοντέλα που αναπτύχθηκαν from scratch, 79,07% στο GAIA... Στο κορυφαίο 2,5% μεταξύ 3.090 μοντέλων»

Ημερομηνία δημοσίευσης: 2026-04-07

Σύνδεσμος: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm: πέντε agents στο stack ιδιόκτητων μοντέλων, όλοι με βαθμολογία άνω των 70

Ποσοστό σωστών απαντήσεων άνω του 98% λαμβάνοντας υπόψη την απώλεια πληροφοριών, υψηλότερο από το ανθρώπινο (92%)

Εικόνα κύριου κειμένου

Η νεοφυής επιχείρηση AI «CLEVI» κατέγραψε ποσοστό σωστών απαντήσεων 79,07% στο παγκόσμιο benchmark AI agents «GAIA», χρησιμοποιώντας ιδιόκτητα μοντέλα που αναπτύχθηκαν from scratch, και κατατάχθηκε στο κορυφαίο 2,5% μεταξύ των 3.090 καταχωρισμένων μοντέλων συνολικά.

Σύμφωνα με την εξήγηση του κλάδου, στην αγορά των benchmarks AI το GAIA αξιολογείται ως benchmark που αντικατοπτρίζει πιστά τις δυνατότητες των «πρακτικών AI agents». Το benchmark αναπτύχθηκε από κοινού από τη Meta AI, το HuggingFace και το Πανεπιστήμιο Paris-Saclay και παρουσιάστηκε για πρώτη φορά τον Νοέμβριο του 2023.

Υπάρχουν τρία βασικά στοιχεία που διαφοροποιούν το GAIA από άλλα benchmarks. Πρώτον, επειδή οι σωστές απαντήσεις δεν δημοσιοποιούνται, η υπερπροσαρμογή είναι αδύνατη. Δεύτερον, επειδή απαιτεί σύνθετη συλλογιστική πολλαπλών βημάτων και πολυτροπική σύνθετη συλλογιστική, δεν είναι δυνατό να επιτευχθεί υψηλή βαθμολογία με απλή αντιστοίχιση μοτίβων. Τρίτον, περισσότερα από 3.090 μοντέλα από όλο τον κόσμο ανταγωνίζονται υπό τις ίδιες συνθήκες μέσω του επίσημου leaderboard του Hugging Face.

Το σύνολο δοκιμών αποτελείται από συνολικά 301 ερωτήσεις. Το Level 1 περιλαμβάνει τη χρήση ενός εργαλείου και απλή συλλογιστική, το Level 2 συνδυασμό πολλαπλών εργαλείων και συλλογιστική μεσαίου επιπέδου, ενώ το Level 3 περιλαμβάνει ερωτήσεις της υψηλότερης δυσκολίας, οι οποίες απαιτούν σχεδιασμό και εκτέλεση agent σε πέντε ή περισσότερα στάδια. Κατά την παρουσίαση του benchmark, το ποσοστό για τα μοντέλα GPT (με ενσωματωμένα plugins) περιοριζόταν περίπου στο 15%, ενώ σήμερα οι κορυφαίες ομάδες το έχουν αυξήσει στο 70–80%.

Μεταξύ αυτών, η CLEVI τόνισε ότι το τεχνικά πιο αξιοσημείωτο στοιχείο αυτού του επιτεύγματος είναι πως δεν χρησιμοποιήθηκαν καθόλου εξωτερικά LLM API, όπως τα GPT, Claude και Gemini. Χαρακτηριστικό είναι ότι η CLEVI χρησιμοποίησε δύο μοντέλα που ανέπτυξε η ίδια independently from scratch.

Το cip-5.5-agent είναι ένα agentic μοντέλο AI που λειτουργεί ως ο βασικός εγκέφαλος μιας διοχέτευσης πρακτόρων, η οποία σχεδιάζει (planning), εκτελεί (execution) και επαληθεύει (verification) αυτόνομα σύνθετες εργασίες. Το cip-5.5-mm είναι ένα μοντέλο υψηλής απόδοσης, γενικής χρήσης και πολυτροπικό, που κατανοεί και συλλογίζεται πάνω σε διάφορες μορφές αρχείων, όπως φωνή, εικόνες και βίντεο. Επειδή σημαντικό μέρος των ερωτήσεων του GAIA περιλαμβάνει μη κειμενικές εισόδους, όπως αρχεία PDF, εικόνες και αρχεία ήχου, αυτή η πολυτροπική ικανότητα αποτέλεσε βασικό παράγοντα για την επίτευξη υψηλής βαθμολογίας.

Η CLEVI συμμετείχε στο GAIA με 5 διαφορετικές διαμορφώσεις πρακτόρων, βασισμένες σε αυτά τα δύο ιδιόκτητα μοντέλα, και όλες κατέγραψαν βαθμολογία άνω των 70.

Σύμφωνα με την εταιρεία, ένας ενδιαφέρων παράγοντας επιβεβαιώθηκε κατά την εσωτερική εκ των υστέρων αξιολόγηση της CLEVI. Για ορισμένες από τις συνολικά 301 ερωτήσεις, τα στοιχεία που τεκμηρίωναν τις σωστές απαντήσεις είχαν πλέον εκλείψει από τον δημόσιο ιστό. Πρόκειται για περιπτώσεις όπου πληροφορίες που στο παρελθόν ήταν διαθέσιμες στο διαδίκτυο ή μέσω μηχανών αναζήτησης διαγράφηκαν ή τροποποιήθηκαν και δεν είναι πλέον προσβάσιμες. Κατά την επανεκτίμηση με βάση το εύρος των πληροφοριών που μπορούν να επαληθεύσουν δημόσια οι άνθρωποι σήμερα, το ποσοστό σωστών απαντήσεων της CLEVI ανήλθε σε πάνω από 98%. Το ποσοστό αυτό ήδη υπερβαίνει τον ανθρώπινο μέσο όρο του 92%.

Εκπρόσωπος της CLEVI εξήγησε: «Η CLEVI, χωρίς συνδυασμό εξωτερικών μοντέλων και χρησιμοποιώντας αποκλειστικά ιδιόκτητα μοντέλα from scratch και ιδιόκτητες λύσεις AI agent, κατέγραψε βαθμολογία 70+ και με τους 5 πράκτορες, κατακτώντας θέση στο κορυφαίο 2,5% του δημόσιου benchmark. Αναμένεται ότι η επίσημη βαθμολογία μπορεί να βελτιωθεί περαιτέρω μέσω της μελλοντικής βελτίωσης των ιδιόκτητων μοντέλων και των λύσεων πρακτόρων. Το επίτευγμα αυτό έχει ιδιαίτερη σημασία, επειδή παρουσιάζει «επαληθευμένη αξιοπιστία», μετρημένη σε ένα παγκόσμιο δημόσιο benchmark, επειδή αποτελεί επίδοση εγχώριας εταιρείας ανάπτυξης AI που βασίζεται σε ιδιόκτητα μοντέλα from scratch, επειδή είναι αποτέλεσμα μιας ανεξάρτητης στοίβας μοντέλων και όχι συνδυασμού εξωτερικών μοντέλων, και επειδή, λαμβάνοντας υπόψη την απώλεια πληροφοριών σε ορισμένες ερωτήσεις, έχει ερμηνευτική αξία που υπερβαίνει τη βαθμολογία».

Επιστροφή στην αίθουσα Τύπου
CLEVI

Γλώσσα και περιοχή

Οι γλώσσες που μεταφράζονται από μηχανή επισημαίνονται. Η διαθεσιμότητα ακολουθεί το δημοσιευμένο πακέτο ιστοτόπου.

136 γλώσσες

Προτεινόμενο

1

Ανατολική Ασία

7

Νοτιοανατολική Ασία

11

Νότια Ασία

18

Κεντρική Ασία

5

Μέση Ανατολή και Καύκασος

10

Δυτική Ευρώπη και Νότια Ευρώπη

16

Ηνωμένο Βασίλειο και Ιρλανδία

4

Βόρεια Ευρώπη

10

Κεντρική Ευρώπη και Βαλκάνια

14

Ανατολική Ευρώπη

5

Ανατολική Αφρική

8

Δυτική Αφρική και Μέση Αφρική

9

Νότιος Αφρική

8

Αμερική

5

Ωκεανία

5
CLEVI, με ιδιόκτητα μοντέλα που αναπτύχθηκαν from scratch, 79,07% στο GAIA... Στο κορυφαίο 2,5% μεταξύ 3.090 μοντέλων — CLEVI