Notizie

CLEVI, 79,07% su GAIA con un modello proprietario sviluppato from scratch... Tra il 2,5% dei migliori su 3.090 modelli

Fonte: Lee Won-ji, Electronic Times

Fonte: Lee Won-ji, Electronic Times

Citazione integrale dell'articolo “CLEVI, 79,07% su GAIA con un modello proprietario sviluppato from scratch... Tra il 2,5% dei migliori su 3.090 modelli”

Data di pubblicazione: 2026-04-07

Link: https://www.etnews.com/20260407000203

Stack di modelli proprietari cip-5.5-agent·cip-5.5-mm: tutti e 5 gli agenti oltre i 70 punti

Tasso di risposte corrette superiore al 98% considerando la perdita di informazioni, oltre quello umano (92%)

Immagine del corpo dell'articolo

La startup di IA 'CLEVI' ha registrato un tasso di risposte corrette del 79,07% nel benchmark globale per agenti di IA 'GAIA', utilizzando un modello proprietario sviluppato from scratch, posizionandosi tra il 2,5% dei migliori modelli sulla base dei 3.090 modelli registrati complessivamente.

Secondo le spiegazioni del settore, nel mercato dei benchmark per l'IA, GAIA è considerato un benchmark che riflette fedelmente le capacità degli 'agenti di IA pratici'. Sviluppato congiuntamente da Meta AI, HuggingFace e dall'Università Paris-Saclay, questo benchmark è stato presentato per la prima volta nel novembre 2023.

GAIA si distingue dagli altri benchmark per tre aspetti fondamentali. Primo, poiché le risposte corrette non sono pubbliche, non è possibile l'overfitting. Secondo, poiché richiede ragionamento complesso multistep e multimodale, non è possibile ottenere punteggi elevati con il semplice pattern matching. Terzo, oltre 3.090 modelli da tutto il mondo competono alle stesse condizioni tramite la classifica ufficiale di HuggingFace.

Il set di test è composto complessivamente da 301 domande. Il Livello 1 richiede l'uso di un singolo strumento e un ragionamento semplice; il Livello 2 combina più strumenti e richiede un ragionamento di livello intermedio; il Livello 3 comprende le domande di massima difficoltà, che richiedono pianificazione ed esecuzione da parte dell'agente in almeno 5 fasi. Al momento della pubblicazione del benchmark, il punteggio dei modelli GPT (con plugin) si attestava intorno al 15%, mentre attualmente i team ai vertici lo hanno portato al 70-80%.

In questo contesto, CLEVI ha sottolineato che l'aspetto tecnicamente più rilevante di questo risultato è il fatto di non aver utilizzato affatto API di LLM esterni come GPT, Claude o Gemini. La caratteristica distintiva di CLEVI è aver utilizzato due modelli sviluppati internamente con un approccio from scratch.

cip-5.5-agent è un modello di IA agentica che funge da cervello centrale della pipeline di agenti, pianificando (planning), eseguendo (execution) e verificando (verification) autonomamente attività complesse. cip-5.5-mm è un modello multimodale general-purpose ad alte prestazioni, in grado di comprendere e ragionare su diversi formati di file, tra cui audio, immagini e video. Poiché una parte significativa delle domande GAIA include input non testuali, come file PDF, immagini e audio, questa capacità multimodale è diventata un fattore chiave per ottenere punteggi elevati.

Basandosi su questi due modelli proprietari, CLEVI ha presentato a GAIA 5 configurazioni di agenti differenti, ottenendo tutte un punteggio superiore a 70.

Secondo quanto spiegato dall’azienda, una successiva revisione interna di CLEVI ha evidenziato risultati interessanti. Su un totale di 301 domande, per alcune di esse le fonti che consentivano di verificare le risposte corrette erano ormai scomparse dal web pubblico. Si tratta di informazioni che in passato erano verificabili online o tramite motori di ricerca, ma che sono state eliminate o modificate e non sono più accessibili. Rivalutando i risultati sulla base delle informazioni attualmente verificabili pubblicamente dagli esseri umani, il tasso di risposte corrette di CLEVI è risultato superiore al 98%. Si tratta di un valore che supera già la media umana del 92%.

Un rappresentante di CLEVI ha spiegato: “Senza combinare modelli esterni, CLEVI ha portato tutti e 5 gli agenti a ottenere oltre 70 punti, entrando nel top 2,5% del benchmark pubblico utilizzando esclusivamente modelli proprietari from scratch e soluzioni di agenti AI proprietarie. In futuro, si prevede che sarà possibile migliorare ulteriormente anche il punteggio ufficiale attraverso il perfezionamento dei modelli e delle soluzioni di agenti proprietari. Questo risultato è particolarmente significativo perché dimostra una 'fiducia verificata' misurata su un benchmark pubblico globale, rappresenta un risultato ottenuto da un’azienda coreana di sviluppo AI sulla base di modelli proprietari from scratch, è il risultato di uno stack di modelli indipendente e non della combinazione di modelli esterni e, considerando la perdita di informazioni relativa ad alcune domande, ha un valore interpretativo superiore al punteggio stesso”.

Torna alla sala stampa
CLEVI

Lingua e regione

Le lingue tradotte automaticamente sono contrassegnate. La disponibilità segue il pacchetto del sito pubblicato.

136 lingue

Consigliato

1

Asia orientale

7

Sud-est asiatico

11

Asia del Sud

18

Asia centrale

5

Medio Oriente e Caucaso

10

Europa occidentale e Europa meridionale

16

Regno Unito e Irlanda

4

Europa settentrionale

10

Europa centrale e Balcani

14

Europa orientale

5

Africa orientale

8

Africa occidentale e Africa centrale

9

Africa del Sud

8

Americhe

5

Oceania

5
CLEVI, 79,07% su GAIA con un modello proprietario sviluppato from scratch... Tra il 2,5% dei migliori su 3.090 modelli — CLEVI