Fonte: Lee Won-ji, Electronic Times
Citazione integrale dell'articolo “CLEVI, 79,07% su GAIA con un modello proprietario sviluppato from scratch... Tra il 2,5% dei migliori su 3.090 modelli”
Data di pubblicazione: 2026-04-07
Link: https://www.etnews.com/20260407000203
Stack di modelli proprietari cip-5.5-agent·cip-5.5-mm: tutti e 5 gli agenti oltre i 70 punti
Tasso di risposte corrette superiore al 98% considerando la perdita di informazioni, oltre quello umano (92%)
La startup di IA 'CLEVI' ha registrato un tasso di risposte corrette del 79,07% nel benchmark globale per agenti di IA 'GAIA', utilizzando un modello proprietario sviluppato from scratch, posizionandosi tra il 2,5% dei migliori modelli sulla base dei 3.090 modelli registrati complessivamente.
Secondo le spiegazioni del settore, nel mercato dei benchmark per l'IA, GAIA è considerato un benchmark che riflette fedelmente le capacità degli 'agenti di IA pratici'. Sviluppato congiuntamente da Meta AI, HuggingFace e dall'Università Paris-Saclay, questo benchmark è stato presentato per la prima volta nel novembre 2023.
GAIA si distingue dagli altri benchmark per tre aspetti fondamentali. Primo, poiché le risposte corrette non sono pubbliche, non è possibile l'overfitting. Secondo, poiché richiede ragionamento complesso multistep e multimodale, non è possibile ottenere punteggi elevati con il semplice pattern matching. Terzo, oltre 3.090 modelli da tutto il mondo competono alle stesse condizioni tramite la classifica ufficiale di HuggingFace.
Il set di test è composto complessivamente da 301 domande. Il Livello 1 richiede l'uso di un singolo strumento e un ragionamento semplice; il Livello 2 combina più strumenti e richiede un ragionamento di livello intermedio; il Livello 3 comprende le domande di massima difficoltà, che richiedono pianificazione ed esecuzione da parte dell'agente in almeno 5 fasi. Al momento della pubblicazione del benchmark, il punteggio dei modelli GPT (con plugin) si attestava intorno al 15%, mentre attualmente i team ai vertici lo hanno portato al 70-80%.
In questo contesto, CLEVI ha sottolineato che l'aspetto tecnicamente più rilevante di questo risultato è il fatto di non aver utilizzato affatto API di LLM esterni come GPT, Claude o Gemini. La caratteristica distintiva di CLEVI è aver utilizzato due modelli sviluppati internamente con un approccio from scratch.
cip-5.5-agent è un modello di IA agentica che funge da cervello centrale della pipeline di agenti, pianificando (planning), eseguendo (execution) e verificando (verification) autonomamente attività complesse. cip-5.5-mm è un modello multimodale general-purpose ad alte prestazioni, in grado di comprendere e ragionare su diversi formati di file, tra cui audio, immagini e video. Poiché una parte significativa delle domande GAIA include input non testuali, come file PDF, immagini e audio, questa capacità multimodale è diventata un fattore chiave per ottenere punteggi elevati.
Basandosi su questi due modelli proprietari, CLEVI ha presentato a GAIA 5 configurazioni di agenti differenti, ottenendo tutte un punteggio superiore a 70.
Secondo quanto spiegato dall’azienda, una successiva revisione interna di CLEVI ha evidenziato risultati interessanti. Su un totale di 301 domande, per alcune di esse le fonti che consentivano di verificare le risposte corrette erano ormai scomparse dal web pubblico. Si tratta di informazioni che in passato erano verificabili online o tramite motori di ricerca, ma che sono state eliminate o modificate e non sono più accessibili. Rivalutando i risultati sulla base delle informazioni attualmente verificabili pubblicamente dagli esseri umani, il tasso di risposte corrette di CLEVI è risultato superiore al 98%. Si tratta di un valore che supera già la media umana del 92%.
Un rappresentante di CLEVI ha spiegato: “Senza combinare modelli esterni, CLEVI ha portato tutti e 5 gli agenti a ottenere oltre 70 punti, entrando nel top 2,5% del benchmark pubblico utilizzando esclusivamente modelli proprietari from scratch e soluzioni di agenti AI proprietarie. In futuro, si prevede che sarà possibile migliorare ulteriormente anche il punteggio ufficiale attraverso il perfezionamento dei modelli e delle soluzioni di agenti proprietari. Questo risultato è particolarmente significativo perché dimostra una 'fiducia verificata' misurata su un benchmark pubblico globale, rappresenta un risultato ottenuto da un’azienda coreana di sviluppo AI sulla base di modelli proprietari from scratch, è il risultato di uno stack di modelli indipendente e non della combinazione di modelli esterni e, considerando la perdita di informazioni relativa ad alcune domande, ha un valore interpretativo superiore al punteggio stesso”.
