Nòvas

La start-up d’IA CLEVI entre dans les 2,5 % superiors de GAIA… e mòstra una credibilitat verificada

Font : Digital Times, Gubon-gyu, jornalista

Font : Digital Times, Gubon-gyu, jornalista

Citacion integrala de l’article « La start-up d’IA CLEVI entre dins los 2,5 % superiors de GAIA… e mòstra una credibilitat verificada »

Data de publicacion : 2026-04-08

Ligam : https://n.news.naver.com/article/029/0003020511?sid=105

La start-up d’IA sud-coreana « CLEVI (Clevi) » a anonciat qu’après aver bastit sos pròpris modèls e sa pròpria solucion d’agent des de zèro, dintrava per la primièra vegada en Corèa del Sud dins los 2,5 % superiors del referencial GAIA, sus la basa dels 3 090 modèls enregistrats.

Segon las explicacions del sector, GAIA, concebut per Meta AI e administrat per Hugging Face, demanda a l’IA non pas « la capacitat de plan far una sola causa », mas « la capacitat de combinar mantuna aptitud per resòlver de problèmas reals ». Cal trobar d’informacions sul Web, legir de tablèus dins de fichièrs PDF, analisar d’imatges, executar de còdi per efectuar de calculs e sintetizar los resultats per donar una responsa unica. Amb 301 questions confidencialas, tres nivèls de dificultat e lo principi de non-divulgacion de las responsas corrèctas, l’estructura empacha tant lo subreaprestissatge coma la tricha.

Per obténer una nòta elevada a aquel examen, doas causas son necessàrias. D’un costat, la capacitat de rasonament del modèl lingüistic que servís de basa e, de l’autre, una solucion d’agent que connecte aquel modèl als espleches del mond real per li permetre d’efectuar de trabalhs de manièra autonòma. Quitament se lo modèl es excellent, un agent feble pòt pas resòlver lo Level 3 ; e quitament se l’agent es fòrça elaborat, una capacitat de rasonament insufisenta del modèl propaga las responsas incorrèctas tre las etapas intermediàrias.

En observant l’estructura actuala del classament GAIA, se desvela un esquèma interessant. La màger part dels agents classificats dins los primièrs rengs adopta una estrategia de « mescla de mantun modèl », en combinant divèrses modèls de las grandas entrepresas tecnologicas coma GPT, Claude e Gemini. Es una apròcha racionala que combina los punts fòrts de cada modèl e se protegís contra la diminucion de las nòtas causada per de pèrdas d’informacion, entre d’autras causas.

En revènge, CLEVI a pas rejunt aquela fila. Desvolopat segon una apròcha des de zèro, cip-5.5-agent (IA agentica) efectua autonòmament la planificacion, l’execucion e la verificacion de prètzfaches complèxes, mentre que cip-5.5-mm (multimodal generalista d’auta prestacion) compren e rasona sus divèrses formats de fichièrs, coma l’àudio, las imatges e las vidèos. Los dos modèls foguèron desvolopats independentament al dintre de CLEVI e cap d’API LLM extèrna foguèt pas utilizada.

E amb aquesta pila de modèls proprietaris, 5 agents participèron a GAIA e totes obtenguèron mai de 70 punts. Del melhor resultat, 79,07 %, al 70,76 %, aquò demostrèt la robustesa de l’ensemble de la pila, e non pas la fortuna d’un resultat isolat.

Imatge del còs del tèxte

Segon las explicacions del proveïdor, darrèr la puntuacion oficiala de 79,07 % i a un autre nombre. La revision posteriora intèrna de CLEVI a confirmat qu’un nombre important de las 301 questions aviá perdut son evidéncia de responsa corrècta sus lo web public actual. Quand l’evaluacion foguèt recalculada en prenent en compte sonque las questions que la responsa corrècta existís encara sul web, lo taus de responsas corrèctas de CLEVI èra superior a 98 %. Es una chifra qu’a ja depassat la mejana umana (92 %).

Benlèu qu’un mescladís de modèls generalistas poderoses d’autres entrepresas auriá permés d’aumentar encara la puntuacion oficiala. Pasmens, CLEVI causiguèt deliberadament de non adoptar aquesta estrategia. L’objectiu d’aqueste benchmark èra pas de competir per la puntuacion mai nauta, mas de verificar se son modèl proprietari from scratch aviá atench un nivèl que li permetèsse de competir sus l’empont mondial.

Lo fach d’aparéisser dins lo classament de GAIA revèst una importància màger, perque significa dispausar d’una credibilitat verificada atribuïda per una evaluacion independenta de tresen. Aquò constituís una pròva objectiva utilizabla dins totes los estadis: recèrca d’investiments, expansion internacionala e vendes B2B.

Un representant de CLEVI declarèt: «Parmi las 63 responsas oficialament incorrèctas, una part importanta èra deguda a de non-conformitats del format de sortida, a d’errors d’interpretacion de documents visuals e a de questions impossiblas de resòlvre perque las informacions avián desaparegut. Es pas una limitacion fondamentala del rasonament logic, mas un problèma de precision del posttractament e de disponibilitat de las informacions extèrnas. Coma se tracta d’un modèl proprietari, CLEVI pòt se melhorar ela meteissa. Aquí l’avantatge estructural del modèl proprietari from scratch. La capitada de CLEVI pausa aquesta question al sector de l’IA coreana: “Fins a quand dependrem de ‘cervèls manlevats’?” CLEVI a causit lo camin mai dificil, lo from scratch, e vòl provar aquesta responsa sus l’empont mondial», precisèt. »

Tornar a la sala de premsa
CLEVI

Lenga e region

Las lengas tradusidas automaticament son marcadas. La disponibilitat seguís lo paquet del site publicat.

136 lengas

Recomandat

1

Asia Orientala

7

Asia del Sud-Èst

11

Asia del Sud

18

Asia Centrala

5

Orient Mejan e Caucàs

10

Euròpa Occidentala e Meridionala

16

Bretanha e Irlanda

4

Euròpa del Nòrd e Baltic

10

Euròpa Centrala e Balcans

14

Euròpa Orientala

5

Àfrica Orientala e la Bana

8

Àfrica Occidentala e Centrala

9

Àfrica Australa

8

Las Americas

5

Lo Pacific

5
La start-up d’IA CLEVI entre dans les 2,5 % superiors de GAIA… e mòstra una credibilitat verificada — CLEVI