Nyheter

CLEVI oppnår 79,07 % i GAIA med egen modell utviklet from scratch ... blant de 2 5 % beste av 3 090 modeller

Kilde: Electronic Times, reporter Lee Won-ji

Kilde: Electronic Times, reporter Lee Won-ji

Full gjengivelse av artikkelen «CLEVI oppnår 79,07 % i GAIA med egen modell utviklet from scratch ... blant de 2,5 % beste av 3 090 modeller»

Publiseringsdato: 2026-04-07

Lenke: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm egen modellstakk med fem agenter, alle over 70 poeng

98 %+ korrekt svarprosent når informasjonstap tas i betraktning, høyere enn mennesker (92 %)

Bilde i brødteksten

AI-oppstartsselskapet «CLEVI» oppnådde en korrekt svarprosent på 79,07 % i den globale AI-agent-benchmarken «GAIA» ved hjelp av sin egen modell utviklet from scratch, og plasserte seg blant de beste 2,5 % av totalt 3 090 registrerte modeller.

Ifølge bransjen vurderes GAIA i AI-benchmarkmarkedet som en benchmark som gjenspeiler egenskapene til «praktiske AI-agenter» på en pålitelig måte. Denne benchmarken, som ble utviklet i fellesskap av Meta AI, HuggingFace og Université Paris-Saclay, ble først offentliggjort i november 2023.

Det er tre hovedtrekk som skiller GAIA fra andre benchmarker. For det første er det umulig å overtilpasse modellen fordi fasiten ikke er offentlig. For det andre kreves sammensatt flerstegs- og multimodal resonnering, noe som gjør det umulig å oppnå høy poengsum med enkel mønstergjenkjenning. For det tredje konkurrerer over 3 090 modeller fra hele verden under identiske betingelser via den offisielle ledertavlen på HuggingFace.

Testsettet består av totalt 301 oppgaver. Level 1 omfatter bruk av ett enkelt verktøy og enkel resonnering, Level 2 krever kombinasjoner av flere verktøy og resonnering på middels nivå, mens Level 3 består av oppgaver med høyest vanskelighetsgrad, som krever agentplanlegging og -utførelse i fem eller flere trinn. Da benchmarken ble lansert, lå GPT-modeller (med plugin) på rundt 15 %, mens de ledende teamene nå har løftet resultatene til 70–80 %.

CLEVI fremhevet at det teknisk sett mest bemerkelsesverdige ved denne prestasjonen er at de ikke brukte eksterne LLM-API-er som GPT, Claude eller Gemini i det hele tatt. Det særegne ved CLEVI er at de brukte to modeller utviklet internt from scratch.

cip-5.5-agent er en agentisk AI-modell som fungerer som kjernen i agentpipelines som autonomt planlegger (planning), utfører (execution) og verifiserer (verification) komplekse oppgaver. cip-5.5-mm er en høyytelses, generell multimodal modell som forstår og trekker slutninger fra ulike filformater, blant annet tale, bilder og video. Siden en betydelig andel av GAIA-spørsmålene inneholder ikke-tekstlig input som PDF-er, bilder og lydfiler, ble denne multimodale evnen en avgjørende faktor for å oppnå høy poengsum.

CLEVI stilte med fem ulike agentkonfigurasjoner i GAIA, basert på disse to egenutviklede modellene, og alle oppnådde over 70 poeng.

Ifølge selskapets forklaring ble det bekreftet interessante resultater i CLEVIs interne etteranalyse. For enkelte av de totalt 301 spørsmålene var grunnlaget for de riktige svarene ikke lenger tilgjengelig på det offentlige nettet. Dette gjaldt tilfeller der informasjon som tidligere kunne bekreftes på nettet eller via søkemotorer, var blitt slettet eller endret og ikke lenger var tilgjengelig. Ved en ny vurdering innenfor omfanget av informasjon som mennesker for øyeblikket kan bekrefte offentlig, viste CLEVIs svarprosent seg å være over 98 %. Dette er allerede høyere enn menneskegjennomsnittet på 92 %.

En representant for CLEVI forklarte: «CLEVI oppnådde over 70 poeng med alle fem agentene og kom inn blant de øverste 2,5 % i den offentlige benchmarken, utelukkende ved hjelp av egne modeller utviklet from scratch og egne AI-agentløsninger, uten å blande inn eksterne modeller. Det ser ut til at den offisielle poengsummen kan forbedres ytterligere gjennom fremtidige forbedringer av egne modeller og agentløsninger. Resultatet er betydningsfullt fordi det viser «verifisert tillit» målt i en global offentlig benchmark, fordi det representerer et resultat basert på en egenutviklet modell fra en innenlandsk AI-utvikler, fordi det er et resultat av en uavhengig modellstakk og ikke en blanding av eksterne modeller, og fordi tap av informasjon i enkelte spørsmål gir resultatet en tolkningsverdi som går utover selve poengsummen.»

Tilbake til nyhetsrommet
CLEVI

Språk og region

Maskinoversatte språk er merket. Tilgjengeligheten følger den publiserte nettstedspakken.

136 språk

Anbefalt

1

Øst-Asia

7

Sørøst-Asia

11

Sør-Asia

18

Sentral-Asia

5

Midtøsten og Kaukasus

10

Vest-Europa og Sør-Europa

16

Storbritannia og Irland

4

Nord-Europa

10

Sentral-Europa og Balkan

14

Øst-Europa

5

Øst-Afrika

8

Vest-Afrika og Sentral-Afrika

9

Sørlige Afrika

8

Amerika

5

Oseania

5
CLEVI oppnår 79,07 % i GAIA med egen modell utviklet from scratch ... blant de 2 5 % beste av 3 090 modeller — CLEVI