Nyheder

AI-startuppen CLEVI træder ind i top 2,5 % på GAIA … dokumenterer sin troværdighed

Kilde: Digital Times, journalist Bon-gyu Gu

Kilde: Digital Times, journalist Bon-gyu Gu

Citat af hele artiklen “AI-startuppen CLEVI træder ind i top 2,5 % på GAIA … dokumenterer sin troværdighed”

Udgivelsesdato 2026-04-08

Link: https://n.news.naver.com/article/029/0003020511?sid=105

Den sydkoreanske AI-startup ‘CLEVI (Clevi)’ har oplyst, at den for første gang i Sydkorea er nået ind blandt de øverste 2,5 % på GAIA-benchmarken ud af i alt 3.090 registrerede modeller, efter at have udviklet sin egen model og sin egen agentsolution from scratch.

Ifølge branchekilder undersøger GAIA, som er designet af Meta AI og drives af Hugging Face, ikke blot AI’ens evne til at ‘være god til én ting’, men dens evne til at ‘kombinere flere evner for at løse problemer fra den virkelige verden’. Den skal finde information på nettet, læse tabeller i PDF-filer, analysere billeder, køre kode for at udføre beregninger og samle resultaterne til ét korrekt svar. Med 301 private spørgsmål, tre sværhedsgrader og et princip om ikke at offentliggøre svarene er benchmarken konstrueret, så hverken overtilpasning eller snyd er muligt.

For at opnå en høj score i denne test kræves der to ting. For det første ræsonneringsevnen i den underliggende sprogmodel og for det andet en agentsolution, der forbinder modellen med værktøjer fra den virkelige verden og gør den i stand til at udføre opgaver autonomt. Uanset hvor god modellen er, kan den ikke løse Level 3, hvis agenten er svag, og uanset hvor sofistikeret agenten er, vil forkerte svar blive videreført på mellemniveauet, hvis modellens ræsonneringsevne er utilstrækkelig.

GAIA-ledertavlens nuværende struktur viser et interessant mønster. De fleste agenter i toppen anvender strategien ‘multi-model mix’, hvor flere big tech-modeller som GPT, Claude og Gemini kombineres. Det er en rationel tilgang, der kombinerer de enkelte modellers styrker og beskytter mod pointtab som følge af informationstab og lignende.

CLEVI har derimod ikke sluttet sig til denne gruppe. cip-5.5-agent (agentisk AI), der er udviklet from scratch, udfører autonomt planlægning, gennemførelse og verifikation af komplekse opgaver, mens cip-5.5-mm (højtydende generel multimodal model) forstår og ræsonnerer over forskellige filformater, herunder lyd, billeder og video. Begge modeller er udviklet uafhængigt internt hos CLEVI, og der er ikke anvendt eksterne LLM-API’er overhovedet.

Med denne egenudviklede modelstak stillede CLEVI fem agenter op i GAIA, og samtlige opnåede over 70 point. Fra den højeste score på 79,07 % til 70,76 % dokumenterer resultaterne stabiliteten i hele stakken – ikke blot heldet ved et enkelt resultat.

Billede i brødteksten

Ifølge virksomheden gemmer der sig et andet tal bag den officielle score på 79,07 %. CLEVI's interne efterfølgende gennemgang viste, at en betydelig del af de 301 spørgsmål ikke længere havde belæg for de korrekte svar på det offentligt tilgængelige web. Ved en genvurdering baseret udelukkende på spørgsmål, hvor det korrekte svar stadig findes på nettet, lå CLEVI's svarprocent på over 98 %. Det er allerede højere end menneskers gennemsnit på 92 %.

Hvis man havde kombineret stærke generelle modeller fra andre virksomheder, kunne den officielle score naturligvis være blevet endnu højere. CLEVI valgte imidlertid bevidst ikke denne strategi. Målet med denne benchmark var ikke at konkurrere om den højeste score, men at verificere, om en egen model udviklet from scratch havde nået et niveau, hvor den kunne konkurrere på den globale scene.

At få sit navn på GAIA's rangliste har stor betydning, fordi det indebærer en verificeret troværdighed tildelt gennem en uafhængig tredjepartsevaluering. Det udgør et objektivt grundlag, der kan anvendes i alle sammenhænge – fra kapitalrejsning og international ekspansion til B2B-salg.

En repræsentant for CLEVI udtalte: “En betydelig del af de 63 officielt forkerte svar skyldtes uoverensstemmelser i outputformatet, fejl i fortolkningen af visuelt materiale samt spørgsmål, der ikke kunne besvares på grund af tab af information. Det handler snarere om præcisionen i efterbehandlingen og tilgængeligheden af ekstern information end om grundlæggende begrænsninger i logisk ræsonnement. Fordi det er vores egen model, kan CLEVI selv forbedre den. Det er netop den strukturelle fordel ved en egen model udviklet from scratch. CLEVI's resultat rejser spørgsmålet i den koreanske AI-branche: ‘Hvor længe vil vi fortsat være afhængige af lånte hjerner?’ CLEVI har valgt den vanskeligere vej med from scratch og ønsker at bevise svaret på den globale scene,” lød det.

Tilbage til nyhedsredaktionen
CLEVI

Sprog og region

Maskinoversatte sprog er markeret. Tilgængeligheden følger den offentliggjorte webstedspakke.

136 sprog

Anbefales

1

Østasien

7

Sydøstasien

11

Sydasien

18

Centralasien

5

Mellemøsten og Kaukasus

10

Vesteuropa og Sydeuropa

16

Storbritannien og Irland

4

Nordeuropa

10

Centraleuropa og Balkan

14

Østeuropa

5

Østafrika

8

Vestafrika og Centralafrika

9

Det sydlige Afrika

8

Nord-, Mellem- og Sydamerika

5

Oceanien

5
AI-startuppen CLEVI træder ind i top 2,5 % på GAIA … dokumenterer sin troværdighed — CLEVI