Nuus

Clevi behaal 79,07% op GAIA met ’n from scratch-eie model... onder die top 2,5% van 3 090 modelle

Bron: Elektroniese Koerant, verslaggewer Lee Won-ji

Bron: Elektroniese Koerant, verslaggewer Lee Won-ji

Volledige aanhaling uit die artikel “Clevi behaal 79,07% op GAIA met ’n from scratch-eie model... onder die top 2,5% van 3 090 modelle”

Publikasiedatum: 2026-04-07

Skakel: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm se onafhanklike modelstapel: al 5 agente bo 70 punte

98%+ korrekte antwoorde wanneer inligtingsverlies in ag geneem word, hoër as mense (92%)

Beeld van die hoofteks

Die KI-opstartonderneming ‘Clevi’ het ’n korrekte-antwoordkoers van 79,07% op die globale KI-agentmaatstaf ‘GAIA’ behaal deur ’n from scratch-eie model te gebruik, en het binne die top 2,5% van altesaam 3 090 geregistreerde modelle geëindig.

Volgens bedryfsverduidelikings word GAIA in die KI-maatstafmark beskou as ’n maatstaf wat die vermoëns van ‘praktiese KI-agente’ getrou weerspieël. Hierdie maatstaf, wat gesamentlik deur Meta AI, HuggingFace en die Universiteit Paris-Saclay ontwikkel is, is die eerste keer in November 2023 bekendgestel.

GAIA se kernkenmerke wat dit van ander maatstawwe onderskei, is drieledig. Eerstens is oorpassing onmoontlik omdat die korrekte antwoorde nie bekend gemaak word nie. Tweedens is hoë tellings deur eenvoudige patroonpassing onmoontlik omdat dit multistap- en multimodale komplekse redenering vereis. Derdens ding meer as 3 090 modelle wêreldwyd onder dieselfde voorwaardes mee via HuggingFace se amptelike ranglys.

Die toetsstel bestaan uit altesaam 301 vrae. Level 1 behels die gebruik van ’n enkele hulpmiddel en eenvoudige redenering, Level 2 behels die kombinasie van veelvuldige hulpmiddels en intermediêre redenering, en Level 3 is die moeilikste vlak, wat agentbeplanning en -uitvoering in vyf of meer stappe vereis. Ten tyde van die maatstaf se bekendstelling was die telling ongeveer 15% vir GPT-modelle (met inproppe), terwyl toonaangewende spanne dit tans tot in die 70–80%-reeks verhoog het.

Clevi het beklemtoon dat die tegnies belangrikste aspek van hierdie prestasie is dat geen eksterne LLM-API’s soos GPT, Claude of Gemini gebruik is nie. Clevi het twee onafhanklik ontwikkelde modelle gebruik wat volgens die from scratch-benadering ontwikkel is.

cip-5.5-agent is ’n agentiese KI-model wat as die kernbrein van ’n agentpyplyn dien wat komplekse take outonoom beplan (planning), uitvoer (execution) en verifieer (verification). cip-5.5-mm is ’n hoëprestasie-algemene multimodale model wat verskeie lêerformate, soos stem, beelde en video, verstaan en daaroor redeneer. Omdat ’n aansienlike deel van die GAIA-vrae nie-tekstuele insette, soos PDF-, beeld- en oudiolêers, insluit, was hierdie multimodale vermoë ’n kernfaktor vir die hoë telling.

Clevi het, gebaseer op hierdie twee eie modelle, 5 verskillende agentkonfigurasies aan GAIA laat deelneem, en almal het tellings van 70 of hoër behaal.

Volgens die maatskappy se verduideliking is interessante resultate tydens Clevi se interne nagesieningsproses bevestig. Van die altesaam 301 vrae het sommige tans geen beskikbare bewys vir die korrekte antwoord op die openbare web nie. Dit is gevalle waar inligting wat voorheen aanlyn of via soekenjins beskikbaar was, verwyder of verander is en nie meer toeganklik is nie. Toe dit herwaardeer is binne die omvang van inligting wat mense tans in die openbaar kan verifieer, het Clevi se akkuraatheidskoers bo 98% geblyk te wees. Dit is reeds hoër as die menslike gemiddeld van 92%.

’n Clevi-verteenwoordiger het verduidelik: “Clevi het, sonder die vermenging van eksterne modelle, slegs met eie modelle wat from scratch ontwikkel is en eie KI-agentoplossings, daarin geslaag om vir al 5 agente tellings van 70+ te behaal en die top 2,5% in ’n openbare maatstaf te betree. Deur eie modelle en agentoplossings in die toekoms te verbeter, lyk dit moontlik dat die amptelike telling verder verhoog kan word. Hierdie prestasie is betekenisvol omdat dit ‘geverifieerde vertroue’ toon wat deur meting in ’n globale openbare maatstaf bevestig is; omdat dit ’n prestasie van ’n plaaslike KI-ontwikkelaar is wat op from scratch-eie modelle gebaseer is; omdat dit die resultaat van ’n onafhanklike modelstapel eerder as ’n mengsel van eksterne modelle is; en omdat dit, met inagneming van die verlies aan inligting in sommige vrae, meer interpretasiewaarde as net die telling het.”

Terug na die nuuskamer
CLEVI

Taal en streek

Masjienvertaalde tale word gemerk. Beskikbaarheid volg die gepubliseerde werfbundel.

136 tale

Aanbeveel

1

Oos-Asië

7

Suidoos-Asië

11

Suid-Asië

18

Sentraal-Asië

5

Midde-Ooste en die Kaukasus

10

Wes-Europa en Suid-Europa

16

Verenigde Koninkryk en Ierland

4

Noord-Europa

10

Sentraal-Europa en die Balkan

14

Oos-Europa

5

Oos-Afrika

8

Wes-Afrika en Midde-Afrika

9

Suider-Afrika

8

Amerikas

5

Oseanië

5