Nuus

Mededingendheid wat deur data bewys word— ’n binnelandse KI-agent bereik die top 2,5% op die GAIA-benchmark

Toe die GAIA-benchmark aanvanklik bekendgestel is, het selfs GPT-4, wat destyds ’n model van die hoogste vlak was, slegs ’n telling van ongeveer 30% behaal. Dit beteken dat KI destyds nog in die vroeë stadiums was wat die vermoë betref om te “dink en uit te voer”, aangesien GAIA, benewens eenvoudige vraag-en-antwoord, komplekse redenering, die gebruik van gereedskap en die oplossing van meerstapprobleme vereis …

Die betekenis van die GAIA-telling — Hoe ver het KI-agente gevorder?

Toe die GAIA-benchmark aanvanklik bekendgestel is, het selfs GPT-4, wat destyds ’n model van die hoogste vlak was, slegs ’n telling van ongeveer 30% behaal. Dit beteken dat KI destyds nog in die vroeë stadiums was wat die vermoë betref om te “dink en uit te voer”, aangesien GAIA, benewens eenvoudige vraag-en-antwoord, komplekse redenering, die gebruik van gereedskap en die oplossing van meerstapprobleme vereis.

Vandag het agente in die boonste ranglys egter 92,36% bereik.

Hierdie verandering is meer as bloot ’n verbetering in prestasie. Dit is ’n aanduiding dat KI nou die vlak van bloot vrae beantwoord het oorskry en die ‘Agentic AI’-fase betree het—’n fase waarin dit situasies interpreteer, die nodige gereedskap kies en verskeie stappe self beplan en uitvoer.

Binne slegs ’n paar jaar het KI van ’n “hulpmiddel vir kennisgenerering” ontwikkel tot ’n “uitvoerende entiteit wat werk verrig”.

Hoofteksprent

📌 En binne daardie top 2,5% is Clevi

In hierdie wêreldwye mededingende omgewing bewys die feit dat Clevi se agent, wat plaaslik ontwikkel is, op die top 2,5% van die GAIA-ranglys geplaas is, tegnologiese selfstandigheid en dien dit as ’n voorbeeld dat ’n KI-agent wat in Korea ontwikkel is, ook volgens wêreldwye standaarde kan presteer. Dit het betekenis wat verder strek as bloot ’n getal. Dit beteken dat dit tegnologiese vermoëns is wat objektief gevalideer is deur mededinging met duisende modelle op ’n wêreldwye openbare benchmark, nie in ’n spesifieke demonstrasie-omgewing nie.

Nog belangriker is dat hierdie prestasie nie die toevallige resultaat van ’n enkele model is nie, maar dat agente met verskillende ontwerpe herhaaldelik topprestasies gelewer het op dieselfde Agent Stack.

Met ander woorde, Clevi se tegnologie is nie bloot ’n “eenmalige goeie resultaat” nie, maar gestruktureerde, reproduseerbare mededingende krag—vermoëns op platformvlak wat na verskeie nywerhede en scenario’s uitgebrei kan word.

Hoofteksprent

Wat beteken hierdie aanwyser dan?

Vanuit die gebruiker se perspektief is die grootste hindernis vir die invoering van KI die vraag: "Kan ek dit werklik vertrou en die taak daaraan toevertrou?"

Prestasie wat herhaaldelik bewys is op die verhoog van ’n derde party—’n wêreldwye openbare ranglys—en nie deur spoggerige demonstrasies of maatskappy-aanbiedings nie, is die mees objektiewe antwoord op daardie vraag. Konkreet het dit betekenis op drie vlakke.

Eerstens, vermindering van implementeringsrisiko

Om ongeverifieerde KI aan interne werk te koppel, is vanuit ’n onderneming se perspektief ’n aansienlike las.

Prestasies op geloofwaardige maatstawwe soos GAIA kan direk as grondslag vir vertroue tydens die tegniese evalueringsfase gebruik word.

Tweedens, die realisering van outomatisering van komplekse werk

Die syfer van die top 2,5% dui op ’n vlak van intelligensie wat verder gaan as eenvoudige herhalende take—dit verstaan konteks, maak self besluite oor verskeie stappe en voltooi die taak.

Werkgebiede wat tot dusver as “te moeilik om aan KI toe te vertrou” beskou is, kan nou werklike teikens vir outomatisering word.

Derdens, die gelyktydige versekering van datasekuriteit en prestasie

Die eie Agent Stack-struktuur beteken dat die datavloei nie na buite beweeg nie.

Dit maak dit moontlik om die vorige dilemma te oorkom waarin sekuriteit opgeoffer moes word om hoëprestasie-KI te gebruik.

Veral in nywerhede met hoë datasensitiwiteit, soos finansies, gesondheidsorg en regsdiens, word hierdie struktuur ’n beslissende onderskeidende faktor.

Die reproduceerbaarheid van die struktuur het reeds begin om bewys te word.

En die prestasies van elke agent wat op hierdie struktuur gebou word, sal weldra tot wesenlike veranderinge in die praktyk lei.

“Uiteindelik word die volwassenheid van tegnologie voltooi deur ‘vertroue’ in die praktyk.”

Clevi doen meer as om bloot hoëprestasie-KI te verskaf. Ons kern is om ’n ‘uitvoeringsgerigte infrastruktuur’ te bou wat die mure van sekuriteit waarmee ondernemings te kampe het, afbreek en komplekse praktiese werk werklik kan voltooi.

Beweeg nou verder as die fase waarin u slegs oor implementering nadink, en begin saam met Clevi ’n veilige en kragtige KI-werksomgewing.

As ’n betroubare vennoot aan wie u met vertroue werk kan toevertrou, sal ons saam met u wesenlike innovasie in u sake-omgewing skep.

Terug na die nuuskamer
CLEVI

Taal en streek

Masjienvertaalde tale word gemerk. Beskikbaarheid volg die gepubliseerde werfbundel.

136 tale

Aanbeveel

1

Oos-Asië

7

Suidoos-Asië

11

Suid-Asië

18

Sentraal-Asië

5

Midde-Ooste en die Kaukasus

10

Wes-Europa en Suid-Europa

16

Verenigde Koninkryk en Ierland

4

Noord-Europa

10

Sentraal-Europa en die Balkan

14

Oos-Europa

5

Oos-Afrika

8

Wes-Afrika en Midde-Afrika

9

Suider-Afrika

8

Amerikas

5

Oseanië

5