Nijs

Op gegevens bewiisde konkurrinsjekrêft — in ynlânske AI-agent hat de top 2,5% fan 'e GAIA-benchmark berikt

Doe't de GAIA-benchmark foar it earst publisearre waard, helle sels GPT-4, dat doe ta de bêste modellen hearde, mar in skoare fan sa'n 30%. Dit betsjutte dat AI doe noch yn in ier stadium siet wat it fermogen oanbelanget om te “tinken en út te fieren”, om't GAIA mear freget as ienfâldige fraach-antwurdtaken: komplekse redenearring, it brûken fan ark en it oplossen fan problemen yn meardere stappen …

De betsjutting fan 'e GAIA-skoare — hoefolle is AI-agenttechnology foarútgien?

Doe't de GAIA-benchmark foar it earst publisearre waard, helle sels GPT-4, dat doe ta de bêste modellen hearde, mar in skoare fan sa'n 30%. Dit betsjutte dat AI doe noch yn in ier stadium siet wat it fermogen oanbelanget om te “tinken en út te fieren”, om't GAIA mear freget as ienfâldige fraach-antwurdtaken: komplekse redenearring, it brûken fan ark en it oplossen fan problemen yn meardere stappen.

Mar hjoed hawwe de bêste agents 92,36% berikt.

Dizze feroaring is mear as allinnich in prestaasjeferbettering. It is in yndikator dat AI no de faze fan ‘Agentic AI’ yngien is: net mear allinnich fragen beantwurdzje, mar situaasjes ynterpretearje, de nedige ark kieze en meardere stappen selsstannich planne en útfiere.

Yn mar in pear jier is AI evoluearre fan in “ark foar it generearjen fan kennis” nei in “útfierende partij dy't wurk útfiert”.

Ofbylding yn de haadtekst

📌 En binnen dy top 2,5% stiet CLEVI

Yn dizze wrâldwide kompetitive omjouwing is it feit dat de yn Korea ûntwikkele agent fan CLEVI opnommen is yn 'e top 2,5% fan it GAIA-leaderboard in bewiis fan technologyske selsstannigens. It is ek in foarbyld dat in yn Korea makke AI-agent foldocht oan wrâldwide noarmen. Dit hat mear betsjutting as allinnich in sifer. It betsjut dat de technology objektyf validearre is troch konkurrinsje mei tûzenen modellen op in iepenbiere wrâldwide benchmark, net yn in spesifike demoomjouwing.

Noch wichtiger is dat dizze prestaasje net it tafallige resultaat fan ien model is, mar dat agents mei ferskillende ûntwerpen op deselde Agent Stack werhelle prestaasjes op topnivo levere hawwe.

Mei oare wurden: de technology fan CLEVI is gjin “ien kear goed útpakte resultaat”, mar in reprodusearbere strukturele konkurrinsjekrêft en in fermogen op platfoarmnivo dat útwreidzje kin nei ferskate yndustryen en senario's.

Ofbylding yn de haadtekst

Wat betsjut dizze yndikator dan?

Foar brûkers is de grutste barriêre foar it ynfieren fan AI de fraach: "Kinne wy it echt mei fertrouwen tabetrouwe?"

Prestaasjes dy't hieltyd wer bewiisd binne op it poadium fan in wrâldwide iepen leaderboard fan tredden, net yn opfallende demo's of eigen presintaasjemateriaal, binne it meast objektive antwurd op dy fraach. Konkreet hat dit betsjutting op trije mêden.

As earste: fermindering fan it risiko by ymplemintaasje

It ferbinen fan net ferifiearre AI oan ynterne wurkprosessen is foar bedriuwen in flinke lêst.

Prestaasjes op betroubere benchmarks lykas GAIA kinne yn de faze fan technyske evaluaasje direkt brûkt wurde as basis foar fertrouwen.

As twadde: de realisaasje fan automatisearring fan komplekse wurkprosessen

In skoare yn de top 2,5% betsjut in nivo fan yntelliginsje dat fierder giet as ienfâldige werhellingstaken: it systeem begrypt kontekst, nimt selsstannich besluten yn meardere stappen en foltôget taken.

Wurkgebieten dy't oant no ta as "te dreech om oan AI oer te litten" beskôge waarden, kinne no in konkreet doelwyt foar automatisearring wurde.

As tredde: tagelyk gegevensfeiligens en prestaasjes garandearje

De eigen Agent Stack-arsjitektuer betsjut dat de gegevensstream net nei bûten giet.

Sa kinne jo ôfskie nimme fan it eardere dilemma wêryn feiligens opoffere wurde moast om AI mei hege prestaasjes te brûken.

Benammen yn yndustryen mei hege gefoelichheid fan gegevens, lykas de finansjele sektor, sûnenssoarch en juridyske tsjinsten, is dizze struktuer in beslissend ûnderskiedend foardiel.

De reprodusearberens fan de struktuer begjint al bewiisd te wurden.

En de prestaasjes fan elke agent dy't op dy struktuer boud is, sille al gau liede ta konkrete feroaringen yn de praktyk.

"Uteinlik wurdt de folsleinens fan technology foltôge troch 'fertrouwen' yn de praktyk."

CLEVI leveret net allinnich AI mei hege prestaasjes. Us essinsje is it bouwen fan 'útfieringsynfrastruktuer' dy't de feiligensbarriêres dêr't bedriuwen foar steane ôfbrekt en komplekse praktyske taken echt foltôgje kin.

Lit de faze fan neitinken oer ymplemintaasje no efter jo en begjin tegearre mei CLEVI oan in feilige en krêftige AI-wurkomjouwing.

As in betroubere partner oan wa't jo wurk mei fertrouwen tabetrouwe kinne, sille wy tegearre mei jo in konkrete ynnovaasje yn jo saaklike praktyk realisearje.

Werom nei de nijsredaksje
CLEVI

Taal en regio

Talen dy’t troch masine oerset binne, wurde markearre. De beskikberens folget it publisearre sitepakket.

136 talen

Oanrekommandearre

1

East-Azië

7

Sûdoost-Azië

11

Sûd-Azië

18

Sintraal-Azië

5

Midden-Easten en de Kaukasus

10

West-Europa en Sûd-Europa

16

Verenigd Koninkrijk en Ierlân

4

Noard-Europa

10

Midden-Europa en de Balkan

14

East-Europa

5

East-Afrika

8

West-Afrika en Sintraal-Afrika

9

Sûdelijk Afrika

8

Amerika

5

Oceanië

5
Op gegevens bewiisde konkurrinsjekrêft — in ynlânske AI-agent hat de top 2,5% fan 'e GAIA-benchmark berikt — CLEVI