Merking GAIA-stiga — hversu mikið hafa AI-agentar þróast?
Þegar GAIA-benchmarkið var fyrst birt náði jafnvel GPT-4, sem þá var talin fremsta gerðin, aðeins um 30% stigum. Þar sem GAIA krefst ekki aðeins einfaldrar spurninga- og svarvinnslu heldur einnig flókinnar rökhugsunar, notkunar verkfæra og lausnar margþrepa vandamála, þýddi þetta að AI var á frumstigi hvað varðar „getuna til að hugsa og framkvæma“ á þeim tíma.
Nú hafa agentar í efstu sætunum hins vegar náð 92,36%.
Þessi breyting er ekki aðeins aukin afköst. Hún sýnir að AI hefur nú farið út fyrir það að svara spurningum og stigið inn á svið „Agentic AI“, þar sem það túlkar aðstæður, velur nauðsynleg verkfæri og skipuleggur og framkvæmir mörg skref sjálfstætt.
Á aðeins fáeinum árum hefur AI þróast úr „verkfæri til þekkingarsköpunar“ í „framkvæmdaraðila sem sinnir verkefnum“.
📌 Og CLEVI er meðal þessara efstu 2,5%
Í þessu alþjóðlega samkeppnisumhverfi er skráning agent CLEVI, sem þróað var innanlands, meðal efstu 2,5% á GAIA-stigalistanum sönnun á tæknilegu sjálfstæði og dæmi um að AI-agent þróað í Kóreu standist einnig alþjóðleg viðmið. Þetta hefur meiri merkingu en aðeins töluleg niðurstaða. Það þýðir að tæknileg geta hefur verið hlutlægt sannreynd með samkeppni við þúsundir módela á alþjóðlegu, opinberu benchmarki — ekki aðeins í tilteknu sýningarumhverfi.
Enn mikilvægara er að þessi árangur er ekki tilviljunarkennd niðurstaða eins módels, heldur sú staðreynd að agentar með ólíka hönnun á sama Agent Stack hafa ítrekað náð afköstum í efstu sætunum.
Með öðrum orðum er tækni CLEVI ekki „niðurstaða sem tókst vel einu sinni“, heldur endurtakanlegt, kerfisbundið samkeppnisforskot og geta á vettvangsstigi sem hægt er að útvíkka til fjölbreyttra atvinnugreina og sviðsmynda.
Hvað þýðir þessi mælikvarði þá?
Frá sjónarhóli notandans er stærsta hindrunin við innleiðingu AI spurningin: „Er í alvöru hægt að treysta því og fela því verkefni?“
Frammistaða sem hefur ítrekað verið sönnuð á sviði þriðja aðila, alþjóðlegum opinberum stigatöflum, en ekki í glæsilegum kynningum eða kynningarefni fyrirtækisins sjálfs, er hlutlægasta svarið við þeirri spurningu. Nánar tiltekið hefur hún þýðingu á þrjá vegu.
Í fyrsta lagi: Minni innleiðingaráhætta
Fyrir fyrirtæki er veruleg áskorun að tengja óprófaða gervigreind við innri starfsemi.
Niðurstöður úr traustum viðmiðum á borð við GAIA geta nýst beint sem grundvöllur trausts á stigi tæknilegrar úttektar.
Í öðru lagi: Flókin sjálfvirkni verkefna verður að veruleika
Talan 2,5% efst á listanum táknar greind á því stigi að hún nær út fyrir einföld endurtekin verk, skilur samhengi og tekur sjálfstæðar ákvarðanir í mörgum skrefum til að ljúka verkefnum.
Verkefnasvið sem hingað til hefur verið talið „of erfitt til að fela gervigreind“ getur orðið raunverulegt markmið sjálfvirknivæðingar.
Í þriðja lagi: Gagnaöryggi og frammistaða tryggð samtímis
Sérsniðin Agent Stack-uppbygging þýðir að gagnaflæðið fer ekki út fyrir kerfið.
Þannig er hægt að losna undan þeirri gömlu togstreitu að þurfa að fórna öryggi til að nýta afkastamikla gervigreind.
Sérstaklega í atvinnugreinum með viðkvæm gögn, svo sem fjármálum, heilbrigðisþjónustu og lögfræði, er þessi uppbygging afgerandi aðgreiningarþáttur.
Möguleikinn á að endurskapa uppbygginguna er þegar farinn að sannast.
Og árangur hvers umboðsmanns sem byggður er ofan á þessa uppbyggingu mun brátt leiða til raunverulegra breytinga á vettvangi.
„Að lokum verður fullkomnun tækninnar til að fullu með ‚vissu‘ á vettvangi.“
CLEVI lætur sér ekki nægja að bjóða upp á afkastamikla gervigreind. Kjarni okkar er að byggja „framkvæmdamiðaða innviði“ sem ryðja niður öryggishindrunum sem fyrirtæki standa frammi fyrir og geta í raun lokið flóknum verkefnum í daglegum rekstri.
Farið nú út fyrir stigið þar sem þið íhugið innleiðingu og hefjið, með CLEVI, öruggt og öflugt vinnuumhverfi fyrir gervigreind.
Sem traustur samstarfsaðili sem þið getið treyst fyrir verkefnum munum við skapa raunverulega nýsköpun saman á vettvangi ykkar eigin fyrirtækis.
