Fréttir

Samkeppnisforskot sannað með gögnum — innlent AI-agent náði efstu 2,5% í GAIA-benchmarkinu

Þegar GAIA-benchmarkið var fyrst birt náði jafnvel GPT-4, sem þá var talin fremsta gerðin, aðeins um 30% stigum. Þar sem GAIA krefst ekki aðeins einfaldrar spurninga- og svarvinnslu heldur einnig flókinnar rökhugsunar, notkunar verkfæra og lausnar margþrepa vandamála, þýddi þetta að AI var á frumstigi hvað varðar „getuna til að hugsa og framkvæma“ á þeim tíma …

Merking GAIA-stiga — hversu mikið hafa AI-agentar þróast?

Þegar GAIA-benchmarkið var fyrst birt náði jafnvel GPT-4, sem þá var talin fremsta gerðin, aðeins um 30% stigum. Þar sem GAIA krefst ekki aðeins einfaldrar spurninga- og svarvinnslu heldur einnig flókinnar rökhugsunar, notkunar verkfæra og lausnar margþrepa vandamála, þýddi þetta að AI var á frumstigi hvað varðar „getuna til að hugsa og framkvæma“ á þeim tíma.

Nú hafa agentar í efstu sætunum hins vegar náð 92,36%.

Þessi breyting er ekki aðeins aukin afköst. Hún sýnir að AI hefur nú farið út fyrir það að svara spurningum og stigið inn á svið „Agentic AI“, þar sem það túlkar aðstæður, velur nauðsynleg verkfæri og skipuleggur og framkvæmir mörg skref sjálfstætt.

Á aðeins fáeinum árum hefur AI þróast úr „verkfæri til þekkingarsköpunar“ í „framkvæmdaraðila sem sinnir verkefnum“.

Mynd í meginmáli

📌 Og CLEVI er meðal þessara efstu 2,5%

Í þessu alþjóðlega samkeppnisumhverfi er skráning agent CLEVI, sem þróað var innanlands, meðal efstu 2,5% á GAIA-stigalistanum sönnun á tæknilegu sjálfstæði og dæmi um að AI-agent þróað í Kóreu standist einnig alþjóðleg viðmið. Þetta hefur meiri merkingu en aðeins töluleg niðurstaða. Það þýðir að tæknileg geta hefur verið hlutlægt sannreynd með samkeppni við þúsundir módela á alþjóðlegu, opinberu benchmarki — ekki aðeins í tilteknu sýningarumhverfi.

Enn mikilvægara er að þessi árangur er ekki tilviljunarkennd niðurstaða eins módels, heldur sú staðreynd að agentar með ólíka hönnun á sama Agent Stack hafa ítrekað náð afköstum í efstu sætunum.

Með öðrum orðum er tækni CLEVI ekki „niðurstaða sem tókst vel einu sinni“, heldur endurtakanlegt, kerfisbundið samkeppnisforskot og geta á vettvangsstigi sem hægt er að útvíkka til fjölbreyttra atvinnugreina og sviðsmynda.

Mynd í meginmáli

Hvað þýðir þessi mælikvarði þá?

Frá sjónarhóli notandans er stærsta hindrunin við innleiðingu AI spurningin: „Er í alvöru hægt að treysta því og fela því verkefni?“

Frammistaða sem hefur ítrekað verið sönnuð á sviði þriðja aðila, alþjóðlegum opinberum stigatöflum, en ekki í glæsilegum kynningum eða kynningarefni fyrirtækisins sjálfs, er hlutlægasta svarið við þeirri spurningu. Nánar tiltekið hefur hún þýðingu á þrjá vegu.

Í fyrsta lagi: Minni innleiðingaráhætta

Fyrir fyrirtæki er veruleg áskorun að tengja óprófaða gervigreind við innri starfsemi.

Niðurstöður úr traustum viðmiðum á borð við GAIA geta nýst beint sem grundvöllur trausts á stigi tæknilegrar úttektar.

Í öðru lagi: Flókin sjálfvirkni verkefna verður að veruleika

Talan 2,5% efst á listanum táknar greind á því stigi að hún nær út fyrir einföld endurtekin verk, skilur samhengi og tekur sjálfstæðar ákvarðanir í mörgum skrefum til að ljúka verkefnum.

Verkefnasvið sem hingað til hefur verið talið „of erfitt til að fela gervigreind“ getur orðið raunverulegt markmið sjálfvirknivæðingar.

Í þriðja lagi: Gagnaöryggi og frammistaða tryggð samtímis

Sérsniðin Agent Stack-uppbygging þýðir að gagnaflæðið fer ekki út fyrir kerfið.

Þannig er hægt að losna undan þeirri gömlu togstreitu að þurfa að fórna öryggi til að nýta afkastamikla gervigreind.

Sérstaklega í atvinnugreinum með viðkvæm gögn, svo sem fjármálum, heilbrigðisþjónustu og lögfræði, er þessi uppbygging afgerandi aðgreiningarþáttur.

Möguleikinn á að endurskapa uppbygginguna er þegar farinn að sannast.

Og árangur hvers umboðsmanns sem byggður er ofan á þessa uppbyggingu mun brátt leiða til raunverulegra breytinga á vettvangi.

„Að lokum verður fullkomnun tækninnar til að fullu með ‚vissu‘ á vettvangi.“

CLEVI lætur sér ekki nægja að bjóða upp á afkastamikla gervigreind. Kjarni okkar er að byggja „framkvæmdamiðaða innviði“ sem ryðja niður öryggishindrunum sem fyrirtæki standa frammi fyrir og geta í raun lokið flóknum verkefnum í daglegum rekstri.

Farið nú út fyrir stigið þar sem þið íhugið innleiðingu og hefjið, með CLEVI, öruggt og öflugt vinnuumhverfi fyrir gervigreind.

Sem traustur samstarfsaðili sem þið getið treyst fyrir verkefnum munum við skapa raunverulega nýsköpun saman á vettvangi ykkar eigin fyrirtækis.

Til baka í fréttastofu
CLEVI

Tungumál og svæði

Tungumál sem hafa verið þýdd með vélþýðingu eru merkt. Aðgengi fylgir útgefnum vefpakka.

136 tungumál

Mælt með

1

Austur-Asía

7

Suðaustur-Asía

11

Suður-Asía

18

Mið-Asía

5

Miðausturlönd og Kákasus

10

Vestur-Evrópa og Suður-Evrópa

16

Bretland og Írland

4

Norður-Evrópa

10

Mið-Evrópa og Balkanskaginn

14

Austur-Evrópa

5

Austur-Afríka

8

Vestur-Afríka og Mið-Afríka

9

Suðurhluti Afríku

8

Ameríka

5

Eyjaálfa

5
Samkeppnisforskot sannað með gögnum — innlent AI-agent náði efstu 2,5% í GAIA-benchmarkinu — CLEVI