Wateya puanên GAIA — Ajanên AI çiqas pêş ketine?
Dema ku benchmarka GAIA yekem car hate eşkerekirin, heta GPT-4, ku wê demê modela herî pêşketî bû, tenê li dor %30 puan girt. Ji ber taybetmendiyên GAIA yên ku ji bilî bersivdana pirsên hêsan, aqilmendiya tevlihev, bikaranîna amûran û çareserkirina pirsgirêkên pir-qonaxî dixwaze, ev nîşan dide ku AI ya wê demê di warê “şiyana fikirîn û pêkanînê” de hê di qonaxa destpêkê de bû.
Lê niha, ajanên di rêza jorîn de gihîştine %92.36.
Ev guhertin tenê başbûna performansê nîne. Ew nîşan dide ku AI êdî ji asta bersivdana pirsan derbas bûye û ketye qonaxa ‘Agentic AI’, ku tê de rewşê şîrove dike, amûrên pêwîst hildibijêre, û gelek gav bi serê xwe plan dike û pêk tîne.
Di nav çend salên tenê de, AI ji “amûra hilberandina zanînê” veguherî “saziya pêkanîna karan”.
📌 Û di nav wan 2.5%ên jorîn de, CLEVI heye
Di vê hawîrdora pêşbaziya gerdûnî de, ku ajana CLEVI ya li hundirê welat hatî çêkirin di rêza 2.5%ên jorîn a tabloya rêber a GAIA de cih girtiye, serxwebûna teknolojîk îspat dike û dibe mînakek ku ajanên AI yên li Koreyê hatine çêkirin li gorî pîvanên gerdûnî jî derbasdar in. Ev ji hejmarek tenê zêdetir wateyek heye. Ev tê wê wateyê ku ev şiyana teknolojîk bi pêşbaziya bi hezaran modelan re di benchmarka gerdûnî ya vekirî de, ne di hawîrdora demoyek taybet de, bi awayek objektîf hatiye piştrastkirin.
Xala girîngtir ew e ku ev serkeftin encama tesadufî ya modelekê tenê nîne; ajanên bi sêwiranên cuda, li ser heman Agent Stackê, bi dubarebûnê performansa asta jorîn hilberandine.
Bi gotineke din, teknolojiya CLEVI ne “encameke ku carekê baş derketiye”, lê şiyaneke strukturel a pêşbaziyê ya dikare were dubarekirin e, û di asta platformê de şiyanek e ku dikare berfirehî bibe ser pîşesaziyên û senaryoyên cuda.
Wê hingê, ev nîşanger çi wateyê dide?
Ji aliyê bikarhêner ve, astengiya herî mezin a pejirandina AI ev pirs e: "Ma bi rastî dikare were bawerkirin û kar jê re were spartin?"
Performansa ku ne di demo-yên spehî an materyalên ragihandina pargîdaniya xwe de, lê li ser qonaxa aliyekî sêyemîn a leaderboarda giştî ya cîhanî car bi car hatî îsbatkirin, bersiva herî objektîf a wê pirsê ye. Bi taybetî, ew di sê aliyên de wateyek girîng heye.
Yekem, kêmkirina rîska danasînê
Girêdana AI-ya nehatî verastkirin bi karên hundirîn, ji bo pargîdaniyan barêkî giran e.
Encama di benchmarkên bi navûdeng ên wekî GAIA de dikare di qonaxa nirxandina teknolojiyê de rasterast wekî bingeha baweriyê were bikaranîn.
Duyem, rastkirina otomasyona karên tevlihev
Nîşana %2.5 ya jorîn îstîreka astekî îstîrektî ye ku ji karên dubare wêdetir, kontekstê fam dike û bi xwe gelek gavên biryardanê dike û biqedîne.
Qadên karê ku heta niha wekî "zehmet e ku bê spartinê AI" dihatin dîtin, dikarin bibin armanca otomasyona pratîkî.
Sêyem, bi hev re ewlekariya daneyan û performansê misoger kirin
Avahiya xweser a Agent Stack tê wê wateyê ku herikîna daneyan dernakeve derveyî.
Dikare ji dilemaya kevneşopî ya ku ji bo bikaranîna AI-ya bi performansa bilind diviyabû ewlehî were qurban kirin, derkeve.
Bi taybetî di sektörên ku hestiyariya daneyan tê de bilind e, wekî darayî, tenduristî û karûbarên hiqûqî, ev avahî dibe xala cudaker a girîng.
Jixwe îsbatkirina dubarekirina vê avahiyê dest pê kiriye.
Û encama her agentê ku li ser vê avahiyê ava dibe, dê di dawiyê de li qadê bibe sedema guhertinên pratîkî.
"Di dawiyê de, temamtiya teknolojiyê bi 'baweriya' li qadê temam dibe."
CLEVI tenê bi pêşkêşkirina AI-ya bi performansa bilind bisînor nabe. Avakirina 'bingeha hilsûrxistî' ya ku dikare astengiya ewlehiyê ya li ber pargîdaniyan hilweşîne û karên tevlihev ên pratîkî biqedîne, bingeha hebûna me ye.
Niha ji qonaxa fikirîna danasînê derkevin û bi CLEVI re dest bi hawîrdora karê AI-ya ewle û bihêz bikin.
Wekî hevkarê ewle ku hûn dikarin karê xwe bi bawerî pê bispartin, em ê bi hev re di qadên karsaziya we de nûjeniyeke pratîkî ava bikin.
