Foinse: Lee Won-ji, Electronic Times
Sleachta iomlána ón alt “CLEVI, 79.07% in GAIA lena mhúnla féin forbartha from scratch... sa 2.5% is airde i measc 3,090 múnla”
Dáta foilsithe: 2026-04-07
Nasc: https://www.etnews.com/20260407000203
cruach mhúnlaí neamhspleách cip-5.5-agent·cip-5.5-mm, na 5 ghníomhaire ar fad os cionn 70 pointe
Níos mó ná 98% cruinnis agus caillteanas faisnéise á chur san áireamh, níos airde ná daoine (92%)
Bhain an gnólacht nuathionscanta AI ‘CLEVI’ cruinneas 79.07% amach sa tagarmharc domhanda do ghníomhairí AI ‘GAIA’ trína mhúnla féin forbartha from scratch a úsáid, agus bhí sé sa 2.5% is airde i measc na 3,090 múnla cláraithe san iomlán.
De réir míniú ón tionscal, meastar go léiríonn GAIA cumais ‘ghníomhairí AI phraiticiúla’ go dílis i margadh na dtagarmharcanna AI. D’fhorbair Meta AI, HuggingFace agus Ollscoil Paris-Saclay an tagarmharc seo i gcomhar, agus foilsíodh den chéad uair é i mí na Samhna 2023.
Tá trí phríomhghné ann a dhéanann idirdhealú idir GAIA agus tagarmharcanna eile. Ar an gcéad dul síos, toisc go bhfuil na freagraí cearta neamhphoiblí, ní féidir rófheistiú a dhéanamh. Ar an dara dul síos, toisc go n-éilíonn sé réasúnaíocht chasta ilchéime agus ilmhódach, ní féidir scór ard a bhaint amach le meaitseáil shimplí patrún. Ar an tríú dul síos, bíonn níos mó ná 3,090 múnla ar fud an domhain san iomaíocht faoi na coinníollacha céanna trí chlár ceannaireachta oifigiúil HuggingFace.
Tá 301 cheist san iomlán sa tacar tástála. Baineann Leibhéal 1 le huirlis aonair a úsáid agus réasúnaíocht shimplí, baineann Leibhéal 2 le huirlisí iolracha a chomhcheangal agus réasúnaíocht mheánleibhéil, agus éilíonn Leibhéal 3 pleanáil agus cur i gcrích gníomhaire thar 5 chéim, rud a fhágann gurb iad na ceisteanna is deacra iad. Ag an am a foilsíodh an tagarmharc, níor shroich samhlacha GPT (le breiseáin) ach thart ar 15%, agus tá na foirne is fearr faoi láthair tar éis é sin a ardú go dtí na 70idí agus na 80idí.
Ina measc seo, chuir CLEVI béim gurb é an ghné is suntasaí go teicniúil den éacht seo ná nár úsáideadh API LLM seachtrach ar bith, amhail GPT, Claude ná Gemini. Is saintréith de chuid CLEVI é gur úsáideadh dhá mhúnla a forbraíodh go neamhspleách trí chur chuige from scratch.
Is samhail AI ghníomhaíoch í cip-5.5-agent, a fheidhmíonn mar an inchinn lárnach do phíblíne gníomhairí a phleanálann (planning), a fheidhmíonn (execution) agus a fhíoraíonn (verification) tascanna casta go huathrialach. Is samhail ilmhódúil ghinearálta ardfheidhmíochta í cip-5.5-mm a thuigeann agus a dhéanann réasúnaíocht le formáidí éagsúla comhad, amhail guth, íomhánna agus físeáin. Ós rud é go bhfuil ionchuir neamhthéacsúla, amhail PDFanna, íomhánna agus comhaid fuaime, i gcuid mhór de cheisteanna GAIA, bhí an cumas ilmhódúil seo ina phríomhfhachtóir sa scór ard.
Bunaithe ar an dá shamhail inmheánacha seo, chuir CLEVI cúig chumraíocht ghníomhaire éagsúla isteach i GAIA, agus ghnóthaigh gach ceann acu scór os cionn 70.
De réir mhíniú na cuideachta, sainaithníodh toradh spéisiúil in athbhreithniú iarchúraim inmheánach CLEVI. As na 301 cheist san iomlán, bhí bunús na bhfreagraí ar chuid acu imithe ón ngréasán poiblí atá ar fáil faoi láthair. Is cásanna iad seo inar scriosadh nó inar athraíodh faisnéis a bhí ar fáil roimhe seo ar líne nó trí innill chuardaigh, rud a fhágann nach bhfuil sí inrochtana a thuilleadh. Nuair a rinneadh athmheasúnú laistigh den raon faisnéise atá ar fáil go poiblí lena fíorú ag daoine faoi láthair, bhí ráta cruinnis CLEVI os cionn 98%. Tá an figiúr seo níos airde cheana féin ná meán an duine, 92%.
Mhínigh ionadaí de chuid CLEVI: “Gan samhlacha seachtracha a mheascadh, ghnóthaigh na cúig ghníomhaire go léir scór 70+ le samhlacha inmheánacha forbartha from scratch agus réitigh AI ghníomhaireachta inmheánacha amháin, rud a chuir muid sa 2.5% is fearr den bhinse tomhais phoiblí. Is cosúil go bhféadfar feabhas breise a chur ar an scór oifigiúil amach anseo trí na samhlacha inmheánacha agus na réitigh ghníomhaireachta a fheabhsú. Tá tábhacht ar leith leis an éacht seo toisc go léiríonn sé ‘muinín fhíoraithe’ arna tomhas i mbinse tomhais poiblí domhanda; gur éacht é atá bunaithe ar shamhail inmheánach from scratch ó fhorbróir AI intíre; gur toradh é ar stac samhlacha neamhspleách seachas meascán de shamhlacha seachtracha; agus, ag cur san áireamh gur cailleadh faisnéis i gcuid de na ceisteanna, go bhfuil luach léirmhínithe aige a sháraíonn an scór féin.”
