Newyddion

Cychwyniad AI CLEVI yn cyrraedd 2.5% uchaf GAIA… yn dangos hygrededd profedig

Ffynhonnell: Go Bon-gyu, Digital Times

Ffynhonnell: Go Bon-gyu, Digital Times

Dyfyniad llawn o’r erthygl “Cychwyniad AI CLEVI yn cyrraedd 2.5% uchaf GAIA… yn dangos hygrededd profedig”

Dyddiad cyhoeddi 2026-04-08

Dolen : https://n.news.naver.com/article/029/0003020511?sid=105

Dywedodd cychwyniad AI domestig ‘CLEVI (Clevi)’ ei fod, ar ôl adeiladu modelau mewnol a wnaed from scratch a datrysiadau asiant mewnol, wedi cyrraedd 2.5% uchaf meincnod GAIA, am y tro cyntaf yn y wlad, ymhlith y 3,090 o fodelau cofrestredig i gyd.

Yn ôl esboniad gan y diwydiant, mae GAIA, a ddyluniwyd gan Meta AI ac a weithredir gan Hugging Face, yn gofyn i AI nid am ‘y gallu i wneud un peth yn dda’ ond am ‘y gallu i gyfuno sawl gallu i ddatrys problemau go iawn’. Rhaid iddo ddod o hyd i wybodaeth ar y we, darllen tablau mewn PDF, dadansoddi delweddau, rhedeg cod i wneud cyfrifiadau, a chyfuno’r canlyniadau i gyflwyno un ateb cywir. Gyda 301 o gwestiynau cyfrinachol, tair lefel o anhawster, ac egwyddor o beidio â datgelu’r atebion cywir, mae’r strwythur yn ei gwneud yn amhosibl gorffitio na thwyllo.

Mae angen dau beth i gael sgôr uchel ar y prawf hwn. Y gallu rhesymu yn y model iaith sylfaenol, a datrysiad asiant sy’n cysylltu’r model hwnnw ag offer y byd go iawn ac yn ei alluogi i gyflawni tasgau’n annibynnol. Waeth pa mor dda yw’r model, os yw’r asiant yn wan ni ellir datrys Lefel 3; ac waeth pa mor soffistigedig yw’r asiant, os yw gallu rhesymu’r model yn annigonol, bydd atebion anghywir yn lledaenu yn y camau canol.

Wrth edrych ar strwythur presennol bwrdd arweinwyr GAIA, gwelir patrwm diddorol. Mae’r rhan fwyaf o’r asiantau ar y brig wedi mabwysiadu strategaeth ‘cymysgedd aml-fodel’ sy’n cyfuno modelau Big Tech lluosog fel GPT, Claude a Gemini. Mae’n ddull rhesymol sy’n cyfuno cryfderau pob model ac yn amddiffyn rhag gostyngiadau mewn sgoriau a achosir gan golli gwybodaeth, ymhlith pethau eraill.

Ar y llaw arall, ni ymunodd CLEVI â’r rhesi hynny. Mae cip-5.5-agent (AI asiantaidd), a ddatblygwyd trwy ddull from scratch, yn cynllunio, gweithredu ac yn dilysu tasgau cymhleth yn annibynnol, tra bod cip-5.5-mm (aml-foddol cyffredinol perfformiad uchel) yn deall ac yn rhesymu dros amrywiaeth o fformatau ffeiliau, gan gynnwys sain, delweddau a fideo. Datblygwyd y ddau fodel yn annibynnol o fewn CLEVI, ac ni ddefnyddiwyd API LLM allanol o gwbl.

A chyda’r pentwr modelau perchnogol hwn, anfonodd CLEVI 5 asiant i GAIA, a chofnododd pob un sgôr o 70+ pwynt. O’r uchaf, sef 79.07%, i 70.76%, profwyd sefydlogrwydd y pentwr cyfan, nid lwc un canlyniad unigol.

Delwedd yn y prif destun

Yn ôl esboniad y cwmni, y tu ôl i’r sgôr swyddogol o 79.07% mae rhif arall. Yn dilyn adolygiad ôl-weithredol mewnol gan CLEVI, canfuwyd bod nifer sylweddol o’r 301 o gwestiynau yn rhai lle roedd tystiolaeth ateb cywir wedi diflannu oddi ar y we gyhoeddus bresennol. Wrth ailasesu ar sail y cwestiynau hynny lle mae’r ateb cywir yn dal i fodoli ar y we, roedd cyfradd atebion cywir CLEVI yn uwch na 98%. Mae hynny eisoes yn uwch na’r cyfartaledd dynol (92%).

Wrth gwrs, pe bai wedi cyfuno modelau cyffredinol pwerus gan gwmnïau eraill, efallai y byddai wedi gallu codi’r sgôr swyddogol ymhellach. Fodd bynnag, dewisodd CLEVI beidio â mabwysiadu’r strategaeth honno’n fwriadol. Y rheswm oedd nad cystadlu am y sgôr uchaf oedd nod y meincnod hwn, ond gwirio a oedd model perchnogol from scratch wedi cyrraedd lefel a oedd yn gallu cystadlu ar y llwyfan byd-eang.

Mae cael enw ar fwrdd arweinwyr GAIA yn arwyddocaol iawn am ei fod yn golygu bod ganddo hygrededd profedig a roddwyd gan werthusiad annibynnol gan drydydd parti. Mae hyn yn sail wrthrychol y gellir ei defnyddio ym mhob cam, gan gynnwys denu buddsoddiad, ehangu dramor a gwerthu B2B.

Dywedodd cynrychiolydd CLEVI: “Deilliodd cyfran sylweddol o’r 63 ateb anghywir swyddogol o anghysondebau yn fformat yr allbwn, gwallau wrth ddehongli deunyddiau gweledol, a chwestiynau na ellid eu hateb oherwydd bod gwybodaeth wedi’i cholli. Nid cyfyngiad sylfaenol ar resymu rhesymegol mohono, ond problem gyda manwl gywirdeb ôl-brosesu ac argaeledd gwybodaeth allanol. Gan mai model perchnogol ydyw, gall CLEVI ei wella ar ei ben ei hun. Dyna fantais strwythurol model perchnogol from scratch. Mae cyflawniad CLEVI y tro hwn yn gofyn i ddiwydiant AI Korea: “Am ba hyd y byddwn yn dibynnu ar ‘ymennydd a fenthycwyd’?” Mae CLEVI wedi dewis y llwybr anoddach, sef from scratch, ac mae’n dymuno profi’r ateb hwnnw ar lwyfan y byd.”

Yn ôl i'r ystafell newyddion
CLEVI

Iaith a rhanbarth

Mae ieithoedd a gyfieithwyd gan beiriant wedi’u marcio. Mae argaeledd yn dilyn y bwndel gwefan cyhoeddedig.

136 iaith

Argymhellir

1

Dwyrain Asia

7

De-Ddwyrain Asia

11

De Asia

18

Canol Asia

5

Y Dwyrain Canol a’r Cawcasws

10

Gorllewin Ewrop a(c) De Ewrop

16

Y Deyrnas Unedig a(c) Iwerddon

4

Gogledd Ewrop

10

Canolbarth Ewrop a’r Balcanau

14

Dwyrain Ewrop

5

Dwyrain Affrica

8

Gorllewin Affrica a(c) Canol Affrica

9

Deheudir Affrica

8

Yr Amerig

5

Oceania

5