Ffynhonnell: Go Bon-gyu, Digital Times
Dyfyniad llawn o’r erthygl “Cychwyniad AI CLEVI yn cyrraedd 2.5% uchaf GAIA… yn dangos hygrededd profedig”
Dyddiad cyhoeddi 2026-04-08
Dolen : https://n.news.naver.com/article/029/0003020511?sid=105
Dywedodd cychwyniad AI domestig ‘CLEVI (Clevi)’ ei fod, ar ôl adeiladu modelau mewnol a wnaed from scratch a datrysiadau asiant mewnol, wedi cyrraedd 2.5% uchaf meincnod GAIA, am y tro cyntaf yn y wlad, ymhlith y 3,090 o fodelau cofrestredig i gyd.
Yn ôl esboniad gan y diwydiant, mae GAIA, a ddyluniwyd gan Meta AI ac a weithredir gan Hugging Face, yn gofyn i AI nid am ‘y gallu i wneud un peth yn dda’ ond am ‘y gallu i gyfuno sawl gallu i ddatrys problemau go iawn’. Rhaid iddo ddod o hyd i wybodaeth ar y we, darllen tablau mewn PDF, dadansoddi delweddau, rhedeg cod i wneud cyfrifiadau, a chyfuno’r canlyniadau i gyflwyno un ateb cywir. Gyda 301 o gwestiynau cyfrinachol, tair lefel o anhawster, ac egwyddor o beidio â datgelu’r atebion cywir, mae’r strwythur yn ei gwneud yn amhosibl gorffitio na thwyllo.
Mae angen dau beth i gael sgôr uchel ar y prawf hwn. Y gallu rhesymu yn y model iaith sylfaenol, a datrysiad asiant sy’n cysylltu’r model hwnnw ag offer y byd go iawn ac yn ei alluogi i gyflawni tasgau’n annibynnol. Waeth pa mor dda yw’r model, os yw’r asiant yn wan ni ellir datrys Lefel 3; ac waeth pa mor soffistigedig yw’r asiant, os yw gallu rhesymu’r model yn annigonol, bydd atebion anghywir yn lledaenu yn y camau canol.
Wrth edrych ar strwythur presennol bwrdd arweinwyr GAIA, gwelir patrwm diddorol. Mae’r rhan fwyaf o’r asiantau ar y brig wedi mabwysiadu strategaeth ‘cymysgedd aml-fodel’ sy’n cyfuno modelau Big Tech lluosog fel GPT, Claude a Gemini. Mae’n ddull rhesymol sy’n cyfuno cryfderau pob model ac yn amddiffyn rhag gostyngiadau mewn sgoriau a achosir gan golli gwybodaeth, ymhlith pethau eraill.
Ar y llaw arall, ni ymunodd CLEVI â’r rhesi hynny. Mae cip-5.5-agent (AI asiantaidd), a ddatblygwyd trwy ddull from scratch, yn cynllunio, gweithredu ac yn dilysu tasgau cymhleth yn annibynnol, tra bod cip-5.5-mm (aml-foddol cyffredinol perfformiad uchel) yn deall ac yn rhesymu dros amrywiaeth o fformatau ffeiliau, gan gynnwys sain, delweddau a fideo. Datblygwyd y ddau fodel yn annibynnol o fewn CLEVI, ac ni ddefnyddiwyd API LLM allanol o gwbl.
A chyda’r pentwr modelau perchnogol hwn, anfonodd CLEVI 5 asiant i GAIA, a chofnododd pob un sgôr o 70+ pwynt. O’r uchaf, sef 79.07%, i 70.76%, profwyd sefydlogrwydd y pentwr cyfan, nid lwc un canlyniad unigol.
Yn ôl esboniad y cwmni, y tu ôl i’r sgôr swyddogol o 79.07% mae rhif arall. Yn dilyn adolygiad ôl-weithredol mewnol gan CLEVI, canfuwyd bod nifer sylweddol o’r 301 o gwestiynau yn rhai lle roedd tystiolaeth ateb cywir wedi diflannu oddi ar y we gyhoeddus bresennol. Wrth ailasesu ar sail y cwestiynau hynny lle mae’r ateb cywir yn dal i fodoli ar y we, roedd cyfradd atebion cywir CLEVI yn uwch na 98%. Mae hynny eisoes yn uwch na’r cyfartaledd dynol (92%).
Wrth gwrs, pe bai wedi cyfuno modelau cyffredinol pwerus gan gwmnïau eraill, efallai y byddai wedi gallu codi’r sgôr swyddogol ymhellach. Fodd bynnag, dewisodd CLEVI beidio â mabwysiadu’r strategaeth honno’n fwriadol. Y rheswm oedd nad cystadlu am y sgôr uchaf oedd nod y meincnod hwn, ond gwirio a oedd model perchnogol from scratch wedi cyrraedd lefel a oedd yn gallu cystadlu ar y llwyfan byd-eang.
Mae cael enw ar fwrdd arweinwyr GAIA yn arwyddocaol iawn am ei fod yn golygu bod ganddo hygrededd profedig a roddwyd gan werthusiad annibynnol gan drydydd parti. Mae hyn yn sail wrthrychol y gellir ei defnyddio ym mhob cam, gan gynnwys denu buddsoddiad, ehangu dramor a gwerthu B2B.
Dywedodd cynrychiolydd CLEVI: “Deilliodd cyfran sylweddol o’r 63 ateb anghywir swyddogol o anghysondebau yn fformat yr allbwn, gwallau wrth ddehongli deunyddiau gweledol, a chwestiynau na ellid eu hateb oherwydd bod gwybodaeth wedi’i cholli. Nid cyfyngiad sylfaenol ar resymu rhesymegol mohono, ond problem gyda manwl gywirdeb ôl-brosesu ac argaeledd gwybodaeth allanol. Gan mai model perchnogol ydyw, gall CLEVI ei wella ar ei ben ei hun. Dyna fantais strwythurol model perchnogol from scratch. Mae cyflawniad CLEVI y tro hwn yn gofyn i ddiwydiant AI Korea: “Am ba hyd y byddwn yn dibynnu ar ‘ymennydd a fenthycwyd’?” Mae CLEVI wedi dewis y llwybr anoddach, sef from scratch, ac mae’n dymuno profi’r ateb hwnnw ar lwyfan y byd.”
