Newyddion

Cystadleurwydd wedi’i brofi gan ddata— asiant AI domestig yn cyflawni safle yn 2.5% uchaf meincnod GAIA

Pan gafodd meincnod GAIA ei gyhoeddi gyntaf, dim ond sgôr o tua 30% a gyflawnodd GPT-4, a oedd yn fodel o’r radd flaenaf ar y pryd. O ystyried nodweddion GAIA, sy’n gofyn am resymu cymhleth, defnyddio offer a datrys problemau aml-gam y tu hwnt i ateb cwestiynau syml, mae hyn yn golygu bod AI ar y pryd yn dal i fod yn y cyfnodau cynnar o ran y gallu i “feddwl a gweithredu”…

Ystyr sgoriau GAIA — Pa mor ddatblygedig yw asiantau AI?

Pan gafodd meincnod GAIA ei gyhoeddi gyntaf, dim ond sgôr o tua 30% a gyflawnodd GPT-4, a oedd yn fodel o’r radd flaenaf ar y pryd. O ystyried nodweddion GAIA, sy’n gofyn am resymu cymhleth, defnyddio offer a datrys problemau aml-gam y tu hwnt i ateb cwestiynau syml, mae hyn yn golygu bod AI ar y pryd yn dal i fod yn y cyfnodau cynnar o ran y gallu i “feddwl a gweithredu”.

Fodd bynnag, erbyn hyn, mae’r asiantau sydd ar frig y rhestr wedi cyrraedd 92.36%.

Nid gwelliant syml mewn perfformiad yw’r newid hwn. Mae’n ddangosydd bod AI bellach wedi symud y tu hwnt i ateb cwestiynau ac wedi cyrraedd cam ‘Agentic AI’, lle mae’n dehongli sefyllfaoedd, yn dewis yr offer angenrheidiol, ac yn cynllunio ac yn cyflawni sawl cam ar ei ben ei hun.

Mewn ychydig flynyddoedd yn unig, mae AI wedi esblygu o fod yn “offeryn cynhyrchu gwybodaeth” i fod yn “endid gweithredu sy’n cyflawni gwaith”.

Delwedd y prif destun

📌 Ac ymhlith y 2.5% uchaf hwnnw, mae CLEVI

Yng nghanol yr amgylchedd cystadleuol byd-eang hwn, mae cofrestru asiant CLEVI, a ddatblygwyd yn ddomestig, yn 2.5% uchaf ar fyrddau arweinwyr GAIA wedi profi hunangynhaliaeth dechnolegol ac yn enghraifft sy’n dangos bod asiant AI a grëwyd yng Nghorea yn gallu cystadlu yn ôl safonau byd-eang. Mae gan hyn arwyddocâd sy’n mynd y tu hwnt i ffigur syml. Mae’n golygu bod gallu technolegol wedi’i ddilysu’n wrthrychol drwy gystadlu â miloedd o fodelau ar feincnod byd-eang cyhoeddus, nid mewn amgylchedd demo penodol yn unig.

Yn bwysicach fyth, nid canlyniad damweiniol model unigol yw’r cyflawniad hwn, ond y ffaith bod asiantau o wahanol ddyluniadau wedi cynhyrchu perfformiad ar frig y rhestr dro ar ôl tro ar yr un Agent Stack.

Hynny yw, nid “canlyniad da unwaith” yw technoleg CLEVI, ond cystadleurwydd strwythurol y gellir ei atgynhyrchu, gyda gallu ar lefel platfform y gellir ei ehangu i amrywiol ddiwydiannau a senarios.

Delwedd y prif destun

Felly, beth mae’r dangosydd hwn yn ei olygu?

O safbwynt y defnyddiwr, y rhwystr mwyaf i fabwysiadu AI yw’r cwestiwn: "A ellir ymddiried ynddo i gyflawni’r gwaith mewn gwirionedd?"

Mae perfformiad a brofwyd dro ar ôl tro ar lwyfan trydydd parti, sef bwrdd arweinwyr byd-eang cyhoeddus, yn hytrach na demo ysblennydd neu ddeunyddiau cyflwyno ein cwmni ein hunain, yn ateb mwyaf gwrthrychol i’r cwestiwn hwnnw. Yn benodol, mae iddo arwyddocâd mewn tair agwedd.

Yn gyntaf, lleihau’r risg o fabwysiadu

Mae cysylltu AI heb ei ddilysu â gwaith mewnol yn faich sylweddol i gwmni.

Gellir defnyddio perfformiad mewn meincnodau awdurdodol fel GAIA yn uniongyrchol fel sail i ymddiriedaeth yn ystod y cam adolygu technegol.

Yn ail, gwireddu awtomeiddio gwaith cymhleth

Mae’r ffigur o fewn y 2.5% uchaf yn dynodi lefel o ddeallusrwydd sy’n mynd y tu hwnt i dasgau ailadroddus syml, gan ddeall cyd-destun, gwneud penderfyniadau’n annibynnol ar sawl cam, a chwblhau’r gwaith.

Gall meysydd gwaith yr ystyriwyd hyd yma eu bod yn “anodd eu rhoi i AI” ddod yn dargedau ymarferol ar gyfer awtomeiddio.

Yn drydydd, sicrhau diogelwch data a pherfformiad ar yr un pryd

Mae strwythur Agent Stack mewnol yn golygu nad yw llif data yn gadael yr amgylchedd allanol.

Gallwn ddianc rhag yr hen gyfyng-gyngor lle roedd yn rhaid cyfaddawdu ar ddiogelwch er mwyn defnyddio AI perfformiad uchel.

Yn enwedig mewn diwydiannau â sensitifrwydd data uchel, fel cyllid, gofal iechyd a gwasanaethau cyfreithiol, mae’r strwythur hwn yn wahaniaethwr pendant.

Mae atgynhyrchadwyedd y strwythur eisoes yn dechrau cael ei brofi.

A bydd cyflawniadau pob asiant a adeiladir ar y strwythur hwnnw yn arwain yn fuan at newid ymarferol yn y gweithle.

“Yn y pen draw, mae cyflawnrwydd technoleg yn cael ei gwblhau gan ‘hyder’ yn y gweithle.”

Nid yw CLEVI yn cyfyngu ei hun i ddarparu AI perfformiad uchel yn unig. Hanfod ein gwaith yw adeiladu ‘seilwaith gweithredu’ sy’n torri’r rhwystrau diogelwch sy’n wynebu mentrau ac yn gallu cwblhau gwaith ymarferol cymhleth mewn gwirionedd.

Nawr, camwch y tu hwnt i’r cyfnod o ystyried mabwysiadu, a dechreuwch amgylchedd gwaith AI diogel a phwerus gyda CLEVI.

Fel partner dibynadwy y gallwch ymddiried ynddo i ymgymryd â’ch gwaith, byddwn yn creu arloesedd ymarferol gyda’n gilydd yn eich amgylchedd busnes.

Yn ôl i'r ystafell newyddion
CLEVI

Iaith a rhanbarth

Mae ieithoedd a gyfieithwyd gan beiriant wedi’u marcio. Mae argaeledd yn dilyn y bwndel gwefan cyhoeddedig.

136 iaith

Argymhellir

1

Dwyrain Asia

7

De-Ddwyrain Asia

11

De Asia

18

Canol Asia

5

Y Dwyrain Canol a’r Cawcasws

10

Gorllewin Ewrop a(c) De Ewrop

16

Y Deyrnas Unedig a(c) Iwerddon

4

Gogledd Ewrop

10

Canolbarth Ewrop a’r Balcanau

14

Dwyrain Ewrop

5

Dwyrain Affrica

8

Gorllewin Affrica a(c) Canol Affrica

9

Deheudir Affrica

8

Yr Amerig

5

Oceania

5