Newyddion

CLEVI, 79.07% yn GAIA gyda model perchnogol o’r dechrau... ymhlith y 2.5% uchaf o 3,090 o fodelau

Ffynhonnell: Lee Won-ji, Electronic Times

Ffynhonnell: Lee Won-ji, Electronic Times

Dyfyniad llawn o’r erthygl “CLEVI, 79.07% yn GAIA gyda model perchnogol o’r dechrau... ymhlith y 2.5% uchaf o 3,090 o fodelau”

Dyddiad cyhoeddi: 2026-04-07

Dolen: https://www.etnews.com/20260407000203

Penty AI modelau unigryw cip-5.5-agent·cip-5.5-mm, gyda phob un o’r 5 asiant yn sgorio dros 70

Cywirdeb o 98%+ wrth ystyried colli gwybodaeth, yn uwch na phobl (92%)

Delwedd corff yr erthygl

Cofnododd y cwmni cychwynnol AI 'CLEVI' gywirdeb o 79.07% yn 'GAIA', meincnod asiantau AI byd-eang, gan ddefnyddio model perchnogol o’r dechrau, a gosododd ei hun ymhlith y 2.5% uchaf o’r 3,090 o fodelau cofrestredig i gyd.

Yn ôl esboniad y diwydiant, ystyrir bod GAIA yn adlewyrchu gallu 'asiantau AI ymarferol' yn ffyddlon ym marchnad meincnodau AI. Datblygwyd y meincnod hwn ar y cyd gan Meta AI, HuggingFace a Phrifysgol Paris-Saclay, ac fe’i cyhoeddwyd gyntaf ym mis Tachwedd 2023.

Mae tair nodwedd allweddol yn gwahaniaethu GAIA oddi wrth feincnodau eraill. Yn gyntaf, gan nad yw’r atebion cywir yn gyhoeddus, mae gorffitio yn amhosibl. Yn ail, gan ei fod yn gofyn am resymu cymhleth aml-gam ac aml-foddol, mae’n amhosibl sgorio’n uchel drwy baru patrymau syml yn unig. Yn drydydd, mae mwy na 3,090 o fodelau ledled y byd yn cystadlu dan yr un amodau drwy arweinlyfr swyddogol HuggingFace.

Mae’r set brofi yn cynnwys cyfanswm o 301 o gwestiynau. Mae Lefel 1 yn cynnwys defnyddio un offeryn a rhesymu syml, mae Lefel 2 yn cynnwys cyfuno offer lluosog a rhesymu lefel ganolig, ac mae Lefel 3 yn cynnwys y cwestiynau anoddaf, sy’n gofyn am gynllunio a gweithredu asiant dros 5 cam neu fwy. Ar adeg cyhoeddi’r meincnod, dim ond tua 15% oedd sgôr modelau GPT (gyda phlwg-ins), ond mae’r timau blaenllaw ar hyn o bryd wedi ei godi i’r ystod 70–80%.

Ymhlith y rhain, pwysleisiodd CLEVI mai’r agwedd dechnegol fwyaf nodedig ar y cyflawniad hwn yw na ddefnyddiwyd APIau LLM allanol fel GPT, Claude na Gemini o gwbl. Nodwedd arbennig CLEVI yw iddo ddefnyddio dau fodel a ddatblygwyd yn annibynnol o’r dechrau.

Mae cip-5.5-agent yn fodel AI asiantig sy’n gweithredu fel yr ymennydd craidd mewn piblinell asiantau sy’n cynllunio (planning), gweithredu (execution) ac yn gwirio (verification) tasgau cymhleth yn annibynnol. Mae cip-5.5-mm yn fodel amlfoddol cyffredinol perfformiad uchel sy’n deall ac yn rhesymu dros amrywiaeth o fformatau ffeiliau, gan gynnwys llais, delweddau a fideo. Gan fod cyfran sylweddol o gwestiynau GAIA yn cynnwys mewnbynnau nad ydynt yn destun, megis ffeiliau PDF, delweddau a ffeiliau sain, roedd y gallu amlfoddol hwn yn ffactor allweddol yn y sgôr uchel.

Gan ddefnyddio’r ddau fodel mewnol hyn, cyflwynodd CLEVI bum ffurfweddiad asiant gwahanol i GAIA, a sgoriodd pob un dros 70.

Yn ôl esboniad y cwmni, cadarnhawyd canlyniad diddorol mewn adolygiad ôl-weithredol mewnol gan CLEVI. O’r cyfanswm o 301 o gwestiynau, roedd sail yr ateb cywir ar gyfer rhai ohonynt wedi diflannu o’r we gyhoeddus bresennol. Mewn rhai achosion, roedd gwybodaeth a oedd ar gael ar-lein neu drwy beiriannau chwilio yn y gorffennol wedi’i dileu neu ei newid ac nid oedd modd cael gafael arni mwyach. Wrth ailwerthuso o fewn cwmpas y wybodaeth y gall pobl ei gwirio’n gyhoeddus ar hyn o bryd, roedd cyfradd atebion cywir CLEVI dros 98%. Mae hyn eisoes yn uwch na’r cyfartaledd dynol, sef 92%.

Esboniodd cynrychiolydd CLEVI: “Heb gymysgu modelau allanol, cofnododd pob un o’r pum asiant 70+ gan ddefnyddio modelau mewnol a ddatblygwyd o’r dechrau a datrysiadau asiantau AI CLEVI yn unig, gan gyrraedd y 2.5% uchaf yn y meincnod cyhoeddus. Drwy wella ein modelau mewnol a’n datrysiadau asiantau yn y dyfodol, mae’n ymddangos y bydd modd gwella’r sgôr swyddogol ymhellach. Mae’r cyflawniad hwn yn arwyddocaol oherwydd ei fod yn dangos ‘ymddiriedaeth ddilys’ a fesurwyd mewn meincnod cyhoeddus byd-eang, oherwydd ei fod yn gyflawniad gan ddatblygwr AI domestig yn seiliedig ar fodelau mewnol a ddatblygwyd o’r dechrau, oherwydd ei fod yn ganlyniad i stac modelau annibynnol yn hytrach na chymysgedd o fodelau allanol, ac oherwydd bod ganddo werth dehongliadol y tu hwnt i’r sgôr, o ystyried bod gwybodaeth ar gyfer rhai cwestiynau wedi’i cholli.”

Yn ôl i'r ystafell newyddion
CLEVI

Iaith a rhanbarth

Mae ieithoedd a gyfieithwyd gan beiriant wedi’u marcio. Mae argaeledd yn dilyn y bwndel gwefan cyhoeddedig.

136 iaith

Argymhellir

1

Dwyrain Asia

7

De-Ddwyrain Asia

11

De Asia

18

Canol Asia

5

Y Dwyrain Canol a’r Cawcasws

10

Gorllewin Ewrop a(c) De Ewrop

16

Y Deyrnas Unedig a(c) Iwerddon

4

Gogledd Ewrop

10

Canolbarth Ewrop a’r Balcanau

14

Dwyrain Ewrop

5

Dwyrain Affrica

8

Gorllewin Affrica a(c) Canol Affrica

9

Deheudir Affrica

8

Yr Amerig

5

Oceania

5