Aħbarijiet

CLEVI, GAIA 79.07% bil-mudell proprjetarju tagħha stess mibni from scratch... fl-ogħla 2.5% fost 3,090 mudell

Sors: Lee Won-ji, Electronic Newspaper

Sors: Lee Won-ji, Electronic Newspaper

Ċitazzjoni sħiħa tal-artiklu “CLEVI, GAIA 79.07% bil-mudell proprjetarju tagħha stess mibni from scratch... fl-ogħla 2.5% fost 3,090 mudell”

Data tal-pubblikazzjoni: 2026-04-07

Link: https://www.etnews.com/20260407000203

Ħames aġenti fl-iskack tal-mudelli indipendenti cip-5.5-agent·cip-5.5-mm kollha jaqbżu 70 punt

Rata ta’ tweġibiet korretti ta’ aktar minn 98% meta jitqies it-telf tal-informazzjoni, ogħla mill-bnedmin (92%)

Immaġni prinċipali

L-istart-up tal-AI ‘CLEVI’ kisbet rata ta’ tweġibiet korretti ta’ 79.07% fil-benchmark globali tal-aġenti tal-AI ‘GAIA’ billi użat il-mudell proprjetarju tagħha stess mibni from scratch, u kklassifikat fl-ogħla 2.5% fost it-3,090 mudell irreġistrat kollha.

Skont spjegazzjonijiet mill-industrija, fis-suq tal-benchmarks tal-AI, GAIA hija meqjusa li tirrifletti b’mod fidil il-kapaċitajiet tal-‘aġenti prattiċi tal-AI’. Dan il-benchmark, żviluppat b’mod konġunt minn Meta AI, HuggingFace u l-Università ta’ Paris-Saclay, ġie ppubblikat għall-ewwel darba f’Novembru 2023.

Hemm tliet karatteristiċi ewlenin li jiddistingwu lil GAIA minn benchmarks oħra. L-ewwel, peress li t-tweġibiet korretti mhumiex pubbliċi, l-overfitting huwa impossibbli. It-tieni, minħabba li jeħtieġ raġunament kumpless multistep u multimodali, punteġġ għoli ma jistax jinkiseb permezz ta’ sempliċi tqabbil ta’ mudelli. It-tielet, aktar minn 3,090 mudell minn madwar id-dinja jikkompetu taħt l-istess kundizzjonijiet permezz tal-leaderboard uffiċjali ta’ HuggingFace.

Is-sett tat-test jikkonsisti minn total ta’ 301 mistoqsija. Il-Livell 1 jinvolvi l-użu ta’ għodda waħda u raġunament sempliċi, il-Livell 2 jinvolvi kombinazzjoni ta’ għodod multipli u raġunament ta’ livell intermedju, filwaqt li l-Livell 3 jikkonsisti fl-aktar mistoqsijiet diffiċli, li jeħtieġu ppjanar u eżekuzzjoni ta’ aġent f’ħames stadji jew aktar. Fiż-żmien tat-tħabbira tal-benchmark, il-mudelli GPT (mgħammra bi plugins) kisbu madwar 15% biss, filwaqt li bħalissa t-timijiet ewlenin għollew ir-riżultati għal 70–80%.

Fost dawn, CLEVI enfasizzat li l-aktar aspett li għandu jingħata attenzjoni teknika f’dan ir-riżultat huwa l-fatt li ma ntużaw xejn APIs esterni ta’ LLM bħal GPT, Claude u Gemini. Il-karatteristika distintiva ta’ CLEVI hija li użat żewġ mudelli żviluppati b’mod indipendenti from scratch.

cip-5.5-agent huwa mudell tal-IA aġentika u jservi bħala l-moħħ ewlieni tal-pipeline tal-aġenti li jippjana (planning), iwettaq (execution) u jivverifika (verification) b’mod awtonomu kompiti kumplessi. cip-5.5-mm huwa mudell multimodali universali ta’ prestazzjoni għolja li jifhem u jirraġuna fuq diversi formati ta’ fajls, inklużi l-vuċi, l-immaġini u l-vidjow. Peress li parti sinifikanti mill-mistoqsijiet ta’ GAIA tinkludi inputs mhux testwali bħal fajls PDF, immaġini u fajls awdjo, din il-kapaċità multimodali saret fattur ewlieni fil-kisba ta’ punteġġ għoli.

CLEVI ressqet ħames konfigurazzjonijiet differenti ta’ aġenti bbażati fuq dawn iż-żewġ mudelli proprjetarji tagħha f’GAIA, u kollha kisbu punteġġ ta’ aktar minn 70.

Skont l-ispjegazzjoni tal-kumpanija, fir-reviżjoni interna ta’ wara minn CLEVI ġew identifikati riżultati interessanti. Minn total ta’ 301 mistoqsija, għal xi wħud minnhom il-bażi ta’ evidenza għat-tweġibiet korretti kienet intilfet fuq il-web pubbliku attwali. F’xi każijiet, informazzjoni li fil-passat kienet tista’ tiġi vverifikata online jew permezz tal-magni tat-tiftix kienet tħassret jew inbidlet u għalhekk ma setgħetx tiġi aċċessata aktar. Meta ġew evalwati mill-ġdid abbażi tal-firxa ta’ informazzjoni li l-bnedmin jistgħu jivverifikaw pubblikament bħalissa, ir-rata ta’ tweġibiet korretti ta’ CLEVI kienet aktar minn 98%. Dan huwa diġà ogħla mill-medja umana ta’ 92%.

Rappreżentant ta’ CLEVI spjega: “Mingħajr ma ħallat mudelli esterni, CLEVI kisbet punteġġ ta’ 70+ bil-ħames aġenti kollha, bl-użu biss tal-mudelli proprjetarji tagħha from scratch u tas-soluzzjonijiet tal-aġenti tal-IA tagħha stess, u daħlet fl-aqwa 2.5% fil-benchmark pubbliku. Jidher li fil-futur ikun possibbli li l-punteġġ uffiċjali jitjieb aktar permezz tat-titjib tal-mudelli proprjetarji u tas-soluzzjonijiet tal-aġenti tagħha. Dan ir-riżultat huwa partikolarment sinifikanti għaliex juri ‘fiduċja vverifikata’ mkejla f’benchmark pubbliku globali, jirrappreżenta kisba bbażata fuq mudelli proprjetarji from scratch minn żviluppatur tal-IA domestiku, huwa r-riżultat ta’ stack ta’ mudelli indipendenti u mhux ta’ taħlita ta’ mudelli esterni, u għandu valur interpretattiv li jaqbeż il-punteġġ innifsu meta jitqies it-telf ta’ informazzjoni f’xi mistoqsijiet.”

Lura għall-kamra tal-aħbarijiet
CLEVI

Lingwa u reġjun

Il-lingwi tradotti awtomatikament huma mmarkati. Id-disponibbiltà ssegwi l-pakkett ippubblikat tas-sit.

136 lingwi

Rakkomandat

1

Asja tal-Lvant

7

Asja tax-Xlokk

11

Asja t’Isfel Ċentrali

18

Asja Ċentrali

5

Lvant Nofsani u l-Kawkasu

10

Ewropa tal-Punent u Ewropa t’Isfel

16

ir-Renju Unit u l-Irlanda

4

Ewropa ta’ Fuq

10

Ewropa Ċentrali u l-Balkani

14

Ewropa tal-Lvant

5

Affrika tal-Lvant

8

Affrika tal-Punent u Affrika Nofsani

9

Affrika t’Isfel

8

Amerika

5

Oċejanja

5
CLEVI, GAIA 79.07% bil-mudell proprjetarju tagħha stess mibni from scratch... fl-ogħla 2.5% fost 3,090 mudell — CLEVI