Sors: Lee Won-ji, Electronic Newspaper
Ċitazzjoni sħiħa tal-artiklu “CLEVI, GAIA 79.07% bil-mudell proprjetarju tagħha stess mibni from scratch... fl-ogħla 2.5% fost 3,090 mudell”
Data tal-pubblikazzjoni: 2026-04-07
Link: https://www.etnews.com/20260407000203
Ħames aġenti fl-iskack tal-mudelli indipendenti cip-5.5-agent·cip-5.5-mm kollha jaqbżu 70 punt
Rata ta’ tweġibiet korretti ta’ aktar minn 98% meta jitqies it-telf tal-informazzjoni, ogħla mill-bnedmin (92%)
L-istart-up tal-AI ‘CLEVI’ kisbet rata ta’ tweġibiet korretti ta’ 79.07% fil-benchmark globali tal-aġenti tal-AI ‘GAIA’ billi użat il-mudell proprjetarju tagħha stess mibni from scratch, u kklassifikat fl-ogħla 2.5% fost it-3,090 mudell irreġistrat kollha.
Skont spjegazzjonijiet mill-industrija, fis-suq tal-benchmarks tal-AI, GAIA hija meqjusa li tirrifletti b’mod fidil il-kapaċitajiet tal-‘aġenti prattiċi tal-AI’. Dan il-benchmark, żviluppat b’mod konġunt minn Meta AI, HuggingFace u l-Università ta’ Paris-Saclay, ġie ppubblikat għall-ewwel darba f’Novembru 2023.
Hemm tliet karatteristiċi ewlenin li jiddistingwu lil GAIA minn benchmarks oħra. L-ewwel, peress li t-tweġibiet korretti mhumiex pubbliċi, l-overfitting huwa impossibbli. It-tieni, minħabba li jeħtieġ raġunament kumpless multistep u multimodali, punteġġ għoli ma jistax jinkiseb permezz ta’ sempliċi tqabbil ta’ mudelli. It-tielet, aktar minn 3,090 mudell minn madwar id-dinja jikkompetu taħt l-istess kundizzjonijiet permezz tal-leaderboard uffiċjali ta’ HuggingFace.
Is-sett tat-test jikkonsisti minn total ta’ 301 mistoqsija. Il-Livell 1 jinvolvi l-użu ta’ għodda waħda u raġunament sempliċi, il-Livell 2 jinvolvi kombinazzjoni ta’ għodod multipli u raġunament ta’ livell intermedju, filwaqt li l-Livell 3 jikkonsisti fl-aktar mistoqsijiet diffiċli, li jeħtieġu ppjanar u eżekuzzjoni ta’ aġent f’ħames stadji jew aktar. Fiż-żmien tat-tħabbira tal-benchmark, il-mudelli GPT (mgħammra bi plugins) kisbu madwar 15% biss, filwaqt li bħalissa t-timijiet ewlenin għollew ir-riżultati għal 70–80%.
Fost dawn, CLEVI enfasizzat li l-aktar aspett li għandu jingħata attenzjoni teknika f’dan ir-riżultat huwa l-fatt li ma ntużaw xejn APIs esterni ta’ LLM bħal GPT, Claude u Gemini. Il-karatteristika distintiva ta’ CLEVI hija li użat żewġ mudelli żviluppati b’mod indipendenti from scratch.
cip-5.5-agent huwa mudell tal-IA aġentika u jservi bħala l-moħħ ewlieni tal-pipeline tal-aġenti li jippjana (planning), iwettaq (execution) u jivverifika (verification) b’mod awtonomu kompiti kumplessi. cip-5.5-mm huwa mudell multimodali universali ta’ prestazzjoni għolja li jifhem u jirraġuna fuq diversi formati ta’ fajls, inklużi l-vuċi, l-immaġini u l-vidjow. Peress li parti sinifikanti mill-mistoqsijiet ta’ GAIA tinkludi inputs mhux testwali bħal fajls PDF, immaġini u fajls awdjo, din il-kapaċità multimodali saret fattur ewlieni fil-kisba ta’ punteġġ għoli.
CLEVI ressqet ħames konfigurazzjonijiet differenti ta’ aġenti bbażati fuq dawn iż-żewġ mudelli proprjetarji tagħha f’GAIA, u kollha kisbu punteġġ ta’ aktar minn 70.
Skont l-ispjegazzjoni tal-kumpanija, fir-reviżjoni interna ta’ wara minn CLEVI ġew identifikati riżultati interessanti. Minn total ta’ 301 mistoqsija, għal xi wħud minnhom il-bażi ta’ evidenza għat-tweġibiet korretti kienet intilfet fuq il-web pubbliku attwali. F’xi każijiet, informazzjoni li fil-passat kienet tista’ tiġi vverifikata online jew permezz tal-magni tat-tiftix kienet tħassret jew inbidlet u għalhekk ma setgħetx tiġi aċċessata aktar. Meta ġew evalwati mill-ġdid abbażi tal-firxa ta’ informazzjoni li l-bnedmin jistgħu jivverifikaw pubblikament bħalissa, ir-rata ta’ tweġibiet korretti ta’ CLEVI kienet aktar minn 98%. Dan huwa diġà ogħla mill-medja umana ta’ 92%.
Rappreżentant ta’ CLEVI spjega: “Mingħajr ma ħallat mudelli esterni, CLEVI kisbet punteġġ ta’ 70+ bil-ħames aġenti kollha, bl-użu biss tal-mudelli proprjetarji tagħha from scratch u tas-soluzzjonijiet tal-aġenti tal-IA tagħha stess, u daħlet fl-aqwa 2.5% fil-benchmark pubbliku. Jidher li fil-futur ikun possibbli li l-punteġġ uffiċjali jitjieb aktar permezz tat-titjib tal-mudelli proprjetarji u tas-soluzzjonijiet tal-aġenti tagħha. Dan ir-riżultat huwa partikolarment sinifikanti għaliex juri ‘fiduċja vverifikata’ mkejla f’benchmark pubbliku globali, jirrappreżenta kisba bbażata fuq mudelli proprjetarji from scratch minn żviluppatur tal-IA domestiku, huwa r-riżultat ta’ stack ta’ mudelli indipendenti u mhux ta’ taħlita ta’ mudelli esterni, u għandu valur interpretattiv li jaqbeż il-punteġġ innifsu meta jitqies it-telf ta’ informazzjoni f’xi mistoqsijiet.”
