Kelda: Digital Times, journalisturin Gu Bon-gyu
Full endurgeving av greinini „AI-startup felagið Clevi kemur inn í ovastu 2,5 % hjá GAIA… vísir váttaða álitisverdugleika“
Útgávudagur 2026-04-08
Leinkja: https://n.news.naver.com/article/029/0003020511?sid=105
Sera koreanska AI-startupfelagið ‘Clevi’ hevur bygt sítt egna modell og sína egnu agentloysn frá scratch og kunngjørt, at felagið sum tað fyrsta í Suðurkorea er komið inn í ovastu 2,5 % á GAIA-benchmarkinum, roknað út frá øllum 3.090 skrásettu modellunum.
Sambært frágreiðingum úr vinnuni spyr GAIA, sum Meta AI hevur ment og Hugging Face rekur, ikki AI um ‘førleikan at vera góður til bara eitt’, men um ‘førleikan at sameina fleiri førleikar og loysa verulig trupulleikar’. Tað skal finna upplýsingar á netinum, lesa talvur í PDF-skjølum, greina myndir, koyra kodu fyri at gera útrokningar og sameina úrslitini til eitt einasta rætt svar. Við 301 óalmennum spurningum, trimum torleikastigum og eini meginreglu um, at røttu svarini ikki verða almannakunngjørd, er skipanin gjørd soleiðis, at hvørki ovtilpassing ella svik eru møgulig.
Fyri at fáa eitt høgt úrslit í hesi royndini krevjast tvey ting. Annars vegar metingarførleikin hjá grundarlagsmálinum, og hins vegar ein agentloysn, sum bindur modellið saman við amboðunum í veruliga heiminum og letur tað arbeiða sjálvstøðugt. Líkamikið hvussu gott modellið er, kann tað ikki loysa Level 3, um agenturin er veikur, og líkamikið hvussu framkomin agenturin er, verða skeiv svar borin víðari á miðstigunum, um metingarførleikin hjá modellinum ikki røkkur.
Hyggja vit at verandi bygnaði á GAIA-leiðaralistanum, sæst eitt áhugavert mynstur. Flestu agentar í oddinum hava valt eina ‘multi-model mix’-strategi, har fleiri stór tøknifyritøkumodell sum GPT, Claude og Gemini verða sameind. Hetta er ein skilagóð tilgongd, sum sameinir styrkirnar hjá hvørjum modelli og verjir móti lækkingum í stigatalinum, ið kunnu standast av millum annað upplýsingamissi.
Clevi gjørdi hinvegin ikki vart við seg í hesum hópinum. cip-5.5-agent (agentiskt AI), sum er ment frá scratch, fremur sjálvstøðugt ætlanlegging, útføring og eftirkanning av fløktum uppgávum, meðan cip-5.5-mm (hágóðskuligt alment multimodalt modell) skilir og ger metingar av ymiskum fílusniðum, eitt nú talu, myndum og video. Bæði modellini eru ment sjálvstøðugt innan Clevi, og eingin ekstern LLM API er yvirhøvur brúkt.
Og við hesum egna modellstakkanum sendi CLEVI fimm agentar í GAIA, og allir fingu 70 stig ella meira. Frá hægsta úrslitinum upp á 79,07 % til 70,76 % prógvar hetta støðufestið í øllum stakkanum, ikki bara hepni í einum einstøkum úrsliti.
Sambært fyritøkuni er eitt annað tøl aftan fyri almenna stigið 79,07 %. Eftirfylgjandi innanhýsis eftirkanning hjá CLEVI vísti, at ein munandi partur av teimum 301 spurningunum hevði mist prógv fyri rætta svarinum á tí almenna vefnum. Tá úrslitið varð endurmett út frá teimum spurningunum, har prógv fyri rætta svarinum framvegis eru tøk á vefnum, var svarprosentið hjá CLEVI yvir 98 %. Hetta er longu hægri enn miðaltalið hjá menniskjum (92 %).
Sjálvandi kundi almenna stigið møguliga verið hækkað enn meira við at blanda sterk altjóða modell frá øðrum veitarum inn. Men CLEVI valdi tilvitað ikki hesa strategi. Tað var, tí endamálið við hesum benchmarkinum ikki var at kappast um hægsta stigið, men at kanna, um eitt from scratch egið modell var komið upp á eitt stig, har tað kundi kappast á altjóða pallinum.
At fáa navn sítt á GAIA-leiðaralistanum hevur stóran týdning, tí tað merkir, at ein hevur fingið váttaða trúvirðið, sum ein óheft triðjapartseftirmeting hevur givið. Hetta er eitt objektivt grundarlag, sum kann nýtast í øllum stigum – frá íløgufígging og altjóða útvíklingi til B2B-sølu.
Ein talsmaður fyri CLEVI segði: “Av teimum 63 almennu skeivu svarunum stavaði ein stórur partur frá ósamsvari í útskrivingarsniði, mistulking av sjónligum tilfari og spurningum, har tað ikki bar til at finna rætta svarið vegna upplýsingarmiss. Hetta snýr seg meira um neyvari eftirviðgerð og atgongd til ytri upplýsingar enn um grundleggjandi avmarkingar í logiskari greining. Tí at talan er um eitt egið modell, kann CLEVI sjálvt bøta um tað. Hetta er júst tann bygnaðarligi fyrimunurin við einum from scratch egnum modeli. Henda avreksingin hjá CLEVI setir koreanska AI-vinnuni spurningin: ‘Hvussu leingi fara vit at vera bundin at “læntum heila”?’ CLEVI hevur valt tann truplari leiðina við from scratch og vil prógva svarið á altjóða pallinum.”
