Allikas: Digital Times, reporter Gu Bon-gyu
Artikli „AI-idufirma Clevi jõudis GAIA edetabelis 2,5% tippu… tõestatud usaldusväärsus“ täisteksti tsitaat
Avaldamiskuupäev 2026-04-08
Link: https://n.news.naver.com/article/029/0003020511?sid=105
Lõuna-Korea AI-idufirma Clevi teatas, et olles loonud from scratch oma mudeli ja agendilahenduse, jõudis ta esimesena Lõuna-Koreas GAIA võrdlusaluse järgi kõigi 3 090 registreeritud mudeli seas 2,5% tippu.
Valdkonna selgituste kohaselt ei testi Meta AI kavandatud ja Hugging Face’i hallatav GAIA tehisintellekti puhul mitte „ühe asja hästi tegemise võimet“, vaid „võimet kombineerida mitut oskust tegelike probleemide lahendamiseks“. See peab leidma veebist teavet, lugema PDF-failis olevat tabelit, analüüsima pilte, käivitama koodi arvutuste tegemiseks ning koondama tulemused üheks õigeks vastuseks. 301 konfidentsiaalset küsimust, kolm raskusastet ja vastuste mitteavalikustamise põhimõte loovad struktuuri, kus nii üleõppimine kui ka petmine on võimatud.
Sellel testil kõrge tulemuse saamiseks on vaja kahte asja. Esiteks aluseks oleva keelemudeli arutlusvõimet ning teiseks agendilahendust, mis ühendab mudeli pärismaailma tööriistadega ja võimaldab tal ülesandeid iseseisvalt täita. Ükskõik kui hea mudel ka poleks, nõrga agendiga ei ole võimalik Level 3 ülesandeid lahendada; ükskõik kui keerukas agent ka poleks, mudeli ebapiisava arutlusvõime korral levivad valed vastused edasi juba keskmisel tasemel.
GAIA edetabeli praegust struktuuri vaadates ilmneb huvitav muster. Enamik tippagentidest kasutab strateegiat „multimudelsegu“, kombineerides mitme suure tehnoloogiaettevõtte mudeleid, nagu GPT, Claude ja Gemini. See on mõistlik lähenemisviis, mis ühendab iga mudeli tugevused ja aitab kaitsta teabe kadumisest tingitud punktikaotuse eest.
Clevi ei ole aga selle reaga liitunud. from scratch arendatud cip-5.5-agent (agentne AI) kavandab, täidab ja kontrollib keerukaid ülesandeid iseseisvalt ning cip-5.5-mm (kõrge jõudlusega üldotstarbeline multimodaalne mudel) mõistab ja arutleb erinevates failivormingutes, sealhulgas heli-, pildi- ja videofailides oleva teabe üle. Mõlemad mudelid töötati iseseisvalt välja Clevi sees ning väliseid LLM API-sid ei kasutatud üldse.
Selle iseseisvalt välja töötatud mudelivirnaga saatis CLEVI GAIA-le võistlema viis agenti, kes kõik saavutasid üle 70 punkti. Alates kõrgeimast tulemusest 79,07% kuni 70,76%-ni tõestas see kogu virna stabiilsust, mitte ühe tulemuse juhuslikku edukust.
Ettevõtte selgituse kohaselt peitub ametliku 79,07% skoori taga veel üks number. CLEVI sisemise järelanalüüsi käigus selgus, et 301 küsimuse hulgas oli märkimisväärne hulk küsimusi, mille õige vastuse alus oli avalikus veebis praeguseks kadunud. Kui hinnata uuesti ainult neid küsimusi, mille õige vastus on veebis endiselt olemas, oli CLEVI täpsus üle 98%. See näitaja ületab juba inimese keskmist tulemust (92%).
Muidugi oleks ametlikku skoori võinud veelgi tõsta, kui oleks segatud sisse teiste ettevõtete tugevaid üldotstarbelisi mudeleid. CLEVI otsustas siiski teadlikult seda strateegiat mitte valida. Selle võrdlustesti eesmärk ei olnud võistelda kõrgeima skoori nimel, vaid kontrollida, kas from scratch loodud enda mudel on jõudnud ülemaailmsel areenil konkureerimise tasemele.
GAIA edetabelisse jõudmisel on suur tähendus, sest see näitab kolmanda osapoole sõltumatu hindamisega antud kontrollitud usaldusväärsust. See on objektiivne alus, mida saab kasutada nii investeeringute kaasamisel, välisturgudele laienemisel kui ka B2B müügis.
CLEVI esindaja sõnul „tulenesid 63 ametlikust valest vastusest märkimisväärne osa väljundvormingu sobimatusest, visuaalse materjali tõlgendamise vigadest ning küsimustest, millele ei olnud teabe kadumise tõttu võimalik õigesti vastata. Probleem seisneb pigem järeltöötluse täpsuses ja välise teabe kättesaadavuses kui loogilise arutluse põhimõttelistes piirides. Kuna tegemist on enda mudeliga, saab CLEVI seda ise täiustada. See ongi from scratch loodud enda mudeli struktuurne eelis. CLEVI tulemus esitab Korea tehisintellektitööstusele küsimuse: „Kui kaua sõltume veel ‘laenatud ajudest’?” CLEVI on valinud raskema, from scratch tee ning soovib tõestada selle vastust ülemaailmsel areenil,“ edastas ta.
