Lähde: Digital Times, toimittaja Bon-gyu Gu
Artikkelin ”Tekoälystartup CLEVI sijoittui GAIA:n parhaaseen 2,5 prosenttiin… osoitus todistetusta uskottavuudesta” koko tekstin lainaus
Julkaisupäivä 2026-04-08
Linkki : https://n.news.naver.com/article/029/0003020511?sid=105
Eteläkorealainen tekoälystartup ’CLEVI (Clevi)’ ilmoitti rakentaneensa from scratch oman mallin ja oman agenttiratkaisun sekä sijoittuneensa ensimmäisenä Etelä-Koreassa GAIA-benchmarkissa 2,5 prosentin parhaimmistoon kaikkien 3 090 rekisteröidyn mallin joukossa.
Alan kuvauksen mukaan Metan tekoälyn suunnittelema ja HuggingFacen ylläpitämä GAIA ei testaa tekoälyn ”kykyä tehdä yksi asia hyvin”, vaan ”kykyä yhdistää useita kykyjä ja ratkaista todellisia ongelmia”. Sen on löydettävä tietoa verkosta, luettava PDF-tiedoston taulukoita, analysoitava kuvia, suoritettava koodia laskelmien tekemiseksi ja yhdistettävä tulokset yhdeksi oikeaksi vastaukseksi. Rakenne perustuu 301 salaiseen kysymykseen, kolmeen vaikeustasoon ja periaatteeseen, jonka mukaan oikeita vastauksia ei julkaista, joten ylioppiminen tai huijaaminen ei ole mahdollista.
Kokeessa korkean pistemäärän saavuttamiseen tarvitaan kaksi asiaa. Ensinnäkin perustana olevan kielimallin päättelykyky ja toiseksi agenttiratkaisu, joka yhdistää mallin todellisen maailman työkaluihin ja mahdollistaa tehtävien itsenäisen suorittamisen. Vaikka malli olisi kuinka hyvä, agentti ei pysty ratkaisemaan Level 3 -tehtäviä, jos se on heikko. Toisaalta vaikka agentti olisi kuinka kehittynyt, vastaukset alkavat olla vääriä jo keskitasolla, jos mallin päättelykyky on riittämätön.
GAIA-tulostaulukon nykyisestä rakenteesta erottuu kiinnostava kuvio. Suurin osa kärkipään agenteista käyttää ”multimallimix”-strategiaa, jossa yhdistetään useita suurten teknologiayritysten malleja, kuten GPT, Claude ja Gemini. Se on järkevä lähestymistapa, jossa yhdistetään kunkin mallin vahvuudet ja torjutaan muun muassa tiedon häviämisestä johtuvaa pisteiden laskua.
CLEVI ei kuitenkaan liittynyt tähän joukkoon. from scratch -menetelmällä kehitetty cip-5.5-agent (agenttinen tekoäly) suunnittelee, suorittaa ja varmentaa monimutkaisia tehtäviä itsenäisesti, kun taas cip-5.5-mm (tehokas yleiskäyttöinen multimodaalimalli) ymmärtää ja päättelee erilaisista tiedostomuodoista, kuten äänestä, kuvista ja videoista. Molemmat mallit on kehitetty itsenäisesti CLEVI:n sisällä, eikä ulkoisia LLM API -rajapintoja ole käytetty lainkaan.
Tällä omalla mallipinolla GAIAan osallistui viisi agenttia, ja kaikki saavuttivat yli 70 pisteen tuloksen. Parhaasta tuloksesta 79,07 % aina 70,76 %:iin asti tulokset osoittivat koko pinon vakauden, eivät vain yksittäisen tuloksen tuuria.
Yrityksen mukaan virallisen pistemäärän 79,07 % taustalla on vielä yksi luku. CLEVI:n sisäisessä jälkiarvioinnissa havaittiin, että 301 kysymyksestä huomattavassa osassa oikean vastauksen perustelut olivat kadonneet julkisesta verkosta. Kun arviointi tehtiin vain niiden kysymysten perusteella, joiden oikea vastaus on edelleen saatavilla verkossa, CLEVI:n oikeiden vastausten osuus oli yli 98 %. Tämä luku ylittää jo ihmisten keskiarvon (92 %).
On toki mahdollista, että virallista pistemäärää olisi voitu nostaa entisestään yhdistämällä muiden yritysten tehokkaita yleiskäyttöisiä malleja. CLEVI ei kuitenkaan tietoisesti valinnut tätä strategiaa. Tämän benchmarkin tavoitteena ei ollut kilpailla korkeimmasta pistemäärästä, vaan selvittää, onko from scratch -periaatteella kehitetty oma malli saavuttanut globaalilla näyttämöllä kilpailukykyisen tason.
Nimen saaminen GAIA:n tulostaulukkoon on merkityksellistä ennen kaikkea siksi, että se osoittaa kolmannen osapuolen riippumattoman arvioinnin myöntämän varmennetun uskottavuuden. Se tarjoaa objektiivisen perustan, jota voidaan hyödyntää investointien hankinnassa, kansainvälisessä laajentumisessa ja kaikissa B2B-myynnin vaiheissa.
CLEVI:n edustaja kertoi: ”Virallisista 63 väärästä vastauksesta huomattava osa johtui tulostusmuodon yhteensopimattomuudesta, visuaalisen aineiston tulkintavirheistä sekä kysymyksistä, joihin ei voitu vastata tietojen häviämisen vuoksi. Kyse ei ole niinkään loogisen päättelyn perustavanlaatuisista rajoituksista kuin jälkikäsittelyn tarkkuudesta ja ulkoisen tiedon saatavuudesta. Koska kyseessä on oma malli, CLEVI voi kehittää sitä itse. Tämä on juuri from scratch -periaatteella kehitetyn oman mallin rakenteellinen etu. CLEVI:n tämänkertainen saavutus esittää Korean tekoälyalalle kysymyksen: ’Kuinka kauan aiomme olla riippuvaisia lainatuista aivoista?’ CLEVI on valinnut vaikeamman from scratch -polun ja pyrkii osoittamaan vastauksen globaalilla näyttämöllä.”
