Uutiset

CLEVI, 79,07 % GAIA:ssa from scratch -menetelmällä kehitetyllä omalla mallilla... 3 090 mallin joukossa 2,5 parhaan prosentin joukossa

Lähde: Electronic Times, toimittaja Lee Won-ji

Lähde: Electronic Times, toimittaja Lee Won-ji

Lainaus koko artikkelista ”CLEVI, 79,07 % GAIA:ssa from scratch -menetelmällä kehitetyllä omalla mallilla... 3 090 mallin joukossa 2,5 parhaan prosentin joukossa”

Julkaisupäivä: 2026-04-07

Linkki: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm:n oma mallipino: kaikki viisi agenttia yli 70 pisteen

Tietojen menetykset huomioiden yli 98 %:n tarkkuus, ylittää ihmiset (92 %)

Artikkelin kuva

Tekoäly-startup CLEVI saavutti 79,07 %:n tarkkuuden globaalissa AI-agenttien GAIA-vertailussa hyödyntämällä from scratch -menetelmällä kehitettyä omaa malliaan ja sijoittui 3 090 rekisteröidyn mallin joukossa 2,5 parhaan prosentin joukkoon.

Alan asiantuntijoiden mukaan GAIA:n arvioidaan heijastavan uskollisesti ”käytännön AI-agenttien” kyvykkyyttä tekoälyn vertailumarkkinoilla. Meta AI:n, HuggingFacen ja Paris-Saclayn yliopiston yhdessä kehittämä vertailu julkaistiin ensimmäisen kerran marraskuussa 2023.

GAIA:n muista vertailuista erottavat kolme keskeistä tekijää. Ensinnäkin oikeat vastaukset eivät ole julkisia, joten ylisovittaminen ei ole mahdollista. Toiseksi monivaiheista ja multimodaalista yhdistettyä päättelyä edellyttävissä tehtävissä ei voi saavuttaa korkeita pisteitä pelkällä kaavojen tunnistamisella. Kolmanneksi HuggingFacen virallisen tulostaulukon kautta yli 3 090 mallia ympäri maailmaa kilpailee samoilla ehdoilla.

Testiaineisto koostuu yhteensä 301 kysymyksestä. Level 1 edellyttää yhden työkalun käyttöä ja yksinkertaista päättelyä, Level 2 useiden työkalujen yhdistämistä ja keskitason päättelyä, ja Level 3 sisältää korkeimman vaikeustason kysymyksiä, jotka edellyttävät agentin vähintään viisiportaisen suunnitelman laatimista ja toteuttamista. Vertailun julkaisemisen aikaan GPT-mallien (plugineilla varustettuna) tulos oli noin 15 %, kun taas kärkijoukkueet ovat nykyään nostaneet tuloksensa 70–80 prosentin tasolle.

CLEVI korosti, että saavutuksessa teknisesti huomionarvoisinta on se, ettei siinä käytetty lainkaan ulkoisia LLM-rajapintoja, kuten GPT:tä, Claudea tai Geminiä. CLEVI:n erityispiirteenä on kahden from scratch -menetelmällä itsenäisesti kehitetyn mallin käyttö.

cip-5.5-agent on agenttinen tekoälymalli, joka toimii monimutkaisia tehtäviä itsenäisesti suunnittelevan (planning), suorittavan (execution) ja varmentavan (verification) agenttiputken keskeisenä aivona. cip-5.5-mm on tehokas yleiskäyttöinen multimodaalinen malli, joka ymmärtää ja käsittelee päätellen erilaisia tiedostomuotoja, kuten ääntä, kuvia ja videoita. Koska huomattava osa GAIA-tehtävistä sisältää tekstittömiä syötteitä, kuten PDF-, kuva- ja äänitiedostoja, tämä multimodaalinen kyvykkyys oli keskeinen tekijä korkean pistemäärän saavuttamisessa.

CLEVI osallistui GAIAan viidellä erilaisella agenttikokoonpanolla, jotka perustuivat näihin kahteen omaan malliin, ja kaikki saavuttivat yli 70 pistettä.

Yhtiön mukaan CLEVI:n sisäisessä jälkiarvioinnissa havaittiin mielenkiintoinen tulos. Kaikkiaan 301 tehtävästä joidenkin vastausten perustana ollut tieto oli tällä hetkellä kadonnut julkisesta verkosta. Aiemmin verkossa tai hakukoneilla saatavilla olleet tiedot oli poistettu tai niitä oli muutettu, eikä niihin enää ollut pääsyä. Kun tehtävät arvioitiin uudelleen tällä hetkellä julkisesti ihmisten tarkistettavissa olevan tiedon perusteella, CLEVI:n oikeiden vastausten osuus oli yli 98 %. Tämä ylittää jo ihmisten 92 prosentin keskiarvon.

CLEVI:n edustaja selitti: ”CLEVI saavutti kaikilla viidellä agentillaan vähintään 70 pistettä ja sijoittui julkisessa vertailuarviossa parhaaseen 2,5 prosenttiin käyttämällä ainoastaan from scratch -periaatteella kehitettyjä omia mallejaan ja omia AI-agenttiratkaisujaan ilman ulkoisten mallien yhdistämistä. Omien malli- ja agenttiratkaisujen kehittämisen myötä myös virallisen pistemäärän odotetaan voivan parantua entisestään. Tämä saavutus on merkittävä, koska se osoittaa globaalissa julkisessa vertailuarviossa mitattua ’todennettua luotettavuutta’, perustuu korealaisen tekoälykehittäjän from scratch -periaatteella kehittämiin omiin malleihin, on saavutettu itsenäisellä mallipinolla ulkoisten mallien yhdistämisen sijaan ja tarjoaa joidenkin tehtävien tietojen katoaminen huomioon ottaen tulkinta-arvoa, joka ylittää pelkän pistemäärän.”

Takaisin uutishuoneeseen
CLEVI

Kieli ja alue

Konekäännetyt kielet on merkitty. Saatavuus noudattaa julkaistua sivustopakettia.

136 kieltä

Suositeltu

1

Itä-Aasia

7

Kaakkois-Aasia

11

Etelä-Aasia

18

Keski-Aasia

5

Lähi-itä ja Kaukasia

10

Länsi-Eurooppa ja Etelä-Eurooppa

16

Iso-Britannia ja Irlanti

4

Pohjois-Eurooppa

10

Keski-Eurooppa ja Balkan

14

Itä-Eurooppa

5

Itä-Afrikka

8

Länsi-Afrikka ja Keski-Afrikka

9

eteläinen Afrikka

8

Amerikka

5

Oseania

5
CLEVI, 79,07 % GAIA:ssa from scratch -menetelmällä kehitetyllä omalla mallilla... 3 090 mallin joukossa 2,5 parhaan prosentin joukossa — CLEVI