Sumber: Digital Times, reporter Gu Bon-gyu
Kutipan lengkap artikel “Startup AI CLEVI mlebu 2,5% paling dhuwur ing GAIA… nuduhake kredibilitas sing wis kabukten”
Tanggal terbit 2026-04-08
Tautan: https://n.news.naver.com/article/029/0003020511?sid=105
Startup AI domestik ‘Clevi’ ngumumake manawa, ing tengah-tengah mbangun model dhewe lan solusi agen dhewe sing digawe from scratch, dheweke dadi sing pisanan ing Korea sing mlebu 2,5% paling dhuwur ing benchmark GAIA adhedhasar total 3.090 model sing kadhaptar.
Miturut katrangan saka industri, GAIA sing dirancang dening Meta AI lan dioperasèkaké dening Hugging Face ora nguji AI babagan ‘kemampuan nindakake siji perkara kanthi apik’, nanging ‘kemampuan nggabungaké manéka kemampuan kanggo ngrampungaké masalah nyata’. AI kudu nemokake informasi ing web, maca tabel ing PDF, nganalisis gambar, nglakokaké kode kanggo ngetung, banjur nggabungaké asil kasebut kanggo menehi siji jawaban sing bener. Kanthi 301 pitakonan rahasia, telung tingkat kangèlan, lan prinsip ora mbukak jawaban, strukture ora bisa ngalami overfitting utawa cheating.
Kanggo entuk skor dhuwur ing ujian kasebut, ana rong bab sing dibutuhake. Yaiku kemampuan nalar model basa sing dadi dhasar lan solusi agen sing nyambungaké model kasebut karo piranti ing donya nyata supaya bisa nindakake tugas kanthi otonom. Sanajan modelé apik banget, yen agené ringkih, Level 3 ora bisa dirampungaké; lan sanajan agené canggih banget, yen kemampuan nalar modelé kurang, jawaban sing salah bakal nyebar wiwit tahap tengah.
Yen ndeleng struktur saiki ing papan peringkat GAIA, katon pola sing menarik. Akèh agèn ing posisi ndhuwur nganggo strategi ‘campuran multimodel’ sing nggabungaké manéka model big tech kayata GPT, Claude, lan Gemini. Iki minangka pendekatan sing rasional kanggo nggabungaké kekuwatan saben model lan nyegah penurunan skor amarga ilangé informasi lan sapituruté.
Nanging, Clevi ora melu ing jajaran kasebut. cip-5.5-agent (AI agentik) sing dikembangaké nganggo metode from scratch kanthi otonom nindakake perencanaan, eksekusi, lan verifikasi tugas rumit, déné cip-5.5-mm (multimodal umum kinerja dhuwur) mangertèni lan nalaraké manéka format file kayata swara, gambar, lan video. Kaloro model iki dikembangaké kanthi mandiri ing internal Clevi, lan ora nggunakake API LLM eksternal babar pisan.
Kanthi tumpukan model gawéan dhéwé iki, CLEVI ngirimaké 5 agen menyang GAIA, lan kabèh nyathet skor luwih saka 70. Saka sing paling dhuwur 79.07% nganti 70.76%, iki mbuktèkaké stabilitas kabèh tumpukan, dudu mung kabegjan asil siji waé.
Miturut katrangan saka pihak perusahaan, ing mburi skor resmi 79.07% ana angka liyané. Asil peninjauan pascatès internal CLEVI nuduhaké yèn saka 301 pitakon, akèh pitakon sing dhasar jawabané wis ilang saka web sing saiki kabuka. Nalika dievaluasi manèh mung adhedhasar pitakon sing jawabané isih ana ing web nganti saiki, tingkat jawaban bener CLEVI luwih saka 98%. Angka iki wis ngluwihi rata-rata manungsa (92%).
Mesthiné, yèn nyampur model serbaguna sing kuwat saka perusahaan liya, skor resmi bisa waé ditingkataké luwih dhuwur. Nanging, CLEVI kanthi sengaja ora milih strategi kuwi. Amarga tujuan benchmark iki dudu kompetisi kanggo nggayuh skor paling dhuwur, nanging kanggo verifikasi apa model gawéan dhéwé saka from scratch wis tekan tingkat sing bisa saingan ing panggung global.
Jeneng sing kacathet ing papan pimpinan GAIA nduwèni teges gedhé amarga nuduhaké yèn CLEVI nduwèni kredibilitas sing wis diverifikasi liwat evaluasi independen pihak katelu. Iki dadi bukti obyektif sing bisa digunakaké ing kabèh kahanan, wiwit saka narik investasi, ekspansi menyang luar negeri, nganti penjualan B2B.
Wakil CLEVI ngandharaké, “Saka 63 jawaban sing resmi dianggep salah, akèh-akèhé asalé saka ketidakcocokan format output, kesalahan interpretasi bahan visual, lan pitakon sing ora bisa dijawab amarga informasié wis ilang. Iki luwih minangka masalah presisi pascaproses lan kasedhiyan informasi eksternal tinimbang watesan dhasar penalaran logis. Amarga minangka model gawéan dhéwé, CLEVI bisa nambahaké perbaikan kanthi mandiri. Iki minangka kauntungan struktural saka model gawéan dhéwé saka from scratch. Prestasi CLEVI wektu iki maringi pitakon marang industri AI Korea: ‘Suwéné pira manèh kita bakal gumantung marang “otak sing disilih”?’ CLEVI milih dalan sing luwih angel, yaiku from scratch, lan kepéngin mbuktèkaké jawabané ing panggung donya,” ujare.
