Sumber: Wartawan Lee Won-ji saka Electronic Times
Kutipan lengkap artikel “CLEVI, nganggo model dhewe sing dikembangaké from scratch, GAIA 79.07%... kalebu 2,5% paling dhuwur saka 3.090 model”
Tanggal terbit: 2026-04-07
Tautan: https://www.etnews.com/20260407000203
Lima agen ing tumpukan model independen cip-5.5-agent·cip-5.5-mm kabeh entuk skor luwih saka 70
Kanthi nimbang mundhut informasi, tingkat jawaban bener 98%+, ngluwihi manungsa (92%)
Startup AI 'CLEVI' nyathet tingkat jawaban bener 79.07% ing benchmark agen AI global 'GAIA' kanthi nggunakake model dhewe sing dikembangaké from scratch, lan mlebu ing 2,5% paling dhuwur adhedhasar 3.090 model sing kadhaftar.
Miturut katrangan saka industri, ing pasar benchmark AI, GAIA dianggep bisa nggambarake kanthi akurat kemampuan 'agen AI praktis'. Benchmark iki dikembangaké bebarengan déning Meta AI, HuggingFace, Universitas Paris-Saclay, lan liya-liyané, lan pisanan diluncuraké ing November 2023.
Ana telung ciri utama sing mbedakaké GAIA saka benchmark liyané. Sepisanan, amarga jawaban sing bener ora dibukak kanggo umum, overfitting ora bisa ditindakake. Kapindho, amarga mbutuhake penalaran gabungan multistep lan multimodal, skor dhuwur ora bisa digayuh mung nganggo pencocokan pola prasaja. Katelu, luwih saka 3.090 model saka saindenging donya saingan ing kahanan sing padha liwat papan peringkat resmi HuggingFace.
Set tes iki dumadi saka total 301 pitakon. Level 1 mbutuhake panggunaan alat tunggal lan penalaran prasaja, Level 2 mbutuhake kombinasi pirang-pirang alat lan penalaran tingkat menengah, déné Level 3 minangka pitakon kanthi tingkat kangelan paling dhuwur sing mbutuhake perencanaan lan eksekusi agen luwih saka 5 tahap. Nalika benchmark iki diumumaké, asilé mung watara 15% adhedhasar model GPT (kanthi plugin), nanging saiki tim-tim paling dhuwur wis ningkataké dadi kisaran 70–80%.
Ing antarane iki, CLEVI negesaké yèn bagéan sing paling pantes digatekaké kanthi teknis saka prestasi kasebut yaiku ora nggunakake API LLM eksternal kayata GPT, Claude, utawa Gemini babar pisan. Ciri khasé yaiku nggunakake rong model sing dikembangaké sacara independen nganggo cara from scratch.
cip-5.5-agent minangka model AI agentik sing dadi otak utama ing pipeline agen sing ngrancang (planning), nglakokake (execution), lan verifikasi (verification) tugas-tugas rumit kanthi otonom. cip-5.5-mm minangka model multimodal umum kanthi performa dhuwur sing bisa mangerteni lan nindakake inferensi marang macem-macem format berkas kayata swara, gambar, lan video. Amarga akèh pitakon GAIA ngemot input nonteks kayata PDF, gambar, lan berkas audio, kemampuan multimodal iki dadi faktor utama kanggo éntuk skor dhuwur.
Adhedhasar rong model gawéané dhéwé iki, CLEVI ngirimaké 5 konfigurasi agen sing béda menyang GAIA, lan kabèh bisa éntuk skor ing ndhuwur 70.
Miturut katrangan saka pihak perusahaan, asil sing menarik ditemokaké sajrone tinjauan pascates internal CLEVI. Saka total 301 pitakon, sawetara pitakon wis ora nduwèni bukti jawaban sing isih bisa diakses ing web umum saiki. Informasi sing biyèn bisa diverifikasi kanthi online utawa liwat mesin telusur wis dibusak utawa diowahi, mula ora bisa diakses manèh. Nalika dievaluasi manèh adhedhasar jangkauan informasi sing saiki bisa diverifikasi déning masyarakat umum, tingkat jawaban bener CLEVI kacathet luwih saka 98%. Angka iki wis ngluwihi rata-rata manungsa, yaiku 92%.
Wakil CLEVI nerangaké, “CLEVI, tanpa nyampur model eksternal, kanthi mung model gawéané dhéwé saka from scratch lan solusi AI agen gawéané dhéwé, kasil nyathet skor 70+ kanggo kabèh 5 agen lan mlebu 2,5% paling dhuwur ing benchmark publik. Ing mangsa ngarep, skor resmi uga bisa terus mundhak liwat perbaikan model lan solusi agen gawéané dhéwé. Prestasi iki nduwèni teges gedhé amarga nuduhaké 'kapercayan sing wis diverifikasi' adhedhasar pangukuran ing benchmark publik global, minangka prestasi perusahaan pangembang AI domestik adhedhasar model gawéané dhéwé saka from scratch, minangka asil saka tumpukan model independen lan dudu campuran model eksternal, uga nduwèni nilai interpretasi sing ngluwihi skor amarga nggatekaké ilangé informasi ing sawetara pitakon.”
