Berita

Startup AI CLEVI memasuki 2.5% teratas GAIA… menunjukkan kredibiliti yang terbukti

Sumber: Digital Times, wartawan Gu Bon-gyu

Sumber: Digital Times, wartawan Gu Bon-gyu

Petikan penuh artikel “Startup AI CLEVI memasuki 2.5% teratas GAIA… menunjukkan kredibiliti yang terbukti”

Tarikh terbitan 2026-04-08

Pautan : https://n.news.naver.com/article/029/0003020511?sid=105

Startup AI Korea ‘Clevi’ telah membina model proprietari dan penyelesaian ejen proprietari yang dihasilkan from scratch, lalu mengumumkan bahawa ia menjadi yang pertama di Korea untuk memasuki kelompok 2.5% teratas dalam penanda aras GAIA, berdasarkan keseluruhan 3,090 model berdaftar.

Menurut penjelasan industri, GAIA, yang direka oleh Meta AI dan dikendalikan oleh Hugging Face, menguji AI bukan sekadar tentang ‘keupayaan melakukan satu perkara dengan baik’, tetapi ‘keupayaan menggabungkan pelbagai keupayaan untuk menyelesaikan masalah sebenar’. AI perlu mencari maklumat di web, membaca jadual dalam PDF, menganalisis imej, menjalankan kod untuk membuat pengiraan, dan menggabungkan hasilnya untuk memberikan satu jawapan yang betul. Dengan 301 soalan sulit, tiga tahap kesukaran dan prinsip tidak mendedahkan jawapan, strukturnya menjadikan overfitting dan penipuan mustahil.

Untuk mendapat markah tinggi dalam ujian ini, dua perkara diperlukan. Pertama ialah keupayaan penaakulan model bahasa yang menjadi asas, dan kedua ialah penyelesaian ejen yang menghubungkan model tersebut dengan alat dunia sebenar supaya dapat melaksanakan tugas secara autonomi. Walau sebaik mana pun model itu, ejen yang lemah tidak akan dapat menyelesaikan Level 3; dan walau secanggih mana pun ejen itu, jika keupayaan penaakulan model tidak mencukupi, jawapan salah akan tersebar dari peringkat pertengahan.

Melihat struktur semasa papan pendahulu GAIA, terdapat satu corak yang menarik. Kebanyakan ejen di kedudukan teratas menggunakan strategi ‘campuran pelbagai model’ yang menggabungkan pelbagai model syarikat teknologi besar seperti GPT, Claude dan Gemini. Ini merupakan pendekatan yang munasabah untuk menggabungkan kekuatan setiap model serta mengurangkan penurunan markah akibat kehilangan maklumat dan faktor lain.

Sebaliknya, Clevi tidak menyertai kelompok tersebut. cip-5.5-agent (AI ejen), yang dibangunkan menggunakan kaedah from scratch, merancang, melaksanakan dan mengesahkan tugas kompleks secara autonomi, manakala cip-5.5-mm (multimodal serba guna berprestasi tinggi) memahami dan menaakul pelbagai format fail termasuk suara, imej dan video. Kedua-dua model ini dibangunkan secara bebas di dalam Clevi, dan tiada API LLM luaran digunakan sama sekali.

Dengan susunan model proprietari ini, CLEVI menghantar 5 ejen ke GAIA dan kesemuanya mencatatkan skor melebihi 70. Daripada skor tertinggi 79.07% hingga 70.76%, keputusan ini membuktikan kestabilan keseluruhan susunan tersebut, bukan sekadar nasib bagi satu keputusan.

Imej dalam artikel

Menurut penjelasan pihak syarikat, di sebalik skor rasmi 79.07% terdapat satu lagi angka. Hasil semakan selepas penilaian dalaman CLEVI mendapati bahawa sebilangan besar daripada 301 soalan tersebut mempunyai bukti jawapan yang telah hilang daripada web awam semasa. Apabila dinilai semula hanya berdasarkan soalan yang jawapannya masih wujud di web, kadar jawapan betul CLEVI melebihi 98%. Angka ini sudah mengatasi purata manusia (92%).

Sudah tentu, skor rasmi mungkin boleh ditingkatkan lagi jika model serba guna yang berkuasa daripada syarikat lain digabungkan. Namun, CLEVI sengaja tidak memilih strategi tersebut. Hal ini kerana matlamat penanda aras ini bukanlah untuk bersaing mendapatkan skor tertinggi, tetapi untuk mengesahkan sama ada model proprietari from scratch sendiri telah mencapai tahap yang mampu bersaing di pentas global.

Nama yang disenaraikan pada papan pendahulu GAIA mempunyai makna besar kerana ia menunjukkan bahawa CLEVI memiliki kredibiliti yang disahkan melalui penilaian bebas pihak ketiga. Ini menjadi bukti objektif yang boleh dimanfaatkan dalam semua peringkat, termasuk mendapatkan pelaburan, pengembangan ke luar negara dan jualan B2B.

Seorang wakil CLEVI berkata, “Sebahagian besar daripada 63 jawapan rasmi yang salah berpunca daripada ketidakpadanan format output, kesilapan mentafsir bahan visual dan soalan yang tidak dapat dijawab akibat kehilangan maklumat. Ini bukanlah masalah batasan asas penaakulan logik, tetapi masalah ketepatan pascapemprosesan dan ketersediaan maklumat luaran. Oleh sebab ini ialah model proprietari sendiri, CLEVI boleh memperbaikinya sendiri. Inilah kelebihan struktur model proprietari from scratch. Pencapaian CLEVI kali ini mengemukakan soalan kepada industri AI Korea: “Sampai bila kita akan bergantung pada ‘otak yang dipinjam’?” CLEVI memilih jalan yang lebih sukar, iaitu from scratch, dan berhasrat membuktikan jawapannya di pentas dunia.”

Kembali ke bilik berita
CLEVI

Bahasa dan wilayah

Bahasa yang diterjemahkan oleh mesin ditandakan. Ketersediaan mengikut pakej laman yang diterbitkan.

136 bahasa

Disyorkan

1

Asia Timur

7

Asia Tenggara

11

Asia Selatan

18

Asia Tengah

5

Timur Tengah dan Kaukasus

10

Eropah Barat dan Eropah Selatan

16

United Kingdom dan Ireland

4

Eropah Utara

10

Eropah Tengah dan Balkan

14

Eropah Timur

5

Afrika Timur

8

Afrika Barat dan Afrika Tengah

9

Selatan Afrika

8

Amerika

5

Oceania

5
Startup AI CLEVI memasuki 2.5% teratas GAIA… menunjukkan kredibiliti yang terbukti — CLEVI