Sumber: Digital Times, wartawan Gu Bon-gyu
Petikan penuh artikel “Startup AI CLEVI memasuki 2.5% teratas GAIA… menunjukkan kredibiliti yang terbukti”
Tarikh terbitan 2026-04-08
Pautan : https://n.news.naver.com/article/029/0003020511?sid=105
Startup AI Korea ‘Clevi’ telah membina model proprietari dan penyelesaian ejen proprietari yang dihasilkan from scratch, lalu mengumumkan bahawa ia menjadi yang pertama di Korea untuk memasuki kelompok 2.5% teratas dalam penanda aras GAIA, berdasarkan keseluruhan 3,090 model berdaftar.
Menurut penjelasan industri, GAIA, yang direka oleh Meta AI dan dikendalikan oleh Hugging Face, menguji AI bukan sekadar tentang ‘keupayaan melakukan satu perkara dengan baik’, tetapi ‘keupayaan menggabungkan pelbagai keupayaan untuk menyelesaikan masalah sebenar’. AI perlu mencari maklumat di web, membaca jadual dalam PDF, menganalisis imej, menjalankan kod untuk membuat pengiraan, dan menggabungkan hasilnya untuk memberikan satu jawapan yang betul. Dengan 301 soalan sulit, tiga tahap kesukaran dan prinsip tidak mendedahkan jawapan, strukturnya menjadikan overfitting dan penipuan mustahil.
Untuk mendapat markah tinggi dalam ujian ini, dua perkara diperlukan. Pertama ialah keupayaan penaakulan model bahasa yang menjadi asas, dan kedua ialah penyelesaian ejen yang menghubungkan model tersebut dengan alat dunia sebenar supaya dapat melaksanakan tugas secara autonomi. Walau sebaik mana pun model itu, ejen yang lemah tidak akan dapat menyelesaikan Level 3; dan walau secanggih mana pun ejen itu, jika keupayaan penaakulan model tidak mencukupi, jawapan salah akan tersebar dari peringkat pertengahan.
Melihat struktur semasa papan pendahulu GAIA, terdapat satu corak yang menarik. Kebanyakan ejen di kedudukan teratas menggunakan strategi ‘campuran pelbagai model’ yang menggabungkan pelbagai model syarikat teknologi besar seperti GPT, Claude dan Gemini. Ini merupakan pendekatan yang munasabah untuk menggabungkan kekuatan setiap model serta mengurangkan penurunan markah akibat kehilangan maklumat dan faktor lain.
Sebaliknya, Clevi tidak menyertai kelompok tersebut. cip-5.5-agent (AI ejen), yang dibangunkan menggunakan kaedah from scratch, merancang, melaksanakan dan mengesahkan tugas kompleks secara autonomi, manakala cip-5.5-mm (multimodal serba guna berprestasi tinggi) memahami dan menaakul pelbagai format fail termasuk suara, imej dan video. Kedua-dua model ini dibangunkan secara bebas di dalam Clevi, dan tiada API LLM luaran digunakan sama sekali.
Dengan susunan model proprietari ini, CLEVI menghantar 5 ejen ke GAIA dan kesemuanya mencatatkan skor melebihi 70. Daripada skor tertinggi 79.07% hingga 70.76%, keputusan ini membuktikan kestabilan keseluruhan susunan tersebut, bukan sekadar nasib bagi satu keputusan.
Menurut penjelasan pihak syarikat, di sebalik skor rasmi 79.07% terdapat satu lagi angka. Hasil semakan selepas penilaian dalaman CLEVI mendapati bahawa sebilangan besar daripada 301 soalan tersebut mempunyai bukti jawapan yang telah hilang daripada web awam semasa. Apabila dinilai semula hanya berdasarkan soalan yang jawapannya masih wujud di web, kadar jawapan betul CLEVI melebihi 98%. Angka ini sudah mengatasi purata manusia (92%).
Sudah tentu, skor rasmi mungkin boleh ditingkatkan lagi jika model serba guna yang berkuasa daripada syarikat lain digabungkan. Namun, CLEVI sengaja tidak memilih strategi tersebut. Hal ini kerana matlamat penanda aras ini bukanlah untuk bersaing mendapatkan skor tertinggi, tetapi untuk mengesahkan sama ada model proprietari from scratch sendiri telah mencapai tahap yang mampu bersaing di pentas global.
Nama yang disenaraikan pada papan pendahulu GAIA mempunyai makna besar kerana ia menunjukkan bahawa CLEVI memiliki kredibiliti yang disahkan melalui penilaian bebas pihak ketiga. Ini menjadi bukti objektif yang boleh dimanfaatkan dalam semua peringkat, termasuk mendapatkan pelaburan, pengembangan ke luar negara dan jualan B2B.
Seorang wakil CLEVI berkata, “Sebahagian besar daripada 63 jawapan rasmi yang salah berpunca daripada ketidakpadanan format output, kesilapan mentafsir bahan visual dan soalan yang tidak dapat dijawab akibat kehilangan maklumat. Ini bukanlah masalah batasan asas penaakulan logik, tetapi masalah ketepatan pascapemprosesan dan ketersediaan maklumat luaran. Oleh sebab ini ialah model proprietari sendiri, CLEVI boleh memperbaikinya sendiri. Inilah kelebihan struktur model proprietari from scratch. Pencapaian CLEVI kali ini mengemukakan soalan kepada industri AI Korea: “Sampai bila kita akan bergantung pada ‘otak yang dipinjam’?” CLEVI memilih jalan yang lebih sukar, iaitu from scratch, dan berhasrat membuktikan jawapannya di pentas dunia.”
