Sumber: Wartawan Lee Won-ji dari ETNews
Petikan penuh artikel “Clevi, dengan model sendiri yang dibangunkan from scratch mencapai 79.07% dalam GAIA... berada dalam kelompok 2.5% teratas daripada 3,090 model”
Tarikh penerbitan: 2026-04-07
Pautan: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm, lima ejen dalam timbunan model tersendiri semuanya melebihi 70 mata
Ketepatan lebih 98% jika mengambil kira kehilangan maklumat, mengatasi manusia (92%)
Syarikat pemula AI 'Clevi' mencatat ketepatan 79.07% dalam penanda aras ejen AI global 'GAIA' dengan menggunakan model sendiri yang dibangunkan from scratch, dan berada dalam kelompok 2.5% teratas berdasarkan keseluruhan 3,090 model yang didaftarkan.
Menurut penjelasan industri, dalam pasaran penanda aras AI, GAIA dinilai mencerminkan dengan baik keupayaan 'ejen AI praktikal'. Penanda aras ini, yang dibangunkan bersama oleh Meta AI, HuggingFace dan Universiti Paris-Saclay, pertama kali diperkenalkan pada November 2023.
Terdapat tiga ciri utama yang membezakan GAIA daripada penanda aras lain. Pertama, kerana jawapan yang betul tidak didedahkan, pengoptimuman berlebihan adalah mustahil. Kedua, kerana ia memerlukan penaakulan kompleks berbilang langkah dan multimodal, markah tinggi tidak boleh dicapai melalui padanan corak mudah. Ketiga, lebih daripada 3,090 model dari seluruh dunia bersaing dalam keadaan yang sama melalui papan pendahulu rasmi HuggingFace.
Set ujian terdiri daripada sejumlah 301 soalan. Level 1 melibatkan penggunaan satu alat dan penaakulan mudah, Level 2 melibatkan gabungan pelbagai alat dan penaakulan peringkat pertengahan, manakala Level 3 ialah soalan paling sukar yang memerlukan perancangan dan pelaksanaan ejen sebanyak lima langkah atau lebih. Ketika penanda aras ini diumumkan, skor model GPT (dengan pemalam) hanya sekitar 15%, tetapi kini pasukan teratas telah meningkatkannya kepada lingkungan 70 hingga 80%.
Dalam hal ini, Clevi menegaskan bahawa perkara yang paling perlu diberi perhatian secara teknikal daripada pencapaian tersebut ialah mereka langsung tidak menggunakan API LLM luaran seperti GPT, Claude atau Gemini. Clevi menggunakan dua model yang dibangunkan sendiri melalui pendekatan from scratch.
cip-5.5-agent ialah model AI agentik yang berperanan sebagai otak utama dalam saluran paip ejen yang merancang (planning), melaksanakan (execution) dan mengesahkan (verification) tugas kompleks secara autonomi. cip-5.5-mm ialah model multimodal serba guna berprestasi tinggi yang memahami dan membuat penaakulan tentang pelbagai format fail seperti audio, imej dan video. Oleh sebab sebahagian besar soalan GAIA mengandungi input bukan teks seperti fail PDF, imej dan audio, keupayaan multimodal ini menjadi faktor utama pencapaian markah tinggi.
Berdasarkan kedua-dua model proprietari ini, Clevi menghantar 5 konfigurasi ejen yang berbeza untuk bertanding dalam GAIA, dan kesemuanya memperoleh markah melebihi 70.
Menurut penjelasan pihak syarikat, hasil yang menarik telah dikenal pasti melalui semakan selepas penilaian dalaman Clevi. Daripada jumlah 301 soalan, bagi sesetengah soalan, asas bukti jawapan kini telah hilang daripada web awam. Ini berlaku apabila maklumat yang sebelum ini boleh disahkan dalam talian atau melalui enjin carian telah dipadam atau diubah dan tidak lagi boleh diakses. Apabila dinilai semula berdasarkan lingkungan maklumat yang boleh disahkan secara terbuka oleh manusia pada masa ini, kadar jawapan betul Clevi didapati melebihi 98%. Angka ini sudah mengatasi purata manusia, iaitu 92%.
Wakil Clevi menjelaskan, “Clevi mencatatkan 70+ bagi kesemua 5 ejen dan berjaya memasuki kelompok 2.5% teratas dalam penanda aras awam hanya dengan model proprietari from scratch dan penyelesaian ejen AI proprietari, tanpa mencampurkan model luaran. Melalui penambahbaikan model dan penyelesaian ejen proprietari pada masa hadapan, markah rasmi juga dijangka boleh dipertingkatkan lagi. Pencapaian ini amat bermakna kerana ia menunjukkan 'kepercayaan yang disahkan' melalui pengukuran sebenar dalam penanda aras awam global, merupakan pencapaian syarikat pembangunan AI tempatan yang berasaskan model proprietari from scratch, mencerminkan hasil susunan model tersendiri dan bukannya gabungan model luaran, serta mempunyai nilai tafsiran yang lebih besar daripada markah semata-mata dengan mengambil kira kehilangan maklumat bagi sesetengah soalan.”
