Berita

CLEVI, dengan model proprietari yang dibangunkan from scratch mencatat 79.07% dalam GAIA... berada dalam 2.5% teratas daripada 3,090 model

Sumber: Lee Won-ji, wartawan ETNews

Sumber: Lee Won-ji, wartawan ETNews

Petikan penuh artikel “CLEVI, dengan model proprietari yang dibangunkan from scratch mencatat 79.07% dalam GAIA... berada dalam 2.5% teratas daripada 3,090 model”

Tarikh penerbitan: 2026-04-07

Pautan: https://www.etnews.com/20260407000203

Lima ejen dalam susunan model eksklusif cip-5.5-agent·cip-5.5-mm semuanya mencatat lebih 70 mata

Ketepatan lebih 98% dengan mengambil kira kehilangan maklumat, mengatasi manusia (92%)

Imej utama

CLEVI, sebuah syarikat pemula AI, mencatat ketepatan 79.07% dalam penanda aras ejen AI global 'GAIA' menggunakan model proprietarinya yang dibangunkan from scratch, sekali gus berada dalam 2.5% teratas berdasarkan keseluruhan 3,090 model yang didaftarkan.

Menurut penjelasan industri, GAIA dinilai mencerminkan keupayaan 'ejen AI praktikal' dengan tepat dalam pasaran penanda aras AI. Penanda aras ini, yang dibangunkan bersama oleh Meta AI, HuggingFace dan Universiti Paris-Saclay, pertama kali diumumkan pada November 2023.

Terdapat tiga ciri utama yang membezakan GAIA daripada penanda aras lain. Pertama, jawapan yang betul tidak didedahkan, maka overfitting tidak boleh dilakukan. Kedua, kerana ia memerlukan penaakulan kompleks berbilang langkah dan berbilang modal, markah tinggi tidak boleh dicapai melalui padanan corak mudah. Ketiga, lebih daripada 3,090 model di seluruh dunia bersaing dalam keadaan yang sama melalui papan pendahulu rasmi HuggingFace.

Set ujian terdiri daripada sejumlah 301 soalan. Level 1 melibatkan penggunaan satu alat dan penaakulan mudah, Level 2 memerlukan gabungan pelbagai alat dan penaakulan tahap pertengahan, manakala Level 3 terdiri daripada soalan paling sukar yang memerlukan perancangan dan pelaksanaan ejen sebanyak lima langkah atau lebih. Ketika penanda aras ini diumumkan, skor model GPT (dengan pemalam) hanya sekitar 15%, namun pasukan teratas kini telah meningkatkannya kepada julat 70 hingga 80%.

Dalam hal ini, CLEVI menegaskan bahawa aspek yang paling perlu diberi perhatian dari segi teknikal ialah pencapaian tersebut dicapai tanpa menggunakan sebarang API LLM luaran seperti GPT, Claude atau Gemini. Keistimewaannya ialah CLEVI menggunakan dua model eksklusif yang dibangunkan sendiri melalui pendekatan from scratch.

cip-5.5-agent ialah model AI agentik yang berperanan sebagai otak utama dalam saluran paip ejen yang merancang (planning), melaksanakan (execution) dan mengesahkan (verification) tugas kompleks secara autonomi. cip-5.5-mm ialah model multimodal serba guna berprestasi tinggi yang memahami dan membuat penaakulan berdasarkan pelbagai format fail seperti suara, imej dan video. Oleh sebab sebahagian besar soalan GAIA mengandungi input bukan teks seperti fail PDF, imej dan audio, keupayaan multimodal ini menjadi faktor utama pencapaian skor tinggi.

Berdasarkan kedua-dua model yang dibangunkan sendiri ini, CLEVI menyertai GAIA dengan 5 konfigurasi ejen yang berbeza, dan kesemuanya mencatatkan skor melebihi 70.

Menurut penjelasan pihak syarikat, semakan pasca penilaian dalaman CLEVI mendapati hasil yang menarik. Bagi sebahagian daripada keseluruhan 301 soalan, bukti jawapan kini telah hilang daripada web awam. Ini merujuk kepada kes apabila maklumat yang sebelum ini boleh disahkan dalam talian atau melalui enjin carian telah dipadamkan atau diubah dan tidak lagi boleh diakses. Apabila dinilai semula berdasarkan julat maklumat yang kini boleh disahkan secara terbuka oleh manusia, kadar jawapan betul CLEVI didapati melebihi 98%. Angka ini sudah mengatasi purata manusia sebanyak 92%.

Seorang wakil CLEVI menjelaskan, “Tanpa mencampurkan model luaran, CLEVI mencatatkan skor 70+ bagi kesemua 5 ejen hanya menggunakan model sendiri from scratch dan penyelesaian AI agent sendiri, sekali gus memasuki kelompok 2.5% teratas dalam penanda aras awam. Melalui penambahbaikan model dan penyelesaian agent sendiri pada masa hadapan, skor rasmi juga dijangka boleh ditingkatkan lagi. Pencapaian ini penting kerana ia menunjukkan 'kepercayaan yang disahkan' melalui pengukuran sebenar dalam penanda aras awam global, merupakan pencapaian syarikat pembangunan AI domestik berasaskan model sendiri from scratch, mencerminkan hasil daripada susunan model proprietari dan bukannya campuran model luaran, serta mempunyai nilai interpretasi yang melebihi skor semata-mata dengan mengambil kira kehilangan maklumat bagi sebahagian soalan.”

Kembali ke bilik berita
CLEVI

Bahasa dan wilayah

Bahasa yang diterjemahkan oleh mesin ditandakan. Ketersediaan mengikut pakej laman yang diterbitkan.

136 bahasa

Disyorkan

1

Asia Timur

7

Asia Tenggara

11

Asia Selatan

18

Asia Tengah

5

Timur Tengah dan Kaukasus

10

Eropah Barat dan Eropah Selatan

16

United Kingdom dan Ireland

4

Eropah Utara

10

Eropah Tengah dan Balkan

14

Eropah Timur

5

Afrika Timur

8

Afrika Barat dan Afrika Tengah

9

Selatan Afrika

8

Amerika

5

Oceania

5
CLEVI, dengan model proprietari yang dibangunkan from scratch mencatat 79.07% dalam GAIA... berada dalam 2.5% teratas daripada 3,090 model — CLEVI