Berita

Daya saing yang dibuktikan oleh data— ejen AI dari Korea mencapai 2.5% teratas dalam GAIA Benchmark

Apabila penanda aras GAIA mula diperkenalkan, GPT-4, yang pada ketika itu merupakan model bertaraf tertinggi, hanya mencatat skor sekitar 30%. Memandangkan GAIA memerlukan penaakulan kompleks, penggunaan alat dan penyelesaian masalah berbilang langkah, bukan sekadar soal jawab, hal ini bermakna AI pada ketika itu masih berada pada peringkat awal dari segi “keupayaan berfikir dan melaksanakan”…

Maksud skor GAIA — Sejauh manakah ejen AI telah berkembang

Apabila penanda aras GAIA mula diperkenalkan, GPT-4, yang pada ketika itu merupakan model bertaraf tertinggi, hanya mencatat skor sekitar 30%. Memandangkan GAIA memerlukan penaakulan kompleks, penggunaan alat dan penyelesaian masalah berbilang langkah, bukan sekadar soal jawab, hal ini bermakna AI pada ketika itu masih berada pada peringkat awal dari segi “keupayaan berfikir dan melaksanakan”.

Namun kini, ejen yang berada dalam kelompok teratas telah mencapai 92.36%.

Perubahan ini bukan sekadar peningkatan prestasi. Ini merupakan petunjuk bahawa AI kini telah melangkaui tahap menjawab soalan dan memasuki fasa ‘Agentic AI’, iaitu mentafsir situasi, memilih alat yang diperlukan serta merancang dan melaksanakan pelbagai langkah secara autonomi.

Dalam tempoh hanya beberapa tahun, AI telah berkembang daripada “alat penjanaan pengetahuan” menjadi “entiti pelaksana yang menjalankan tugas”.

Imej utama

📌 Dan CLEVI berada dalam kelompok 2.5% teratas itu

Dalam persekitaran persaingan global ini, kejayaan ejen CLEVI yang dibangunkan di Korea disenaraikan dalam kelompok 2.5% teratas papan pendahulu GAIA membuktikan kebebasan teknologi, serta menjadi contoh bahawa ejen AI yang dibangunkan di Korea mampu memenuhi piawaian global. Ini membawa makna yang lebih besar daripada sekadar angka. Ini bermakna keupayaan teknologi tersebut telah disahkan secara objektif melalui persaingan dengan ribuan model dalam penanda aras global yang terbuka, bukannya dalam persekitaran demo tertentu.

Lebih penting lagi, pencapaian ini bukan hasil kebetulan satu model, tetapi kerana ejen dengan reka bentuk yang berbeza di atas Agent Stack yang sama telah berulang kali menghasilkan prestasi dalam kelompok teratas.

Dengan kata lain, teknologi CLEVI bukanlah “hasil yang baik sekali sahaja”, tetapi daya saing struktur yang boleh dihasilkan semula, serta keupayaan pada tahap platform yang boleh dikembangkan kepada pelbagai industri dan senario.

Imej utama

Jadi, apakah maksud penunjuk ini?

Bagi pengguna, halangan terbesar dalam penerapan AI ialah persoalan "bolehkah ia benar-benar dipercayai dan diberikan tanggungjawab?"}

Prestasi yang telah dibuktikan berulang kali di pentas pihak ketiga, iaitu papan pendahuluan global yang terbuka kepada umum, bukan melalui demo yang mengagumkan atau bahan pembentangan syarikat sendiri, merupakan jawapan paling objektif kepada persoalan tersebut. Secara khususnya, prestasi ini membawa makna dalam tiga aspek.

Pertama, pengurangan risiko pelaksanaan

Menghubungkan AI yang belum terbukti kepada operasi dalaman merupakan beban yang besar bagi perusahaan.

Pencapaian dalam penanda aras berwibawa seperti GAIA boleh digunakan secara langsung sebagai asas kepercayaan pada peringkat penilaian teknologi.

Kedua, merealisasikan automasi tugas yang kompleks

Angka 2.5% teratas menunjukkan tahap kecerdasan yang bukan sahaja melangkaui tugasan berulang yang mudah, malah mampu memahami konteks, membuat pertimbangan sendiri melalui beberapa langkah dan menyelesaikan tugasan.

Bidang tugasan yang selama ini dianggap "sukar untuk diserahkan kepada AI" kini boleh menjadi sasaran automasi yang sebenar.

Ketiga, mencapai keselamatan data dan prestasi secara serentak

Struktur Agent Stack tersendiri bermaksud aliran data tidak keluar ke pihak luar.

Anda boleh keluar daripada dilema sedia ada yang memerlukan kompromi terhadap keselamatan untuk menggunakan AI berprestasi tinggi.

Khususnya dalam industri yang mempunyai tahap sensitiviti data yang tinggi seperti kewangan, perubatan dan perundangan, struktur ini menjadi pembeza yang menentukan.

Kebolehulangan struktur ini telah mula dibuktikan.

Dan prestasi setiap ejen yang dibina di atas struktur tersebut akhirnya akan membawa perubahan sebenar di lapangan.

"Kesimpulannya, kesempurnaan teknologi disempurnakan melalui 'keyakinan' di lapangan."

CLEVI bukan sekadar menyediakan AI berprestasi tinggi. Hakikat kami adalah membina 'infrastruktur berorientasikan pelaksanaan' yang meruntuhkan tembok keselamatan yang dihadapi perusahaan dan benar-benar mampu menyelesaikan tugas operasi yang kompleks.

Kini, beralihlah daripada peringkat mempertimbangkan pelaksanaan dan mulakan persekitaran kerja AI yang selamat serta berkuasa bersama CLEVI.

Sebagai rakan kongsi yang boleh dipercayai untuk mengamanahkan tugasan, kami akan bersama-sama mencipta inovasi sebenar dalam operasi perniagaan anda.

Kembali ke bilik berita
CLEVI

Bahasa dan wilayah

Bahasa yang diterjemahkan oleh mesin ditandakan. Ketersediaan mengikut pakej laman yang diterbitkan.

136 bahasa

Disyorkan

1

Asia Timur

7

Asia Tenggara

11

Asia Selatan

18

Asia Tengah

5

Timur Tengah dan Kaukasus

10

Eropah Barat dan Eropah Selatan

16

United Kingdom dan Ireland

4

Eropah Utara

10

Eropah Tengah dan Balkan

14

Eropah Timur

5

Afrika Timur

8

Afrika Barat dan Afrika Tengah

9

Selatan Afrika

8

Amerika

5

Oceania

5
Daya saing yang dibuktikan oleh data— ejen AI dari Korea mencapai 2.5% teratas dalam GAIA Benchmark — CLEVI