ព័ត៌មាន

ក្រុមហ៊ុនស្តាតអាប់ AI CLEVI ឈានចូលក្នុងចំណោម 2.5% ខ្ពស់បំផុតនៃ GAIA… បង្ហាញពីភាពគួរឱ្យជឿជាក់ដែលបានផ្ទៀងផ្ទាត់

ប្រភព៖ Digital Times អ្នកសារព័ត៌មាន គូ បុនហ្គ្យូ

ប្រភព៖ Digital Times អ្នកសារព័ត៌មាន គូ បុនហ្គ្យូ

ដកស្រង់អត្ថបទពេញ៖ “ក្រុមហ៊ុនស្តាតអាប់ AI CLEVI ឈានចូលក្នុងចំណោម 2.5% ខ្ពស់បំផុតនៃ GAIA… បង្ហាញពីភាពគួរឱ្យជឿជាក់ដែលបានផ្ទៀងផ្ទាត់”

កាលបរិច្ឆេទចេញផ្សាយ 2026-04-08

តំណភ្ជាប់៖ https://n.news.naver.com/article/029/0003020511?sid=105

ក្រុមហ៊ុនស្តាតអាប់ AI ក្នុងស្រុក ‘CLEVI (Clevi)’ បានប្រកាសថា ខណៈពេលដែលបានកសាងម៉ូដែលផ្ទាល់ខ្លួន និងដំណោះស្រាយភ្នាក់ងារផ្ទាល់ខ្លួនដែលបង្កើត from scratch វាបានឈានចូលក្នុងចំណោម 2.5% ខ្ពស់បំផុត ដោយផ្អែកលើម៉ូដែលដែលបានចុះបញ្ជីសរុបចំនួន 3,090 ក្នុងការធ្វើតេស្ត GAIA ជាលើកដំបូងក្នុងប្រទេសកូរ៉េខាងត្បូង។

យោងតាមការពន្យល់របស់ឧស្សាហកម្ម GAIA ដែលត្រូវបានរចនាដោយ Meta AI និងដំណើរការដោយ Hugging Face មិនសួរ AI អំពី ‘សមត្ថភាពធ្វើរឿងតែមួយបានល្អ’ ទេ ប៉ុន្តែសួរអំពី ‘សមត្ថភាពបញ្ចូលសមត្ថភាពជាច្រើន ដើម្បីដោះស្រាយបញ្ហាជាក់ស្តែង’។ វាត្រូវស្វែងរកព័ត៌មាននៅលើបណ្តាញ អានតារាងក្នុង PDF វិភាគរូបភាព ដំណើរការកូដដើម្បីគណនា ហើយបញ្ចូលលទ្ធផលទាំងនោះ ដើម្បីផ្តល់ចម្លើយត្រឹមត្រូវតែមួយ។ ដោយផ្អែកលើសំណួរឯកជនចំនួន 301 កម្រិតលំបាកបី និងគោលការណ៍មិនបង្ហាញចម្លើយត្រឹមត្រូវ វាមានរចនាសម្ព័ន្ធដែលមិនអាចធ្វើ overfitting ឬ cheating បានទេ។

ដើម្បីទទួលបានពិន្ទុខ្ពស់ក្នុងការធ្វើតេស្តនេះ ត្រូវការរឿងពីរ។ ទីមួយ គឺសមត្ថភាព reasoning របស់ language model ដែលជាមូលដ្ឋាន ហើយទីពីរ គឺដំណោះស្រាយភ្នាក់ងារដែលភ្ជាប់ម៉ូដែលនោះទៅនឹងឧបករណ៍ក្នុងពិភពជាក់ស្តែង ដើម្បីឱ្យវាអាចអនុវត្តការងារដោយស្វ័យប្រវត្តិ។ ទោះម៉ូដែលល្អប៉ុណ្ណាក៏ដោយ ប្រសិនបើភ្នាក់ងារខ្សោយ វាមិនអាចដោះស្រាយ Level 3 បានទេ ហើយទោះភ្នាក់ងារមានភាពល្អិតល្អន់ប៉ុណ្ណាក៏ដោយ ប្រសិនបើសមត្ថភាព reasoning របស់ម៉ូដែលមិនគ្រប់គ្រាន់ ចម្លើយខុសនឹងត្រូវបានបន្តចម្លងនៅដំណាក់កាលកណ្តាល។

នៅពេលមើលរចនាសម្ព័ន្ធបច្ចុប្បន្នរបស់តារាងចំណាត់ថ្នាក់ GAIA គេអាចឃើញលំនាំគួរឱ្យចាប់អារម្មណ៍មួយ។ ភ្នាក់ងារភាគច្រើននៅលំដាប់កំពូលប្រើយុទ្ធសាស្ត្រ ‘ការលាយម៉ូដែលច្រើន’ ដែលបញ្ចូលម៉ូដែលបច្ចេកវិទ្យាធំៗជាច្រើន ដូចជា GPT, Claude និង Gemini។ នេះជាវិធីសាស្ត្រសមហេតុផលដែលរួមបញ្ចូលចំណុចខ្លាំងរបស់ម៉ូដែលនីមួយៗ និងការពារការថយចុះពិន្ទុដែលបណ្តាលមកពីការបាត់បង់ព័ត៌មានជាដើម។

ផ្ទុយទៅវិញ CLEVI មិនបានចូលរួមក្នុងជួរនោះទេ។ cip-5.5-agent (AI បែប agentic) ដែលត្រូវបានអភិវឌ្ឍតាមវិធី from scratch អនុវត្តការរៀបចំផែនការ ប្រតិបត្តិ និងផ្ទៀងផ្ទាត់ការងារស្មុគស្មាញដោយស្វ័យប្រវត្តិ ខណៈ cip-5.5-mm (ម៉ូដែលពហុមធ្យមទូទៅដែលមានសមត្ថភាពខ្ពស់) យល់ដឹង និងធ្វើ reasoning លើទម្រង់ឯកសារផ្សេងៗ ដូចជា សំឡេង រូបភាព និងវីដេអូ។ ម៉ូដែលទាំងពីរនេះត្រូវបានអភិវឌ្ឍដោយឯករាជ្យនៅក្នុង CLEVI ហើយមិនបានប្រើប្រាស់ external LLM API ឡើយ។

ហើយដោយប្រើស្ទាក់ម៉ូដែលកម្មសិទ្ធិនេះ បានបញ្ជូនភ្នាក់ងារ 5 ទៅចូលរួមក្នុង GAIA ដោយទាំងអស់ទទួលបានពិន្ទុលើស 70។ ចាប់ពីពិន្ទុខ្ពស់បំផុត 79.07% ដល់ 70.76% នេះបង្ហាញថា មិនមែនជាសំណាងនៃលទ្ធផលតែមួយទេ ប៉ុន្តែជាស្ថិរភាពនៃស្ទាក់ម៉ូដែលទាំងមូល។

រូបភាពក្នុងអត្ថបទ

យោងតាមការពន្យល់របស់ក្រុមហ៊ុន នៅពីក្រោយពិន្ទុផ្លូវការ 79.07% មានលេខមួយទៀត។ តាមការត្រួតពិនិត្យក្រោយការវាយតម្លៃនៅខាងក្នុង CLEVI បានរកឃើញថា ក្នុងចំណោមសំណួរ 301 មានសំណួរជាច្រើនដែលភស្តុតាងនៃចម្លើយត្រឹមត្រូវបានបាត់ពីគេហទំព័រសាធារណៈបច្ចុប្បន្ន។ នៅពេលវាយតម្លៃឡើងវិញដោយផ្អែកតែលើសំណួរដែលចម្លើយត្រឹមត្រូវនៅតែមាននៅលើគេហទំព័រ អត្រាចម្លើយត្រឹមត្រូវរបស់ CLEVI មានលើស 98%។ តួលេខនេះបានលើសមធ្យមភាគមនុស្ស (92%) រួចទៅហើយ។

ជាការពិត ប្រសិនបើបានបញ្ចូលម៉ូដែលទូទៅដ៏មានសមត្ថភាពរបស់ក្រុមហ៊ុនផ្សេងៗ ពិន្ទុផ្លូវការអាចត្រូវបានលើកឡើងបន្ថែមទៀត។ ទោះជាយ៉ាងណា CLEVI បានជ្រើសរើសដោយចេតនាមិនប្រើយុទ្ធសាស្ត្រនោះ។ នោះគឺដោយសារគោលដៅនៃការវាយតម្លៃស្តង់ដារលើកនេះ មិនមែនជាការប្រកួតប្រជែងដើម្បីបានពិន្ទុខ្ពស់បំផុតទេ ប៉ុន្តែដើម្បីផ្ទៀងផ្ទាត់ថា ម៉ូដែលកម្មសិទ្ធិពី from scratch អាចឈានដល់កម្រិតដែលអាចប្រកួតប្រជែងបានលើឆាកពិភពលោកឬអត់។

ការដែលឈ្មោះត្រូវបានបង្ហាញនៅលើតារាងចំណាត់ថ្នាក់ GAIA មានន័យសំខាន់ថា វាទទួលបានភាពជឿទុកចិត្តដែលត្រូវបានផ្ទៀងផ្ទាត់ដោយការវាយតម្លៃឯករាជ្យពីភាគីទីបី។ នេះជាភស្តុតាង客观ដែលអាចប្រើបានក្នុងគ្រប់ដំណាក់កាល រួមមានការទាក់ទាញវិនិយោគ ការពង្រីកទៅក្រៅប្រទេស និងការលក់ B2B។

អ្នកតំណាង CLEVI បានមានប្រសាសន៍ថា “ក្នុងចំណោមចម្លើយខុសផ្លូវការ 63 មានចំនួនច្រើនកើតចេញពីភាពមិនស៊ីគ្នានៃទម្រង់លទ្ធផល កំហុសក្នុងការបកស្រាយសម្ភារៈដែលមើលឃើញ និងសំណួរដែលមិនអាចឆ្លើយបានដោយសារការបាត់បង់ព័ត៌មាន។ វាជាបញ្ហានៃភាពជាក់លាក់ក្នុងការដំណើរការក្រោយ និងលទ្ធភាពប្រើប្រាស់ព័ត៌មានខាងក្រៅ ជាជាងកម្រិតកំណត់មូលដ្ឋាននៃការវែកញែកដោយតក្កវិជ្ជា។ ដោយសារវាជាម៉ូដែលកម្មសិទ្ធិ CLEVI អាចកែលម្អខ្លួនឯងបាន។ នេះហើយជាអត្ថប្រយោជន៍រចនាសម្ព័ន្ធរបស់ម៉ូដែលកម្មសិទ្ធិពី from scratch។ សមិទ្ធផលរបស់ CLEVI លើកនេះបានចោទជាសំណួរដល់ឧស្សាហកម្ម AI កូរ៉េថា “តើយើងនឹងពឹងផ្អែកលើ ‘ខួរក្បាលដែលខ្ចី’ រហូតដល់ពេលណា?” CLEVI បានជ្រើសរើសផ្លូវដ៏លំបាកជាងនេះ គឺ from scratch ហើយមានបំណងបង្ហាញចម្លើយនោះឱ្យឃើញនៅលើឆាកពិភពលោក”។

ត្រឡប់ទៅបន្ទប់ព័ត៌មាន
CLEVI

ភាសា និងតំបន់

ភាសាដែលបកប្រែដោយម៉ាស៊ីនត្រូវបានសម្គាល់។ ភាពអាចប្រើបានអាស្រ័យលើកញ្ចប់គេហទំព័រដែលបានបោះពុម្ពផ្សាយ។

ភាសា 136

បានណែនាំ

1

អាស៊ី​ខាង​កើត

7

អាស៊ីអាគ្នេយ៍

11

អាស៊ី​ខាង​ត្បូង

18

អាស៊ី​កណ្ដាល

5

មជ្ឈិមបូព៌ា និងកូកាស៊ុស

10

អឺរ៉ុប​ខាង​លិច និង​អឺរ៉ុប​ខាង​ត្បូង

16

ចក្រភព​អង់គ្លេស និង​អៀរឡង់

4

អឺរ៉ុប​ខាង​ជើង

10

អឺរ៉ុបកណ្ដាល និងបាល់កង់

14

អឺរ៉ុប​ខាង​កើត

5

អាហ្វ្រិកខាងកើត

8

អាហ្វ្រិក​ខាង​លិច និង​អាហ្វ្រិក​កណ្តាល

9

អាហ្វ្រិកភាគខាងត្បូង

8

អាមេរិក

5

អូសេអានី

5
ក្រុមហ៊ុនស្តាតអាប់ AI CLEVI ឈានចូលក្នុងចំណោម 2.5% ខ្ពស់បំផុតនៃ GAIA… បង្ហាញពីភាពគួរឱ្យជឿជាក់ដែលបានផ្ទៀងផ្ទាត់ — CLEVI