ແຫຼ່ງຂ່າວ: ນັກຂ່າວ Lee Won-ji ຈາກ Electronic Times
ອ້າງອີງບົດຄວາມເຕັມ “CLEVI, ໂມເດວລຂອງຕົນເອງທີ່ພັດທະນາ from scratch ໄດ້ຄະແນນ 79.07% ໃນ GAIA... ຕິດອັນດັບ 2.5% ສູງສຸດຈາກ 3,090 ໂມເດວ”
ວັນທີເຜີຍແຜ່: 2026-04-07
ລິ້ງ: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm ສະແຕັກໂມເດວລເອກະລັກ: ເອເຈນຕ໌ 5 ຕົວໄດ້ຄະແນນຫຼາຍກວ່າ 70 ຄະແນນທຸກຕົວ
ເມື່ອຄຳນຶງເຖິງການສູນເສຍຂໍ້ມູນ, ອັດຕາຄຳຕອບຖືກຕ້ອງສູງກວ່າ 98%, ເໜືອກວ່າມະນຸດ (92%)
ບໍລິສັດສະຕາດອັບ AI 'CLEVI' ໄດ້ໃຊ້ໂມເດວລຂອງຕົນເອງທີ່ພັດທະນາ from scratch ແລະບັນທຶກອັດຕາຄຳຕອບຖືກຕ້ອງ 79.07% ໃນ 'GAIA' ເຊິ່ງເປັນເບັນຊ໌ມາກຂອງເອເຈນຕ໌ AI ລະດັບໂລກ, ໂດຍຕິດຢູ່ໃນ 2.5% ອັນດັບສູງສຸດຈາກໂມເດວທີ່ລົງທະບຽນທັງໝົດ 3,090 ໂມເດວ.
ຕາມຄຳອະທິບາຍຈາກວົງການ, ໃນຕະຫຼາດເບັນຊ໌ມາກ AI, GAIA ໄດ້ຮັບການປະເມີນວ່າສະທ້ອນຄວາມສາມາດຂອງ 'ເອເຈນຕ໌ AI ທີ່ໃຊ້ງານໄດ້ຈິງ' ໄດ້ຢ່າງຄົບຖ້ວນ. ເບັນຊ໌ມາກນີ້ພັດທະນາຮ່ວມກັນໂດຍ Meta AI, HuggingFace ແລະມະຫາວິທະຍາໄລ Paris-Saclay ແລະເປີດເຜີຍຄັ້ງທຳອິດໃນເດືອນ 11 ປີ 2023.
ຈຸດສຳຄັນ 3 ປະການທີ່ເຮັດໃຫ້ GAIA ແຕກຕ່າງຈາກເບັນຊ໌ມາກອື່ນມີດັ່ງນີ້. ປະການທຳອິດ, ເນື່ອງຈາກຄຳຕອບທີ່ຖືກຕ້ອງບໍ່ຖືກເປີດເຜີຍ, ຈຶ່ງບໍ່ສາມາດ overfitting ໄດ້. ປະການທີສອງ, ເນື່ອງຈາກຕ້ອງການການໃຫ້ເຫດຜົນແບບປະສົມຫຼາຍຂັ້ນຕອນ·ຫຼາຍໂມດັລ, ຈຶ່ງບໍ່ສາມາດໄດ້ຄະແນນສູງດ້ວຍການຈັບຄູ່ແພັດເທີນຢ່າງງ່າຍດາຍ. ປະການທີສາມ, ໂມເດວລຫຼາຍກວ່າ 3,090 ໂມເດວຈາກທົ່ວໂລກແຂ່ງຂັນກັນພາຍໃຕ້ເງື່ອນໄຂດຽວກັນຜ່ານລີດເດີບອດຢ່າງເປັນທາງການຂອງ HuggingFace.
ຊຸດທົດສອບປະກອບດ້ວຍຄຳຖາມທັງໝົດ 301 ຂໍ້. Level 1 ແມ່ນການໃຊ້ເຄື່ອງມືດຽວແລະການໃຫ້ເຫດຜົນງ່າຍໆ, Level 2 ແມ່ນການປະສົມເຄື່ອງມືຫຼາຍຢ່າງແລະການໃຫ້ເຫດຜົນລະດັບປານກາງ, ແລະ Level 3 ແມ່ນຄຳຖາມລະດັບຍາກສູງສຸດທີ່ຕ້ອງການການວາງແຜນແລະດຳເນີນງານຂອງເອເຈນຕ໌ຕັ້ງແຕ່ 5 ຂັ້ນຕອນຂຶ້ນໄປ. ໃນເວລາປະກາດເບັນຊ໌ມາກ, ຄະແນນຢູ່ທີ່ປະມານ 15% ສຳລັບໂມເດວ GPT (ຕິດຕັ້ງປລັກອິນ), ແລະປັດຈຸບັນທີມຊັ້ນນຳໄດ້ຍົກຂຶ້ນມາຢູ່ລະດັບ 70~80%.
ໃນບັນດາຈຸດເຫຼົ່ານີ້, CLEVI ເນັ້ນວ່າສ່ວນທີ່ຄວນໃຫ້ຄວາມສົນໃຈທາງເຕັກນິກຫຼາຍທີ່ສຸດຂອງຜົນງານນີ້ແມ່ນ ບໍ່ໄດ້ໃຊ້ LLM API ພາຍນອກເຊັ່ນ GPT, Claude ຫຼື Gemini ເລີຍ. ຈຸດເດັ່ນຄື CLEVI ໄດ້ໃຊ້ໂມເດວ 2 ຮູບແບບທີ່ພັດທະນາເອງໂດຍໃຊ້ວິທີ from scratch.
cip-5.5-agent ແມ່ນໂມເດວ AI ແບບຕົວແທນ (agentic AI) ເຊິ່ງເຮັດໜ້າທີ່ເປັນສະໝອງຫຼັກຂອງກະບວນການຕົວແທນທີ່ວາງແຜນ (planning)·ດຳເນີນການ (execution)·ກວດສອບ (verification) ວຽກງານທີ່ຊັບຊ້ອນຢ່າງເອກະລາດ. cip-5.5-mm ແມ່ນໂມເດວມັນຕິໂມດັລທົ່ວໄປປະສິດທິພາບສູງ ທີ່ເຂົ້າໃຈແລະໃຫ້ເຫດຜົນກັບໄຟລ໌ຫຼາຍຮູບແບບ ເຊັ່ນ ສຽງ·ຮູບພາບ·ວິດີໂອ. ເນື່ອງຈາກຄຳຖາມ GAIA ຈຳນວນຫຼາຍມີຂໍ້ມູນປ້ອນທີ່ບໍ່ແມ່ນຂໍ້ຄວາມ ເຊັ່ນ PDF, ໄຟລ໌ຮູບພາບ ແລະໄຟລ໌ສຽງ, ຄວາມສາມາດດ້ານມັນຕິໂມດັລນີ້ຈຶ່ງກາຍເປັນປັດໃຈຫຼັກຂອງຄະແນນສູງ.
CLEVI ໄດ້ສົ່ງອົງປະກອບຕົວແທນ 5 ແບບທີ່ແຕກຕ່າງກັນເຂົ້າແຂ່ງຂັນໃນ GAIA ໂດຍອີງໃສ່ໂມເດວພາຍໃນຂອງຕົນເອງ 2 ໂມເດວນີ້ ແລະທັງໝົດບັນທຶກຄະແນນໄດ້ຫຼາຍກວ່າ 70 ຄະແນນ.
ຕາມຄຳອະທິບາຍຂອງບໍລິສັດ ການທົບທວນຫຼັງການປະເມີນພາຍໃນ CLEVI ໄດ້ພົບຜົນທີ່ໜ້າສົນໃຈ. ໃນຈຳນວນຄຳຖາມທັງໝົດ 301 ຂໍ້ ມີບາງຂໍ້ທີ່ຫຼັກຖານຄຳຕອບທີ່ຖືກຕ້ອງໄດ້ສູນຫາຍໄປຈາກເວັບສາທາລະນະໃນປັດຈຸບັນ. ນັ້ນແມ່ນກໍລະນີທີ່ຂໍ້ມູນຊຶ່ງໃນອະດີດເຄີຍກວດສອບໄດ້ທາງອອນລາຍຫຼືເຄື່ອງມືຄົ້ນຫາ ຖືກລຶບຫຼືປ່ຽນແປງ ແລະບໍ່ສາມາດເຂົ້າເຖິງໄດ້ອີກຕໍ່ໄປ. ເມື່ອປະເມີນຄືນພາຍໃຕ້ຂອບເຂດຂໍ້ມູນທີ່ມະນຸດສາມາດກວດສອບໄດ້ຢ່າງເປີດເຜີຍໃນປັດຈຸບັນ ອັດຕາຄວາມຖືກຕ້ອງຂອງ CLEVI ປາກົດວ່າສູງກວ່າ 98%. ຕົວເລກນີ້ສູງກວ່າຄ່າສະເລ່ຍຂອງມະນຸດທີ່ 92% ແລ້ວ.
ຜູ້ຕາງໜ້າຂອງ CLEVI ອະທິບາຍວ່າ: “CLEVI ບັນທຶກຄະແນນ 70+ ໄດ້ຄົບທັງ 5 ຕົວແທນ ແລະເຂົ້າສູ່ 2.5% ເທິງສຸດຂອງມາດຕະຖານວັດຜົນສາທາລະນະ ໂດຍບໍ່ປະສົມໂມເດວພາຍນອກ ແລະໃຊ້ພຽງໂມເດວຈາກ from scratch ຂອງຕົນເອງແລະໂຊລູຊັນຕົວແທນ AI ຂອງຕົນເອງ. ໃນອະນາຄົດ ຄາດວ່າຄະແນນທາງການຈະສາມາດປັບປຸງເພີ່ມໄດ້ອີກ ຜ່ານການພັດທະນາໂມເດວແລະໂຊລູຊັນຕົວແທນຂອງຕົນເອງ. ຜົນງານຄັ້ງນີ້ມີຄວາມໝາຍຢ່າງເລິກເຊິ່ງ ເພາະໄດ້ສະແດງ 'ຄວາມໄວ້ວາງໃຈທີ່ຜ່ານການຢືນຢັນ' ຈາກການວັດຜົນຈິງໃນມາດຕະຖານວັດຜົນສາກົນ, ເປັນຜົນງານຈາກໂມເດວຂອງຕົນເອງທີ່ພັດທະນາ from scratch ໂດຍຜູ້ພັດທະນາ AI ພາຍໃນປະເທດ, ເປັນຜົນຈາກກອງໂມເດວທີ່ເປັນເອກະລັກ ບໍ່ແມ່ນການປະສົມໂມເດວພາຍນອກ, ແລະເມື່ອຄຳນຶງເຖິງການສູນຫາຍຂອງຂໍ້ມູນໃນບາງຄຳຖາມ ຈຶ່ງມີຄຸນຄ່າຕໍ່ການຕີຄວາມຫຼາຍກວ່າຄະແນນ.”
