GAIA онооны утга — AI агентууд хэр хөгжсөн бэ
GAIA бенчмаркийг анх нийтлэх үед тухайн үеийн хамгийн өндөр түвшний загвар байсан GPT-4 хүртэл ойролцоогоор 30%-ийн оноо авахад л хүрсэн. Энэ нь GAIA нь энгийн асуулт-хариултаас давсан цогц дүгнэлт хийх, хэрэгсэл ашиглах, олон үе шаттай асуудал шийдвэрлэх чадвар шаарддагтай холбоотой бөгөөд тухайн үеийн AI “сэтгэж, хэрэгжүүлэх чадвар”-ын хувьд хараахан эхний шатандаа байсныг илэрхийлнэ.
Харин өнөөдөр тэргүүлэх агентууд 92.36%-д хүрчээ.
Энэ өөрчлөлт нь зүгээр нэг гүйцэтгэлийн сайжруулалт биш юм. Одоо AI асуултад хариулах түвшнээс давж, нөхцөл байдлыг тайлбарлан ойлгож, шаардлагатай хэрэгслийг сонгон, олон үе шатыг бие даан төлөвлөж хэрэгжүүлдэг ‘Agentic AI’ шатанд орсныг харуулсан үзүүлэлт юм.
Хэдхэн жилийн дотор AI “мэдлэг бүтээх хэрэгсэл”-ээс “ажлыг гүйцэтгэдэг хэрэгжүүлэгч субъект” болон хөгжлөө.
📌 Мөн тэргүүлэх 2.5%-ийн дотор CLEVI байна
Ийм дэлхийн өрсөлдөөний орчинд дотоодод бүтээсэн CLEVI-ийн агент GAIA-ийн тэргүүлэгчдийн самбарын шилдэг 2.5%-д багтсан нь технологийн бие даасан байдлыг нотолж, Солонгост бүтээгдсэн AI агент дэлхийн стандартад ч өрсөлдөх чадвартайг баталсан хэрэг юм. Энэ нь зүгээр нэг тоон үзүүлэлтээс давсан утгатай. Өөрөөр хэлбэл, тодорхой демо орчинд бус, дэлхий нийтэд нээлттэй бенчмаркаар олон мянган загвартай өрсөлдөн бодитоор баталгаажсан технологийн чадавх гэсэн үг.
Үүнээс илүү чухал нь энэхүү амжилт нэг загварын санамсаргүй үр дүн биш, ижил Agent Stack дээр суурилсан өөр өөр загварын агентууд дахин дахин тэргүүлэх түвшний гүйцэтгэл үзүүлсэн явдал юм.
Өөрөөр хэлбэл, CLEVI-ийн технологи нь “нэг удаа сайн гарсан үр дүн” бус, дахин үйлдвэрлэж болох бүтцийн өрсөлдөх чадвар бөгөөд төрөл бүрийн салбар, хувилбарт өргөжүүлэх боломжтой платформын түвшний чадавх юм.
Тэгвэл энэ үзүүлэлт ямар утгатай вэ?
Хэрэглэгчийн байр сууринаас AI нэвтрүүлэхэд тулгардаг хамгийн том саад бол "Үнэхээр итгэж даатгаж болох уу?" гэсэн асуулт юм.
Гял цал демо эсвэл өөрсдийн танилцуулгын материал биш, дэлхий даяар нээлттэй тэргүүлэгчдийн жагсаалт хэмээх гуравдагч талын талбарт олон удаа батлагдсан гүйцэтгэл нь энэ асуултын хамгийн бодитой хариулт юм. Тодруулбал, энэ нь гурван талаараа ач холбогдолтой.
Нэгдүгээрт, нэвтрүүлэлтийн эрсдэлийг бууруулах
Баталгаажаагүй AI-г дотоод ажилтай холбох нь байгууллагын хувьд ихээхэн дарамт болдог.
GAIA зэрэг нэр хүндтэй бенчмарк дахь амжилтыг технологийн үнэлгээний шатанд итгэлцлийн үндэслэл болгон шууд ашиглах боломжтой.
Хоёрдугаарт, нарийн төвөгтэй ажлын автоматжуулалтыг бодит болгох
Шилдэг 2.5%-д багтана гэдэг нь энгийн давтагддаг ажлаас давж, нөхцөл байдлыг ойлгон, олон үе шатыг өөрөө дүгнэж дуусгах түвшний оюун ухааныг илэрхийлнэ.
Өнөөг хүртэл "AI-д даатгахад хэцүү" гэж үзэж ирсэн ажлын салбарууд бодит автоматжуулалтын зорилт болж чадна.
Гуравдугаарт, өгөгдлийн аюулгүй байдал болон гүйцэтгэлийг зэрэг хангах
Өөрсдийн Agent Stack бүтэц нь өгөгдлийн урсгал гадагш гарахгүй гэсэн үг юм.
Өндөр гүйцэтгэлтэй AI ашиглахын тулд аюулгүй байдлыг золиослох шаардлагатай байсан өмнөх мухардлаас гарах боломжтой.
Ялангуяа санхүү, эрүүл мэнд, хууль зүй зэрэг өгөгдлийн мэдрэг чанар өндөртэй салбаруудад энэ бүтэц нь шийдвэрлэх ялгарах давуу тал болно.
Бүтцийн дахин хэрэгжих боломж аль хэдийн батлагдаж эхэлсэн.
Мөн тэр бүтэц дээр бий болох агент бүрийн амжилт нь удалгүй бодит ажлын талбарт бодит өөрчлөлт авчирна.
"Эцсийн дүндээ, технологийн боловсронгуй байдал нь ажлын талбар дахь 'итгэл'-ээр төгөлдөржинө."
CLEVI нь зөвхөн өндөр гүйцэтгэлтэй AI хангахаар хязгаарлагдахгүй. Байгууллагуудын тулгардаг аюулгүй байдлын саадыг арилгаж, нарийн төвөгтэй практик ажлыг бодитоор дуусгах боломжтой 'гүйцэтгэлд чиглэсэн дэд бүтэц'-ийг бий болгох нь бидний мөн чанар юм.
Одоо нэвтрүүлэх эсэхээ эргэцүүлж байсан үеэс гарч, CLEVI-тэй хамт аюулгүй, хүчирхэг AI ажлын орчныг эхлүүлээрэй.
Ажлаа итгэлтэйгээр даатгаж болох найдвартай түншийн хувьд та бүхний бизнесийн талбарт бодит шинэчлэлийг хамтдаа бүтээнэ.
