GAIA онооны утга — AI агентууд хэр зэрэг хөгжсөн бэ
GAIA бенчмаркийг анх нийтэд танилцуулах үед тухайн үеийн хамгийн өндөр түвшний загвар байсан GPT-4 хүртэл ойролцоогоор 30%-ийн оноо аваад зогссон. Энэ нь энгийн асуулт-хариултаас давсан нийлмэл дүгнэлт, хэрэгсэл ашиглалт, олон алхамт асуудал шийдвэрлэлтийг шаарддаг GAIA-ийн онцлогоос шалтгаалан тухайн үеийн AI “сэтгэж, хэрэгжүүлэх чадвар”-ын хувьд хараахан эхний шатандаа байсныг илэрхийлж байна.
Гэвч өнөөдөр тэргүүлэх агентууд 92.36%-д хүрчээ.
Энэхүү өөрчлөлт нь зөвхөн гүйцэтгэлийн сайжралт биш юм. Энэ нь AI асуултад хариулах түвшнээс давж, нөхцөл байдлыг тайлбарлан ойлгож, шаардлагатай хэрэгслийг сонгон, олон алхмыг өөрөө төлөвлөж хэрэгжүүлдэг ‘Agentic AI’ үе шатанд орсныг харуулсан үзүүлэлт юм.
Хэдхэн жилийн дотор AI “мэдлэг бүтээх хэрэгсэл”-ээс “ажлыг гүйцэтгэдэг хэрэгжүүлэгч субъект” болон хөгжлөө.
📌 Тэрхүү шилдэг 2.5%-д CLEVI мөн багтдаг
Ийм дэлхийн өрсөлдөөний орчинд дотоодод бүтээгдсэн CLEVI-ийн агент GAIA-ийн тэргүүлэгчдийн жагсаалтын шилдэг 2.5%-д бүртгэгдсэн нь технологийн бие даасан байдлыг баталж, Солонгост бүтээгдсэн AI агент дэлхийн стандартад ч өрсөлдөх чадвартайг нотолсон тохиолдол юм. Энэ нь энгийн нэг тоон үзүүлэлтээс хавьгүй их утгатай. Өөрөөр хэлбэл, тодорхой нэг демо орчинд бус, дэлхийн нийтэд нээлттэй бенчмарк дээр мянга мянган загвартай өрсөлдөж, технологийн чадамжаа бодитоор баталгаажуулсан гэсэн үг.
Илүү чухал нь энэхүү амжилт нь нэг загварын санамсаргүй үр дүн биш бөгөөд ижил Agent Stack дээр суурилсан өөр өөр загварын агентууд давтан шилдэг түвшний гүйцэтгэл үзүүлсэн явдал юм.
Өөрөөр хэлбэл, CLEVI-ийн технологи нь “нэг удаа сайн гарсан үр дүн” бус, дахин давтаж болох бүтцийн өрсөлдөх чадвар бөгөөд төрөл бүрийн салбар, хувилбарт өргөжүүлэх боломжтой платформын түвшний чадамж юм.
Тэгвэл энэ үзүүлэлт ямар утгатай вэ?
Хэрэглэгчийн хувьд AI нэвтрүүлэхэд тулгардаг хамгийн том саад бол "Үнэхээр итгэж даатгаж болох уу" гэсэн асуулт юм.
Гоёмсог демо эсвэл өөрсдийн танилцуулгын материал бус, дэлхийн нийтэд нээлттэй тэргүүлэгчдийн жагсаалт хэмээх гуравдагч талын талбарт олонтаа нотлогдсон гүйцэтгэл нь энэ асуултын хамгийн бодитой хариулт юм. Тодруулбал, энэ нь гурван талаараа ач холбогдолтой.
Нэгдүгээрт, нэвтрүүлэлтийн эрсдэлийг бууруулах
Баталгаажаагүй AI-г байгууллагын дотоод ажилтай холбох нь компанийн хувьд ихээхэн дарамт болдог.
GAIA зэрэг нэр хүндтэй жишиг үзүүлэлтүүдэд гаргасан үр дүнг технологийн үнэлгээний шатанд итгэлцлийн үндэслэл болгон шууд ашиглах боломжтой.
Хоёрдугаарт, нарийн төвөгтэй ажлын автоматжуулалтыг бодит болгох
Шилдэг 2.5%-д багтсан гэсэн үзүүлэлт нь энгийн давтагддаг ажлаас давж, нөхцөл байдлыг ойлгон, олон алхмыг бие даан дүгнэж гүйцээх түвшний оюун ухааныг илэрхийлнэ.
Өнөөг хүртэл "AI-д даатгахад хэцүү" гэж үзэж байсан ажлын салбарууд бодит автоматжуулалтын зорилт болж чадна.
Гуравдугаарт, өгөгдлийн аюулгүй байдал болон гүйцэтгэлийг зэрэг хангах
Өөрийн Agent Stack бүтэц нь өгөгдлийн урсгал гадагш гарахгүй гэсэн үг юм.
Өндөр гүйцэтгэлтэй AI ашиглахын тулд аюулгүй байдлыг золиослох шаардлагатай байсан өмнөх бэрхшээлээс ангижрах боломжтой.
Ялангуяа санхүү, эрүүл мэнд, хуулийн үйлчилгээ зэрэг өгөгдлийн мэдрэмж өндөртэй салбаруудад энэ бүтэц нь шийдвэрлэх ялгарах давуу тал болно.
Бүтцийн дахин хэрэгжих боломж аль хэдийн нотлогдож эхэлсэн.
Мөн тэр бүтэц дээр бий болох агент бүрийн гүйцэтгэл нь удалгүй ажлын талбарт бодит өөрчлөлт болон хэрэгжинэ.
"Эцсийн дүндээ технологийн боловсронгуй байдал нь ажлын талбар дахь 'итгэл үнэмшлээр' бүрэн төгөлдөр болдог."
CLEVI нь зөвхөн өндөр гүйцэтгэлтэй AI-гаар хангахаар хязгаарлагдахгүй. Компаниудад тулгардаг аюулгүй байдлын саадыг арилгаж, нарийн төвөгтэй практик ажлыг бодитоор дуусгах боломжтой 'гүйцэтгэлд чиглэсэн дэд бүтэц'-ийг бий болгох нь бидний мөн чанар юм.
Одоо нэвтрүүлэх эсэхээ эргэлзэж байсан үеэс гарч, CLEVI-тэй хамт аюулгүй, хүчирхэг AI ажлын орчныг эхлүүлээрэй.
Ажлаа итгэлтэйгээр даатгаж болох найдвартай түншийн хувьд бид танай бизнесийн талбарт бодит инновацийг хамтдаа бүтээнэ.
