የGAIA ውጤት ትርጉም — የAI ኤጀንቶች ምን ያህል እድገት አሳይተዋል
GAIA ቤንችማርክ ለመጀመሪያ ጊዜ በይፋ ሲተዋወቅ፣ በወቅቱ ከፍተኛ ደረጃ ላይ የነበረው GPT-4 እንኳን ወደ 30% ገደማ የሚሆን ውጤት ብቻ አስመዝግቧል። ይህም ከቀላል ጥያቄና መልስ በላይ የተወሳሰበ ምክንያታዊ አስተሳሰብ፣ መሳሪያዎችን መጠቀም እና ባለብዙ ደረጃ ችግር መፍታትን የሚጠይቀው የGAIA ባህሪ ስለሆነ፣ በወቅቱ AI በ“ማሰብና በመፈጸም ችሎታ” ላይ አሁንም በመጀመሪያ ደረጃ ላይ እንደነበር ያሳያል።
ነገር ግን አሁን ከፍተኛ ደረጃ ላይ ያሉ ኤጀንቶች 92.36% ደርሰዋል።
ይህ ለውጥ ቀላል የአፈጻጸም መሻሻል ብቻ አይደለም። አሁን AI ለጥያቄዎች መልስ ከመስጠት ባለፈ፣ ሁኔታዎችን መተርጎም፣ አስፈላጊ መሳሪያዎችን መምረጥ፣ ብዙ ደረጃዎችን በራሱ ማቀድና መፈጸም ወደሚችልበት ‘Agentic AI’ ደረጃ መግባቱን የሚያሳይ መለኪያ ነው።
በጥቂት ዓመታት ውስጥ AI ከ“የእውቀት መፍጠሪያ መሳሪያ” ወደ “ሥራን የሚፈጽም አካል” ተለውጧል።
📌 እና ክሌቪ በዚያ ከፍተኛ 2.5% ውስጥ ይገኛል
በዚህ ዓለም አቀፍ የውድድር አካባቢ፣ በኮሪያ የተሰራው የክሌቪ ኤጀንት በGAIA የመሪዎች ሰሌዳ ከፍተኛ 2.5% ውስጥ መመዝገቡ የቴክኖሎጂ ራስን መቻልን አረጋግጧል፤ እንዲሁም በኮሪያ የተፈጠረ የAI ኤጀንት በዓለም አቀፍ መስፈርቶችም እንደሚወዳደር ያሳየ ምሳሌ ነው። ይህ ከቀላል ቁጥር በላይ ትርጉም አለው። ይህም ማለት ከሺዎች ከሚቆጠሩ ሞዴሎች ጋር በመወዳደር፣ በአንድ የተወሰነ የማሳያ አካባቢ ሳይሆን በዓለም አቀፍ ክፍት ቤንችማርክ ላይ በተጨባጭ የተረጋገጠ የቴክኖሎጂ ብቃት ነው።
ከዚህ የበለጠ አስፈላጊው ነገር፣ ይህ ውጤት የአንድ ሞዴል የአጋጣሚ ውጤት ሳይሆን፣ በአንድ የAgent Stack ላይ የተመሰረቱ የተለያዩ ዲዛይኖች ያላቸው ኤጀንቶች ደጋግመው ከፍተኛ ደረጃ አፈጻጸም ማምጣታቸው ነው።
በሌላ አነጋገር፣ የክሌቪ ቴክኖሎጂ “አንድ ጊዜ ብቻ ጥሩ ውጤት ያስገኘ” ሳይሆን ሊደገም የሚችል መዋቅራዊ ተወዳዳሪነት ነው፤ እንዲሁም ወደ ተለያዩ ኢንዱስትሪዎችና ሁኔታዎች ሊሰፋ የሚችል የመድረክ ደረጃ ብቃት ነው።
ታዲያ ይህ መለኪያ ምን ማለት ነው?
ከተጠቃሚው አንጻር፣ AIን ለመጠቀም ትልቁ እንቅፋት “በእውነት ማመንና ኃላፊነት መስጠት ይቻላል?” የሚለው ጥያቄ ነው።
ይህ በሚያምር ዴሞ ወይም በኩባንያው የራሱ የማቅረቢያ ሰነዶች ሳይሆን፣ በዓለም አቀፍ ይፋዊ የመሪዎች ደረጃ ሰንጠረዥ ላይ በተደጋጋሚ በተረጋገጠ አፈጻጸም የተሰጠ ለዚያ ጥያቄ በጣም ተጨባጭ መልስ ነው። በተለይም፣ በሦስት አቅጣጫዎች ጠቀሜታ አለው።
አንደኛ፣ የመተግበር አደጋን መቀነስ
ያልተረጋገጠ AIን ከውስጣዊ የሥራ ሂደቶች ጋር ማገናኘት ለድርጅቶች ከፍተኛ ሸክም ነው።
እንደ GAIA ባሉ ታማኝ የማጣቀሻ ፈተናዎች የሚገኘው ውጤት በቴክኖሎጂ ግምገማ ደረጃ እንደ የመተማመኛ መሠረት በቀጥታ ሊያገለግል ይችላል።
ሁለተኛ፣ ውስብስብ የሥራ ሂደቶችን በራስ-ሰር ማከናወንን እውን ማድረግ
ከፍተኛው 2.5% ውስጥ መገኘት የሚለው አኃዝ ከቀላል ተደጋጋሚ ሥራዎች በላይ፣ አውድን ተረድቶ በርካታ ደረጃዎችን በራሱ በመገምገም ማጠናቀቅ የሚችል የማሰብ ደረጃን ያመለክታል።
እስከ አሁን ድረስ "ለAI አደራ መስጠት አስቸጋሪ ነው" ተብሎ የሚታሰቡ የሥራ መስኮች ተጨባጭ የራስ-ሰር ሂደት ዒላማዎች ሊሆኑ ይችላሉ።
ሦስተኛ፣ የውሂብ ደህንነትንና አፈጻጸምን በአንድ ጊዜ ማረጋገጥ
የራስ-ተኮር Agent Stack አወቃቀር የውሂብ ፍሰት ወደ ውጭ እንደማይወጣ ያመለክታል።
ከፍተኛ አፈጻጸም ያለው AI ለመጠቀም ደህንነትን መስዋዕት ማድረግ ከነበረበት የቀድሞ አስቸጋሪ ምርጫ መላቀቅ ይቻላል።
በተለይም እንደ ፋይናንስ፣ ጤና አጠባበቅ እና የሕግ አገልግሎት ባሉ የውሂብ ሚስጥራዊነት ከፍተኛ በሆነባቸው ኢንዱስትሪዎች፣ ይህ አወቃቀር ወሳኝ ልዩነት ይሆናል።
የአወቃቀሩ እንደገና ሊተገበር መቻሉ አስቀድሞ መረጋገጥ ጀምሯል።
እናም በዚያ አወቃቀር ላይ የሚገነባው የእያንዳንዱ ኤጀንት አፈጻጸም በቅርቡ በመስክ ላይ ወደ ተጨባጭ ለውጥ ይመራል።
"በመጨረሻም፣ የቴክኖሎጂ ፍጹምነት በመስክ ላይ በሚገኘው ‘እምነት’ ይጠናቀቃል።"
ክሌቪ ከፍተኛ አፈጻጸም ያለው AI ብቻ ከማቅረብ አይቆምም። ድርጅቶች የሚጋፈጡትን የደህንነት እንቅፋት ማስወገድ እና ውስብስብ የሙያ ሥራዎችን በተጨባጭ ማጠናቀቅ የሚያስችል ‘ተግባራዊ መሠረተ ልማት’ መገንባት የእኛ ማንነት ነው።
አሁን ስለመተግበር ከማሰብ ደረጃ በመውጣት፣ ከክሌቪ ጋር አስተማማኝና ኃይለኛ የAI የሥራ አካባቢን ይጀምሩ።
ሥራዎን በእምነት አደራ ሊሰጡት እንደሚችሉ ጠንካራ አጋር፣ በንግድዎ መስክ ተጨባጭ ፈጠራን አብረን እንፈጥራለን።
