სიახლეები

CLEVI-მ, from scratch საკუთარი მოდელით, GAIA-ზე 79.07%... 3,090 მოდელს შორის ტოპ-2.5%

წყარო: ელექტრონული გაზეთი, რეპორტიორი ლი ვონ-ჯი

წყარო: ელექტრონული გაზეთი, რეპორტიორი ლი ვონ-ჯი

სტატიის „CLEVI-მ, from scratch საკუთარი მოდელით, GAIA-ზე 79.07%... 3,090 მოდელს შორის ტოპ-2.5%“ სრული ტექსტის ციტირება

გამოქვეყნების თარიღი: 2026-04-07

ბმული: https://www.etnews.com/20260407000203

cip-5.5-agent·cip-5.5-mm独自 მოდელების სტეკი — 5 აგენტი, ყველა 70-ზე მეტ ქულას იღებს

ინფორმაციის დაკარგვის გათვალისწინებით, 98%+-იანი სიზუსტე, ადამიანებზე (92%) მაღალი

ძირითადი ტექსტის სურათი

AI სტარტაპმა „CLEVI“-მ from scratch საკუთარი მოდელის გამოყენებით გლობალური AI აგენტების ბენჩმარკში „GAIA“ 79.07%-იანი სიზუსტე დააფიქსირა და 3,090 რეგისტრირებულ მოდელს შორის ტოპ-2.5%-ში დამკვიდრდა.

ინდუსტრიის განმარტებით, AI ბენჩმარკების ბაზარზე GAIA შეფასებულია როგორც ბენჩმარკი, რომელიც „პრაქტიკული AI აგენტების“ შესაძლებლობებს ერთგულად ასახავს. Meta AI-ის, HuggingFace-ისა და პარიზ-საკლეს უნივერსიტეტის ერთობლივად შემუშავებული ეს ბენჩმარკი პირველად 2023 წლის ნოემბერში გამოქვეყნდა.

GAIA-ს სხვა ბენჩმარკებისგან განმასხვავებელი სამი ძირითადი მახასიათებელი აქვს. პირველი: რადგან სწორი პასუხები გასაიდუმლოებულია, გადამეტებული მორგება შეუძლებელია. მეორე: რადგან ის მოითხოვს მრავალსაფეხურიან, მულტიმოდალურ კომპლექსურ მსჯელობას, მხოლოდ შაბლონების დამთხვევით მაღალი ქულის მიღება შეუძლებელია. მესამე: HuggingFace-ის ოფიციალური ლიდერბორდის მეშვეობით მსოფლიოს 3,090-ზე მეტი მოდელი იდენტურ პირობებში კონკურირებს.

ტესტის ნაკრები სულ 301 კითხვისგან შედგება. Level 1 მოიცავს ერთი ინსტრუმენტის გამოყენებასა და მარტივ მსჯელობას, Level 2 — მრავალი ინსტრუმენტის კომბინაციასა და საშუალო დონის მსჯელობას, ხოლო Level 3-ში მოცემულია უმაღლესი სირთულის კითხვები, რომლებიც 5 ან მეტი საფეხურის მქონე აგენტის დაგეგმვასა და შესრულებას მოითხოვს. ბენჩმარკის გამოქვეყნების დროს GPT მოდელებმა (პლაგინით აღჭურვილმა) დაახლოებით 15% აჩვენეს, ხოლო ამჟამად მოწინავე გუნდებმა ეს მაჩვენებელი 70–80%-მდე გაზარდეს.

ამასთან დაკავშირებით, CLEVI-მ ხაზი გაუსვა, რომ ამ მიღწევაში ტექნიკურად ყველაზე საყურადღებო ის არის, რომ GPT-ის, Claude-ის, Gemini-ისა და სხვა გარე LLM API-ები საერთოდ არ გამოუყენებია. CLEVI-ის თავისებურება ისაა, რომ მან from scratch მეთოდით დამოუკიდებლად შემუშავებული ორი მოდელი გამოიყენა.

cip-5.5-agent არის აგენტური AI მოდელი, რომელიც რთული ამოცანების ავტონომიურად დაგეგმვისა(planning), შესრულებისა(execution) და გადამოწმებისგან(verification) შემდგარი აგენტული პაიპლაინის ძირითადი ტვინის როლს ასრულებს. cip-5.5-mm არის მაღალი წარმადობის, ზოგადი დანიშნულების მულტიმოდალური მოდელი, რომელსაც ესმის და შეუძლია მსჯელობა სხვადასხვა ფაილის ფორმატზე, მათ შორის ხმაზე, სურათებსა და ვიდეოზე. ვინაიდან GAIA-ს კითხვების მნიშვნელოვანი ნაწილი შეიცავს არატექსტურ შეყვანებს, მაგალითად PDF-ს, სურათებსა და აუდიოფაილებს, ეს მულტიმოდალური შესაძლებლობა მაღალი ქულის მიღწევის მთავარი ფაქტორი გახდა.

CLEVI-მ ამ ორ საკუთარ მოდელზე დაყრდნობით GAIA-ში 5 განსხვავებული აგენტული კონფიგურაცია წარადგინა და ყველამ 70-ზე მეტი ქულა დააგროვა.

კომპანიის განმარტებით, CLEVI-ის შიდა შემდგომი მიმოხილვისას საინტერესო შედეგი გამოვლინდა. სულ 301 კითხვიდან ზოგიერთზე სწორი პასუხის დამადასტურებელი საფუძველი ამჟამად საჯარო ვებში დაკარგულია. ეს ის შემთხვევებია, როდესაც ადრე ონლაინ ან საძიებო სისტემებში ხელმისაწვდომი ინფორმაცია წაიშალა ან შეიცვალა და მასზე წვდომა აღარ არის შესაძლებელი. იმ ინფორმაციის ფარგლებში ხელახალი შეფასებისას, რომლის საჯაროდ გადამოწმებაც ამჟამად ადამიანს შეუძლია, CLEVI-ის სიზუსტემ 98%-ს გადააჭარბა. ეს მაჩვენებელი უკვე აღემატება ადამიანის საშუალო შედეგს — 92%-ს.

CLEVI-ის წარმომადგენელმა განმარტა: „CLEVI-მ გარე მოდელების შერევის გარეშე, მხოლოდ from scratch საკუთარ მოდელებსა და საკუთარ AI აგენტულ გადაწყვეტილებებზე დაყრდნობით, 5-ვე აგენტით 70+ ქულა დააგროვა და საჯარო ბენჩმარკში საუკეთესო 2.5%-ში შევიდა. მოსალოდნელია, რომ მომავალში საკუთარი მოდელებისა და აგენტული გადაწყვეტილებების გაუმჯობესებით ოფიციალური ქულის დამატებითი ზრდაც იქნება შესაძლებელი. ეს შედეგი განსაკუთრებით მნიშვნელოვანია, რადგან გლობალურ საჯარო ბენჩმარკში პრაქტიკულად დადასტურდა და „შემოწმებულ სანდოობას“ აჩვენებს; იგი ადგილობრივი AI დეველოპერის from scratch საკუთარ მოდელზე დაფუძნებული შედეგია; მიღებულია არა გარე მოდელების შერევით, არამედ დამოუკიდებელი მოდელების სტეკის საფუძველზე; ამასთან, ზოგიერთი კითხვის შესახებ ინფორმაციის დაკარგვის გათვალისწინებით, მას ქულაზე მეტი ინტერპრეტაციული ღირებულება აქვს.“

ნიუსრუმში დაბრუნება
CLEVI

ენა და რეგიონი

მანქანურად ნათარგმნი ენები მონიშნულია. ხელმისაწვდომობა გამოქვეყნებული საიტის პაკეტის შესაბამისად განისაზღვრება.

136 ენა

რეკომენდებული

1

აღმოსავლეთ აზია

7

სამხრეთ-აღმოსავლეთ აზია

11

სამხრეთ აზია

18

ცენტრალური აზია

5

ახლო აღმოსავლეთი და კავკასია

10

დასავლეთ ევროპა და სამხრეთ ევროპა

16

გაერთიანებული სამეფო და ირლანდია

4

ჩრდილოეთ ევროპა

10

ცენტრალური ევროპა და ბალკანეთი

14

აღმოსავლეთ ევროპა

5

აღმოსავლეთ აფრიკა

8

დასავლეთ აფრიკა და შუა აფრიკა

9

სამხრეთ აფრიკა

8

ამერიკები

5

ოკეანეთი

5
CLEVI-მ, from scratch საკუთარი მოდელით, GAIA-ზე 79.07%... 3,090 მოდელს შორის ტოპ-2.5% — CLEVI