სიახლეები

AI სტარტაპი CLEVI GAIA-ს ტოპ 2.5%-ში შევიდა… დადასტურებული სანდოობის დემონსტრირება

წყარო: Digital Times, ჟურნალისტი კუ ბონ-გიუ

წყარო: Digital Times, ჟურნალისტი კუ ბონ-გიუ

სტატიის სრული ციტატა: „AI სტარტაპი CLEVI GAIA-ს ტოპ 2.5%-ში შევიდა… დადასტურებული სანდოობის დემონსტრირება“

გამოქვეყნების თარიღი: 2026-04-08

ბმული: https://n.news.naver.com/article/029/0003020511?sid=105

ადგილობრივმა AI სტარტაპმა „CLEVI-მ (Clevi)“ განაცხადა, რომ from scratch შექმნა საკუთარი მოდელი და საკუთარი აგენტული გადაწყვეტა, და პირველად ქვეყანაში GAIA-ს ბენჩმარკში ყველა 3,090 რეგისტრირებულ მოდელს შორის ტოპ 2.5%-ში შევიდა.

ინდუსტრიის განმარტებით, GAIA, რომელიც Meta AI-მ დააპროექტა და Hugging Face ოპერირებს, AI-ს ეკითხება არა „ერთი საქმის კარგად შესრულების უნარს“, არამედ „რამდენიმე უნარის გაერთიანებით რეალური პრობლემების გადაჭრის უნარს“. მან უნდა მოიძიოს ინფორმაცია ვებში, წაიკითხოს ცხრილი PDF-ში, გააანალიზოს გამოსახულება, კოდის გაშვებით გამოთვალოს და მიღებული შედეგები გააერთიანოს ერთი სწორი პასუხის მისაღებად. 301 კონფიდენციალური კითხვა, სირთულის სამი დონე და სწორი პასუხების გაუმჟღავნებლობის პრინციპი ქმნის სტრუქტურას, სადაც არც ზედმეტი მორგება და არც ჩითინგი არის შესაძლებელი.

ამ გამოცდაზე მაღალი ქულის მისაღებად ორი რამ არის საჭირო. საბაზისო ენობრივი მოდელის მსჯელობის უნარი და აგენტული გადაწყვეტა, რომელიც ამ მოდელს რეალური სამყაროს ინსტრუმენტებთან აკავშირებს და ავტონომიურად მუშაობის საშუალებას აძლევს. რაც არ უნდა კარგი იყოს მოდელი, თუ აგენტი სუსტია, Level 3-ის ამოხსნა შეუძლებელია; ხოლო რაც არ უნდა დახვეწილი იყოს აგენტი, თუ მოდელის მსჯელობის უნარი არასაკმარისია, შუალედურ ეტაპზე არასწორი პასუხები გავრცელდება.

GAIA-ს ლიდერბორდის ამჟამინდელი სტრუქტურის დაკვირვებისას საინტერესო კანონზომიერება იკვეთება. მოწინავე აგენტების უმეტესობა იყენებს „მრავალმოდელური მიქსის“ სტრატეგიას, რომელიც აერთიანებს ისეთ Big Tech-ის მოდელებს, როგორებიცაა GPT, Claude და Gemini. ეს გონივრული მიდგომაა, რომელიც თითოეული მოდელის ძლიერ მხარეებს აერთიანებს და ინფორმაციის დაკარგვით გამოწვეული ქულების შემცირებისგან იცავს.

ამის საპირისპიროდ, CLEVI ამ რიგებს არ შეუერთდა. from scratch მეთოდით შემუშავებული cip-5.5-agent (აგენტური AI) ავტონომიურად ასრულებს რთული ამოცანების დაგეგმვას, შესრულებასა და შემოწმებას, ხოლო cip-5.5-mm (მაღალი წარმადობის ზოგადი მულტიმოდალური მოდელი) ესმის და მსჯელობს სხვადასხვა ფაილის ფორმატზე, მათ შორის აუდიოზე, გამოსახულებებსა და ვიდეოზე. ორივე ეს მოდელი დამოუკიდებლად შეიქმნა CLEVI-ს შიგნით და გარე LLM API-ები საერთოდ არ გამოუყენებიათ.

그리고 이 독자 모델 스택으로 GAIA에 5개 에이전트를 출전시켜, 전원 70점대+를 기록했다. 최고 79.07%부터 70.76%까지, 단일 결과의 행운이 아닌 스택 전체의 안정성이 입증된 것이다.

본문 이미지

업체 측 설명에 따르면 공식 점수 79.07% 뒤에는 또 다른 숫자가 있다. CLEVI 내부 사후 검토 결과, 301개 문항 중 현재 공개 웹에서 정답 근거가 소실된 문항이 상당수 확인됐다. 정답이 현재도 웹 상에 존재하는 문항만을 기준으로 재평가했을 때, CLEVI의 정답률은 98% 이상이었다. 이는 인간 평균(92%)을 이미 넘어선 수치다.

물론 타사의 강력한 범용 모델을 혼합했다면 공식 점수를 더 끌어올릴 수도 있었을 것이다. 그러나 CLEVI는 의도적으로 그 전략을 택하지 않았다. 이번 벤치마크의 목표는 최고 점수 경쟁이 아니라, from scratch 자체 모델이 글로벌 무대에서 경쟁 가능한 수준에 도달했는지를 검증하는 것이었기 때문이다.

GAIA 리더보드에 이름이 올라간다는 것은 제3자 독립 평가가 부여한 검증된 공신력을 갖췄다는 데 큰 의미가 있다. 이는 투자 유치, 해외 진출, B2B 영업 모든 국면에서 활용 가능한 객관적 근거가 된다.

CLEVI 관계자는 “공식 오답 63개 중 상당수는 출력 포맷 불일치, 시각 자료 해석 오류, 그리고 정보 소실로 인한 정답 불가 문항에서 비롯됐다. 논리적 추론의 근본적 한계보다는 후처리 정밀도와 외부 정보 가용성의 문제다. 자체 모델이기 때문에 CLEVI가 스스로 개선할 수 있다. 이것이 바로 from scratch 자체 모델의 구조적 이점이다. CLEVI의 이번 성과는 한국 AI 업계에 “우리는 언제까지 ‘빌린 두뇌’에 의존할 것인가?”라는 질문을 던진다. CLEVI는 from scratch라는 더 어려운 길을 택하고 세계 무대에서 그 답을 증명하고자 한다”고 전했다.

ნიუსრუმში დაბრუნება
CLEVI

ენა და რეგიონი

მანქანურად ნათარგმნი ენები მონიშნულია. ხელმისაწვდომობა გამოქვეყნებული საიტის პაკეტის შესაბამისად განისაზღვრება.

136 ენა

რეკომენდებული

1

აღმოსავლეთ აზია

7

სამხრეთ-აღმოსავლეთ აზია

11

სამხრეთ აზია

18

ცენტრალური აზია

5

ახლო აღმოსავლეთი და კავკასია

10

დასავლეთ ევროპა და სამხრეთ ევროპა

16

გაერთიანებული სამეფო და ირლანდია

4

ჩრდილოეთ ევროპა

10

ცენტრალური ევროპა და ბალკანეთი

14

აღმოსავლეთ ევროპა

5

აღმოსავლეთ აფრიკა

8

დასავლეთ აფრიკა და შუა აფრიკა

9

სამხრეთ აფრიკა

8

ამერიკები

5

ოკეანეთი

5
AI სტარტაპი CLEVI GAIA-ს ტოპ 2.5%-ში შევიდა… დადასტურებული სანდოობის დემონსტრირება — CLEVI