Bron: Digitale Tye, verslaggewer Gu Bon-gyu
Volledige aanhaling uit die artikel “KI-beginonderneming Clevi tree tot die boonste 2,5% van GAIA binne… Toon bewese geloofwaardigheid”
Publikasiedatum 2026-04-08
Skakel: https://n.news.naver.com/article/029/0003020511?sid=105
Die plaaslike KI-beginonderneming ‘Clevi’ het aangekondig dat dit, te midde van die bou van sy eie model en eie agentoplossing wat from scratch ontwikkel is, vir die eerste keer in Korea tot die boonste 2,5% behoort volgens die 3 090 geregistreerde modelle in totaal op die GAIA-maatstaf.
Volgens verduidelikings uit die bedryf vra GAIA, wat deur Meta AI ontwerp en deur Hugging Face bedryf word, nie van KI die vermoë om ‘net een ding goed te doen’ nie, maar eerder die vermoë om ‘verskeie vermoëns te kombineer om werklike probleme op te los’. Dit moet inligting op die web vind, tabelle in PDF’s lees, beelde ontleed, berekeninge uitvoer deur kode te laat loop, en die resultate kombineer om een korrekte antwoord te lewer. Met 301 privaat vrae, drie moeilikheidsvlakke en ’n beginsel waarvolgens die antwoorde nie bekend gemaak word nie, is dit ’n struktuur waarin nóg oorpassing nóg kullery moontlik is.
Om ’n hoë telling in dié toets te behaal, is twee dinge nodig. Eerstens die redenasievermoë van die onderliggende taalmodel, en tweedens ’n agentoplossing wat die model met werklikewêreldgereedskap verbind sodat dit take outonoom kan uitvoer. Hoe goed die model ook al is, as die agent swak is, kan Level 3 nie opgelos word nie; en hoe gesofistikeerd die agent ook al is, as die model se redenasievermoë tekortskiet, word verkeerde antwoorde in die intermediêre stadium voortgeplant.
Wanneer die huidige struktuur van die GAIA-leierbord ondersoek word, kom ’n interessante patroon na vore. Die meeste agente in die boonste geledere volg ’n ‘multimodelmengsel’-strategie waarin verskeie groottegnologiemodelle soos GPT, Claude en Gemini gekombineer word. Dit is ’n redelike benadering om die sterk punte van elke model te kombineer en punteverlies weens onder meer inligtingsverlies te voorkom.
Clevi het egter nie by dié groep aangesluit nie. Die from scratch-ontwikkelde cip-5.5-agent (agentiese KI) beplan, voer uit en verifieer komplekse take outonoom, terwyl cip-5.5-mm (’n hoëprestasie-algemene multimodale model) verskeie lêerformate, waaronder klank, beelde en video, verstaan en daaroor redeneer. Albei hierdie modelle is onafhanklik binne Clevi ontwikkel, en geen eksterne LLM-API’s is enigsins gebruik nie.
En deur vyf agente met hierdie eie modelstapel aan GAIA deel te neem, het almal tellings in die 70's of hoër behaal. Van die hoogste telling van 79,07% tot 70,76% is die stabiliteit van die hele stapel, nie die geluk van 'n enkele resultaat nie, bewys.
Volgens die maatskappy se verduideliking lê daar nog 'n ander syfer agter die amptelike telling van 79,07%. Volgens Clevi se interne nagesienevaluering is daar vasgestel dat 'n aansienlike aantal van die 301 vrae tans nie meer antwoorde met bewyse op die openbare web het nie. Wanneer die resultate herwaardeer word op grond van slegs die vrae waarvan die korrekte antwoorde steeds op die web bestaan, was Clevi se akkuraatheid meer as 98%. Dit is reeds hoër as die menslike gemiddelde (92%).
Natuurlik sou die amptelike telling verder verhoog kon word as kragtige algemene modelle van ander maatskappye gemeng is. Clevi het egter doelbewus nie daardie strategie gekies nie. Dit was omdat die doel van hierdie maatstaf nie 'n kompetisie om die hoogste telling was nie, maar om te verifieer of 'n from scratch-eie model 'n vlak bereik het waarop dit op die wêreldverhoog kon meeding.
Die betekenis daarvan dat 'n naam op die GAIA-leierbord verskyn, lê grootliks daarin dat dit geverifieerde geloofwaardigheid het wat deur 'n onafhanklike derdeparty-evaluering toegeken is. Dit bied objektiewe gronde wat in alle fases—van beleggingsverkryging en uitbreiding na die buiteland tot B2B-verkope—benut kan word.
'n Verteenwoordiger van Clevi het gesê: “Van die 63 amptelike verkeerde antwoorde het 'n aansienlike deel ontstaan uit teenstrydighede in die uitvoerformaat, foute in die interpretasie van visuele materiaal, en vrae wat weens verlies aan inligting nie beantwoord kon word nie. Dit is eerder 'n probleem van presisie in naverwerking en die beskikbaarheid van eksterne inligting as 'n fundamentele beperking van logiese redenering. Omdat dit 'n eie model is, kan Clevi dit self verbeter. Dit is juis die strukturele voordeel van 'n from scratch-eie model. Clevi se prestasie hierdie keer stel die vraag aan die Koreaanse KI-bedryf: “Hoe lank sal ons nog op ‘geleende breine’ staatmaak?” Clevi het die moeiliker pad van from scratch gekies en wil daardie antwoord op die wêreldverhoog bewys,” het hy gesê.
