Quell: Digital Times, Reporter Gu Bon-gyu
Vollstänneg Zitatioun vum Artikel „KI-Start-up Clevi erreecht déi Top 2,5 % bei GAIA … beweist seng unerkannt Kredibilitéit“
Verëffentlechungsdatum 2026-04-08
Link: https://n.news.naver.com/article/029/0003020511?sid=105
De südkoreanesche KI-Start-up ‘Clevi’ huet mat engem eegene Modell an enger eegener Agent-Léisung, déi from scratch entwéckelt goufen, bekannt ginn, datt en als éischte Start-up a Südkorea am GAIA-Benchmark ënnert den Top 2,5 % vun insgesamt 3.090 registréierte Modeller läit.
D'Branche erkläert, datt GAIA, entwéckelt vu Meta AI a bedriwwe vun Hugging Face, d'KI net no der „Fäegkeet, nëmmen eng Saach gutt ze maachen“, bewäert, mee no der „Fäegkeet, verschidde Fäegkeeten ze kombinéieren, fir reell Problemer ze léisen“. Si muss Informatiounen um Internet fannen, Tabellen an PDF-Dateie liesen, Biller analyséieren, Berechnungen duerch Ausféiere vu Code maachen an d'Resultater zesummeféieren, fir eng eenzeg richteg Äntwert ze ginn. D'Struktur baséiert op 301 net ëffentleche Froen, dräi Schwieregkeetsstufen an dem Prinzip, datt d'Äntwerten net verëffentlecht ginn, soudatt weder Iwweranpassung nach Cheating méiglech ass.
Fir an dësem Test eng héich Punktzuel ze erreechen, sinn zwou Saache néideg. Engersäits d'Inferenzeegkeet vum fundamentale Sproochmodell an anerersäits eng Agent-Léisung, déi dëse Modell mat den Tools vun der realer Welt verbënnt an him erlaabt, autonom Aufgaben auszeféieren. Egal wéi gutt de Modell ass: Wann den Agent schwaach ass, kënnen d'Level 3-Aufgaben net geléist ginn. A sou präzis den Agent och ass: Wann d'Inferenzeegkeet vum Modell net duergeet, propagéieren sech falsch Äntwerten an de mëttleren Etappen.
Wann een d'aktuell Struktur vun der GAIA-Ranglëscht kuckt, weist sech e interessante Muster. Déi meescht Agenten an den Toppositiounen adoptéieren eng „Multi-Model-Mix“-Strategie, bei där verschidde Big-Tech-Modeller wéi GPT, Claude a Gemini kombinéiert ginn. Et ass eng raisonnabel Approche, déi d'Modeller hir Stäerkte verbënnt an de Punkteverloscht duerch Informatiounsverloscht ënnerbindet.
Clevi huet sech deem Trend awer net ugeschloss. Den op Basis vun engem from scratch-Usaz entwéckelte cip-5.5-agent (agentesch KI) féiert d'Planung, d'Ausféierung an d'Verifizéierung vu komplexen Aufgaben autonom aus, während cip-5.5-mm (leistungsstaarken universelle Multimodalmodell) verschidde Dateiformater wéi Audio, Biller a Video versteet an dorop schléisst. Béid Modeller goufen intern bei Clevi eegestänneg entwéckelt, an et goufe guer keng extern LLM-APIs benotzt.
A mat dësem eegene Modell-Stack huet CLEVI 5 Agenten op GAIA ugetrueden a si all hunn iwwer 70 Punkte erreecht. Vun engem Maximum vun 79,07 % bis 70,76 % beweist dëst d'Stabilitéit vum gesamte Stack, an net nëmmen d'Gléck vun engem eenzegen Resultat.
Dem Fournisseur no stécht hannert dem offizielle Score vun 79,07 % nach eng aner Zuel. Bei der interner Noanalys vu CLEVI gouf festgestallt, datt bei enger bedeitender Zuel vun den 301 Froen d'Beweiser fir déi richteg Äntwert aktuell aus dem ëffentleche Web verschwonne sinn. Bei enger Neibewäertung, déi nëmmen d'Froen berücksichtegt, fir déi déi richteg Äntwert nach ëmmer um Web ze fannen ass, louch dem CLEVI seng Richtegkeetsquote bei iwwer 98 %. Dat ass e Wäert, dee schonn iwwer dem mënschlechen Duerchschnëtt (92 %) läit.
Natierlech hätt een den offizielle Score nach kënne steigeren, wann ee staark allgemeng Modeller vun anere Fournisseuren kombinéiert hätt. CLEVI huet dës Strategie awer bewosst net gewielt. D'Zil vun dësem Benchmark war nämlech net de Concours ëm den héchste Score, mee ze iwwerpréiwen, ob e from scratch eegene Modell e konkurrenzfäegen Niveau op der globaler Bühn erreecht huet.
Datt den Numm op der GAIA-Leaderboard steet, ass virun allem dofir bedeitend, well dëst eng validéiert Kredibilitéit bedeit, déi duerch eng onofhängeg Drëttpartei-Evaluatioun zouerkannt gouf. Dëst ass eng objektiv Grondlag, déi an alle Phasen agesat ka ginn – vun der Kapitalakquise iwwer d'international Expansioun bis zum B2B-Verkaf.
E Vertrieder vu CLEVI sot: „Vun den 63 offiziell falschen Äntwerte sinn der vill duerch net konform Ausgabeformater, Feeler bei der Interpretatioun vu visuellem Material an Aufgaben, bei deenen duerch de Verloscht vun Informatioun keng richteg Äntwert méiglech war, entstanen. Et geet manner ëm fundamental Limitte beim logesche Raisonnement wéi ëm d'Präzisioun bei der Noofbeaarbechtung an d'Verfügbarkeet vun externen Informatiounen. Well et en eegene Modell ass, kann CLEVI en aus eegener Kraaft verbesseren. Dat ass de strukturelle Virdeel vun engem from scratch eegene Modell. Dës Leeschtung vu CLEVI stellt der koreanescher AI-Branche d'Fro: „Wéi laang wäerte mir nach op ‚geléinte Gehirer‘ vertrauen?“ CLEVI huet de méi schwéiere Wee vum from scratch gewielt a wëll dës Äntwert op der globaler Bühn beweisen“, huet hien erkläert.
