Quell: Elektronesch Zeitung, Journalist Lee Won-ji
Vollstänneg Zitatioun vum Artikel „CLEVI, eegene from-scratch-Modell mat 79,07 % bei GAIA ... ënnert den Top 2,5 % vun 3.090 Modeller“
Verëffentlechungsdatum: 2026-04-07
Link: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm: fënnef Agenten am eegene Modell-Stack, all mat iwwer 70 Punkten
Bei Berücksichtegung vum Informatiounsverloscht eng Trefferrate vun iwwer 98 %, iwwer dem Mënsch (92 %)
Den AI-Startup „CLEVI“ huet mat engem eegene from-scratch-Modell beim globalen AI-Agent-Benchmark „GAIA“ eng Trefferrate vun 79,07 % erreecht a sech, baséiert op insgesamt 3.090 registréierte Modeller, ënnert den Top 2,5 % etabléiert.
Laut Erklärunge vun der Industrie gëllt GAIA um AI-Benchmark-Maart als Benchmark, deen d’Fäegkeete vu „prakteschen AI-Agenten“ zouverlässeg reflektéiert. Dëse Benchmark, deen zesumme vu Meta AI, HuggingFace an der Universitéit Paris-Saclay entwéckelt gouf, gouf fir d’éischt am November 2023 publizéiert.
Et ginn dräi Schlësselmerkmale, duerch déi GAIA sech vun anere Benchmarks ënnerscheet. Éischtens ass d’Léisung net ëffentlech, soudatt Overfitting onméiglech ass. Zweetens erfuerdert de Benchmark komplex Multi-Step- a multimodal Inferenz, soudatt mat einfachem Pattern Matching keng héich Punktzuel méiglech ass. Drëttens konkurréiere méi wéi 3.090 Modeller aus der ganzer Welt ënner identesche Konditiounen iwwer den offiziellen HuggingFace-Leaderboard.
Den Testset besteet aus insgesamt 301 Froen. Level 1 ëmfaasst d’Benotzung vun engem eenzegen Tool an einfach Inferenz, Level 2 d’Kombinatioun vu verschiddenen Tools an Inferenz op mëttlerem Niveau, an Level 3 Froen op héchstem Schwieregkeetsgrad, déi Agent-Planung an -Ausféierung a fënnef oder méi Schrëtt erfuerderen. Beim Start vum Benchmark louch d’Leeschtung bei ongeféier 15 % fir GPT-Modeller (mat Plugins); aktuell hunn déi féierend Équipen se op 70 bis 80 % gesteigert.
An dësem Kontext huet CLEVI betount, datt den technesch bemierkenswäertsten Aspekt vun dëser Leeschtung doranner läit, datt guer keng extern LLM-APIe wéi GPT, Claude oder Gemini benotzt goufen. D’Besonneschkeet ass, datt CLEVI zwee Modeller benotzt huet, déi onofhängeg no der from-scratch-Methode entwéckelt goufen.
cip-5.5-agent ass en agentëchen AI-Modell, dat als zentrale "Gehir" vun Agentepipelines déngt, déi komplex Aufgaben autonom plangen (planning), ausféieren (execution) a verifizéieren (verification). cip-5.5-mm ass en héich performante generescht multimodalt Modell, dat verschidde Dateiformater wéi Audio, Biller a Video versteet an doriwwer schléisse kann. Well e groussen Deel vun de GAIA-Froen net-textuell Inputen ewéi PDFen, Biller an Audiodateien enthält, war dës multimodal Fäegkeet e Schlësselfaktor fir déi héich Punktzuel.
Op Basis vun dësen zwee eegene Modeller huet CLEVI fënnef verschidden Agentekonfiguratiounen un GAIA deelhuele gelooss, an all fënnef hunn iwwer 70 Punkte kritt.
Laut den Aussoe vum Entreprise goufen bei enger interner posteriore Revisioun vu CLEVI interessant Resultater festgestallt. Ënnert den insgesamt 301 Froen waren e puer, fir déi d'Beweiser fir déi richteg Äntwert aktuell um ëffentleche Web net méi disponibel waren. Et handelt sech ëm Fäll, an deenen Informatiounen, déi fréier online oder iwwer Sichmaschinne konnt verifizéiert ginn, geläscht oder geännert goufen an net méi zougänglech sinn. Bei enger Neibewäertung am Kader vun den Informatiounen, déi de Mënsch aktuell ëffentlech verifizéiere kann, louch dem CLEVI seng Richtegkeetsquote bei iwwer 98 %. Dat ass schonn iwwer dem mënschlechen Duerchschnëtt vun 92 %.
E Vertrieder vu CLEVI huet erkläert: „CLEVI huet, ouni extern Modeller ze vermëschen, nëmme mat eegene Modeller vu from scratch an eegene AI-Agentléisungen all fënnef Agenten op 70+ bruecht an domat déi éischt 2,5 % am ëffentleche Benchmark erreecht. Et ass ze erwaarden, datt den offizielle Score an Zukunft duerch d'Verbesserung vun den eegene Modeller an Agentléisunge weider gesteigert ka ginn. Dës Leeschtung ass besonnesch bedeitend, well se an engem globalen ëffentleche Benchmark gemooss gouf an domat 'verifizéiert Vertrauen' weist, well et sech ëm eng Leeschtung vun engem koreaneschen AI-Entwéckler op Basis vun eegene Modeller vu from scratch handelt, well se d'Resultat vun engem eegene Modellstack an net vun enger Vermëschung mat externe Modeller ass, a well se am Hibléck op de Verloscht vun Informatiounen bei e puer Froen en Interpretatiounswäert huet, deen iwwer de Score erausgeet.“
