News

CLEVI erzielt mit einem from scratch selbst entwickelten Modell 79,07 % bei GAIA … unter den besten 2,5 % von 3.090 Modellen

Quelle: Electronic Times, Reporter Lee Won-ji

Quelle: Electronic Times, Reporter Lee Won-ji

Vollständiges Zitat des Artikels „CLEVI erzielt mit einem from scratch selbst entwickelten Modell 79,07 % bei GAIA … unter den besten 2,5 % von 3.090 Modellen“

Veröffentlichungsdatum: 2026-04-07

Link: https://www.etnews.com/20260407000203

Fünf unabhängige Modell-Stacks von cip-5.5-agent und cip-5.5-mm; alle fünf Agenten erzielen über 70 Punkte

Unter Berücksichtigung von Informationsverlusten liegt die Genauigkeit bei über 98 % und damit über dem Wert von Menschen (92 %)

Bild im Haupttext

Das KI-Startup „CLEVI“ erzielte mit einem from scratch selbst entwickelten Modell beim globalen KI-Agenten-Benchmark „GAIA“ eine Genauigkeit von 79,07 % und platzierte sich damit unter den besten 2,5 % der insgesamt 3.090 registrierten Modelle.

Branchenangaben zufolge gilt GAIA auf dem KI-Benchmark-Markt als repräsentativ für die Fähigkeiten „praktischer KI-Agenten“. Dieser Benchmark wurde gemeinsam von Meta AI, HuggingFace und der Universität Paris-Saclay entwickelt und erstmals im November 2023 veröffentlicht.

GAIA unterscheidet sich vor allem in drei Punkten von anderen Benchmarks. Erstens ist eine Überanpassung nicht möglich, da die richtigen Antworten nicht öffentlich sind. Zweitens erfordern die Aufgaben komplexes mehrstufiges und multimodales Schlussfolgern, sodass mit einfachem Pattern Matching keine hohe Punktzahl erreicht werden kann. Drittens treten über die offizielle Rangliste von HuggingFace mehr als 3.090 Modelle weltweit unter identischen Bedingungen gegeneinander an.

Der Testsatz besteht aus insgesamt 301 Fragen. Level 1 umfasst die Verwendung eines einzelnen Tools und einfaches Schlussfolgern, Level 2 die Kombination mehrerer Tools und Schlussfolgern auf mittlerem Niveau, während Level 3 Aufgaben mit dem höchsten Schwierigkeitsgrad umfasst, die eine Agentenplanung und -ausführung über mindestens fünf Schritte erfordern. Zum Zeitpunkt der Veröffentlichung des Benchmarks lag der Wert bei GPT-Modellen (mit Plugins) bei etwa 15 %; mittlerweile haben die führenden Teams ihn auf 70 bis 80 % gesteigert.

CLEVI betonte, dass der technisch bemerkenswerteste Aspekt dieser Leistung darin liege, dass keinerlei externe LLM-APIs wie GPT, Claude oder Gemini verwendet wurden. Charakteristisch ist die Verwendung von zwei unabhängig im from scratch-Verfahren entwickelten Modellen.

cip-5.5-agent ist ein agentisches KI-Modell und fungiert als zentrales Gehirn der Agenten-Pipeline, die komplexe Aufgaben autonom plant (planning), ausführt (execution) und überprüft (verification). cip-5.5-mm ist ein leistungsstarkes, universelles multimodales Modell, das verschiedene Dateiformate wie Sprache, Bilder und Videos versteht und daraus Schlussfolgerungen zieht. Da ein beträchtlicher Teil der GAIA-Aufgaben nicht-textuelle Eingaben wie PDFs, Bild- und Audiodateien enthält, erwies sich diese multimodale Fähigkeit als entscheidender Faktor für die hohe Punktzahl.

CLEVI trat auf Grundlage dieser beiden eigenen Modelle mit fünf verschiedenen Agentenkonfigurationen bei GAIA an, wobei alle eine Punktzahl von über 70 erreichten.

Laut Angaben des Unternehmens wurden bei einer internen nachträglichen Überprüfung durch CLEVI interessante Ergebnisse festgestellt. Bei einigen der insgesamt 301 Aufgaben waren die Belege für die richtigen Antworten im derzeit öffentlich zugänglichen Web nicht mehr vorhanden. Dabei handelt es sich um Informationen, die früher online oder über Suchmaschinen zugänglich waren, inzwischen jedoch gelöscht oder geändert wurden und nicht mehr abgerufen werden können. Bei einer Neubewertung innerhalb des Informationsumfangs, den Menschen derzeit öffentlich überprüfen können, lag die Trefferquote von CLEVI bei über 98 %. Damit übertrifft sie bereits den menschlichen Durchschnitt von 92 %.

Ein Vertreter von CLEVI erklärte: „CLEVI hat ohne die Kombination externer Modelle, ausschließlich mit eigenen, von Grund auf entwickelten Modellen und eigenen KI-Agentenlösungen, mit allen fünf Agenten eine Punktzahl von 70+ erreicht und damit die besten 2,5 % des öffentlichen Benchmarks erreicht. Durch die künftige Verbesserung der eigenen Modelle und Agentenlösungen dürfte auch eine weitere Steigerung der offiziellen Punktzahl möglich sein. Der Erfolg ist insofern besonders bedeutsam, als er durch eine Messung in einem globalen öffentlichen Benchmark ‚verifiziertes Vertrauen‘ zeigt, auf dem Erfolg eines koreanischen KI-Entwicklers mit eigenen, von Grund auf entwickelten Modellen beruht, das Ergebnis eines unabhängigen Modell-Stacks und nicht einer Kombination externer Modelle ist und angesichts des Informationsverlusts bei einigen Aufgaben einen über die Punktzahl hinausgehenden Interpretationswert besitzt.“

Zurück zum Newsroom
CLEVI

Sprache und Region

Maschinell übersetzte Sprachen sind gekennzeichnet. Die Verfügbarkeit richtet sich nach dem veröffentlichten Site-Bundle.

136 Sprachen

Empfohlen

1

Ostasien

7

Südostasien

11

Südasien

18

Zentralasien

5

Naher Osten und Kaukasus

10

Westeuropa und Südeuropa

16

Vereinigtes Königreich und Irland

4

Nordeuropa

10

Mitteleuropa und Balkan

14

Osteuropa

5

Ostafrika

8

Westafrika und Zentralafrika

9

Südliches Afrika

8

Amerika

5

Ozeanien

5