Neuigkeiten

CLEVI erzielt mit einem eigenen from-scratch-Modell 79,07 % bei GAIA … unter den besten 2,5 % von 3.090 Modellen

Quelle: Electronic Times, Reporter Lee Won-ji

Quelle: Electronic Times, Reporter Lee Won-ji

Vollständiges Zitat des Artikels „CLEVI erzielt mit einem eigenen from-scratch-Modell 79,07 % bei GAIA … unter den besten 2,5 % von 3.090 Modellen“

Veröffentlichungsdatum: 2026-04-07

Link: https://www.etnews.com/20260407000203

Fünf-Agenten-Stack mit unabhängigen Modellen cip-5.5-agent·cip-5.5-mm, alle fünf Agents erreichen mindestens Werte im Bereich der 70er

Bei Berücksichtigung von Informationsverlust beträgt die Genauigkeit über 98 % und liegt damit über der des Menschen (92 %)

Bild im Haupttext

Das KI-Startup „CLEVI“ erzielte mit einem eigenen from-scratch-Modell eine Genauigkeit von 79,07 % beim globalen KI-Agenten-Benchmark „GAIA“ und etablierte sich damit unter den besten 2,5 % aller 3.090 registrierten Modelle.

Branchenexperten zufolge gilt GAIA im KI-Benchmark-Markt als Benchmark, der die Fähigkeiten „praktischer KI-Agenten“ realitätsgetreu widerspiegelt. Dieser Benchmark wurde gemeinsam von Meta AI, HuggingFace und der Université Paris-Saclay entwickelt und im November 2023 erstmals veröffentlicht.

GAIA unterscheidet sich vor allem in drei Punkten von anderen Benchmarks. Erstens ist eine Überanpassung unmöglich, da die richtigen Antworten nicht veröffentlicht werden. Zweitens erfordern die Aufgaben mehrstufiges und multimodales komplexes Schlussfolgern, sodass mit einfachem Pattern Matching keine hohen Punktzahlen erzielt werden können. Drittens konkurrieren über 3.090 Modelle weltweit unter identischen Bedingungen über die offizielle Hugging-Face-Rangliste.

Der Testsatz besteht aus insgesamt 301 Fragen. Level 1 umfasst die Nutzung eines einzelnen Tools und einfache Schlussfolgerungen, Level 2 die Kombination mehrerer Tools und Schlussfolgerungen mittleren Schwierigkeitsgrads, während Level 3 Aufgaben mit dem höchsten Schwierigkeitsgrad umfasst, die eine Agentenplanung und -ausführung über mindestens fünf Schritte erfordern. Zum Zeitpunkt der Veröffentlichung des Benchmarks lagen GPT-Modelle (mit Plugins) bei etwa 15 %, während führende Teams diesen Wert inzwischen auf 70 bis 80 % steigern konnten.

CLEVI betonte, dass der technisch wichtigste Aspekt dieser Leistung darin liege, dass keinerlei externe LLM-APIs wie GPT, Claude oder Gemini verwendet wurden. Charakteristisch ist der Einsatz von zwei unabhängig im from-scratch-Verfahren entwickelten Modellen.

cip-5.5-agent ist ein agentisches KI-Modell und fungiert als zentrales Gehirn der Agenten-Pipeline, die komplexe Aufgaben autonom plant (planning), ausführt (execution) und überprüft (verification). cip-5.5-mm ist ein leistungsstarkes, universelles multimodales Modell, das verschiedene Dateiformate wie Audio, Bilder und Videos versteht und Schlussfolgerungen daraus zieht. Da ein beträchtlicher Teil der GAIA-Aufgaben nicht-textuelle Eingaben wie PDFs, Bild- und Audiodateien enthält, erwies sich diese multimodale Fähigkeit als entscheidender Faktor für die hohe Punktzahl.

CLEVI trat auf Grundlage dieser beiden eigenen Modelle mit fünf unterschiedlichen Agentenkonfigurationen bei GAIA an, wobei alle eine Punktzahl von über 70 erreichten.

Nach Angaben des Unternehmens wurden bei einer internen nachträglichen Prüfung durch CLEVI interessante Ergebnisse festgestellt. Bei einigen der insgesamt 301 Aufgaben waren die Belege für die richtigen Antworten im derzeit öffentlich zugänglichen Web nicht mehr vorhanden. Informationen, die früher online oder über Suchmaschinen abrufbar waren, wurden gelöscht oder verändert und sind daher nicht mehr zugänglich. Bei einer Neubewertung innerhalb des Informationsumfangs, den Menschen derzeit öffentlich überprüfen können, lag die Trefferquote von CLEVI bei über 98 %. Damit übertrifft sie bereits den menschlichen Durchschnitt von 92 %.

Ein Vertreter von CLEVI erklärte: „CLEVI erreichte mit allen fünf Agenten 70+ und stieg damit bei einem öffentlichen Benchmark in die Top 2,5 % auf – ausschließlich mit eigenen, from scratch entwickelten Modellen und eigenen KI-Agentenlösungen, ohne eine Mischung externer Modelle. Durch die künftige Verbesserung der eigenen Modelle und Agentenlösungen dürfte auch eine weitere Steigerung der offiziellen Punktzahl möglich sein. Der Erfolg ist insofern von großer Bedeutung, als er durch Messungen in einem globalen öffentlichen Benchmark ein ‚verifiziertes Vertrauen‘ zeigt, auf einer Leistung eines koreanischen KI-Entwicklers auf Basis eigener, from scratch entwickelter Modelle beruht, das Ergebnis eines unabhängigen Modell-Stacks statt einer Mischung externer Modelle ist und angesichts des Informationsverlusts bei einigen Aufgaben einen über die Punktzahl hinausgehenden Interpretationswert besitzt.“

Zurück zum Newsroom
CLEVI

Sprache und Region

Maschinell übersetzte Sprachen sind gekennzeichnet. Die Verfügbarkeit richtet sich nach dem veröffentlichten Website-Bundle.

136 Sprachen

Empfohlen

1

Ostasien

7

Südostasien

11

Südasien

18

Zentralasien

5

Naher Osten und Kaukasus

10

Westeuropa und Südeuropa

16

Vereinigtes Königreich und Irland

4

Nordeuropa

10

Mitteleuropa und Balkan

14

Osteuropa

5

Ostafrika

8

Westafrika und Zentralafrika

9

Südliches Afrika

8

Amerika

5

Ozeanien

5
CLEVI erzielt mit einem eigenen from-scratch-Modell 79,07 % bei GAIA … unter den besten 2,5 % von 3.090 Modellen — CLEVI