Zprávy

CLEVI, s vlastním modelem vyvinutým from scratch dosáhl na GAIA 79,07 %... mezi 3 090 modely patří do horních 2,5 %

Zdroj: elektronické noviny, reportér I Won-ji

Zdroj: elektronické noviny, reportér I Won-ji

Citace celého článku „CLEVI, s vlastním modelem vyvinutým from scratch dosáhl na GAIA 79,07 %... mezi 3 090 modely patří do horních 2,5 %“

Datum vydání: 7. 4. 2026

Odkaz: https://www.etnews.com/20260407000203

Vlastní modelový stack cip-5.5-agent·cip-5.5-mm, všech 5 agentů nad 70 body

Po zohlednění ztráty informací přesnost 98 %+, vyšší než u lidí (92 %)

Obrázek v článku

AI startup „CLEVI“ zaznamenal s využitím vlastního modelu vyvinutého from scratch přesnost 79,07 % v globálním benchmarku AI agentů „GAIA“ a umístil se mezi horními 2,5 % z celkem 3 090 registrovaných modelů.

Podle vysvětlení odborníků z oboru je GAIA na trhu AI benchmarků hodnocena jako benchmark, který věrně odráží schopnosti „praktických AI agentů“. Tento benchmark, společně vyvinutý společnostmi Meta AI a HuggingFace a Univerzitou Paris-Saclay, byl poprvé zveřejněn v listopadu 2023.

GAIA se od ostatních benchmarků odlišuje třemi hlavními rysy. Zaprvé, protože jsou správné odpovědi neveřejné, není možné přeučení. Zadruhé, protože vyžaduje vícekrokové a multimodální komplexní uvažování, nelze dosáhnout vysokého skóre pouhým rozpoznáváním vzorců. Zatřetí, prostřednictvím oficiálního žebříčku HuggingFace soutěží více než 3 090 modelů z celého světa za stejných podmínek.

Testovací sada se skládá celkem z 301 otázek. Level 1 zahrnuje použití jediného nástroje a jednoduché uvažování, Level 2 kombinuje více nástrojů a vyžaduje uvažování střední úrovně, zatímco Level 3 obsahuje otázky s nejvyšší obtížností, které vyžadují plánování a provedení agentem v pěti či více krocích. V době zveřejnění benchmarku dosahovaly modely GPT (s pluginy) přibližně 15 %, zatímco přední týmy tuto hodnotu nyní zvýšily na 70–80 %.

CLEVI zdůraznil, že technicky nejpozoruhodnější částí tohoto výsledku je skutečnost, že nebyla vůbec použita externí LLM API, jako jsou GPT, Claude nebo Gemini. Charakteristické je, že CLEVI použil dva modely vyvinuté vlastním týmem from scratch.

cip-5.5-agent je agentický AI model, který slouží jako hlavní mozek agentní pipeline pro autonomní plánování (planning), provádění (execution) a ověřování (verification) komplexních úkolů. cip-5.5-mm je vysoce výkonný univerzální multimodální model, který rozumí různým formátům souborů, jako jsou zvuk, obrázky a video, a dokáže nad nimi provádět inference. Vzhledem k tomu, že značná část úloh GAIA obsahuje netextové vstupy, například PDF, obrazové nebo zvukové soubory, stala se tato multimodální schopnost klíčovým faktorem vysokého skóre.

CLEVI nasadila v soutěži GAIA na základě těchto dvou vlastních modelů 5 různých konfigurací agentů a všechny dosáhly skóre nad 70 body.

Podle vysvětlení společnosti přinesla interní následná kontrola CLEVI zajímavé výsledky. U některých z celkem 301 úloh se ukázalo, že důkazy podporující správné odpovědi již nejsou na veřejném webu dostupné. Informace, které bylo dříve možné ověřit online nebo prostřednictvím vyhledávačů, byly smazány či změněny a již k nim nelze získat přístup. Při opětovném vyhodnocení v rámci informací, které jsou dnes veřejně ověřitelné lidmi, dosáhla přesnost CLEVI více než 98 %. To již převyšuje lidský průměr 92 %.

Zástupce CLEVI uvedl: „CLEVI se bez kombinování externích modelů, pouze s vlastními modely vytvořenými from scratch a vlastními řešeními AI agentů, umístila s pěti agenty, z nichž každý dosáhl skóre 70+, mezi nejlepšími 2,5 % ve veřejném benchmarku. Očekává se, že dalším zlepšováním vlastních modelů a řešení agentů bude možné dále zvýšit i oficiální skóre. Tento výsledek má hluboký význam, protože představuje ‚ověřenou důvěryhodnost‘ naměřenou v globálním veřejném benchmarku, jde o výsledek domácího vývojáře AI založený na vlastních modelech vytvořených from scratch, je výsledkem nezávislého modelového stacku bez kombinování externích modelů a s ohledem na ztrátu informací u některých úloh má interpretační hodnotu přesahující samotné skóre.“

Zpět do redakce
CLEVI

Jazyk a region

Jazyky přeložené strojově jsou označeny. Dostupnost odpovídá zveřejněnému balíčku webu.

136 jazyků

Doporučeno

1

východní Asie

7

jihovýchodní Asie

11

jižní Asie

18

Střední Asie

5

Blízký východ a Kavkaz

10

západní Evropa a jižní Evropa

16

Spojené království a Irsko

4

severní Evropa

10

Střední Evropa a Balkán

14

východní Evropa

5

východní Afrika

8

západní Afrika a střední Afrika

9

jižní Afrika

8

Amerika

5

Oceánie

5