Fonte: jornalista Lee Won-ji, do Electronic Times
Citação integral da matéria “Clevi, modelo próprio desenvolvido do zero alcança 79,07% no GAIA... entre os 3.090 modelos, está no top 2,5%”
Data de publicação: 07/04/2026
Link: https://www.etnews.com/20260407000203
cip-5.5-agent·cip-5.5-mm: stack de modelos próprios com 5 agentes, todos acima de 70 pontos
Considerando a perda de informações, taxa de acerto de mais de 98%, superior à humana (92%)
A startup de IA 'Clevi' registrou uma taxa de acerto de 79,07% no 'GAIA', um benchmark global de agentes de IA, utilizando seu próprio modelo desenvolvido do zero, ficando entre os 2,5% melhores com base no total de 3.090 modelos registrados.
Segundo explicações do setor, o GAIA é avaliado no mercado de benchmarks de IA como um indicador que reflete fielmente a capacidade de 'agentes de IA práticos'. Desenvolvido em conjunto pela Meta AI, Hugging Face e pela Universidade Paris-Saclay, entre outras instituições, esse benchmark foi divulgado pela primeira vez em novembro de 2023.
Há três aspectos principais que distinguem o GAIA de outros benchmarks. Primeiro, como as respostas corretas não são divulgadas, não é possível haver sobreajuste. Segundo, como exige raciocínio complexo em múltiplas etapas e modalidades, não é possível obter uma pontuação alta apenas com correspondência simples de padrões. Terceiro, mais de 3.090 modelos de todo o mundo competem sob as mesmas condições por meio do leaderboard oficial do Hugging Face.
O conjunto de testes é composto por um total de 301 questões. O Nível 1 envolve o uso de uma única ferramenta e raciocínio simples; o Nível 2 exige a combinação de várias ferramentas e raciocínio intermediário; e o Nível 3 consiste em questões de dificuldade máxima que requerem planejamento e execução por agentes em cinco ou mais etapas. No momento da divulgação do benchmark, os modelos GPT (com plugins) alcançavam cerca de 15%, enquanto atualmente as equipes líderes elevaram esse índice para a faixa de 70% a 80%.
Nesse contexto, a Clevi enfatizou que o aspecto tecnicamente mais importante desse resultado é o fato de não ter utilizado de forma alguma APIs de LLMs externos, como GPT, Claude ou Gemini. A característica marcante é que a Clevi utilizou dois modelos desenvolvidos internamente pelo método from scratch.
O cip-5.5-agent é um modelo de IA agêntica que atua como o cérebro central de um pipeline de agentes que planeja (planning), executa (execution) e verifica (verification) tarefas complexas de forma autônoma. O cip-5.5-mm é um modelo multimodal geral de alto desempenho que compreende e raciocina sobre diversos formatos de arquivo, como áudio, imagem e vídeo. Como uma parte significativa das questões da GAIA inclui entradas não textuais, como arquivos PDF, imagens e áudio, essa capacidade multimodal tornou-se um fator essencial para alcançar uma pontuação alta.
Com base nesses dois modelos próprios, a Clevi participou da GAIA com 5 configurações de agentes diferentes, e todos alcançaram pontuações acima de 70.
Segundo a empresa, uma revisão posterior interna da Clevi revelou resultados interessantes. Entre as 301 questões no total, algumas haviam perdido suas evidências de resposta na web pública atual. Eram casos em que informações anteriormente verificáveis online ou em mecanismos de busca haviam sido excluídas ou alteradas e não podiam mais ser acessadas. Quando reavaliada dentro do escopo das informações que as pessoas ainda conseguem verificar publicamente, a taxa de acerto da Clevi ficou acima de 98%. Esse valor já supera a média humana de 92%.
Um representante da Clevi explicou: “A Clevi registrou pontuações acima de 70 para todos os 5 agentes e entrou no grupo dos 2,5% melhores no benchmark público usando apenas modelos próprios from scratch e soluções próprias de agentes de IA, sem combinar modelos externos. Com melhorias futuras nos modelos e nas soluções próprias de agentes, também parece possível aumentar ainda mais a pontuação oficial. Este resultado é significativo porque demonstra uma 'confiança comprovada' medida em um benchmark público global; representa uma conquista de uma empresa nacional de desenvolvimento de IA baseada em modelos próprios from scratch; é resultado de uma pilha de modelos independente, não de uma combinação de modelos externos; e, considerando a perda de informações em algumas questões, possui um valor interpretativo que vai além da pontuação em si”.
