Notícias

Startup de IA Clevi entra no top 2,5% da GAIA… demonstrando credibilidade comprovada

Fonte: Digital Times, repórter Gubon-gyu

Fonte: Digital Times, repórter Gubon-gyu

Citação integral da matéria “Startup de IA Clevi entra no top 2,5% da GAIA… demonstrando credibilidade comprovada”

Data de publicação: 08/04/2026

Link: https://n.news.naver.com/article/029/0003020511?sid=105

A startup de IA sul-coreana ‘Clevi’ anunciou que, enquanto construía seu próprio modelo e sua própria solução de agentes desenvolvidos from scratch, alcançou, pela primeira vez na Coreia do Sul, o top 2,5% do benchmark GAIA, com base no total de 3.090 modelos registrados.

Segundo explicações do setor, a GAIA, projetada pela Meta AI e operada pela Hugging Face, não avalia apenas a capacidade de uma IA de ‘fazer bem uma única coisa’, mas sim sua capacidade de ‘combinar várias habilidades para resolver problemas reais’. É preciso encontrar informações na web, ler tabelas em PDFs, analisar imagens, executar códigos para fazer cálculos e combinar os resultados para fornecer uma única resposta correta. Com 301 questões privadas, três níveis de dificuldade e o princípio de não divulgação das respostas, sua estrutura impossibilita tanto o overfitting quanto trapaças.

Para obter uma pontuação alta nesse teste, são necessários dois elementos. Primeiro, a capacidade de raciocínio do modelo de linguagem que serve de base; segundo, uma solução de agentes que conecte esse modelo às ferramentas do mundo real e permita que ele execute tarefas de forma autônoma. Por melhor que seja o modelo, se o agente for fraco, não será possível resolver o Level 3; por mais sofisticado que seja o agente, se a capacidade de raciocínio do modelo for insuficiente, respostas incorretas serão propagadas nas etapas intermediárias.

Ao observar a estrutura atual do leaderboard da GAIA, percebe-se um padrão interessante. A maioria dos agentes no topo adota uma estratégia de ‘mistura de múltiplos modelos’, combinando vários modelos de big techs, como GPT, Claude e Gemini. É uma abordagem racional que combina os pontos fortes de cada modelo e protege contra reduções na pontuação causadas, por exemplo, pela perda de informações.

Por outro lado, a Clevi não se juntou a essa tendência. Desenvolvido pelo método from scratch, o cip-5.5-agent (IA agêntica) executa de forma autônoma o planejamento, a execução e a verificação de tarefas complexas, enquanto o cip-5.5-mm (multimodal geral de alto desempenho) compreende e raciocina sobre diversos formatos de arquivo, como áudio, imagem e vídeo. Ambos os modelos foram desenvolvidos internamente pela Clevi de forma independente, sem utilizar nenhum tipo de API de LLM externa.

E, com essa própria pilha de modelos, colocou 5 agentes na GAIA, todos registrando pontuações acima de 70. Da máxima de 79,07% à mínima de 70,76%, isso comprovou a estabilidade de toda a pilha, e não a sorte de um único resultado.

Imagem do corpo do texto

Segundo a explicação da empresa, por trás da pontuação oficial de 79,07% há outro número. Uma revisão interna posterior da Clevi confirmou que, entre as 301 questões, um número significativo tinha perdido suas evidências de resposta correta na web pública atual. Quando reavaliada considerando apenas as questões cuja resposta correta ainda está disponível na web, a taxa de acerto da Clevi foi superior a 98%. Esse valor já supera a média humana (92%).

É claro que, se tivesse combinado modelos de uso geral poderosos de outras empresas, poderia ter elevado ainda mais a pontuação oficial. No entanto, a Clevi deliberadamente não adotou essa estratégia. Isso porque o objetivo deste benchmark não era competir pela maior pontuação, mas verificar se um modelo próprio desenvolvido from scratch havia alcançado um nível capaz de competir no cenário global.

Ter seu nome incluído no ranking da GAIA tem grande significado por contar com credibilidade verificada, conferida por uma avaliação independente de terceiros. Isso se torna uma base objetiva que pode ser utilizada em todas as etapas, desde a captação de investimentos até a expansão internacional e as vendas B2B.

Um representante da Clevi afirmou: “Entre as 63 respostas oficialmente incorretas, muitas resultaram de incompatibilidades no formato de saída, erros na interpretação de materiais visuais e questões impossíveis de responder devido à perda de informações. O problema está mais na precisão do pós-processamento e na disponibilidade de informações externas do que em limitações fundamentais do raciocínio lógico. Como se trata de um modelo próprio, a Clevi pode aprimorá-lo por conta própria. Essa é precisamente a vantagem estrutural de um modelo próprio desenvolvido from scratch. O desempenho da Clevi desta vez lança uma pergunta à indústria de IA coreana: ‘Até quando dependeremos de “cérebros emprestados”?’ A Clevi escolheu o caminho mais difícil do desenvolvimento from scratch e pretende provar a resposta no cenário mundial”.

Voltar para a redação
CLEVI

Yezh ha rannvro

Os idiomas traduzidos automaticamente estão marcados. A disponibilidade segue o pacote do site publicado.

136 yezh

Erbedet

1

Azia ar Reter

7

Azia ar Gevred

11

Azia ar Su

18

Azia ar Cʼhreiz

5

Reter-Kreiz ha Kaokaz

10

Europa ar Cʼhornôg ha Europa ar Su

16

Rouantelezh-Unanet ha Iwerzhon

4

Europa an Norzh

10

Kreiz-Europa hag ar Balkanoù

14

Europa ar Reter

5

Afrika ar Reter

8

Afrika ar Cʼhornôg ha Afrika ar Cʼhreiz

9

Afrika ar Su

8

Amerikaoù

5

Oseania

5