Developer guide

Modelo

Resumo do modelo

Os modelos CLEVI são divididos em três linhas de produtos: CIP, responsável pela inteligência geral e automação de tarefas; Cosa, responsável pela geração e reconhecimento de voz; e Cova, responsável pela extração de informações de documentos e imagens. Cada produto pode ser usado de forma independente ou conectado a serviços que abrangem reconhecimento de documentos, análise, execução de tarefas e orientação por voz.

ProdutoID do modeloPrincipais especificaçõesFunção principal
CIP-5.5-SMcip-5.5-sm24B~40B ajustávelAutomação de tarefas locais e em servidores de borda
CIP-5.5-IMcip-5.5-im360B · entrada 256K · saída 64K · multimodalProcessamento geral de tarefas. Prioridade à velocidade de resposta e à capacidade de processamento
CIP-5.5-MMcip-5.5-mm800B · entrada 512K · saída 64K · multimodalAnálise de contextos longos e resolução de problemas complexos
Cosa-Acosa-aSíntese·clonagem·design·streaming de vozGeração de voz com controle detalhado da síntese
Cosa-Bcosa-bSíntese·clonagem·design·streaming de vozSeleção de voz e geração de voz personalizada
Cosa ASRcosa-asrReconhecimento de vozConversão da entrada de voz em texto
Covacova-1Exclusivo para OCR visual baseado em LLMExtração de texto, layout e tabelas, além de descrição simples de imagens

CIP

O CIP é responsável pela inteligência geral e pela automação de tarefas. Ele é composto pelo cip-5.5-im e pelo cip-5.5-mm, acessados por meio do gateway, e pelo cip-5.5-sm, implantado em servidores de borda e em ambientes on-premises.

cip-5.5-im e cip-5.5-mm

Itemcip-5.5-imcip-5.5-mm
Escala360B800B
Limite de entrada256K512K
Saída máxima64K64K
Formato de entradaTexto e materiais visuais (documentos, imagens de tela, tabelas e gráficos)Texto e materiais visuais (revisão integrada de código, documentos e materiais de tela)
Direção de usoProcessa tarefas diárias de conhecimento e desenvolvimento com foco na velocidade de resposta, eficiência de custos e capacidade de processamento.Processa tarefas complexas que combinam e analisam diversos materiais e condições, conectando os resultados da análise ao trabalho prático.
Uso de entradas longasRevisa vários documentos, arquivos de código e históricos de conversas em conjunto.Lida com grandes volumes de materiais de referência e históricos de trabalho, executando tarefas de agente nas quais pesquisa, execução e verificação ocorrem em várias etapas.

cip-5.5-im é adequado para tarefas com objetivos e escopo de trabalho claros. Exemplos representativos incluem extrair as informações necessárias dos materiais fornecidos, produzir resultados no formato especificado e modificar o código de acordo com os requisitos. O limite de saída de até 64K é útil para elaborar relatórios detalhados ou resultados compostos por várias partes.

  • Assistência ao desenvolvimento: escrever funções e recursos, corrigir bugs de escopo bem definido e implementar de acordo com os padrões existentes.
  • Geração de testes: elaborar rascunhos de testes e casos de validação com base nos requisitos e na implementação.
  • Processamento de documentos: realizar resumos, classificações, extração de itens, conversão de formatos e elaboração de rascunhos.
  • Análise multimodal: revisar imagens de telas e tabelas e gráficos de documentos junto com as explicações relevantes.
  • Suporte interativo ao trabalho: responder a perguntas com base nos materiais de trabalho e produzir os resultados necessários.
  • Processamento em massa: realizar resumos individuais de vários documentos, classificação de solicitações e transformação de dados.
  • Subagente: executar subtarefas com limites claros, como explorar código, revisar arquivos específicos e organizar materiais.

Por exemplo, é usado para receber requisitos funcionais e código relacionado e elaborar uma proposta de alteração, testes e descrição das mudanças, ou para classificar documentos recebidos e criar resumos para os responsáveis.

cip-5.5-mm é adequado para tarefas que exigem compreender as relações entre as informações e manter a consistência de todo o trabalho. No desenvolvimento, ele revisa as conexões entre requisitos, design, implementação e testes; na análise de documentos, sintetiza as afirmações e evidências, diferenças e contradições de vários materiais.

  • Implementação de recursos complexos: alterar código, testes e documentação em conjunto, considerando os contratos e o comportamento de vários módulos.
  • Análise de grandes bases de código: revisar relações de chamada, fluxo de dados e escopo do impacto das alterações.
  • Análise das causas de incidentes: comparar logs, configurações, código e resultados de execução para organizar hipóteses de causa e procedimentos de verificação.
  • Suporte a design e tomada de decisões: estruturar requisitos e restrições e analisar o impacto das alternativas de implementação.
  • Análise integrada de vários documentos: organizar, com foco nas evidências, semelhanças, diferenças e contradições entre relatórios e documentos técnicos.
  • Revisão multimodal integrada: interpretar textos e materiais visuais em conjunto para analisar problemas e requisitos.
  • Agente de várias etapas: usar em tarefas que envolvem investigação, planejamento, execução de ferramentas e revisão dos resultados.
  • Redação de documentos especializados: elaborar relatórios técnicos, propostas de design e documentos de revisão detalhados que reflitam condições complexas e evidências.

Por exemplo, é usado para revisar em conjunto os códigos relacionados e os logs de erros ocorridos em vários serviços, ou em tarefas que vão desde a análise de requisitos de funcionalidades complexas até a implementação e a revisão dos resultados da validação.

cip-5.5-sm

O cip-5.5-sm realiza inferência local e automação de tarefas em servidores de edge e ambientes on-premises. Como o tamanho do modelo pode ser ajustado na faixa de 24B a 40B, é possível escolher uma configuração adequada aos recursos computacionais do equipamento de implantação e ao desempenho exigido no local. Como os dados são processados próximos ao ponto onde são gerados, ele é usado na integração com sistemas locais e no uso de dados internos. Ao configurar localmente os modelos e as ferramentas necessários, também pode ser operado em ambientes com conexão externa limitada.

Ele interpreta as informações geradas no local e as conecta aos procedimentos de processamento. Classifica logs e solicitações, extrai as informações necessárias dos dados e executa tarefas repetitivas usando ferramentas internas e scripts conectados.

  • Processamento de eventos locais: classifica os logs dos equipamentos e as informações de status, selecionando os eventos que precisam de verificação.
  • Pré-processamento de dados: extrai os itens principais dos registros de trabalho e realiza sua classificação, marcação e normalização.
  • Roteamento de solicitações: encaminha as solicitações recebidas ao sistema responsável ou ao procedimento de processamento correspondente.
  • Agente de tarefas locais: executa tarefas repetitivas consultando sistemas internos e executando scripts.
  • Suporte a tarefas on-premises: responde a perguntas com base em materiais internos e organiza o conteúdo das tarefas.
  • Suporte à análise posterior: seleciona os materiais que precisam de revisão adicional e organiza os pontos principais.

Por exemplo, é usado em um fluxo que classifica os logs operacionais no servidor de uma unidade, consulta o histórico relacionado e redige um resumo do incidente para os responsáveis.

Cosa

Cosa é uma família de produtos de voz que converte texto em fala, reconhece a fala de entrada como texto e permite registrar e reutilizar a voz desejada. É usada em orientações de serviço, produção de conteúdo, suporte à acessibilidade e interfaces de voz de agentes conversacionais.

A geração de voz é realizada pelo cosa-a e pelo cosa-b, enquanto o reconhecimento de voz é realizado pelo cosa-asr. cosa-a e cosa-b são modelos separados, cada um com sua própria lista de vozes e configurações de síntese, selecionados na mesma interface de serviço. Os recursos oferecidos em comum pelos dois modelos são os seguintes.

  • Conversão de texto em fala: sintetiza o texto inserido usando a voz selecionada.
  • Clonagem de voz: registra uma voz com base em uma gravação de referência para a qual você tem permissão de uso e sintetiza novas frases.
  • Design de voz: cria e registra uma voz descrevendo as características desejadas.
  • Reutilização de voz: usa a voz registrada em sínteses posteriores.
  • Configurações de síntese: ajusta a velocidade da fala e o idioma, entre outros parâmetros.
  • Transmissão em streaming: sintetiza o texto em unidades de frases assim que ele chega e transmite o áudio sequencialmente.
  • Controle de reprodução: oferece suporte a pausar, retomar, interromper e inserir frases adicionais.

Com o uso da entrada progressiva de texto, é possível iniciar a reprodução de voz antes que toda a resposta seja concluída. Enquanto o CIP redige a resposta, você pode configurar um serviço em que cosa lê as frases prontas.

cosa-a

cosa-a oferece suporte à conversão de texto em fala, clonagem de voz, design de voz e saída em streaming. Além dos recursos básicos de seleção de voz, idioma e velocidade da fala, oferece controles adicionais, como configurações relacionadas ao número de etapas de síntese, à intensidade da orientação e ao comprimento da geração. É usado para ajustar as configurações durante a criação da voz e revisar os resultados, ou para aplicar várias configurações ao mesmo roteiro e escolher o resultado.

  • Sintetiza orientações e notificações para aplicativos, quiosques e sistemas corporativos.
  • Cria materiais educacionais e manuais de uso em áudio.
  • Produz narração para conteúdos de vídeo e áudio.
  • Cria conteúdos recorrentes usando a voz registrada.
  • É usado para a saída de voz em streaming de agentes conversacionais.
  • É usado na criação de voz para ajustar configurações detalhadas de síntese.

cosa-b

cosa-b oferece suporte à seleção de vozes predefinidas, ao design de voz baseado em descrição, à clonagem baseada em voz de referência e à saída em streaming. Você pode escolher uma voz na lista de vozes própria ou registrar uma nova voz para usar no serviço.

A clonagem de voz usa uma gravação de referência e o texto correspondente a ela. Também oferece suporte a um fluxo que gera o texto de referência por reconhecimento de voz durante o registro, e a voz registrada é reutilizada em sínteses posteriores.

  • Configura a persona vocal de serviços e personagens.
  • Cria vozes personalizadas a partir de uma descrição ou gravação de referência.
  • Sintetiza orientações de marca, falas de personagens e narrações de conteúdo.
  • É usado para respostas de voz de agentes conversacionais.
  • Sintetiza mensagens de orientação e roteiros que mudam usando a mesma voz.

Ao escolher entre cosa-a e cosa-b, considere a voz desejada, o resultado real da síntese e os itens de controle necessários.

Itemcosa-acosa-b
Configurações de sínteseConfigurações relacionadas ao número de etapas de síntese, à intensidade da orientação e ao comprimento da geração, além da voz, do idioma e da velocidade de falaConfigurações comuns, como a velocidade de fala e o idioma
Entrada para clonagemGravação de referência para a qual você tem autorização de usoGravação de referência e texto correspondente. Durante o processo de registro, é possível gerar o texto de referência por reconhecimento de voz
FunçãoGeração de voz com controle detalhado da sínteseSeleção de voz e geração de voz personalizada

cosa-asr

cosa-asr converte a voz de entrada em texto. Ele documenta materiais gravados ou transforma solicitações recebidas por voz em entradas que os sistemas de negócios subsequentes podem processar.

  • Transcreve memorandos de voz e materiais gravados.
  • Converte perguntas e solicitações de trabalho baseadas em voz em entradas.
  • Gera textos de referência para clonagem de voz.
  • É usado em processos que continuam, após a transcrição, com resumo, classificação e busca.

Ao enviar o resultado da transcrição ao CIP, é possível prosseguir com o resumo do conteúdo, a classificação das solicitações e a elaboração de rascunhos de trabalho. Ao sintetizar os resultados do processamento com cosa-a ou cosa-b, você obtém um serviço de negócios com entrada e saída de voz.

Cova

cova-1 é um modelo especializado em OCR visual baseado em LLM. Ele reconhece texto em documentos e imagens, extrai o layout e a estrutura das tabelas e fornece descrições simples dos elementos visuais.

Converte documentos visualizados por pessoas em um formato adequado para uso por agentes e sistemas de negócios. O corpo do texto e as tabelas são extraídos como conteúdo estruturado, enquanto as imagens incluídas no documento são transmitidas como descrições curtas. Assim, os agentes subsequentes podem compreender tanto o conteúdo do documento quanto o contexto visual. Ao estruturar um fluxo que primeiro compreende o material com o texto e as descrições extraídos e revisa adicionalmente apenas os originais que exigem confirmação detalhada, é possível reduzir a quantidade de vezes que as imagens originais são inseridas e economizar tokens de contexto.

FunçãoDescrição
Reconhecimento de textoExtrai texto de documentos digitalizados ou fotografados.
Interpretação do layoutDivide o conteúdo em blocos considerando a disposição do documento.
Fornecimento de informações de localizaçãoFornece a localização dos blocos reconhecidos para associar os resultados extraídos ao conteúdo original.
Extração da estrutura de tabelasEstrutura o conteúdo das tabelas para uso em pesquisas e processamento de dados.
Descrição simples de imagensDescreve brevemente o conteúdo de imagens e elementos visuais, fornecendo pistas para a interpretação pelo agente.
Otimização de contextoReduz a necessidade de inserir repetidamente a imagem original ao transmitir informações com foco no texto, na estrutura e na descrição da imagem.
Análise detalhada seletivaAjuda o agente a decidir quais imagens originais devem ser verificadas adicionalmente.
Conversão de formato de documentosOrganiza os resultados do reconhecimento em HTML ou Markdown.
  • Digitalização de documentos: converte documentos em papel e materiais digitalizados em materiais baseados em texto.
  • Recebimento de documentos comerciais: extrai conteúdo de formulários de solicitação, documentos comprobatórios e relatórios.
  • Processamento de dados tabulares: utiliza as tabelas incluídas nos documentos no processamento posterior de dados.
  • Pré-processamento para pesquisa de conhecimento: converte imagens de documentos e materiais visuais em texto e estruturas pesquisáveis.
  • Automação da revisão de documentos: envia os resultados extraídos ao CIP para verificar itens, resumir e comparar materiais.
  • Otimização de entradas para agentes: organiza o corpo, as tabelas e as descrições de imagens de documentos extensos para transmitir apenas as informações necessárias.

Por exemplo, ao extrair o corpo e as tabelas de um relatório, descreve um gráfico inserido como um gráfico que mostra a tendência da receita por trimestre. Com essa descrição, o agente identifica a existência e a finalidade do gráfico e, quando precisa de valores ou tendências precisos, verifica adicionalmente o original correspondente.

Conexão entre produtos

Ao conectar os produtos, é possível configurar o seguinte fluxo.

  • Operações baseadas em documentos: Cova extrai o corpo, as tabelas e as descrições de imagens; o CIP verifica seletivamente os originais necessários para realizar análises e processar tarefas; e Cosa transmite os resultados por voz.
  • Operações baseadas em voz: Cosa ASR converte solicitações de voz em texto, e cosa-a ou cosa-b lê as respostas processadas pelo CIP.
  • Automação em campo: cip-5.5-sm classifica os dados do local e executa operações locais, encaminhando para cip-5.5-im ou cip-5.5-mm os materiais que exigem análises integradas adicionais.

Chamadas permitidas no gateway

Os planos do gateway determinam as chamadas permitidas para cada modelo. A tabela abaixo mostra os escopos disponibilizados pelos planos LLM_FREE, TTS_FREE e STT_FREE, que são aplicados automaticamente sem necessidade de solicitação. Ela não inclui modelos disponibilizados por outras rotas.

ID do modeloChamadas permitidasPlano aplicável
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm e cova-1 não estão nesta tabela de planos. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm e ivy-4-mm nesta tabela são IDs de modelos que não estão incluídos nas descrições dos produtos acima. O documento Como fazer chamadas de API informa a qual caminho corresponde cada chave de chamada.

CLEVI

Yezh ha rannvro

Os idiomas traduzidos automaticamente estão marcados. A disponibilidade segue o pacote do site publicado.

136 yezh

Erbedet

1

Azia ar Reter

7

Azia ar Gevred

11

Azia ar Su

18

Azia ar Cʼhreiz

5

Reter-Kreiz ha Kaokaz

10

Europa ar Cʼhornôg ha Europa ar Su

16

Rouantelezh-Unanet ha Iwerzhon

4

Europa an Norzh

10

Kreiz-Europa hag ar Balkanoù

14

Europa ar Reter

5

Afrika ar Reter

8

Afrika ar Cʼhornôg ha Afrika ar Cʼhreiz

9

Afrika ar Su

8

Amerikaoù

5

Oseania

5