Developer guide
Modelo
Resumo do modelo
Os modelos CLEVI são divididos em três linhas de produtos: CIP, responsável pela inteligência geral e automação de tarefas; Cosa, responsável pela geração e reconhecimento de voz; e Cova, responsável pela extração de informações de documentos e imagens. Cada produto pode ser usado de forma independente ou conectado a serviços que abrangem reconhecimento de documentos, análise, execução de tarefas e orientação por voz.
| Produto | ID do modelo | Principais especificações | Função principal |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B ajustável | Automação de tarefas locais e em servidores de borda |
| CIP-5.5-IM | cip-5.5-im | 360B · entrada 256K · saída 64K · multimodal | Processamento geral de tarefas. Prioridade à velocidade de resposta e à capacidade de processamento |
| CIP-5.5-MM | cip-5.5-mm | 800B · entrada 512K · saída 64K · multimodal | Análise de contextos longos e resolução de problemas complexos |
| Cosa-A | cosa-a | Síntese·clonagem·design·streaming de voz | Geração de voz com controle detalhado da síntese |
| Cosa-B | cosa-b | Síntese·clonagem·design·streaming de voz | Seleção de voz e geração de voz personalizada |
| Cosa ASR | cosa-asr | Reconhecimento de voz | Conversão da entrada de voz em texto |
| Cova | cova-1 | Exclusivo para OCR visual baseado em LLM | Extração de texto, layout e tabelas, além de descrição simples de imagens |
CIP
O CIP é responsável pela inteligência geral e pela automação de tarefas. Ele é composto pelo cip-5.5-im e pelo cip-5.5-mm, acessados por meio do gateway, e pelo cip-5.5-sm, implantado em servidores de borda e em ambientes on-premises.
cip-5.5-im e cip-5.5-mm
| Item | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Escala | 360B | 800B |
| Limite de entrada | 256K | 512K |
| Saída máxima | 64K | 64K |
| Formato de entrada | Texto e materiais visuais (documentos, imagens de tela, tabelas e gráficos) | Texto e materiais visuais (revisão integrada de código, documentos e materiais de tela) |
| Direção de uso | Processa tarefas diárias de conhecimento e desenvolvimento com foco na velocidade de resposta, eficiência de custos e capacidade de processamento. | Processa tarefas complexas que combinam e analisam diversos materiais e condições, conectando os resultados da análise ao trabalho prático. |
| Uso de entradas longas | Revisa vários documentos, arquivos de código e históricos de conversas em conjunto. | Lida com grandes volumes de materiais de referência e históricos de trabalho, executando tarefas de agente nas quais pesquisa, execução e verificação ocorrem em várias etapas. |
cip-5.5-im é adequado para tarefas com objetivos e escopo de trabalho claros. Exemplos representativos incluem extrair as informações necessárias dos materiais fornecidos, produzir resultados no formato especificado e modificar o código de acordo com os requisitos. O limite de saída de até 64K é útil para elaborar relatórios detalhados ou resultados compostos por várias partes.
- Assistência ao desenvolvimento: escrever funções e recursos, corrigir bugs de escopo bem definido e implementar de acordo com os padrões existentes.
- Geração de testes: elaborar rascunhos de testes e casos de validação com base nos requisitos e na implementação.
- Processamento de documentos: realizar resumos, classificações, extração de itens, conversão de formatos e elaboração de rascunhos.
- Análise multimodal: revisar imagens de telas e tabelas e gráficos de documentos junto com as explicações relevantes.
- Suporte interativo ao trabalho: responder a perguntas com base nos materiais de trabalho e produzir os resultados necessários.
- Processamento em massa: realizar resumos individuais de vários documentos, classificação de solicitações e transformação de dados.
- Subagente: executar subtarefas com limites claros, como explorar código, revisar arquivos específicos e organizar materiais.
Por exemplo, é usado para receber requisitos funcionais e código relacionado e elaborar uma proposta de alteração, testes e descrição das mudanças, ou para classificar documentos recebidos e criar resumos para os responsáveis.
cip-5.5-mm é adequado para tarefas que exigem compreender as relações entre as informações e manter a consistência de todo o trabalho. No desenvolvimento, ele revisa as conexões entre requisitos, design, implementação e testes; na análise de documentos, sintetiza as afirmações e evidências, diferenças e contradições de vários materiais.
- Implementação de recursos complexos: alterar código, testes e documentação em conjunto, considerando os contratos e o comportamento de vários módulos.
- Análise de grandes bases de código: revisar relações de chamada, fluxo de dados e escopo do impacto das alterações.
- Análise das causas de incidentes: comparar logs, configurações, código e resultados de execução para organizar hipóteses de causa e procedimentos de verificação.
- Suporte a design e tomada de decisões: estruturar requisitos e restrições e analisar o impacto das alternativas de implementação.
- Análise integrada de vários documentos: organizar, com foco nas evidências, semelhanças, diferenças e contradições entre relatórios e documentos técnicos.
- Revisão multimodal integrada: interpretar textos e materiais visuais em conjunto para analisar problemas e requisitos.
- Agente de várias etapas: usar em tarefas que envolvem investigação, planejamento, execução de ferramentas e revisão dos resultados.
- Redação de documentos especializados: elaborar relatórios técnicos, propostas de design e documentos de revisão detalhados que reflitam condições complexas e evidências.
Por exemplo, é usado para revisar em conjunto os códigos relacionados e os logs de erros ocorridos em vários serviços, ou em tarefas que vão desde a análise de requisitos de funcionalidades complexas até a implementação e a revisão dos resultados da validação.
cip-5.5-sm
O cip-5.5-sm realiza inferência local e automação de tarefas em servidores de edge e ambientes on-premises. Como o tamanho do modelo pode ser ajustado na faixa de 24B a 40B, é possível escolher uma configuração adequada aos recursos computacionais do equipamento de implantação e ao desempenho exigido no local. Como os dados são processados próximos ao ponto onde são gerados, ele é usado na integração com sistemas locais e no uso de dados internos. Ao configurar localmente os modelos e as ferramentas necessários, também pode ser operado em ambientes com conexão externa limitada.
Ele interpreta as informações geradas no local e as conecta aos procedimentos de processamento. Classifica logs e solicitações, extrai as informações necessárias dos dados e executa tarefas repetitivas usando ferramentas internas e scripts conectados.
- Processamento de eventos locais: classifica os logs dos equipamentos e as informações de status, selecionando os eventos que precisam de verificação.
- Pré-processamento de dados: extrai os itens principais dos registros de trabalho e realiza sua classificação, marcação e normalização.
- Roteamento de solicitações: encaminha as solicitações recebidas ao sistema responsável ou ao procedimento de processamento correspondente.
- Agente de tarefas locais: executa tarefas repetitivas consultando sistemas internos e executando scripts.
- Suporte a tarefas on-premises: responde a perguntas com base em materiais internos e organiza o conteúdo das tarefas.
- Suporte à análise posterior: seleciona os materiais que precisam de revisão adicional e organiza os pontos principais.
Por exemplo, é usado em um fluxo que classifica os logs operacionais no servidor de uma unidade, consulta o histórico relacionado e redige um resumo do incidente para os responsáveis.
Cosa
Cosa é uma família de produtos de voz que converte texto em fala, reconhece a fala de entrada como texto e permite registrar e reutilizar a voz desejada. É usada em orientações de serviço, produção de conteúdo, suporte à acessibilidade e interfaces de voz de agentes conversacionais.
A geração de voz é realizada pelo cosa-a e pelo cosa-b, enquanto o reconhecimento de voz é realizado pelo cosa-asr. cosa-a e cosa-b são modelos separados, cada um com sua própria lista de vozes e configurações de síntese, selecionados na mesma interface de serviço. Os recursos oferecidos em comum pelos dois modelos são os seguintes.
- Conversão de texto em fala: sintetiza o texto inserido usando a voz selecionada.
- Clonagem de voz: registra uma voz com base em uma gravação de referência para a qual você tem permissão de uso e sintetiza novas frases.
- Design de voz: cria e registra uma voz descrevendo as características desejadas.
- Reutilização de voz: usa a voz registrada em sínteses posteriores.
- Configurações de síntese: ajusta a velocidade da fala e o idioma, entre outros parâmetros.
- Transmissão em streaming: sintetiza o texto em unidades de frases assim que ele chega e transmite o áudio sequencialmente.
- Controle de reprodução: oferece suporte a pausar, retomar, interromper e inserir frases adicionais.
Com o uso da entrada progressiva de texto, é possível iniciar a reprodução de voz antes que toda a resposta seja concluída. Enquanto o CIP redige a resposta, você pode configurar um serviço em que cosa lê as frases prontas.
cosa-a
cosa-a oferece suporte à conversão de texto em fala, clonagem de voz, design de voz e saída em streaming. Além dos recursos básicos de seleção de voz, idioma e velocidade da fala, oferece controles adicionais, como configurações relacionadas ao número de etapas de síntese, à intensidade da orientação e ao comprimento da geração. É usado para ajustar as configurações durante a criação da voz e revisar os resultados, ou para aplicar várias configurações ao mesmo roteiro e escolher o resultado.
- Sintetiza orientações e notificações para aplicativos, quiosques e sistemas corporativos.
- Cria materiais educacionais e manuais de uso em áudio.
- Produz narração para conteúdos de vídeo e áudio.
- Cria conteúdos recorrentes usando a voz registrada.
- É usado para a saída de voz em streaming de agentes conversacionais.
- É usado na criação de voz para ajustar configurações detalhadas de síntese.
cosa-b
cosa-b oferece suporte à seleção de vozes predefinidas, ao design de voz baseado em descrição, à clonagem baseada em voz de referência e à saída em streaming. Você pode escolher uma voz na lista de vozes própria ou registrar uma nova voz para usar no serviço.
A clonagem de voz usa uma gravação de referência e o texto correspondente a ela. Também oferece suporte a um fluxo que gera o texto de referência por reconhecimento de voz durante o registro, e a voz registrada é reutilizada em sínteses posteriores.
- Configura a persona vocal de serviços e personagens.
- Cria vozes personalizadas a partir de uma descrição ou gravação de referência.
- Sintetiza orientações de marca, falas de personagens e narrações de conteúdo.
- É usado para respostas de voz de agentes conversacionais.
- Sintetiza mensagens de orientação e roteiros que mudam usando a mesma voz.
Ao escolher entre cosa-a e cosa-b, considere a voz desejada, o resultado real da síntese e os itens de controle necessários.
| Item | cosa-a | cosa-b |
|---|---|---|
| Configurações de síntese | Configurações relacionadas ao número de etapas de síntese, à intensidade da orientação e ao comprimento da geração, além da voz, do idioma e da velocidade de fala | Configurações comuns, como a velocidade de fala e o idioma |
| Entrada para clonagem | Gravação de referência para a qual você tem autorização de uso | Gravação de referência e texto correspondente. Durante o processo de registro, é possível gerar o texto de referência por reconhecimento de voz |
| Função | Geração de voz com controle detalhado da síntese | Seleção de voz e geração de voz personalizada |
cosa-asr
cosa-asr converte a voz de entrada em texto. Ele documenta materiais gravados ou transforma solicitações recebidas por voz em entradas que os sistemas de negócios subsequentes podem processar.
- Transcreve memorandos de voz e materiais gravados.
- Converte perguntas e solicitações de trabalho baseadas em voz em entradas.
- Gera textos de referência para clonagem de voz.
- É usado em processos que continuam, após a transcrição, com resumo, classificação e busca.
Ao enviar o resultado da transcrição ao CIP, é possível prosseguir com o resumo do conteúdo, a classificação das solicitações e a elaboração de rascunhos de trabalho. Ao sintetizar os resultados do processamento com cosa-a ou cosa-b, você obtém um serviço de negócios com entrada e saída de voz.
Cova
cova-1 é um modelo especializado em OCR visual baseado em LLM. Ele reconhece texto em documentos e imagens, extrai o layout e a estrutura das tabelas e fornece descrições simples dos elementos visuais.
Converte documentos visualizados por pessoas em um formato adequado para uso por agentes e sistemas de negócios. O corpo do texto e as tabelas são extraídos como conteúdo estruturado, enquanto as imagens incluídas no documento são transmitidas como descrições curtas. Assim, os agentes subsequentes podem compreender tanto o conteúdo do documento quanto o contexto visual. Ao estruturar um fluxo que primeiro compreende o material com o texto e as descrições extraídos e revisa adicionalmente apenas os originais que exigem confirmação detalhada, é possível reduzir a quantidade de vezes que as imagens originais são inseridas e economizar tokens de contexto.
| Função | Descrição |
|---|---|
| Reconhecimento de texto | Extrai texto de documentos digitalizados ou fotografados. |
| Interpretação do layout | Divide o conteúdo em blocos considerando a disposição do documento. |
| Fornecimento de informações de localização | Fornece a localização dos blocos reconhecidos para associar os resultados extraídos ao conteúdo original. |
| Extração da estrutura de tabelas | Estrutura o conteúdo das tabelas para uso em pesquisas e processamento de dados. |
| Descrição simples de imagens | Descreve brevemente o conteúdo de imagens e elementos visuais, fornecendo pistas para a interpretação pelo agente. |
| Otimização de contexto | Reduz a necessidade de inserir repetidamente a imagem original ao transmitir informações com foco no texto, na estrutura e na descrição da imagem. |
| Análise detalhada seletiva | Ajuda o agente a decidir quais imagens originais devem ser verificadas adicionalmente. |
| Conversão de formato de documentos | Organiza os resultados do reconhecimento em HTML ou Markdown. |
- Digitalização de documentos: converte documentos em papel e materiais digitalizados em materiais baseados em texto.
- Recebimento de documentos comerciais: extrai conteúdo de formulários de solicitação, documentos comprobatórios e relatórios.
- Processamento de dados tabulares: utiliza as tabelas incluídas nos documentos no processamento posterior de dados.
- Pré-processamento para pesquisa de conhecimento: converte imagens de documentos e materiais visuais em texto e estruturas pesquisáveis.
- Automação da revisão de documentos: envia os resultados extraídos ao CIP para verificar itens, resumir e comparar materiais.
- Otimização de entradas para agentes: organiza o corpo, as tabelas e as descrições de imagens de documentos extensos para transmitir apenas as informações necessárias.
Por exemplo, ao extrair o corpo e as tabelas de um relatório, descreve um gráfico inserido como um gráfico que mostra a tendência da receita por trimestre. Com essa descrição, o agente identifica a existência e a finalidade do gráfico e, quando precisa de valores ou tendências precisos, verifica adicionalmente o original correspondente.
Conexão entre produtos
Ao conectar os produtos, é possível configurar o seguinte fluxo.
- Operações baseadas em documentos: Cova extrai o corpo, as tabelas e as descrições de imagens; o CIP verifica seletivamente os originais necessários para realizar análises e processar tarefas; e Cosa transmite os resultados por voz.
- Operações baseadas em voz: Cosa ASR converte solicitações de voz em texto, e cosa-a ou cosa-b lê as respostas processadas pelo CIP.
- Automação em campo: cip-5.5-sm classifica os dados do local e executa operações locais, encaminhando para cip-5.5-im ou cip-5.5-mm os materiais que exigem análises integradas adicionais.
Chamadas permitidas no gateway
Os planos do gateway determinam as chamadas permitidas para cada modelo. A tabela abaixo mostra os escopos disponibilizados pelos planos LLM_FREE, TTS_FREE e STT_FREE, que são aplicados automaticamente sem necessidade de solicitação. Ela não inclui modelos disponibilizados por outras rotas.
| ID do modelo | Chamadas permitidas | Plano aplicável |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm e cova-1 não estão nesta tabela de planos. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm e ivy-4-mm nesta tabela são IDs de modelos que não estão incluídos nas descrições dos produtos acima. O documento Como fazer chamadas de API informa a qual caminho corresponde cada chave de chamada.
