Developer guide

Modelo

Resumo dos modelos

Os modelos CLEVI divídense en tres familias de produtos: CIP, responsable da intelixencia xeral e da automatización do traballo; Cosa, responsable da xeración e do recoñecemento de voz; e Cova, responsable da extracción de información de documentos e imaxes. Cada produto pode utilizarse de forma independente ou conectarse para ofrecer servizos que abranguen o recoñecemento de documentos, a análise, a execución de tarefas e a orientación por voz.

ProdutoID do modeloEspecificacións principaisFunción principal
CIP-5.5-SMcip-5.5-sm24B~40B axustableAutomatización de tarefas no servidor de edge e local
CIP-5.5-IMcip-5.5-im360B · Entrada 256K · Saída 64K · MultimodalProcesamento xeral de tarefas. Prioridade á velocidade de resposta e ao rendemento
CIP-5.5-MMcip-5.5-mm800B · Entrada 512K · Saída 64K · MultimodalAnálise de contextos longos e resolución de problemas complexos
Cosa-Acosa-aSíntese, clonación, deseño e streaming de vozXeración de voz con control detallado da síntese
Cosa-Bcosa-bSíntese, clonación, deseño e streaming de vozSelección de voces e xeración de voz personalizada
Cosa ASRcosa-asrRecoñecemento de vozConversión da entrada de voz en texto
Covacova-1Dedicado ao OCR visual baseado en LLMExtracción de texto, deseño e táboas, e descricións sinxelas de imaxes

CIP

CIP é responsable da intelixencia xeral e da automatización do traballo. Está composto por cip-5.5-im e cip-5.5-mm, aos que se accede a través da pasarela, e por cip-5.5-sm, que se desprega en servidores de edge e en instalacións locais.

cip-5.5-im e cip-5.5-mm

Elementocip-5.5-imcip-5.5-mm
Escala360B800B
Límite de entrada256K512K
Saída máxima64K64K
Formatos de entradaTexto e materiais visuais (documentos, imaxes de pantalla, táboas e gráficos)Texto e materiais visuais (revisión integrada de código, documentos e materiais de pantalla)
Orientación do deseñoProcesa tarefas cotiás de coñecemento e traballos de desenvolvemento, centrándose na velocidade de resposta, na eficiencia de custos e no rendemento.Procesa tarefas complexas que integran varios materiais e condicións e conectan os resultados da análise co traballo real.
Uso de entradas longasRevisa conxuntamente varios documentos, ficheiros de código e históricos de conversas.Xestiona conxuntamente unha gran cantidade de materiais de referencia e históricos de tarefas, e realiza tarefas de axente nas que a investigación, a execución e a verificación se desenvolven en varias etapas.

cip-5.5-im é adecuado para tarefas cun obxectivo e un ámbito de traballo claros. Entre os usos representativos están extraer a información necesaria dos materiais proporcionados, redactar resultados no formato especificado e modificar código conforme aos requisitos. A saída máxima de 64K úsase para redactar informes detallados ou resultados compostos por varias partes.

  • Asistencia ao desenvolvemento: escribe funcións e funcionalidades, corrixe erros cun ámbito claro e implementa conforme aos patróns existentes.
  • Xeración de probas: redacta borradores de probas e casos de validación baseándose nos requisitos e na implementación.
  • Tratamento de documentos: encárgase de resumir, clasificar, extraer elementos, converter formatos e redactar borradores.
  • Análise multimodal: revisa imaxes de pantallas e táboas e gráficos de documentos xunto coas explicacións relacionadas.
  • Asistencia interactiva ao traballo: responde preguntas baseándose nos materiais de traballo e redacta os resultados necesarios.
  • Procesamento masivo: úsase para resumir individualmente numerosos documentos, clasificar solicitudes e transformar datos.
  • Subaxente: encárgase de subtarefas cunha delimitación clara, como explorar código, revisar ficheiros específicos e organizar materiais.

Por exemplo, úsase para recibir requisitos funcionais e código relacionado e redactar propostas de modificación, probas e explicacións dos cambios, ou para clasificar documentos recibidos e crear resumos para os responsables.

cip-5.5-mm é adecuado para tarefas que esixen comprender as relacións entre a información e manter a coherencia do traballo no seu conxunto. No desenvolvemento, revisa as conexións entre requisitos, deseño, implementación e probas; na análise documental, sintetiza as afirmacións e evidencias, así como as diferenzas e contradicións, de varios materiais.

  • Implementación de funcionalidades complexas: modifica conxuntamente o código, as probas e a documentación tendo en conta os contratos e o comportamento de varios módulos.
  • Análise de código a grande escala: revisa as relacións de chamadas, o fluxo de datos e o alcance do impacto dos cambios.
  • Análise das causas de incidentes: contrasta os rexistros, a configuración, o código e os resultados de execución para organizar hipóteses sobre as causas e os procedementos de verificación.
  • Apoio ao deseño e á toma de decisións: estrutura os requisitos e as restricións e analiza o impacto das alternativas de implementación.
  • Análise sintética de varios documentos: organiza, baseándose nas evidencias, os puntos en común, as diferenzas e as contradicións de informes e documentos técnicos.
  • Revisión integradora multimodal: interpreta conxuntamente textos e materiais visuais para analizar problemas e requisitos.
  • Axente de varias etapas: úsase en tarefas que inclúen investigación, planificación, execución de ferramentas e revisión dos resultados.
  • Redacción de documentos especializados: redacta informes técnicos, propostas de deseño e documentos de revisión detallados que reflicten condicións complexas e as súas evidencias.

Por exemplo, úsase para revisar conxuntamente os códigos relacionados e os rexistros dos erros producidos en varios servizos, ou para tarefas que abranguen desde a análise dos requisitos dunha función complexa ata a implementación e a revisión dos resultados da validación.

cip-5.5-sm

cip-5.5-sm realiza inferencia local e automatización de tarefas en servidores edge e contornos on-premises. Como o tamaño do modelo se pode axustar no intervalo de 24B~40B, a configuración pódese escoller de acordo cos recursos de computación do equipamento de despregamento e co rendemento necesario no lugar de operación. Ao procesar os datos preto do punto no que se xeran, úsase para integrar sistemas locais e aproveitar datos internos; se os modelos e as ferramentas necesarios se configuran localmente, pode funcionar mesmo en contornos con conexión externa limitada.

Encárgase de interpretar a información xerada no lugar de operación e conectala cos procedementos de procesamento. Clasifica os rexistros e as solicitudes, extrae a información necesaria dos datos e realiza tarefas repetitivas mediante ferramentas internas e scripts conectados.

  • Procesamento de eventos locais: clasifica os rexistros dos equipos e a información de estado, e selecciona os eventos que requiren comprobación.
  • Preprocesamento de datos: extrae os elementos clave dos rexistros de traballo e clasifícaos, etiquétaos e normalízaos.
  • Encamiñamento de solicitudes: transmite as solicitudes recibidas ao sistema responsable ou ao procedemento de procesamento correspondente.
  • Axente de tarefas local: realiza tarefas repetitivas consultando sistemas internos e executando scripts.
  • Asistencia para tarefas on-premises: responde preguntas baseándose en materiais internos e organiza o contido do traballo.
  • Apoio á análise posterior: selecciona os materiais que requiren revisión adicional e resume o contido clave.

Por exemplo, úsase nun fluxo que clasifica os rexistros operativos nun servidor do centro de traballo, consulta o historial relacionado e redacta un resumo do caso para a persoa responsable.

Cosa

Cosa é unha familia de produtos de voz que converte texto en voz, recoñece a voz de entrada como texto e permite rexistrar e reutilizar a voz desexada. Úsase para a orientación sobre servizos, a creación de contido, o apoio á accesibilidade e as interfaces de voz de axentes conversacionais.

cosa-a e cosa-b encárganse da xeración de voz, mentres que cosa-asr se encarga do recoñecemento de voz. cosa-a e cosa-b son modelos independentes que ofrecen as súas propias listas de voces e configuracións de síntese, e pódense seleccionar desde a mesma interface de servizo. As funcións que ofrecen en común os dous modelos son as seguintes.

  • Texto a voz: sintetiza o texto introducido coa voz seleccionada.
  • Clonación de voz: rexistra unha voz a partir dunha gravación de referencia para a que se ten permiso de uso e sintetiza novas frases.
  • Deseño de voz: crea e rexistra unha voz describindo as características desexadas.
  • Reutilización de voz: usa a voz rexistrada en sínteses posteriores.
  • Configuración da síntese: axusta a velocidade de fala, o idioma e outros parámetros.
  • Entrega en streaming: sintetiza por fragmentos a medida que chega o texto e entrega o audio de forma secuencial.
  • Control da reprodución: admite pausar, retomar, deter e introducir frases adicionais.

A entrada progresiva de texto permite iniciar a reprodución de voz antes de completar toda a resposta. Mentres CIP redacta a resposta, pódese configurar un servizo no que cosa lea os fragmentos que xa estean preparados.

cosa-a

cosa-a admite texto a voz, clonación de voz, deseño de voz e saída en streaming. Ademais das funcións básicas para seleccionar a voz, o idioma e a velocidade de fala, ofrece opcións de control adicionais, como a configuración do número de pasos de síntese, a intensidade da guía e a lonxitude da xeración. Úsase para axustar a configuración durante o proceso de creación da voz e revisar os resultados, ou para aplicar varias configuracións ao mesmo guión e escoller o resultado.

  • Sintetiza indicacións e notificacións para aplicacións, quioscos e sistemas empresariais.
  • Crea materiais formativos e manuais de uso en formato de voz.
  • Produce narracións para contido de vídeo e audio.
  • Crea contido recorrente coa voz rexistrada.
  • Úsase para a saída de voz en streaming de axentes conversacionais.
  • Úsase para a creación de voz axustando configuracións detalladas de síntese.

cosa-b

cosa-b admite a selección de voces predefinidas, o deseño de voz baseado en descricións, a clonación baseada en voces de referencia e a saída en streaming. Permite escoller unha voz da súa propia lista de voces ou rexistrar unha nova voz para usala no servizo.

A clonación de voz utiliza unha gravación de referencia e o texto correspondente. Tamén admite un fluxo no que se xera o texto de referencia mediante recoñecemento de voz durante o proceso de rexistro, e a voz rexistrada reutilízase en sínteses posteriores.

  • Configura a personalidade vocal de servizos e personaxes.
  • Crea voces personalizadas a partir dunha descrición ou dunha gravación de referencia.
  • Sintetiza indicacións de marca, diálogos de personaxes e narracións de contido.
  • Úsase para as respostas de voz de axentes conversacionais.
  • Sintetiza mensaxes de indicación e guións que cambian mantendo a mesma voz.

Ao elixir entre cosa-a e cosa-b, tome como referencia a voz que desexa, o resultado real da síntese e os elementos de control que necesita.

Elementocosa-acosa-b
Configuración da sínteseAdemais da voz, o idioma e a velocidade de fala, ofrece configuracións relacionadas co número de pasos de síntese, a intensidade da guía e a lonxitude da xeraciónConfiguracións comúns, como a velocidade de fala e o idioma
Entrada para a clonaciónGravación de referencia para a que dispón de autorización de usoGravación de referencia e texto correspondente. Durante o proceso de rexistro, é posible xerar o texto de referencia mediante recoñecemento de voz
FunciónXeración de voz mediante controis detallados da sínteseSelección de voz e xeración de voz personalizada

cosa-asr

cosa-asr converte a voz de entrada en texto. Documenta gravacións ou transforma as solicitudes recibidas por voz en entradas que os sistemas posteriores de xestión poden procesar.

  • Transcribe notas de voz e gravacións.
  • Converte preguntas e solicitudes de traballo baseadas na voz en entradas.
  • Xera texto de referencia para a clonación de voz.
  • Utilízao para procesos posteriores á transcrición, como o resumo, a clasificación e a busca.

Ao transmitir os resultados da transcrición a CIP, o proceso continúa co resumo do contido, a clasificación das solicitudes e a elaboración de borradores de traballo. Se os resultados do procesamento se sintetizan con cosa-a ou cosa-b, obtense un servizo de xestión con entrada e saída de voz.

Cova

cova-1 é un modelo especializado en OCR visual baseado en LLM. Recoñece texto en documentos e imaxes, extrae o deseño e a estrutura das táboas e ofrece descricións sinxelas dos elementos visuais.

Converte os documentos que ven as persoas nun formato axeitado para o uso por parte de axentes e sistemas de xestión. Extrae o corpo do texto e as táboas como contido estruturado e transmite as imaxes incluídas nos documentos mediante descricións breves, permitindo que os axentes posteriores comprendan tanto o contido do documento como o contexto visual. Se configura un fluxo no que primeiro se analiza o material a partir do texto e as descricións extraídos e só se revisan adicionalmente os orixinais que requiren unha comprobación detallada, pode reducir a cantidade de veces que se introducen as imaxes orixinais e aforrar tokens de contexto.

FunciónDescrición
Recoñecemento de textoExtrae texto de documentos escaneados ou fotografados.
Interpretación do deseñoDivide o contido en bloques tendo en conta a disposición do documento.
Provisión de información de localizaciónProporciona a localización dos bloques recoñecidos para vincular os resultados extraídos co documento orixinal.
Extracción da estrutura das táboasEstrutura o contido das táboas para utilizalo en buscas e no procesamento de datos.
Descrición breve de imaxesDescribe brevemente o contido das imaxes e dos elementos visuais para proporcionar pistas de interpretación ao axente.
Optimización do contextoReduce a introdución repetida da imaxe orixinal transmitindo a información centrada no texto, a estrutura e as descricións das imaxes.
Análise detallada selectivaAxuda o axente a determinar que imaxes orixinais debe revisar adicionalmente.
Conversión do formato dos documentosOrganiza os resultados do recoñecemento en HTML ou Markdown.
  • Dixitalización de documentos: converte documentos en papel e materiais escaneados en materiais baseados en texto.
  • Recepción de documentos de traballo: extrae contido de formularios de solicitude, documentos xustificativos e informes.
  • Procesamento de datos de táboas: utiliza as táboas incluídas nos documentos para o procesamento posterior dos datos.
  • Preprocesamento para a busca de coñecemento: converte imaxes de documentos e materiais visuais en texto e estruturas que se poden buscar.
  • Automatización da revisión de documentos: transmite os resultados extraídos a CIP para comprobar elementos, resumir e comparar materiais.
  • Optimización das entradas do axente: organiza o corpo, as táboas e as descricións de imaxes de documentos longos para transmitir só a información necesaria.

Por exemplo, extrae o corpo e as táboas dun informe e describe un gráfico inserido como un gráfico que mostra a tendencia das vendas por trimestre. Coa descrición, o axente identifica a existencia e o propósito do gráfico e, cando precisa cifras ou tendencias exactas, revisa adicionalmente o orixinal correspondente.

Conexión de produtos

Ao conectar os produtos, pódese configurar o seguinte fluxo.

  • Traballo baseado en documentos: Cova extrae o corpo, as táboas e as descricións de imaxes; CIP selecciona e revisa os orixinais necesarios para realizar análises e procesar o traballo; e Cosa transmite os resultados por voz.
  • Traballo baseado na voz: Cosa ASR converte as solicitudes de voz en texto, e cosa-a ou cosa-b le en voz alta as respostas procesadas por CIP.
  • Automatización no lugar de traballo: cip-5.5-sm clasifica os datos do lugar de traballo e realiza tarefas locais, e transfire a cip-5.5-im ou cip-5.5-mm os materiais que precisan de análise integral adicional.

Chamadas permitidas na pasarela

Os plans da pasarela determinan as chamadas permitidas para cada modelo. A táboa seguinte mostra o alcance que habilitan os plans LLM_FREE, TTS_FREE e STT_FREE, que se aplican automaticamente sen necesidade de solicitude. Non inclúe os modelos habilitados por outras vías.

ID do modeloChamadas permitidasPlan de referencia
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm e cova-1 non están nesta táboa de plans. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm e ivy-4-mm que aparecen na táboa son ID de modelos que non están incluídos nas descricións dos produtos anteriores. A documentación sobre as chamadas á API indica a que ruta corresponde a clave de chamada.

CLEVI

Idioma e rexión

As linguas traducidas automaticamente están marcadas. A dispoñibilidade segue o paquete do sitio publicado.

136 idiomas

Recomendado

1

Asia Oriental

7

Sueste Asiático

11

Asia Meridional

18

Asia Central

5

Oriente Medio e o Cáucaso

10

Europa Occidental e Europa Meridional

16

Reino Unido e Irlanda

4

Europa Setentrional

10

Europa Central e os Balcáns

14

Europa do Leste

5

África Oriental

8

África Occidental e África Central

9

África Meridional

8

América

5

Oceanía

5