Developer guide
Modelo
Resumo dos modelos
Os modelos CLEVI divídense en tres familias de produtos: CIP, responsable da intelixencia xeral e da automatización do traballo; Cosa, responsable da xeración e do recoñecemento de voz; e Cova, responsable da extracción de información de documentos e imaxes. Cada produto pode utilizarse de forma independente ou conectarse para ofrecer servizos que abranguen o recoñecemento de documentos, a análise, a execución de tarefas e a orientación por voz.
| Produto | ID do modelo | Especificacións principais | Función principal |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B axustable | Automatización de tarefas no servidor de edge e local |
| CIP-5.5-IM | cip-5.5-im | 360B · Entrada 256K · Saída 64K · Multimodal | Procesamento xeral de tarefas. Prioridade á velocidade de resposta e ao rendemento |
| CIP-5.5-MM | cip-5.5-mm | 800B · Entrada 512K · Saída 64K · Multimodal | Análise de contextos longos e resolución de problemas complexos |
| Cosa-A | cosa-a | Síntese, clonación, deseño e streaming de voz | Xeración de voz con control detallado da síntese |
| Cosa-B | cosa-b | Síntese, clonación, deseño e streaming de voz | Selección de voces e xeración de voz personalizada |
| Cosa ASR | cosa-asr | Recoñecemento de voz | Conversión da entrada de voz en texto |
| Cova | cova-1 | Dedicado ao OCR visual baseado en LLM | Extracción de texto, deseño e táboas, e descricións sinxelas de imaxes |
CIP
CIP é responsable da intelixencia xeral e da automatización do traballo. Está composto por cip-5.5-im e cip-5.5-mm, aos que se accede a través da pasarela, e por cip-5.5-sm, que se desprega en servidores de edge e en instalacións locais.
cip-5.5-im e cip-5.5-mm
| Elemento | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Escala | 360B | 800B |
| Límite de entrada | 256K | 512K |
| Saída máxima | 64K | 64K |
| Formatos de entrada | Texto e materiais visuais (documentos, imaxes de pantalla, táboas e gráficos) | Texto e materiais visuais (revisión integrada de código, documentos e materiais de pantalla) |
| Orientación do deseño | Procesa tarefas cotiás de coñecemento e traballos de desenvolvemento, centrándose na velocidade de resposta, na eficiencia de custos e no rendemento. | Procesa tarefas complexas que integran varios materiais e condicións e conectan os resultados da análise co traballo real. |
| Uso de entradas longas | Revisa conxuntamente varios documentos, ficheiros de código e históricos de conversas. | Xestiona conxuntamente unha gran cantidade de materiais de referencia e históricos de tarefas, e realiza tarefas de axente nas que a investigación, a execución e a verificación se desenvolven en varias etapas. |
cip-5.5-im é adecuado para tarefas cun obxectivo e un ámbito de traballo claros. Entre os usos representativos están extraer a información necesaria dos materiais proporcionados, redactar resultados no formato especificado e modificar código conforme aos requisitos. A saída máxima de 64K úsase para redactar informes detallados ou resultados compostos por varias partes.
- Asistencia ao desenvolvemento: escribe funcións e funcionalidades, corrixe erros cun ámbito claro e implementa conforme aos patróns existentes.
- Xeración de probas: redacta borradores de probas e casos de validación baseándose nos requisitos e na implementación.
- Tratamento de documentos: encárgase de resumir, clasificar, extraer elementos, converter formatos e redactar borradores.
- Análise multimodal: revisa imaxes de pantallas e táboas e gráficos de documentos xunto coas explicacións relacionadas.
- Asistencia interactiva ao traballo: responde preguntas baseándose nos materiais de traballo e redacta os resultados necesarios.
- Procesamento masivo: úsase para resumir individualmente numerosos documentos, clasificar solicitudes e transformar datos.
- Subaxente: encárgase de subtarefas cunha delimitación clara, como explorar código, revisar ficheiros específicos e organizar materiais.
Por exemplo, úsase para recibir requisitos funcionais e código relacionado e redactar propostas de modificación, probas e explicacións dos cambios, ou para clasificar documentos recibidos e crear resumos para os responsables.
cip-5.5-mm é adecuado para tarefas que esixen comprender as relacións entre a información e manter a coherencia do traballo no seu conxunto. No desenvolvemento, revisa as conexións entre requisitos, deseño, implementación e probas; na análise documental, sintetiza as afirmacións e evidencias, así como as diferenzas e contradicións, de varios materiais.
- Implementación de funcionalidades complexas: modifica conxuntamente o código, as probas e a documentación tendo en conta os contratos e o comportamento de varios módulos.
- Análise de código a grande escala: revisa as relacións de chamadas, o fluxo de datos e o alcance do impacto dos cambios.
- Análise das causas de incidentes: contrasta os rexistros, a configuración, o código e os resultados de execución para organizar hipóteses sobre as causas e os procedementos de verificación.
- Apoio ao deseño e á toma de decisións: estrutura os requisitos e as restricións e analiza o impacto das alternativas de implementación.
- Análise sintética de varios documentos: organiza, baseándose nas evidencias, os puntos en común, as diferenzas e as contradicións de informes e documentos técnicos.
- Revisión integradora multimodal: interpreta conxuntamente textos e materiais visuais para analizar problemas e requisitos.
- Axente de varias etapas: úsase en tarefas que inclúen investigación, planificación, execución de ferramentas e revisión dos resultados.
- Redacción de documentos especializados: redacta informes técnicos, propostas de deseño e documentos de revisión detallados que reflicten condicións complexas e as súas evidencias.
Por exemplo, úsase para revisar conxuntamente os códigos relacionados e os rexistros dos erros producidos en varios servizos, ou para tarefas que abranguen desde a análise dos requisitos dunha función complexa ata a implementación e a revisión dos resultados da validación.
cip-5.5-sm
cip-5.5-sm realiza inferencia local e automatización de tarefas en servidores edge e contornos on-premises. Como o tamaño do modelo se pode axustar no intervalo de 24B~40B, a configuración pódese escoller de acordo cos recursos de computación do equipamento de despregamento e co rendemento necesario no lugar de operación. Ao procesar os datos preto do punto no que se xeran, úsase para integrar sistemas locais e aproveitar datos internos; se os modelos e as ferramentas necesarios se configuran localmente, pode funcionar mesmo en contornos con conexión externa limitada.
Encárgase de interpretar a información xerada no lugar de operación e conectala cos procedementos de procesamento. Clasifica os rexistros e as solicitudes, extrae a información necesaria dos datos e realiza tarefas repetitivas mediante ferramentas internas e scripts conectados.
- Procesamento de eventos locais: clasifica os rexistros dos equipos e a información de estado, e selecciona os eventos que requiren comprobación.
- Preprocesamento de datos: extrae os elementos clave dos rexistros de traballo e clasifícaos, etiquétaos e normalízaos.
- Encamiñamento de solicitudes: transmite as solicitudes recibidas ao sistema responsable ou ao procedemento de procesamento correspondente.
- Axente de tarefas local: realiza tarefas repetitivas consultando sistemas internos e executando scripts.
- Asistencia para tarefas on-premises: responde preguntas baseándose en materiais internos e organiza o contido do traballo.
- Apoio á análise posterior: selecciona os materiais que requiren revisión adicional e resume o contido clave.
Por exemplo, úsase nun fluxo que clasifica os rexistros operativos nun servidor do centro de traballo, consulta o historial relacionado e redacta un resumo do caso para a persoa responsable.
Cosa
Cosa é unha familia de produtos de voz que converte texto en voz, recoñece a voz de entrada como texto e permite rexistrar e reutilizar a voz desexada. Úsase para a orientación sobre servizos, a creación de contido, o apoio á accesibilidade e as interfaces de voz de axentes conversacionais.
cosa-a e cosa-b encárganse da xeración de voz, mentres que cosa-asr se encarga do recoñecemento de voz. cosa-a e cosa-b son modelos independentes que ofrecen as súas propias listas de voces e configuracións de síntese, e pódense seleccionar desde a mesma interface de servizo. As funcións que ofrecen en común os dous modelos son as seguintes.
- Texto a voz: sintetiza o texto introducido coa voz seleccionada.
- Clonación de voz: rexistra unha voz a partir dunha gravación de referencia para a que se ten permiso de uso e sintetiza novas frases.
- Deseño de voz: crea e rexistra unha voz describindo as características desexadas.
- Reutilización de voz: usa a voz rexistrada en sínteses posteriores.
- Configuración da síntese: axusta a velocidade de fala, o idioma e outros parámetros.
- Entrega en streaming: sintetiza por fragmentos a medida que chega o texto e entrega o audio de forma secuencial.
- Control da reprodución: admite pausar, retomar, deter e introducir frases adicionais.
A entrada progresiva de texto permite iniciar a reprodución de voz antes de completar toda a resposta. Mentres CIP redacta a resposta, pódese configurar un servizo no que cosa lea os fragmentos que xa estean preparados.
cosa-a
cosa-a admite texto a voz, clonación de voz, deseño de voz e saída en streaming. Ademais das funcións básicas para seleccionar a voz, o idioma e a velocidade de fala, ofrece opcións de control adicionais, como a configuración do número de pasos de síntese, a intensidade da guía e a lonxitude da xeración. Úsase para axustar a configuración durante o proceso de creación da voz e revisar os resultados, ou para aplicar varias configuracións ao mesmo guión e escoller o resultado.
- Sintetiza indicacións e notificacións para aplicacións, quioscos e sistemas empresariais.
- Crea materiais formativos e manuais de uso en formato de voz.
- Produce narracións para contido de vídeo e audio.
- Crea contido recorrente coa voz rexistrada.
- Úsase para a saída de voz en streaming de axentes conversacionais.
- Úsase para a creación de voz axustando configuracións detalladas de síntese.
cosa-b
cosa-b admite a selección de voces predefinidas, o deseño de voz baseado en descricións, a clonación baseada en voces de referencia e a saída en streaming. Permite escoller unha voz da súa propia lista de voces ou rexistrar unha nova voz para usala no servizo.
A clonación de voz utiliza unha gravación de referencia e o texto correspondente. Tamén admite un fluxo no que se xera o texto de referencia mediante recoñecemento de voz durante o proceso de rexistro, e a voz rexistrada reutilízase en sínteses posteriores.
- Configura a personalidade vocal de servizos e personaxes.
- Crea voces personalizadas a partir dunha descrición ou dunha gravación de referencia.
- Sintetiza indicacións de marca, diálogos de personaxes e narracións de contido.
- Úsase para as respostas de voz de axentes conversacionais.
- Sintetiza mensaxes de indicación e guións que cambian mantendo a mesma voz.
Ao elixir entre cosa-a e cosa-b, tome como referencia a voz que desexa, o resultado real da síntese e os elementos de control que necesita.
| Elemento | cosa-a | cosa-b |
|---|---|---|
| Configuración da síntese | Ademais da voz, o idioma e a velocidade de fala, ofrece configuracións relacionadas co número de pasos de síntese, a intensidade da guía e a lonxitude da xeración | Configuracións comúns, como a velocidade de fala e o idioma |
| Entrada para a clonación | Gravación de referencia para a que dispón de autorización de uso | Gravación de referencia e texto correspondente. Durante o proceso de rexistro, é posible xerar o texto de referencia mediante recoñecemento de voz |
| Función | Xeración de voz mediante controis detallados da síntese | Selección de voz e xeración de voz personalizada |
cosa-asr
cosa-asr converte a voz de entrada en texto. Documenta gravacións ou transforma as solicitudes recibidas por voz en entradas que os sistemas posteriores de xestión poden procesar.
- Transcribe notas de voz e gravacións.
- Converte preguntas e solicitudes de traballo baseadas na voz en entradas.
- Xera texto de referencia para a clonación de voz.
- Utilízao para procesos posteriores á transcrición, como o resumo, a clasificación e a busca.
Ao transmitir os resultados da transcrición a CIP, o proceso continúa co resumo do contido, a clasificación das solicitudes e a elaboración de borradores de traballo. Se os resultados do procesamento se sintetizan con cosa-a ou cosa-b, obtense un servizo de xestión con entrada e saída de voz.
Cova
cova-1 é un modelo especializado en OCR visual baseado en LLM. Recoñece texto en documentos e imaxes, extrae o deseño e a estrutura das táboas e ofrece descricións sinxelas dos elementos visuais.
Converte os documentos que ven as persoas nun formato axeitado para o uso por parte de axentes e sistemas de xestión. Extrae o corpo do texto e as táboas como contido estruturado e transmite as imaxes incluídas nos documentos mediante descricións breves, permitindo que os axentes posteriores comprendan tanto o contido do documento como o contexto visual. Se configura un fluxo no que primeiro se analiza o material a partir do texto e as descricións extraídos e só se revisan adicionalmente os orixinais que requiren unha comprobación detallada, pode reducir a cantidade de veces que se introducen as imaxes orixinais e aforrar tokens de contexto.
| Función | Descrición |
|---|---|
| Recoñecemento de texto | Extrae texto de documentos escaneados ou fotografados. |
| Interpretación do deseño | Divide o contido en bloques tendo en conta a disposición do documento. |
| Provisión de información de localización | Proporciona a localización dos bloques recoñecidos para vincular os resultados extraídos co documento orixinal. |
| Extracción da estrutura das táboas | Estrutura o contido das táboas para utilizalo en buscas e no procesamento de datos. |
| Descrición breve de imaxes | Describe brevemente o contido das imaxes e dos elementos visuais para proporcionar pistas de interpretación ao axente. |
| Optimización do contexto | Reduce a introdución repetida da imaxe orixinal transmitindo a información centrada no texto, a estrutura e as descricións das imaxes. |
| Análise detallada selectiva | Axuda o axente a determinar que imaxes orixinais debe revisar adicionalmente. |
| Conversión do formato dos documentos | Organiza os resultados do recoñecemento en HTML ou Markdown. |
- Dixitalización de documentos: converte documentos en papel e materiais escaneados en materiais baseados en texto.
- Recepción de documentos de traballo: extrae contido de formularios de solicitude, documentos xustificativos e informes.
- Procesamento de datos de táboas: utiliza as táboas incluídas nos documentos para o procesamento posterior dos datos.
- Preprocesamento para a busca de coñecemento: converte imaxes de documentos e materiais visuais en texto e estruturas que se poden buscar.
- Automatización da revisión de documentos: transmite os resultados extraídos a CIP para comprobar elementos, resumir e comparar materiais.
- Optimización das entradas do axente: organiza o corpo, as táboas e as descricións de imaxes de documentos longos para transmitir só a información necesaria.
Por exemplo, extrae o corpo e as táboas dun informe e describe un gráfico inserido como un gráfico que mostra a tendencia das vendas por trimestre. Coa descrición, o axente identifica a existencia e o propósito do gráfico e, cando precisa cifras ou tendencias exactas, revisa adicionalmente o orixinal correspondente.
Conexión de produtos
Ao conectar os produtos, pódese configurar o seguinte fluxo.
- Traballo baseado en documentos: Cova extrae o corpo, as táboas e as descricións de imaxes; CIP selecciona e revisa os orixinais necesarios para realizar análises e procesar o traballo; e Cosa transmite os resultados por voz.
- Traballo baseado na voz: Cosa ASR converte as solicitudes de voz en texto, e cosa-a ou cosa-b le en voz alta as respostas procesadas por CIP.
- Automatización no lugar de traballo: cip-5.5-sm clasifica os datos do lugar de traballo e realiza tarefas locais, e transfire a cip-5.5-im ou cip-5.5-mm os materiais que precisan de análise integral adicional.
Chamadas permitidas na pasarela
Os plans da pasarela determinan as chamadas permitidas para cada modelo. A táboa seguinte mostra o alcance que habilitan os plans LLM_FREE, TTS_FREE e STT_FREE, que se aplican automaticamente sen necesidade de solicitude. Non inclúe os modelos habilitados por outras vías.
| ID do modelo | Chamadas permitidas | Plan de referencia |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm e cova-1 non están nesta táboa de plans. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm e ivy-4-mm que aparecen na táboa son ID de modelos que non están incluídos nas descricións dos produtos anteriores. A documentación sobre as chamadas á API indica a que ruta corresponde a clave de chamada.
