Developer guide

Modelo

Resumen del modelo

Los modelos de CLEVI se dividen en tres familias de productos: CIP, responsable de la inteligencia general y la automatización del trabajo; Cosa, responsable de la generación y el reconocimiento de voz; y Cova, responsable de la extracción de información de documentos e imágenes. Cada producto puede utilizarse de forma independiente o conectarse para crear servicios que abarcan desde el reconocimiento y el análisis de documentos hasta la ejecución de tareas y la guía por voz.

ProductoID del modeloEspecificaciones principalesFunción principal
CIP-5.5-SMcip-5.5-sm24B~40B ajustableAutomatización de tareas locales y en servidores perimetrales
CIP-5.5-IMcip-5.5-im360B · entrada de 256K · salida de 64K · multimodalProcesamiento general de tareas. Prioriza la velocidad de respuesta y el rendimiento
CIP-5.5-MMcip-5.5-mm800B · entrada de 512K · salida de 64K · multimodalAnálisis de contextos extensos y resolución de problemas complejos
Cosa-Acosa-aSíntesis·clonación·diseño·streaming de vozGeneración de voz con control detallado de la síntesis
Cosa-Bcosa-bSíntesis·clonación·diseño·streaming de vozSelección de voz y generación de voz personalizada
Cosa ASRcosa-asrReconocimiento de vozConversión de la entrada de voz en texto
Covacova-1Exclusivo para OCR visual basado en LLMExtracción de texto, diseño y tablas, y descripción sencilla de imágenes

CIP

CIP se encarga de la inteligencia general y la automatización del trabajo. Está compuesto por cip-5.5-im y cip-5.5-mm, que se invocan a través de una puerta de enlace, y cip-5.5-sm, que se implementa en servidores perimetrales y entornos locales.

cip-5.5-im y cip-5.5-mm

Elementocip-5.5-imcip-5.5-mm
Tamaño360B800B
Límite de entrada256K512K
Salida máxima64K64K
Formato de entradaTexto y materiales visuales (documentos, imágenes de pantalla, tablas y gráficos)Texto y materiales visuales (revisión integrada de código, documentos y materiales de pantalla)
Orientación del diseñoProcesa tareas cotidianas de conocimiento y desarrollo, centrándose en la velocidad de respuesta, la rentabilidad y el rendimiento.Procesa tareas complejas que integran múltiples materiales y condiciones, y conectan los resultados del análisis con el trabajo real.
Uso de entradas extensasRevisa conjuntamente varios documentos, archivos de código e historiales de conversación.Gestiona conjuntamente grandes cantidades de materiales de referencia e historiales de trabajo, y ejecuta tareas de agente en las que la investigación, la ejecución y la verificación se suceden en varias etapas.

cip-5.5-im es adecuado para tareas con objetivos y alcance claramente definidos. Algunos ejemplos representativos son extraer la información necesaria de los materiales proporcionados, redactar resultados en el formato especificado y modificar código según los requisitos. La salida máxima de 64K se utiliza para redactar informes detallados o resultados compuestos por varias partes.

  • Asistencia en el desarrollo: escribe funciones y funcionalidades, corrige errores de alcance definido e implementa siguiendo los patrones existentes.
  • Generación de pruebas: redacta borradores de pruebas y casos de validación basados en los requisitos y la implementación.
  • Procesamiento de documentos: se encarga de resumir, clasificar, extraer elementos, convertir formatos y redactar borradores.
  • Análisis multimodal: revisa imágenes de pantallas y tablas y gráficos de documentos junto con las explicaciones pertinentes.
  • Asistencia interactiva en tareas: responde preguntas basándose en materiales de trabajo y redacta los resultados necesarios.
  • Procesamiento masivo: se utiliza para resumir individualmente numerosos documentos, clasificar solicitudes y transformar datos.
  • Subagentes: se encargan de subtareas con límites claros, como explorar código, revisar archivos específicos u organizar materiales.

Por ejemplo, se utiliza para recibir requisitos funcionales y código relacionado, y redactar una propuesta de modificación, pruebas y descripción de los cambios, o para clasificar documentos recibidos y crear resúmenes para los responsables.

cip-5.5-mm es adecuado para tareas que requieren comprender las relaciones entre la información y mantener la coherencia de todo el trabajo. En el desarrollo, revisa las conexiones entre los requisitos, el diseño, la implementación y las pruebas; en el análisis de documentos, integra las afirmaciones y evidencias, así como las diferencias y contradicciones de diversos materiales.

  • Implementación de funcionalidades complejas: modifica conjuntamente el código, las pruebas y la documentación teniendo en cuenta los contratos y el comportamiento de varios módulos.
  • Análisis de código a gran escala: revisa las relaciones de llamadas, el flujo de datos y el alcance del impacto de los cambios.
  • Análisis de las causas de incidentes: contrasta los registros, la configuración, el código y los resultados de ejecución para organizar hipótesis sobre las causas y procedimientos de verificación.
  • Apoyo al diseño y la toma de decisiones: estructura los requisitos y las restricciones, y analiza el impacto de las alternativas de implementación.
  • Análisis integrado de múltiples documentos: organiza basándose en evidencias las similitudes, diferencias y contradicciones de informes y documentos técnicos.
  • Revisión integrada multimodal: interpreta conjuntamente textos y materiales visuales para analizar problemas y requisitos.
  • Agentes de múltiples etapas: se utiliza en tareas que incluyen investigación, planificación, ejecución de herramientas y revisión de resultados.
  • Redacción de documentos especializados: redacta informes técnicos, propuestas de diseño y documentos de revisión detallados que reflejan condiciones complejas y sus fundamentos.

Por ejemplo, se utiliza para revisar conjuntamente los códigos y registros relacionados con errores producidos en varios servicios, o para tareas que abarcan desde el análisis de requisitos de funciones complejas hasta la implementación y la revisión de los resultados de validación.

cip-5.5-sm

cip-5.5-sm realiza inferencias locales y automatiza tareas en servidores edge y entornos on-premises. Como el tamaño del modelo puede ajustarse en un rango de 24B a 40B, la configuración puede seleccionarse de acuerdo con los recursos de cómputo del equipo de implementación y el rendimiento requerido en el lugar de trabajo. Dado que procesa los datos cerca del punto donde se generan, se utiliza para integrarse con los sistemas del lugar de trabajo y aprovechar los datos internos. Si los modelos y las herramientas necesarios se configuran localmente, también puede operar en entornos con conectividad externa limitada.

Interpreta y procesa la información generada en el lugar de trabajo y la conecta con los procedimientos de procesamiento. Clasifica registros y solicitudes, extrae la información necesaria de los datos y ejecuta tareas repetitivas mediante herramientas internas y scripts conectados.

  • Procesamiento de eventos en el lugar de trabajo: clasifica los registros de los equipos y la información de estado, y selecciona los eventos que requieren verificación.
  • Preprocesamiento de datos: extrae los elementos clave de los registros de trabajo y los clasifica, etiqueta y normaliza.
  • Enrutamiento de solicitudes: reenvía las solicitudes recibidas al sistema responsable o al procedimiento de procesamiento correspondiente.
  • Agente de tareas local: realiza tareas repetitivas consultando sistemas internos y ejecutando scripts.
  • Asistencia para tareas on-premises: responde preguntas basándose en materiales internos y organiza el contenido de las tareas.
  • Asistencia para análisis posteriores: selecciona los materiales que requieren una revisión adicional y resume su contenido clave.

Por ejemplo, se utiliza para clasificar los registros operativos en el servidor de un centro de trabajo, consultar el historial relacionado y redactar un resumen del incidente para la persona responsable.

Cosa

Cosa es una familia de productos de voz que convierte texto en voz, reconoce como texto la voz introducida y permite registrar y reutilizar la voz deseada. Se utiliza para la orientación de servicios, la creación de contenido, la accesibilidad y las interfaces de voz de agentes conversacionales.

La generación de voz está a cargo de cosa-a y cosa-b, mientras que el reconocimiento de voz está a cargo de cosa-asr. cosa-a y cosa-b son modelos independientes que ofrecen sus propias listas de voces y configuraciones de síntesis, y se seleccionan desde la misma interfaz de servicio. Las funciones que ofrecen ambos modelos en común son las siguientes.

  • Conversión de texto a voz: sintetiza el texto introducido con la voz seleccionada.
  • Clonación de voz: registra una voz a partir de una grabación de referencia cuyo uso está autorizado y sintetiza nuevas frases.
  • Diseño de voz: crea y registra una voz describiendo las características deseadas.
  • Reutilización de voz: utiliza la voz registrada en síntesis posteriores.
  • Configuración de síntesis: ajusta la velocidad del habla y el idioma, entre otros parámetros.
  • Entrega en streaming: sintetiza el texto por frases a medida que llega y entrega el audio de forma secuencial.
  • Control de reproducción: admite pausar, reanudar, detener e introducir frases adicionales.

La entrada progresiva de texto permite iniciar la reproducción de voz antes de que se complete toda la respuesta. Mientras CIP redacta la respuesta, puede configurarse un servicio en el que Cosa lea las frases que estén listas.

cosa-a

cosa-a admite la conversión de texto a voz, la clonación de voz, el diseño de voz y la salida en streaming. Además de las funciones básicas para seleccionar la voz, el idioma y la velocidad del habla, ofrece controles adicionales, como la configuración del número de pasos de síntesis, la intensidad de la guía y la longitud de generación. Se utiliza para ajustar la configuración durante el proceso de creación de voz y revisar los resultados, o para aplicar varias configuraciones al mismo guion y elegir el resultado más adecuado.

  • Sintetiza indicaciones y notificaciones para aplicaciones, quioscos y sistemas empresariales.
  • Convierte materiales educativos y manuales de usuario en voz.
  • Produce narraciones para contenidos de vídeo y audio.
  • Crea contenidos recurrentes con una voz registrada.
  • Se utiliza para la salida de voz en streaming de agentes conversacionales.
  • Se utiliza para la creación de voz ajustando configuraciones detalladas de síntesis.

cosa-b

cosa-b admite la selección de voces preestablecidas, el diseño de voz basado en descripciones, la clonación basada en voces de referencia y la salida en streaming. Permite elegir una voz de su propia lista de voces o registrar una nueva voz para utilizarla en el servicio.

La clonación de voz utiliza una grabación de referencia y el texto correspondiente. También admite un flujo en el que se genera el texto de referencia mediante reconocimiento de voz durante el registro, y la voz registrada se reutiliza en síntesis posteriores.

  • Configura la personalidad de voz de servicios y personajes.
  • Crea voces personalizadas a partir de una descripción o una grabación de referencia.
  • Sintetiza indicaciones de marca, diálogos de personajes y narraciones de contenidos.
  • Se utiliza para las respuestas de voz de agentes conversacionales.
  • Sintetiza mensajes de indicación y guiones cambiantes con la misma voz.

Al elegir entre cosa-a y cosa-b, utilice como criterios la voz que desea, el resultado de síntesis real y los elementos de control que necesita.

Elementocosa-acosa-b
Configuración de síntesisAdemás de la voz, el idioma y la velocidad del habla, configuraciones relacionadas con el número de pasos de síntesis, la intensidad de guía y la longitud de generaciónConfiguraciones comunes, como la velocidad del habla y el idioma
Entrada de clonaciónGrabación de referencia para la que tiene autorización de usoGrabación de referencia y texto correspondiente. Durante el proceso de registro, es posible generar el texto de referencia mediante reconocimiento de voz
FunciónGeneración de voz mediante controles detallados de síntesisSelección de voz y generación de voz personalizada

cosa-asr

cosa-asr convierte el audio de entrada en texto. Documenta grabaciones y transforma las solicitudes recibidas por voz en entradas que los sistemas posteriores de trabajo pueden procesar.

  • Transcribe notas de voz y grabaciones.
  • Convierte preguntas y solicitudes de trabajo basadas en voz en entradas.
  • Genera texto de referencia para la clonación de voz.
  • Se utiliza en procesos posteriores a la transcripción, como el resumen, la clasificación y la búsqueda.

Al transmitir los resultados de la transcripción a CIP, el proceso continúa con el resumen del contenido, la clasificación de solicitudes y la elaboración de borradores de trabajo. Si los resultados del procesamiento se sintetizan con cosa-a o cosa-b, se obtiene un servicio de trabajo con entrada y salida de voz.

Cova

cova-1 es un modelo especializado de OCR visual basado en LLM. Reconoce texto en documentos e imágenes, extrae el diseño y la estructura de las tablas, y proporciona descripciones sencillas de los elementos visuales.

Convierte los documentos que ven las personas en un formato más adecuado para los agentes y los sistemas de trabajo. Extrae el cuerpo del texto y las tablas como contenido estructurado, y transmite las imágenes incluidas en el documento como descripciones breves, de modo que los agentes posteriores puedan comprender tanto el contenido del documento como su contexto visual. Si se configura un flujo en el que primero se revisa el material mediante el texto y las descripciones extraídos, y solo se vuelven a examinar los originales que requieren una confirmación detallada, se reduce la cantidad de veces que se introducen las imágenes originales y se ahorran tokens de contexto.

FunciónDescripción
Reconocimiento de textoExtrae texto de documentos escaneados o fotografiados.
Interpretación del diseñoDivide el contenido en bloques teniendo en cuenta la distribución del documento.
Provisión de información de ubicaciónProporciona la ubicación de los bloques reconocidos para vincular los resultados extraídos con el original.
Extracción de la estructura de tablasEstructura el contenido de las tablas para utilizarlo en búsquedas y procesamiento de datos.
Descripción breve de imágenesDescribe brevemente el contenido de las imágenes y los elementos visuales para proporcionar al agente pistas para su interpretación.
Optimización del contextoReduce la introducción repetida de la imagen original transmitiendo la información principalmente mediante descripciones de texto, estructura e imágenes.
Análisis detallado selectivoAyuda al agente a determinar qué imágenes originales debe revisar adicionalmente.
Conversión de formato de documentosOrganiza los resultados del reconocimiento en HTML o Markdown.
  • Digitalización de documentos: convierte documentos en papel y materiales escaneados en materiales basados en texto.
  • Recepción de documentos de trabajo: extrae contenido de formularios de solicitud, documentos justificativos e informes.
  • Procesamiento de datos tabulares: utiliza las tablas incluidas en los documentos para el procesamiento posterior de datos.
  • Preprocesamiento para la búsqueda de conocimiento: convierte imágenes de documentos y materiales visuales en texto y estructuras que se pueden buscar.
  • Automatización de la revisión de documentos: entrega los resultados extraídos a CIP para comprobar elementos, resumir y comparar materiales.
  • Optimización de entradas para agentes: organiza el texto principal, las tablas y las descripciones de imágenes de documentos extensos para transmitir únicamente la información necesaria.

Por ejemplo, extrae el texto principal y las tablas de un informe y describe el gráfico insertado como un gráfico que muestra la tendencia de las ventas por trimestre. Con esta descripción, el agente identifica la existencia y el propósito del gráfico y, cuando necesita cifras o tendencias precisas, revisa adicionalmente el original correspondiente.

Conexión entre productos

Al conectar los productos, se puede configurar el siguiente flujo.

  • Trabajo basado en documentos: Cova extrae el texto principal, las tablas y las descripciones de imágenes; CIP revisa selectivamente los originales necesarios para realizar análisis y procesar el trabajo; y Cosa transmite los resultados mediante voz.
  • Trabajo basado en voz: Cosa ASR convierte las solicitudes de voz en texto, y cosa-a o cosa-b leen las respuestas procesadas por CIP.
  • Automatización en campo: cip-5.5-sm clasifica los datos de campo y realiza tareas locales, y transfiere a cip-5.5-im o cip-5.5-mm los materiales que requieren un análisis integral adicional.

Llamadas permitidas en la puerta de enlace

Los planes de la puerta de enlace determinan las llamadas permitidas para cada modelo. La tabla siguiente muestra el alcance que habilitan los planes LLM_FREE, TTS_FREE y STT_FREE, que se aplican automáticamente sin necesidad de solicitarlo. No se incluyen los modelos habilitados mediante otras rutas.

ID del modeloLlamadas permitidasPlan de referencia
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm y cova-1 no están en esta tabla de planes. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm e ivy-4-mm de la tabla son ID de modelos que no están incluidos en las descripciones de productos anteriores. La ruta a la que corresponde la clave de llamada se indica en el documento sobre cómo realizar llamadas a la API.

CLEVI

Idioma y región

Los idiomas traducidos automáticamente están marcados. La disponibilidad sigue el paquete publicado del sitio.

136 idiomas

Recomendado

1

Asia oriental

7

Sudeste asiático

11

Asia meridional

18

Asia central

5

Oriente Medio y el Cáucaso

10

Europa occidental y Europa meridional

16

Reino Unido e Irlanda

4

Europa septentrional

10

Europa Central y los Balcanes

14

Europa oriental

5

África oriental

8

África occidental y África central

9

África meridional

8

América

5

Oceanía

5