Developer guide

Modelo

Resumen del modelo

Los modelos de CLEVI se dividen en tres líneas de productos: CIP, responsable de la inteligencia general y la automatización de tareas; Cosa, responsable de la generación y el reconocimiento de voz; y Cova, responsable de la extracción de información de documentos e imágenes. Cada producto puede utilizarse de forma independiente o conectarse para crear servicios que abarcan desde el reconocimiento y análisis de documentos hasta la ejecución de tareas y la orientación por voz.

ProductoID del modeloEspecificaciones principalesFunción principal
CIP-5.5-SMcip-5.5-sm24B~40B ajustableAutomatización de tareas locales y en servidores perimetrales
CIP-5.5-IMcip-5.5-im360B · entrada de 256K · salida de 64K · multimodalProcesamiento de tareas generales. Prioriza la velocidad de respuesta y el rendimiento
CIP-5.5-MMcip-5.5-mm800B · entrada de 512K · salida de 64K · multimodalAnálisis de contextos extensos y resolución de problemas complejos
Cosa-Acosa-aSíntesis, clonación, diseño y streaming de vozGeneración de voz con control detallado de la síntesis
Cosa-Bcosa-bSíntesis, clonación, diseño y streaming de vozSelección de voz y generación de voz personalizada
Cosa ASRcosa-asrReconocimiento de vozConversión de entradas de voz a texto
Covacova-1Exclusivo para OCR visual basado en LLMExtracción de texto, diseño y tablas, y descripción sencilla de imágenes

CIP

CIP se encarga de la inteligencia general y la automatización de tareas. Está compuesto por cip-5.5-im y cip-5.5-mm, que se invocan a través de una puerta de enlace, y cip-5.5-sm, que se implementa en servidores perimetrales y entornos locales.

cip-5.5-im y cip-5.5-mm

Elementocip-5.5-imcip-5.5-mm
Escala360B800B
Límite de entrada256K512K
Salida máxima64K64K
Formato de entradaTexto y material visual (documentos, imágenes de pantalla, tablas y gráficos)Texto y material visual (revisión integrada de código, documentos y material de pantalla)
Orientación del diseñoProcesa tareas cotidianas de conocimiento y desarrollo, con énfasis en la velocidad de respuesta, la rentabilidad y el rendimiento.Procesa tareas complejas que integran y analizan múltiples materiales y condiciones, y conectan los resultados del análisis con tareas reales.
Uso de entradas extensasRevisa varios documentos, archivos de código e historiales de conversación en conjunto.Gestiona grandes volúmenes de materiales de referencia e historiales de trabajo, y ejecuta tareas de agente en las que la investigación, la ejecución y la validación se desarrollan en varias etapas.

cip-5.5-im es adecuado para tareas con objetivos y alcance claramente definidos. Algunos ejemplos representativos son extraer la información necesaria de los materiales proporcionados, redactar resultados en el formato especificado y modificar código conforme a los requisitos. La salida de hasta 64K se utiliza para redactar informes detallados o resultados compuestos por varias partes.

  • Asistencia para desarrollo: escribe funciones y características, corrige errores con un alcance claramente definido e implementa conforme a los patrones existentes.
  • Generación de pruebas: redacta borradores de pruebas y casos de validación basados en los requisitos y la implementación.
  • Procesamiento de documentos: se encarga de resumir, clasificar, extraer elementos, convertir formatos y preparar borradores.
  • Análisis multimodal: revisa imágenes de pantalla y tablas y gráficos de documentos junto con las explicaciones pertinentes.
  • Asistencia interactiva para tareas: responde preguntas basándose en materiales de trabajo y prepara los resultados necesarios.
  • Procesamiento masivo: se utiliza para resumir documentos individualmente, clasificar solicitudes y transformar datos.
  • Subagentes: se encargan de subtareas con límites claramente definidos, como explorar código, revisar archivos específicos y organizar materiales.

Por ejemplo, se utiliza para recibir requisitos funcionales y código relacionado y preparar una propuesta de modificación, pruebas y una explicación de los cambios, o para clasificar documentos recibidos y crear resúmenes para los responsables.

cip-5.5-mm es adecuado para tareas que requieren comprender las relaciones entre la información y mantener la coherencia de todo el trabajo. En desarrollo, revisa la conexión entre los requisitos, el diseño, la implementación y las pruebas; en el análisis de documentos, sintetiza las afirmaciones y evidencias, así como las diferencias y contradicciones de varios materiales.

  • Implementación de funcionalidades complejas: modifica conjuntamente el código, las pruebas y la documentación considerando los contratos y el comportamiento de varios módulos.
  • Análisis de código a gran escala: revisa las relaciones de llamadas, el flujo de datos y el alcance del impacto de los cambios.
  • Análisis de la causa de incidentes: contrasta registros, configuraciones, código y resultados de ejecución para organizar hipótesis sobre las causas y los procedimientos de verificación.
  • Asistencia para diseño y toma de decisiones: estructura los requisitos y las restricciones y analiza el impacto de las alternativas de implementación.
  • Análisis integral de varios documentos: organiza con base en evidencias las similitudes, diferencias y contradicciones entre informes y documentos técnicos.
  • Revisión multimodal integrada: interpreta conjuntamente texto y material visual para analizar problemas y requisitos.
  • Agentes de varios pasos: se utiliza para tareas que incluyen investigación, planificación, ejecución de herramientas y revisión de resultados.
  • Redacción de documentos especializados: redacta informes técnicos, propuestas de diseño y documentos de revisión detallada que reflejan condiciones complejas y evidencias.

Por ejemplo, se utiliza para revisar conjuntamente los códigos relacionados y los registros de errores generados en varios servicios, o para tareas que abarcan desde el análisis de requisitos de una función compleja hasta la implementación y la revisión de los resultados de validación.

cip-5.5-sm

cip-5.5-sm realiza inferencia local y automatización de tareas en servidores perimetrales y entornos locales. Como el tamaño del modelo puede ajustarse en el rango de 24B a 40B, la configuración puede elegirse según los recursos de cómputo del equipo de implementación y el rendimiento requerido en el sitio. Dado que procesa los datos cerca del punto donde se generan, se utiliza para integrarse con los sistemas del sitio y aprovechar datos internos. Si los modelos y las herramientas necesarios se configuran localmente, también puede operarse en entornos con conectividad externa limitada.

Se encarga de interpretar la información generada en el sitio y conectarla con los procedimientos de procesamiento. Clasifica registros y solicitudes, extrae la información necesaria de los datos y ejecuta tareas repetitivas mediante herramientas internas y scripts conectados.

  • Procesamiento de eventos en el sitio: clasifica los registros de los equipos y la información de estado, y selecciona los eventos que requieren verificación.
  • Preprocesamiento de datos: extrae los elementos clave de los registros de trabajo y los clasifica, etiqueta y normaliza.
  • Enrutamiento de solicitudes: transfiere las solicitudes recibidas al sistema responsable o al procedimiento de procesamiento correspondiente.
  • Agente de tareas local: realiza tareas repetitivas consultando sistemas internos y ejecutando scripts.
  • Asistencia para tareas en entornos locales: responde preguntas basándose en materiales internos y organiza la información de trabajo.
  • Asistencia para análisis posteriores: selecciona los materiales que requieren revisión adicional y resume los puntos clave.

Por ejemplo, se utiliza en un flujo que clasifica los registros operativos en el servidor de una instalación, consulta el historial relacionado y redacta un resumen del incidente para la persona responsable.

Cosa

Cosa es una familia de productos de voz que convierte texto en voz, reconoce como texto la voz de entrada y permite registrar y reutilizar la voz deseada. Se utiliza para guías de servicio, creación de contenido, accesibilidad e interfaces de voz para agentes conversacionales.

cosa-a y cosa-b se encargan de la generación de voz, mientras que cosa-asr se encarga del reconocimiento de voz. cosa-a y cosa-b son modelos independientes que ofrecen sus propias listas de voces y configuraciones de síntesis, y se seleccionan desde la misma interfaz de servicio. Las funciones que ambos modelos ofrecen en común son las siguientes.

  • Conversión de texto a voz: sintetiza las frases introducidas con la voz seleccionada.
  • Clonación de voz: registra una voz a partir de una grabación de referencia para la que se cuenta con autorización de uso y sintetiza nuevas frases.
  • Diseño de voz: crea y registra una voz describiendo las características deseadas.
  • Reutilización de voz: utiliza una voz registrada en síntesis posteriores.
  • Configuración de síntesis: ajusta la velocidad del habla, el idioma y otros parámetros.
  • Entrega en streaming: sintetiza por frases conforme llega el texto y entrega el audio de forma secuencial.
  • Control de reproducción: admite pausar, reanudar, detener e introducir frases adicionales.

La entrada progresiva de texto permite iniciar la reproducción de voz antes de que se complete toda la respuesta. Mientras CIP redacta la respuesta, puedes configurar un servicio en el que Cosa lea las frases que estén listas.

cosa-a

cosa-a admite conversión de texto a voz, clonación de voz, diseño de voz y salida en streaming. Además de las funciones básicas para seleccionar la voz, el idioma y la velocidad del habla, ofrece controles adicionales, como la configuración del número de pasos de síntesis, la intensidad de la guía y la longitud de generación. Se utiliza para ajustar la configuración durante la creación de voz y revisar los resultados, o para aplicar varias configuraciones al mismo guion y elegir el resultado.

  • Sintetiza indicaciones y notificaciones para aplicaciones, quioscos y sistemas empresariales.
  • Convierte materiales educativos y manuales de usuario en voz.
  • Produce narraciones para contenido de video y audio.
  • Produce contenido recurrente con voces registradas.
  • Se utiliza para la salida de voz en streaming de agentes conversacionales.
  • Se utiliza para la creación de voz con ajustes detallados de síntesis.

cosa-b

cosa-b admite la selección de voces preestablecidas, el diseño de voz basado en descripciones, la clonación basada en voces de referencia y la salida en streaming. Puedes elegir una voz de su propia lista de voces o registrar una nueva para utilizarla en el servicio.

La clonación de voz utiliza una grabación de referencia y el texto correspondiente. También admite un flujo que genera el texto de referencia mediante reconocimiento de voz durante el proceso de registro, y las voces registradas se reutilizan en síntesis posteriores.

  • Configura la personalidad de voz de servicios y personajes.
  • Crea voces personalizadas a partir de una descripción o una grabación de referencia.
  • Sintetiza indicaciones de marca, diálogos de personajes y narraciones de contenido.
  • Se utiliza para las respuestas de voz de agentes conversacionales.
  • Sintetiza mensajes de indicación y guiones cambiantes con la misma voz.

Al elegir entre cosa-a y cosa-b, tome como referencia la voz que desea, el resultado de síntesis real y los elementos de control que necesita.

Elementocosa-acosa-b
Configuración de síntesisAdemás de la voz, el idioma y la velocidad de habla, incluye configuraciones relacionadas con el número de pasos de síntesis, la intensidad de guía y la longitud de generaciónConfiguraciones comunes, como la velocidad de habla y el idioma
Entrada para clonaciónGrabación de referencia para la que tiene permiso de usoGrabación de referencia y texto correspondiente. Durante el registro, es posible generar el texto de referencia mediante reconocimiento de voz
FunciónGeneración de voz con controles detallados de síntesisSelección de voz y generación de voz personalizada

cosa-asr

cosa-asr convierte el audio de entrada en texto. Documenta materiales grabados o convierte solicitudes recibidas por voz en entradas que los sistemas de trabajo posteriores pueden procesar.

  • Transcribe notas de voz y materiales grabados.
  • Convierte preguntas y solicitudes de trabajo basadas en voz en entradas.
  • Genera texto de referencia para la clonación de voz.
  • Se utiliza en procesos posteriores a la transcripción, como el resumen, la clasificación y la búsqueda.

Al entregar los resultados de la transcripción a CIP, el proceso continúa con el resumen del contenido, la clasificación de solicitudes y la redacción de borradores de trabajo. Si los resultados del procesamiento se sintetizan con cosa-a o cosa-b, se obtiene un servicio de trabajo con entrada y salida de voz.

Cova

cova-1 es un modelo especializado en OCR visual basado en LLM. Reconoce texto en documentos e imágenes, extrae el diseño y la estructura de las tablas, y proporciona descripciones breves de los elementos visuales.

Convierte los documentos que las personas visualizan en un formato más adecuado para agentes y sistemas de trabajo. Extrae el cuerpo del texto y las tablas como contenido estructurado, y transmite las imágenes incluidas en el documento mediante descripciones breves, de modo que los agentes posteriores puedan comprender tanto el contenido del documento como su contexto visual. Al configurar un flujo en el que primero se revisan los materiales mediante el texto y las descripciones extraídos, y solo se vuelven a revisar los originales que requieren una confirmación detallada, se reduce la cantidad de veces que se introducen las imágenes originales y se ahorran tokens de contexto.

FunciónDescripción
Reconocimiento de textoExtrae texto de documentos escaneados o fotografiados.
Interpretación del diseñoDivide el contenido en bloques teniendo en cuenta la distribución del documento.
Proporcionar información de ubicaciónProporciona la ubicación de los bloques reconocidos para vincular los resultados extraídos con el texto original.
Extracción de la estructura de tablasEstructura el contenido de las tablas para utilizarlo en búsquedas y procesamiento de datos.
Descripción breve de imágenesDescribe brevemente el contenido de las imágenes y los elementos visuales para proporcionar al agente pistas para su interpretación.
Optimización del contextoReduce la entrada repetida de la imagen original al transmitir la información principalmente mediante el texto, la estructura y la descripción de la imagen.
Análisis detallado selectivoAyuda al agente a determinar qué imágenes originales debe revisar adicionalmente.
Conversión de formato de documentosOrganiza los resultados del reconocimiento en HTML o Markdown.
  • Digitalización de documentos: convierte documentos en papel y materiales escaneados en materiales basados en texto.
  • Recepción de documentos de trabajo: extrae contenido de solicitudes, documentos comprobatorios e informes.
  • Procesamiento de datos tabulares: utiliza las tablas incluidas en los documentos para el procesamiento posterior de datos.
  • Preprocesamiento para la búsqueda de conocimiento: convierte imágenes de documentos y materiales visuales en texto y estructuras que se pueden buscar.
  • Automatización de la revisión de documentos: envía los resultados extraídos a CIP para verificar elementos, resumir y comparar materiales.
  • Optimización de entradas para agentes: organiza el contenido, las tablas y las descripciones de imágenes de documentos extensos para transmitir solo la información necesaria.

Por ejemplo, extrae el contenido y las tablas de un informe, y describe el gráfico incluido como un gráfico que muestra la tendencia de las ventas por trimestre. Con esta descripción, el agente identifica la existencia y el propósito del gráfico y, cuando necesita cifras o tendencias precisas, revisa adicionalmente el original correspondiente.

Conexión de productos

Al conectar los productos, se puede configurar el siguiente flujo.

  • Tareas basadas en documentos: Cova extrae el contenido, las tablas y las descripciones de imágenes; CIP revisa de forma selectiva los originales necesarios para realizar análisis y procesar las tareas; y Cosa comunica los resultados por voz.
  • Tareas basadas en voz: Cosa ASR convierte las solicitudes de voz en texto, y cosa-a o cosa-b leen las respuestas procesadas por CIP.
  • Automatización en campo: cip-5.5-sm clasifica los datos de campo y realiza las tareas locales, y transfiere a cip-5.5-im o cip-5.5-mm los materiales que requieren un análisis integral adicional.

Llamadas permitidas en la puerta de enlace

Los planes del gateway determinan las llamadas permitidas para cada modelo. La tabla siguiente muestra los alcances habilitados por los planes LLM_FREE, TTS_FREE y STT_FREE, que se aplican automáticamente sin necesidad de solicitarlo. No incluye los modelos habilitados mediante otras rutas.

ID del modeloLlamadas permitidasPlan de referencia
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm과 cova-1은 이 플랜 표에 없습니다. 표의 cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm, ivy-4-mm은 위 제품 설명에 포함되지 않은 모델 ID입니다. 호출 키가 어느 경로에 해당하는지는 API 호출하기 문서에 있습니다.

CLEVI

Idioma y región

Los idiomas traducidos automáticamente están marcados. La disponibilidad depende del paquete publicado del sitio.

136 idiomas

Recomendado

1

Asia Oriental

7

Sudeste Asiático

11

Asia meridional

18

Asia central

5

Medio Oriente y el Cáucaso

10

Europa Occidental y Europa meridional

16

Reino Unido e Irlanda

4

Europa septentrional

10

Europa Central y los Balcanes

14

Europa Oriental

5

África Oriental

8

África Occidental y África central

9

África meridional

8

América

5

Oceanía

5