Developer guide
Modelo
Resumen del modelo
Los modelos de CLEVI se dividen en tres líneas de productos: CIP, responsable de la inteligencia general y la automatización de tareas; Cosa, responsable de la generación y el reconocimiento de voz; y Cova, responsable de la extracción de información de documentos e imágenes. Cada producto puede utilizarse de forma independiente o conectarse para crear servicios que abarcan desde el reconocimiento y análisis de documentos hasta la ejecución de tareas y la orientación por voz.
| Producto | ID del modelo | Especificaciones principales | Función principal |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B ajustable | Automatización de tareas locales y en servidores perimetrales |
| CIP-5.5-IM | cip-5.5-im | 360B · entrada de 256K · salida de 64K · multimodal | Procesamiento de tareas generales. Prioriza la velocidad de respuesta y el rendimiento |
| CIP-5.5-MM | cip-5.5-mm | 800B · entrada de 512K · salida de 64K · multimodal | Análisis de contextos extensos y resolución de problemas complejos |
| Cosa-A | cosa-a | Síntesis, clonación, diseño y streaming de voz | Generación de voz con control detallado de la síntesis |
| Cosa-B | cosa-b | Síntesis, clonación, diseño y streaming de voz | Selección de voz y generación de voz personalizada |
| Cosa ASR | cosa-asr | Reconocimiento de voz | Conversión de entradas de voz a texto |
| Cova | cova-1 | Exclusivo para OCR visual basado en LLM | Extracción de texto, diseño y tablas, y descripción sencilla de imágenes |
CIP
CIP se encarga de la inteligencia general y la automatización de tareas. Está compuesto por cip-5.5-im y cip-5.5-mm, que se invocan a través de una puerta de enlace, y cip-5.5-sm, que se implementa en servidores perimetrales y entornos locales.
cip-5.5-im y cip-5.5-mm
| Elemento | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Escala | 360B | 800B |
| Límite de entrada | 256K | 512K |
| Salida máxima | 64K | 64K |
| Formato de entrada | Texto y material visual (documentos, imágenes de pantalla, tablas y gráficos) | Texto y material visual (revisión integrada de código, documentos y material de pantalla) |
| Orientación del diseño | Procesa tareas cotidianas de conocimiento y desarrollo, con énfasis en la velocidad de respuesta, la rentabilidad y el rendimiento. | Procesa tareas complejas que integran y analizan múltiples materiales y condiciones, y conectan los resultados del análisis con tareas reales. |
| Uso de entradas extensas | Revisa varios documentos, archivos de código e historiales de conversación en conjunto. | Gestiona grandes volúmenes de materiales de referencia e historiales de trabajo, y ejecuta tareas de agente en las que la investigación, la ejecución y la validación se desarrollan en varias etapas. |
cip-5.5-im es adecuado para tareas con objetivos y alcance claramente definidos. Algunos ejemplos representativos son extraer la información necesaria de los materiales proporcionados, redactar resultados en el formato especificado y modificar código conforme a los requisitos. La salida de hasta 64K se utiliza para redactar informes detallados o resultados compuestos por varias partes.
- Asistencia para desarrollo: escribe funciones y características, corrige errores con un alcance claramente definido e implementa conforme a los patrones existentes.
- Generación de pruebas: redacta borradores de pruebas y casos de validación basados en los requisitos y la implementación.
- Procesamiento de documentos: se encarga de resumir, clasificar, extraer elementos, convertir formatos y preparar borradores.
- Análisis multimodal: revisa imágenes de pantalla y tablas y gráficos de documentos junto con las explicaciones pertinentes.
- Asistencia interactiva para tareas: responde preguntas basándose en materiales de trabajo y prepara los resultados necesarios.
- Procesamiento masivo: se utiliza para resumir documentos individualmente, clasificar solicitudes y transformar datos.
- Subagentes: se encargan de subtareas con límites claramente definidos, como explorar código, revisar archivos específicos y organizar materiales.
Por ejemplo, se utiliza para recibir requisitos funcionales y código relacionado y preparar una propuesta de modificación, pruebas y una explicación de los cambios, o para clasificar documentos recibidos y crear resúmenes para los responsables.
cip-5.5-mm es adecuado para tareas que requieren comprender las relaciones entre la información y mantener la coherencia de todo el trabajo. En desarrollo, revisa la conexión entre los requisitos, el diseño, la implementación y las pruebas; en el análisis de documentos, sintetiza las afirmaciones y evidencias, así como las diferencias y contradicciones de varios materiales.
- Implementación de funcionalidades complejas: modifica conjuntamente el código, las pruebas y la documentación considerando los contratos y el comportamiento de varios módulos.
- Análisis de código a gran escala: revisa las relaciones de llamadas, el flujo de datos y el alcance del impacto de los cambios.
- Análisis de la causa de incidentes: contrasta registros, configuraciones, código y resultados de ejecución para organizar hipótesis sobre las causas y los procedimientos de verificación.
- Asistencia para diseño y toma de decisiones: estructura los requisitos y las restricciones y analiza el impacto de las alternativas de implementación.
- Análisis integral de varios documentos: organiza con base en evidencias las similitudes, diferencias y contradicciones entre informes y documentos técnicos.
- Revisión multimodal integrada: interpreta conjuntamente texto y material visual para analizar problemas y requisitos.
- Agentes de varios pasos: se utiliza para tareas que incluyen investigación, planificación, ejecución de herramientas y revisión de resultados.
- Redacción de documentos especializados: redacta informes técnicos, propuestas de diseño y documentos de revisión detallada que reflejan condiciones complejas y evidencias.
Por ejemplo, se utiliza para revisar conjuntamente los códigos relacionados y los registros de errores generados en varios servicios, o para tareas que abarcan desde el análisis de requisitos de una función compleja hasta la implementación y la revisión de los resultados de validación.
cip-5.5-sm
cip-5.5-sm realiza inferencia local y automatización de tareas en servidores perimetrales y entornos locales. Como el tamaño del modelo puede ajustarse en el rango de 24B a 40B, la configuración puede elegirse según los recursos de cómputo del equipo de implementación y el rendimiento requerido en el sitio. Dado que procesa los datos cerca del punto donde se generan, se utiliza para integrarse con los sistemas del sitio y aprovechar datos internos. Si los modelos y las herramientas necesarios se configuran localmente, también puede operarse en entornos con conectividad externa limitada.
Se encarga de interpretar la información generada en el sitio y conectarla con los procedimientos de procesamiento. Clasifica registros y solicitudes, extrae la información necesaria de los datos y ejecuta tareas repetitivas mediante herramientas internas y scripts conectados.
- Procesamiento de eventos en el sitio: clasifica los registros de los equipos y la información de estado, y selecciona los eventos que requieren verificación.
- Preprocesamiento de datos: extrae los elementos clave de los registros de trabajo y los clasifica, etiqueta y normaliza.
- Enrutamiento de solicitudes: transfiere las solicitudes recibidas al sistema responsable o al procedimiento de procesamiento correspondiente.
- Agente de tareas local: realiza tareas repetitivas consultando sistemas internos y ejecutando scripts.
- Asistencia para tareas en entornos locales: responde preguntas basándose en materiales internos y organiza la información de trabajo.
- Asistencia para análisis posteriores: selecciona los materiales que requieren revisión adicional y resume los puntos clave.
Por ejemplo, se utiliza en un flujo que clasifica los registros operativos en el servidor de una instalación, consulta el historial relacionado y redacta un resumen del incidente para la persona responsable.
Cosa
Cosa es una familia de productos de voz que convierte texto en voz, reconoce como texto la voz de entrada y permite registrar y reutilizar la voz deseada. Se utiliza para guías de servicio, creación de contenido, accesibilidad e interfaces de voz para agentes conversacionales.
cosa-a y cosa-b se encargan de la generación de voz, mientras que cosa-asr se encarga del reconocimiento de voz. cosa-a y cosa-b son modelos independientes que ofrecen sus propias listas de voces y configuraciones de síntesis, y se seleccionan desde la misma interfaz de servicio. Las funciones que ambos modelos ofrecen en común son las siguientes.
- Conversión de texto a voz: sintetiza las frases introducidas con la voz seleccionada.
- Clonación de voz: registra una voz a partir de una grabación de referencia para la que se cuenta con autorización de uso y sintetiza nuevas frases.
- Diseño de voz: crea y registra una voz describiendo las características deseadas.
- Reutilización de voz: utiliza una voz registrada en síntesis posteriores.
- Configuración de síntesis: ajusta la velocidad del habla, el idioma y otros parámetros.
- Entrega en streaming: sintetiza por frases conforme llega el texto y entrega el audio de forma secuencial.
- Control de reproducción: admite pausar, reanudar, detener e introducir frases adicionales.
La entrada progresiva de texto permite iniciar la reproducción de voz antes de que se complete toda la respuesta. Mientras CIP redacta la respuesta, puedes configurar un servicio en el que Cosa lea las frases que estén listas.
cosa-a
cosa-a admite conversión de texto a voz, clonación de voz, diseño de voz y salida en streaming. Además de las funciones básicas para seleccionar la voz, el idioma y la velocidad del habla, ofrece controles adicionales, como la configuración del número de pasos de síntesis, la intensidad de la guía y la longitud de generación. Se utiliza para ajustar la configuración durante la creación de voz y revisar los resultados, o para aplicar varias configuraciones al mismo guion y elegir el resultado.
- Sintetiza indicaciones y notificaciones para aplicaciones, quioscos y sistemas empresariales.
- Convierte materiales educativos y manuales de usuario en voz.
- Produce narraciones para contenido de video y audio.
- Produce contenido recurrente con voces registradas.
- Se utiliza para la salida de voz en streaming de agentes conversacionales.
- Se utiliza para la creación de voz con ajustes detallados de síntesis.
cosa-b
cosa-b admite la selección de voces preestablecidas, el diseño de voz basado en descripciones, la clonación basada en voces de referencia y la salida en streaming. Puedes elegir una voz de su propia lista de voces o registrar una nueva para utilizarla en el servicio.
La clonación de voz utiliza una grabación de referencia y el texto correspondiente. También admite un flujo que genera el texto de referencia mediante reconocimiento de voz durante el proceso de registro, y las voces registradas se reutilizan en síntesis posteriores.
- Configura la personalidad de voz de servicios y personajes.
- Crea voces personalizadas a partir de una descripción o una grabación de referencia.
- Sintetiza indicaciones de marca, diálogos de personajes y narraciones de contenido.
- Se utiliza para las respuestas de voz de agentes conversacionales.
- Sintetiza mensajes de indicación y guiones cambiantes con la misma voz.
Al elegir entre cosa-a y cosa-b, tome como referencia la voz que desea, el resultado de síntesis real y los elementos de control que necesita.
| Elemento | cosa-a | cosa-b |
|---|---|---|
| Configuración de síntesis | Además de la voz, el idioma y la velocidad de habla, incluye configuraciones relacionadas con el número de pasos de síntesis, la intensidad de guía y la longitud de generación | Configuraciones comunes, como la velocidad de habla y el idioma |
| Entrada para clonación | Grabación de referencia para la que tiene permiso de uso | Grabación de referencia y texto correspondiente. Durante el registro, es posible generar el texto de referencia mediante reconocimiento de voz |
| Función | Generación de voz con controles detallados de síntesis | Selección de voz y generación de voz personalizada |
cosa-asr
cosa-asr convierte el audio de entrada en texto. Documenta materiales grabados o convierte solicitudes recibidas por voz en entradas que los sistemas de trabajo posteriores pueden procesar.
- Transcribe notas de voz y materiales grabados.
- Convierte preguntas y solicitudes de trabajo basadas en voz en entradas.
- Genera texto de referencia para la clonación de voz.
- Se utiliza en procesos posteriores a la transcripción, como el resumen, la clasificación y la búsqueda.
Al entregar los resultados de la transcripción a CIP, el proceso continúa con el resumen del contenido, la clasificación de solicitudes y la redacción de borradores de trabajo. Si los resultados del procesamiento se sintetizan con cosa-a o cosa-b, se obtiene un servicio de trabajo con entrada y salida de voz.
Cova
cova-1 es un modelo especializado en OCR visual basado en LLM. Reconoce texto en documentos e imágenes, extrae el diseño y la estructura de las tablas, y proporciona descripciones breves de los elementos visuales.
Convierte los documentos que las personas visualizan en un formato más adecuado para agentes y sistemas de trabajo. Extrae el cuerpo del texto y las tablas como contenido estructurado, y transmite las imágenes incluidas en el documento mediante descripciones breves, de modo que los agentes posteriores puedan comprender tanto el contenido del documento como su contexto visual. Al configurar un flujo en el que primero se revisan los materiales mediante el texto y las descripciones extraídos, y solo se vuelven a revisar los originales que requieren una confirmación detallada, se reduce la cantidad de veces que se introducen las imágenes originales y se ahorran tokens de contexto.
| Función | Descripción |
|---|---|
| Reconocimiento de texto | Extrae texto de documentos escaneados o fotografiados. |
| Interpretación del diseño | Divide el contenido en bloques teniendo en cuenta la distribución del documento. |
| Proporcionar información de ubicación | Proporciona la ubicación de los bloques reconocidos para vincular los resultados extraídos con el texto original. |
| Extracción de la estructura de tablas | Estructura el contenido de las tablas para utilizarlo en búsquedas y procesamiento de datos. |
| Descripción breve de imágenes | Describe brevemente el contenido de las imágenes y los elementos visuales para proporcionar al agente pistas para su interpretación. |
| Optimización del contexto | Reduce la entrada repetida de la imagen original al transmitir la información principalmente mediante el texto, la estructura y la descripción de la imagen. |
| Análisis detallado selectivo | Ayuda al agente a determinar qué imágenes originales debe revisar adicionalmente. |
| Conversión de formato de documentos | Organiza los resultados del reconocimiento en HTML o Markdown. |
- Digitalización de documentos: convierte documentos en papel y materiales escaneados en materiales basados en texto.
- Recepción de documentos de trabajo: extrae contenido de solicitudes, documentos comprobatorios e informes.
- Procesamiento de datos tabulares: utiliza las tablas incluidas en los documentos para el procesamiento posterior de datos.
- Preprocesamiento para la búsqueda de conocimiento: convierte imágenes de documentos y materiales visuales en texto y estructuras que se pueden buscar.
- Automatización de la revisión de documentos: envía los resultados extraídos a CIP para verificar elementos, resumir y comparar materiales.
- Optimización de entradas para agentes: organiza el contenido, las tablas y las descripciones de imágenes de documentos extensos para transmitir solo la información necesaria.
Por ejemplo, extrae el contenido y las tablas de un informe, y describe el gráfico incluido como un gráfico que muestra la tendencia de las ventas por trimestre. Con esta descripción, el agente identifica la existencia y el propósito del gráfico y, cuando necesita cifras o tendencias precisas, revisa adicionalmente el original correspondiente.
Conexión de productos
Al conectar los productos, se puede configurar el siguiente flujo.
- Tareas basadas en documentos: Cova extrae el contenido, las tablas y las descripciones de imágenes; CIP revisa de forma selectiva los originales necesarios para realizar análisis y procesar las tareas; y Cosa comunica los resultados por voz.
- Tareas basadas en voz: Cosa ASR convierte las solicitudes de voz en texto, y cosa-a o cosa-b leen las respuestas procesadas por CIP.
- Automatización en campo: cip-5.5-sm clasifica los datos de campo y realiza las tareas locales, y transfiere a cip-5.5-im o cip-5.5-mm los materiales que requieren un análisis integral adicional.
Llamadas permitidas en la puerta de enlace
Los planes del gateway determinan las llamadas permitidas para cada modelo. La tabla siguiente muestra los alcances habilitados por los planes LLM_FREE, TTS_FREE y STT_FREE, que se aplican automáticamente sin necesidad de solicitarlo. No incluye los modelos habilitados mediante otras rutas.
| ID del modelo | Llamadas permitidas | Plan de referencia |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm과 cova-1은 이 플랜 표에 없습니다. 표의 cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm, ivy-4-mm은 위 제품 설명에 포함되지 않은 모델 ID입니다. 호출 키가 어느 경로에 해당하는지는 API 호출하기 문서에 있습니다.
