Developer guide
Model
Resum dels models
Els models de CLEVI es divideixen en tres famílies de productes: CIP, responsable de la intel·ligència general i l’automatització de tasques; Cosa, responsable de la generació i el reconeixement de veu; i Cova, responsable de l’extracció d’informació de documents i imatges. Cada producte es pot utilitzar de manera independent o connectar-se en serveis que van des del reconeixement de documents i l’anàlisi fins a l’execució de tasques i la guia per veu.
| Producte | ID del model | Especificacions principals | Funció principal |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B ajustable | Automatització de tasques locals i en servidors edge |
| CIP-5.5-IM | cip-5.5-im | 360B · entrada 256K · sortida 64K · multimodal | Processament general de tasques. Prioritza la velocitat de resposta i el rendiment |
| CIP-5.5-MM | cip-5.5-mm | 800B · entrada 512K · sortida 64K · multimodal | Anàlisi de contextos llargs i resolució de problemes complexos |
| Cosa-A | cosa-a | Síntesi, clonació, disseny i streaming de veu | Generació de veu amb control detallat de la síntesi |
| Cosa-B | cosa-b | Síntesi, clonació, disseny i streaming de veu | Selecció de veu i generació de veu personalitzada |
| Cosa ASR | cosa-asr | Reconeixement de veu | Conversió de l’entrada de veu en text |
| Cova | cova-1 | OCR visual específic basat en LLM | Extracció de text, disseny i taules, i descripcions senzilles d’imatges |
CIP
CIP és responsable de la intel·ligència general i l’automatització de tasques. Està format per cip-5.5-im i cip-5.5-mm, que es poden invocar a través de la passarel·la, i cip-5.5-sm, que es desplega en servidors edge i en entorns on-premises.
cip-5.5-im i cip-5.5-mm
| Element | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Mida | 360B | 800B |
| Límit d’entrada | 256K | 512K |
| Sortida màxima | 64K | 64K |
| Formats d’entrada | Text i materials visuals (documents, imatges de pantalla, taules i gràfics) | Text i materials visuals (revisió integrada de codi, documents i materials de pantalla) |
| Orientació del disseny | Processa tasques quotidianes de coneixement i desenvolupament centrant-se en la velocitat de resposta, l’eficiència de costos i el rendiment. | Processa tasques complexes que integren diversos materials i condicions i connecten els resultats de l’anàlisi amb tasques reals. |
| Ús d’entrades llargues | Revisa conjuntament diversos documents, fitxers de codi i historials de converses. | Gestiona conjuntament grans quantitats de materials de referència i historials de tasques, i executa tasques d’agent en què la recerca, l’execució i la verificació es desenvolupen en diverses etapes. |
cip-5.5-im és adequat per a tasques amb objectius i abast clarament definits. Alguns exemples representatius són extreure la informació necessària dels materials proporcionats, elaborar resultats en el format especificat i modificar el codi d’acord amb els requisits. La sortida màxima de 64K s’utilitza per elaborar informes detallats o resultats formats per diverses parts.
- Assistència al desenvolupament: escriu funcions i funcionalitats, corregeix errors amb un abast clar i implementa d’acord amb els patrons existents.
- Generació de proves: elabora esborranys de proves i casos de validació basats en els requisits i la implementació.
- Processament de documents: s’encarrega de la síntesi, la classificació, l’extracció d’elements, la conversió de formats i l’elaboració d’esborranys.
- Anàlisi multimodal: revisa imatges de pantalles i taules i gràfics de documents juntament amb les explicacions pertinents.
- Assistència interactiva en tasques: respon preguntes basant-se en materials de treball i elabora els resultats necessaris.
- Processament massiu: s’utilitza per a la síntesi individual de nombrosos documents, la classificació de sol·licituds i la transformació de dades.
- Subagent: s’encarrega de subtasques amb límits clars, com ara explorar codi, revisar fitxers específics o organitzar materials.
Per exemple, s’utilitza per rebre els requisits funcionals i el codi relacionat i elaborar una proposta de modificació, proves i descripció dels canvis, o per classificar documents rebuts i crear una síntesi per al responsable.
cip-5.5-mm és adequat per a tasques que requereixen comprendre les relacions entre la informació i mantenir la coherència de tot el treball. En el desenvolupament, revisa les connexions entre els requisits, el disseny, la implementació i les proves; en l’anàlisi documental, integra les afirmacions i les proves, així com les diferències i contradiccions, de diversos materials.
- Implementació de funcionalitats complexes: modifica conjuntament el codi, les proves i la documentació tenint en compte els contractes i el comportament de diversos mòduls.
- Anàlisi de grans bases de codi: revisa les relacions de crida, el flux de dades i l’abast de l’impacte dels canvis.
- Anàlisi de les causes d’incidències: contrasta els registres, la configuració, el codi i els resultats d’execució per organitzar les hipòtesis sobre les causes i els procediments de verificació.
- Suport al disseny i a la presa de decisions: estructura els requisits i les restriccions i analitza l’impacte de les alternatives d’implementació.
- Anàlisi integradora de diversos documents: organitza, basant-se en proves, les similituds, les diferències i les contradiccions de reports i documents tècnics.
- Revisió integradora multimodal: interpreta conjuntament textos i materials visuals per analitzar problemes i requisits.
- Agent multietapa: s’utilitza per a tasques que encadenen recerca, planificació, execució d’eines i revisió dels resultats.
- Redacció de documents especialitzats: elabora informes tècnics, propostes de disseny i documents de revisió detallats que reflecteixen condicions i proves complexes.
Per exemple, s’utilitza per revisar conjuntament els codis relacionats i els registres d’errors generats en diversos serveis, o per a tasques que s’estenen des de l’anàlisi dels requisits d’una funció complexa fins a la implementació i la revisió dels resultats de validació.
cip-5.5-sm
cip-5.5-sm realitza inferència local i automatització de tasques en servidors d’edge i entorns on-premises. Com que la mida del model es pot ajustar en un interval de 24B~40B, la configuració es pot triar d’acord amb els recursos de càlcul de l’equip de desplegament i el rendiment requerit sobre el terreny. Com que processa les dades a prop del punt on es generen, s’utilitza per a la integració amb sistemes locals i l’aprofitament de dades internes; si es configuren localment els models i les eines necessaris, també es pot operar en entorns amb connexions externes limitades.
Té la funció d’interpretar la informació generada sobre el terreny i convertir-la en procediments de processament. Classifica els registres i les sol·licituds, extreu la informació necessària de les dades i executa tasques repetitives amb eines internes i scripts connectats.
- Processament d’esdeveniments sobre el terreny: classifica els registres dels equips i la informació d’estat, i selecciona els esdeveniments que cal revisar.
- Preprocessament de dades: extreu els elements clau dels registres de treball i els classifica, etiqueta i normalitza.
- Enrutament de sol·licituds: transmet les sol·licituds rebudes al sistema responsable o al procediment de processament corresponent.
- Agent de tasques local: executa tasques repetitives consultant sistemes interns i executant scripts.
- Suport a les tasques on-premises: respon preguntes basant-se en materials interns i organitza el contingut de les tasques.
- Suport a l’anàlisi posterior: selecciona els materials que requereixen una revisió addicional i en resumeix els punts clau.
Per exemple, s’utilitza en fluxos de treball que classifiquen els registres operatius en un servidor del centre de treball, consulten l’historial relacionat i redacten un resum de l’incident per a la persona responsable.
Cosa
Cosa és una família de productes de veu que converteix text en veu, reconeix la veu d’entrada com a text i permet registrar i reutilitzar la veu desitjada. S’utilitza per a guies de servei, creació de continguts, suport a l’accessibilitat i interfícies de veu d’agents conversacionals.
La generació de veu és responsabilitat de cosa-a i cosa-b, mentre que el reconeixement de veu correspon a cosa-asr. cosa-a i cosa-b són models independents que ofereixen, respectivament, les seves pròpies llistes de veus i configuracions de síntesi, i se seleccionen des de la mateixa interfície de servei. Les funcions que ofereixen en comú els dos models són les següents.
- Conversió de text a veu: sintetitza el text introduït amb la veu seleccionada.
- Clonació de veu: registra una veu basant-se en una gravació de referència per a la qual es disposa d'autorització d'ús i sintetitza frases noves.
- Disseny de veu: crea i registra una veu descrivint les característiques de la veu desitjada.
- Reutilització de veus: utilitza les veus registrades en síntesis posteriors.
- Configuració de síntesi: ajusta la velocitat de parla, l'idioma i altres paràmetres.
- Transmissió en streaming: sintetitza per frases a mesura que arriba el text i transmet l'àudio seqüencialment.
- Control de reproducció: permet pausar, reprendre, aturar i introduir frases addicionals.
Amb l'entrada progressiva de text, es pot iniciar la reproducció de veu abans que es completi tota la resposta. Mentre CIP redacta la resposta, es pot configurar un servei perquè cosa-a llegeixi les frases que ja estiguin preparades.
cosa-a
cosa-a admet la conversió de text a veu, la clonació de veu, el disseny de veu i la sortida en streaming. A més de les funcions bàsiques per seleccionar la veu, l'idioma i la velocitat de parla, ofereix controls addicionals, com ara la configuració del nombre d'etapes de síntesi, la intensitat de guia i la longitud de generació. S'utilitza per ajustar la configuració durant el procés de creació de veu i revisar-ne els resultats, o per aplicar diverses configuracions al mateix guió i seleccionar-ne el resultat.
- Sintetitza instruccions i notificacions per a aplicacions, quioscos i sistemes empresarials.
- Converteix materials educatius i manuals d'ús en veu.
- Crea la narració de continguts de vídeo i àudio.
- Crea continguts repetitius amb veus registrades.
- S'utilitza per a la sortida de veu en streaming d'agents conversacionals.
- S'utilitza per a la creació de veu amb ajustos detallats de síntesi.
cosa-b
cosa-b admet la selecció de veus predefinides, el disseny de veu basat en descripcions, la clonació basada en veus de referència i la sortida en streaming. Permet seleccionar una veu de la seva pròpia llista de veus o registrar-ne una de nova per utilitzar-la en un servei.
Per a la clonació de veu, s'utilitzen una gravació de referència i el text corresponent. També admet un flux de treball que genera el text de referència mitjançant el reconeixement de veu durant el registre, i les veus registrades es reutilitzen en síntesis posteriors.
- Configura la persona vocal de serveis i personatges.
- Crea veus personalitzades a partir d'una descripció o d'una gravació de referència.
- Sintetitza instruccions de marca, diàlegs de personatges i narracions de continguts.
- S'utilitza per a les respostes de veu d'agents conversacionals.
- Sintetitza missatges d'instruccions i guions que canvien amb la mateixa veu.
A l’hora de triar entre cosa-a i cosa-b, pren com a criteri la veu que vols, el resultat real de la síntesi i els elements de control que necessites.
| Element | cosa-a | cosa-b |
|---|---|---|
| Configuració de la síntesi | A més de la veu, l’idioma i la velocitat de parla, configuració relacionada amb el nombre de passos de síntesi, la intensitat de guia i la longitud de generació | Configuració comuna, com ara la velocitat de parla i l’idioma |
| Entrada per a la clonació | Enregistrament de referència del qual tens els drets d’ús | Enregistrament de referència i text corresponent. Durant el procés de registre, es pot generar el text de referència mitjançant reconeixement de veu |
| Funció | Generació de veu amb controls detallats de síntesi | Selecció de veu i generació de veu personalitzada |
cosa-asr
cosa-asr converteix la veu d’entrada en text. Permet documentar enregistraments o convertir sol·licituds rebudes per veu en entrades que els sistemes de treball posteriors poden processar.
- Transcriu notes de veu i enregistraments.
- Converteix preguntes i sol·licituds de treball basades en veu en entrades.
- Genera text de referència per a la clonació de veu.
- S’utilitza en processos que continuen amb el resum, la classificació i la cerca després de la transcripció.
Si transmets els resultats de la transcripció a CIP, el procés pot continuar amb el resum del contingut, la classificació de les sol·licituds i la redacció d’esborranys de treball. Si sintetitzes els resultats amb cosa-a o cosa-b, obtens un servei de treball amb entrada i sortida de veu.
Cova
cova-1 és un model especialitzat en OCR visual basat en LLM. Reconeix text en documents i imatges, extreu la disposició i l’estructura de les taules i proporciona descripcions breus dels elements visuals.
Converteix els documents que veuen les persones en un format fàcil d’utilitzar per als agents i els sistemes de treball. Extreu el text principal i les taules com a contingut estructurat i transmet les imatges incloses en el document com a descripcions breus, de manera que els agents posteriors poden comprendre tant el contingut del document com el context visual. Si estructures un flux en què primer analitzes els materials mitjançant el text i les descripcions extrets i després revises només els originals que requereixen una verificació detallada, pots reduir la quantitat de vegades que introdueixes la imatge original i estalviar tokens de context.
| Funció | Descripció |
|---|---|
| Reconeixement de text | Extreu text dels documents escanejats o fotografiats. |
| Interpretació del disseny | Divideix el contingut en blocs tenint en compte la disposició del document. |
| Provisió d'informació d'ubicació | Proporciona la ubicació dels blocs reconeguts per enllaçar els resultats extrets amb el text original. |
| Extracció de l'estructura de les taules | Estructura el contingut de les taules per utilitzar-lo en cerques i processos de dades. |
| Descripció breu de les imatges | Descriu breument el contingut de les imatges i els elements visuals per proporcionar pistes d'interpretació a l'agent. |
| Optimització del context | Redueix l'entrada repetida de la imatge original transmetent la informació principalment mitjançant el text, l'estructura i les descripcions de les imatges. |
| Anàlisi detallada selectiva | Ajuda l'agent a determinar quines imatges originals ha de revisar addicionalment. |
| Conversió del format dels documents | Organitza els resultats del reconeixement en HTML o Markdown. |
- Digitalització de documents: converteix documents en paper i materials escanejats en materials basats en text.
- Recepció de documents de treball: extreu contingut de formularis de sol·licitud, documents acreditatius i informes.
- Processament de dades tabulars: utilitza les taules incloses en els documents per al processament posterior de dades.
- Preprocessament per a la cerca de coneixement: converteix imatges de documents i materials visuals en text i estructures cercables.
- Automatització de la revisió de documents: transmet els resultats extrets a CIP per verificar i resumir elements i comparar materials.
- Optimització de les entrades de l'agent: organitza el cos, les taules i les descripcions de les imatges dels documents extensos per transmetre només la informació necessària.
Per exemple, mentre extreu el cos i les taules d'un informe, descriu el gràfic inserit com un gràfic que mostra l'evolució trimestral de les vendes. Amb aquesta descripció, l'agent identifica l'existència i la finalitat del gràfic i, quan necessita xifres o tendències exactes, revisa addicionalment l'original corresponent.
Connexió de productes
En connectar els productes, podeu configurar el flux següent.
- Tasques basades en documents: Cova extreu el cos, les taules i les descripcions de les imatges; CIP revisa selectivament els originals necessaris per dur a terme l'anàlisi i el processament de les tasques, i Cosa transmet els resultats per veu.
- Tasques basades en veu: Cosa ASR converteix les sol·licituds de veu en text, i cosa-a o cosa-b llegeixen les respostes processades per CIP.
- Automatització sobre el terreny: cip-5.5-sm classifica les dades del lloc i executa les tasques locals, i transfereix a cip-5.5-im o cip-5.5-mm els materials que requereixen una anàlisi integral addicional.
Trucades permeses a la passarel·la
Els plans de la passarel·la determinen les crides permeses per a cada model. La taula següent mostra l'abast que habiliten els plans LLM_FREE, TTS_FREE i STT_FREE, que s'apliquen automàticament sense necessitat de sol·licitar-los. No inclou els models habilitats per altres rutes.
| ID del model | Crides permeses | Pla de referència |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm i cova-1 no apareixen en aquesta taula del pla. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm i ivy-4-mm que figuren a la taula són ID de models que no s’inclouen en les descripcions dels productes anteriors. La documentació sobre com fer crides a l’API indica a quin camí correspon la clau de crida.
