Developer guide
Modello
Riepilogo del modello
I modelli CLEVI sono suddivisi in tre famiglie di prodotti: CIP, dedicata all'intelligenza generale e all'automazione del lavoro; Cosa, dedicata alla generazione e al riconoscimento vocale; e Cova, dedicata all'estrazione di informazioni da documenti e immagini. Ogni prodotto può essere utilizzato in modo indipendente oppure collegato a servizi che comprendono il riconoscimento dei documenti, l'analisi, l'esecuzione delle attività e la guida vocale.
| Prodotto | ID modello | Specifiche principali | Ruolo principale |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B regolabile | Automazione del lavoro su server edge e in locale |
| CIP-5.5-IM | cip-5.5-im | 360B · input 256K · output 64K · multimodale | Elaborazione generale delle attività. Priorità alla velocità di risposta e al throughput |
| CIP-5.5-MM | cip-5.5-mm | 800B · input 512K · output 64K · multimodale | Analisi di contesti lunghi e risoluzione di problemi complessi |
| Cosa-A | cosa-a | Sintesi·clonazione·design·streaming vocale | Generazione vocale con controllo dettagliato della sintesi |
| Cosa-B | cosa-b | Sintesi·clonazione·design·streaming vocale | Selezione della voce e generazione vocale personalizzata |
| Cosa ASR | cosa-asr | Riconoscimento vocale | Conversione dell'input vocale in testo |
| Cova | cova-1 | Dedicato all'OCR visivo basato su LLM | Estrazione di testo, layout e tabelle e semplice descrizione delle immagini |
CIP
CIP è dedicato all'intelligenza generale e all'automazione del lavoro. Comprende cip-5.5-im e cip-5.5-mm, richiamabili tramite gateway, e cip-5.5-sm, distribuibile su server edge e on-premises.
cip-5.5-im e cip-5.5-mm
| Voce | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Dimensioni | 360B | 800B |
| Limite di input | 256K | 512K |
| Output massimo | 64K | 64K |
| Formati di input | Testo e materiali visivi (documenti, immagini di schermate, tabelle e grafici) | Testo e materiali visivi (revisione integrata di codice, documenti e materiali su schermo) |
| Orientamento progettuale | Gestisce le attività quotidiane di knowledge work e sviluppo, con particolare attenzione alla velocità di risposta, all'efficienza dei costi e al throughput. | Gestisce attività complesse che integrano più materiali e condizioni e collegano i risultati dell'analisi alle attività concrete. |
| Utilizzo degli input lunghi | Esamina insieme più documenti, file di codice e cronologie delle conversazioni. | Gestisce insieme un'enorme quantità di materiali di riferimento e cronologie delle attività ed esegue attività agentiche in cui ricerca, esecuzione e verifica si susseguono in più fasi. |
cip-5.5-im è adatto per attività con obiettivi e ambito di lavoro chiari. Tra gli esempi principali rientrano l’estrazione delle informazioni necessarie dai materiali forniti, la stesura dei risultati nel formato specificato e la modifica del codice in base ai requisiti. L’output massimo di 64K viene utilizzato per redigere report dettagliati o risultati composti da più parti.
- Assistenza allo sviluppo: scrive funzioni e funzionalità, corregge bug con ambito definito e implementa seguendo i pattern esistenti.
- Generazione di test: prepara bozze di test e casi di verifica sulla base dei requisiti e dell’implementazione.
- Elaborazione dei documenti: si occupa di riepiloghi, classificazione, estrazione di elementi, conversione dei formati e stesura di bozze.
- Analisi multimodale: esamina immagini dello schermo e tabelle e grafici nei documenti insieme alle relative spiegazioni.
- Supporto interattivo alle attività: risponde alle domande basandosi sui materiali di lavoro e redige i risultati necessari.
- Elaborazione in batch: viene utilizzato per riepiloghi individuali di numerosi documenti, classificazione delle richieste e trasformazione dei dati.
- Subagenti: gestiscono sottoattività con confini chiari, come l’esplorazione del codice, la revisione di file specifici e l’organizzazione dei materiali.
Ad esempio, viene utilizzato per ricevere i requisiti funzionali e il codice correlato e redigere una proposta di modifica, i test e la descrizione delle modifiche, oppure per classificare i documenti ricevuti e creare riepiloghi per i responsabili.
cip-5.5-mm è adatto per attività che richiedono di comprendere le relazioni tra le informazioni e mantenere la coerenza dell’intero lavoro. Nello sviluppo, esamina i collegamenti tra requisiti, progettazione, implementazione e test; nell’analisi dei documenti, integra le affermazioni e le prove, le differenze e le contraddizioni presenti in più materiali.
- Implementazione di funzionalità complesse: modifica congiuntamente codice, test e documentazione tenendo conto dei contratti e del comportamento di più moduli.
- Analisi di basi di codice di grandi dimensioni: esamina le relazioni tra le chiamate, i flussi di dati e l’ambito degli effetti delle modifiche.
- Analisi delle cause dei malfunzionamenti: confronta log, configurazioni, codice e risultati di esecuzione per organizzare ipotesi sulle cause e procedure di verifica.
- Supporto alla progettazione e alle decisioni: struttura requisiti e vincoli e analizza l’impatto delle alternative di implementazione.
- Analisi integrata di più documenti: organizza in modo basato sulle prove i punti in comune, le differenze e le contraddizioni tra report e documentazione tecnica.
- Revisione integrata multimodale: interpreta congiuntamente testo e materiali visivi per analizzare problemi e requisiti.
- Agenti multi-step: viene utilizzato per attività che comprendono ricerca, pianificazione, esecuzione di strumenti e revisione dei risultati.
- Redazione di documentazione professionale: redige report tecnici, proposte di progettazione e documenti di revisione dettagliati che riflettono condizioni e prove complesse.
Ad esempio, viene utilizzato per esaminare insieme i codici correlati e i log degli errori verificatisi in più servizi, oppure per attività che vanno dall’analisi dei requisiti di una funzionalità complessa all’implementazione e alla revisione dei risultati della verifica.
cip-5.5-sm
cip-5.5-sm esegue inferenza locale e automatizza le attività su server edge e in ambienti on-premises. Poiché le dimensioni del modello possono essere regolate nell’intervallo da 24B a 40B, è possibile scegliere la configurazione in base alle risorse di calcolo dell’hardware di distribuzione e alle prestazioni richieste sul campo. L’elaborazione avviene vicino al punto in cui vengono generati i dati, quindi il modello può essere utilizzato per l’integrazione con i sistemi sul campo e per l’impiego dei dati interni. Configurando localmente i modelli e gli strumenti necessari, può essere utilizzato anche in ambienti con connettività esterna limitata.
Svolge il ruolo di interpretare le informazioni generate sul campo e collegarle alle procedure di elaborazione. Classifica log e richieste, estrae le informazioni necessarie dai dati ed esegue attività ripetitive tramite strumenti interni e script collegati.
- Elaborazione degli eventi sul campo: classifica i log delle apparecchiature e le informazioni sullo stato, selezionando gli eventi che richiedono verifica.
- Pre-elaborazione dei dati: estrae gli elementi chiave dai registri delle attività e li classifica, etichetta e normalizza.
- Instradamento delle richieste: inoltra le richieste ricevute al sistema responsabile o alla procedura di elaborazione appropriata.
- Agente locale per le attività: esegue attività ripetitive consultando i sistemi interni ed eseguendo script.
- Supporto alle attività on-premises: risponde alle domande sulla base dei materiali interni e organizza i contenuti delle attività.
- Supporto all’analisi successiva: seleziona i materiali che richiedono un’ulteriore revisione e ne organizza i contenuti principali.
Ad esempio, viene utilizzato per classificare i log operativi su un server aziendale, consultare la cronologia correlata e redigere un riepilogo dell’incidente destinato al responsabile.
Cosa
Cosa è una famiglia di prodotti vocali che converte il testo in voce, riconosce l’audio in ingresso come testo e consente di registrare e riutilizzare la voce desiderata. Viene utilizzata per le indicazioni sul servizio, la creazione di contenuti, il supporto all’accessibilità e le interfacce vocali degli agenti conversazionali.
La generazione vocale è gestita da cosa-a e cosa-b, mentre il riconoscimento vocale è gestito da cosa-asr. cosa-a e cosa-b sono modelli distinti, ciascuno con il proprio elenco di voci e le proprie impostazioni di sintesi, selezionabili dalla stessa interfaccia del servizio. Le funzionalità comuni ai due modelli sono le seguenti.
- Sintesi vocale: sintetizza il testo inserito con la voce selezionata.
- Clonazione vocale: registra una voce e sintetizza nuove frasi sulla base di una registrazione di riferimento per la quale si dispone dei diritti di utilizzo.
- Progettazione vocale: crea e registra una voce descrivendone le caratteristiche desiderate.
- Riutilizzo della voce: utilizza una voce registrata per le sintesi successive.
- Impostazioni di sintesi: regola la velocità di parlato, la lingua e altri parametri.
- Trasmissione in streaming: sintetizza il testo in unità di frasi man mano che arriva e trasmette l’audio in sequenza.
- Controllo della riproduzione: supporta la pausa, la ripresa, l’interruzione e l’inserimento di frasi aggiuntive.
Con l’inserimento progressivo del testo, è possibile avviare la riproduzione vocale prima che l’intera risposta sia completata. Mentre CIP elabora la risposta, è possibile configurare un servizio in cui Cosa legge le frasi già pronte.
cosa-a
cosa-a supporta la sintesi vocale, la clonazione vocale, la progettazione vocale e l’output in streaming. Oltre alle funzioni di base per selezionare voce, lingua e velocità di parlato, offre ulteriori opzioni di controllo, tra cui impostazioni relative al numero di passaggi di sintesi, all’intensità della guida e alla lunghezza della generazione. Viene utilizzato per regolare le impostazioni durante la produzione vocale e verificare i risultati, oppure per applicare più configurazioni allo stesso copione e scegliere il risultato migliore.
- Sintetizza indicazioni e notifiche per app, chioschi e sistemi aziendali.
- Crea materiali didattici e manuali utente in formato audio.
- Produce la narrazione per contenuti video e audio.
- Crea contenuti ricorrenti con una voce registrata.
- Viene utilizzato per l’output vocale in streaming degli agenti conversazionali.
- Viene utilizzato per la produzione vocale con regolazione dettagliata delle impostazioni di sintesi.
cosa-b
cosa-b supporta la selezione di voci preimpostate, la progettazione vocale basata su descrizioni, la clonazione basata su voci di riferimento e l’output in streaming. È possibile scegliere una voce dall’elenco di voci disponibile oppure registrarne una nuova da utilizzare nel servizio.
La clonazione vocale utilizza una registrazione di riferimento e il testo corrispondente. Supporta anche un flusso in cui il testo di riferimento viene generato tramite riconoscimento vocale durante la registrazione; le voci registrate vengono riutilizzate nelle sintesi successive.
- Configura la personalità vocale di servizi e personaggi.
- Crea voci personalizzate a partire da una descrizione o da una registrazione di riferimento.
- Sintetizza indicazioni del brand, battute dei personaggi e narrazioni per contenuti.
- Viene utilizzato per le risposte vocali degli agenti conversazionali.
- Sintetizza messaggi di 안내 e copioni modificati mantenendo la stessa voce.
Quando scegliete tra cosa-a e cosa-b, basatevi sulla voce desiderata, sul risultato della sintesi e sugli elementi di controllo necessari.
| Elemento | cosa-a | cosa-b |
|---|---|---|
| Impostazioni di sintesi | Oltre alla voce, alla lingua e alla velocità di parlato, include impostazioni relative al numero di passaggi di sintesi, all'intensità della guida e alla lunghezza della generazione | Impostazioni comuni come la velocità di parlato e la lingua |
| Input per la clonazione | Una registrazione di riferimento per cui si dispone dell'autorizzazione all'uso | Una registrazione di riferimento e il testo corrispondente. Durante la registrazione è possibile generare il testo di riferimento tramite il riconoscimento vocale |
| Ruolo | Generazione vocale con controllo dettagliato della sintesi | Selezione della voce e generazione di voci personalizzate |
cosa-asr
cosa-asr converte l'audio in ingresso in testo. Documenta le registrazioni o trasforma le richieste ricevute tramite voce in input che i sistemi operativi successivi possono elaborare.
- Trascrive memo vocali e registrazioni.
- Trasforma domande e richieste di lavoro basate sulla voce in input.
- Genera il testo di riferimento per la clonazione vocale.
- Viene utilizzato per processi successivi alla trascrizione, come riepilogo, classificazione e ricerca.
Trasmettendo i risultati della trascrizione a CIP, si procede con il riepilogo dei contenuti, la classificazione delle richieste e la preparazione di bozze operative. Sintetizzando i risultati elaborati con cosa-a o cosa-b, si ottiene un servizio operativo con input e output vocali.
Cova
cova-1 è un modello LLM specializzato nell'OCR visivo. Riconosce il testo nei documenti e nelle immagini, estrae il layout e la struttura delle tabelle e fornisce brevi descrizioni degli elementi visivi.
Converte i documenti destinati alla lettura umana in un formato più adatto agli agenti e ai sistemi operativi. Estrae il testo principale e le tabelle come contenuti strutturati e fornisce brevi descrizioni delle immagini incluse nei documenti, consentendo agli agenti successivi di comprendere sia il contenuto sia il contesto visivo del documento. Organizzando un flusso in cui i materiali vengono analizzati inizialmente tramite il testo e le descrizioni estratti e vengono esaminati in dettaglio solo gli originali che richiedono una verifica approfondita, è possibile ridurre la quantità di immagini originali inserite ripetutamente e risparmiare token di contesto.
| Funzione | Descrizione |
|---|---|
| Riconoscimento del testo | Estrae il testo dai documenti acquisiti tramite scansione o fotografia. |
| Interpretazione del layout | Tiene conto della disposizione del documento e suddivide il contenuto in blocchi. |
| Fornitura delle informazioni sulla posizione | Fornisce la posizione dei blocchi riconosciuti per collegare i risultati estratti al testo originale. |
| Estrazione della struttura delle tabelle | Struttura il contenuto delle tabelle per utilizzarlo nella ricerca e nell'elaborazione dei dati. |
| Descrizione sintetica delle immagini | Descrive brevemente il contenuto delle immagini e degli elementi visivi, fornendo agli agenti indicazioni per l'interpretazione. |
| Ottimizzazione del contesto | Riduce l'inserimento ripetuto dell'immagine originale trasmettendo le informazioni principalmente attraverso descrizioni del testo, della struttura e delle immagini. |
| Analisi dettagliata selettiva | Aiuta l'agente a determinare quali immagini originali esaminare ulteriormente. |
| Conversione del formato dei documenti | Organizza i risultati del riconoscimento in HTML o Markdown. |
- Digitalizzazione dei documenti: converte i documenti cartacei e i materiali acquisiti tramite scansione in materiali basati sul testo.
- Acquisizione dei documenti aziendali: estrae i contenuti da moduli di richiesta, documenti giustificativi e report.
- Elaborazione dei dati tabellari: utilizza le tabelle incluse nei documenti per le successive elaborazioni dei dati.
- Pre-elaborazione per la ricerca nella knowledge base: converte le immagini dei documenti e i materiali visivi in testo e strutture ricercabili.
- Automazione della revisione dei documenti: trasmette i risultati estratti a CIP per verificare le voci, creare riepiloghi e confrontare i materiali.
- Ottimizzazione degli input per gli agenti: organizza il corpo del testo, le tabelle e le descrizioni delle immagini dei documenti lunghi per trasmettere solo le informazioni necessarie.
Ad esempio, estrae il corpo del testo e le tabelle di un report e descrive il grafico inserito come un grafico che mostra l'andamento trimestrale delle vendite. L'agente utilizza questa descrizione per comprendere l'esistenza e lo scopo del grafico e, quando sono necessari valori o tendenze precise, esamina ulteriormente l'originale corrispondente.
Collegamento delle famiglie di prodotti
Collegando i prodotti, è possibile configurare il seguente flusso.
- Attività basate sui documenti: Cova estrae il corpo del testo, le tabelle e le descrizioni delle immagini; CIP seleziona ed esamina i materiali originali necessari per eseguire analisi ed elaborare le attività; Cosa comunica i risultati tramite la voce.
- Attività basate sulla voce: Cosa ASR converte le richieste vocali in testo e cosa-a o cosa-b legge le risposte elaborate da CIP.
- Automazione sul campo: cip-5.5-sm classifica i dati sul campo ed esegue le attività locali, quindi trasferisce a cip-5.5-im o cip-5.5-mm i materiali che richiedono un'ulteriore analisi complessiva.
Chiamate consentite dal gateway
I piani del gateway determinano le chiamate consentite per ciascun modello. La tabella seguente mostra l'ambito abilitato dai piani LLM_FREE, TTS_FREE e STT_FREE, applicati automaticamente senza richiesta. Non include i modelli abilitati tramite altri percorsi.
| ID modello | Chiamate consentite | Piano di riferimento |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm e cova-1 non sono presenti in questa tabella del piano. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm e ivy-4-mm nella tabella sono ID modello non inclusi nelle descrizioni dei prodotti sopra. Il percorso corrispondente alla chiave di chiamata è indicato nella documentazione per effettuare chiamate API.
