Developer guide

Modello

Riepilogo del modello

I modelli CLEVI sono suddivisi in tre famiglie di prodotti: CIP, dedicata all'intelligenza generale e all'automazione del lavoro; Cosa, dedicata alla generazione e al riconoscimento vocale; e Cova, dedicata all'estrazione di informazioni da documenti e immagini. Ogni prodotto può essere utilizzato in modo indipendente oppure collegato a servizi che comprendono il riconoscimento dei documenti, l'analisi, l'esecuzione delle attività e la guida vocale.

ProdottoID modelloSpecifiche principaliRuolo principale
CIP-5.5-SMcip-5.5-sm24B~40B regolabileAutomazione del lavoro su server edge e in locale
CIP-5.5-IMcip-5.5-im360B · input 256K · output 64K · multimodaleElaborazione generale delle attività. Priorità alla velocità di risposta e al throughput
CIP-5.5-MMcip-5.5-mm800B · input 512K · output 64K · multimodaleAnalisi di contesti lunghi e risoluzione di problemi complessi
Cosa-Acosa-aSintesi·clonazione·design·streaming vocaleGenerazione vocale con controllo dettagliato della sintesi
Cosa-Bcosa-bSintesi·clonazione·design·streaming vocaleSelezione della voce e generazione vocale personalizzata
Cosa ASRcosa-asrRiconoscimento vocaleConversione dell'input vocale in testo
Covacova-1Dedicato all'OCR visivo basato su LLMEstrazione di testo, layout e tabelle e semplice descrizione delle immagini

CIP

CIP è dedicato all'intelligenza generale e all'automazione del lavoro. Comprende cip-5.5-im e cip-5.5-mm, richiamabili tramite gateway, e cip-5.5-sm, distribuibile su server edge e on-premises.

cip-5.5-im e cip-5.5-mm

Vocecip-5.5-imcip-5.5-mm
Dimensioni360B800B
Limite di input256K512K
Output massimo64K64K
Formati di inputTesto e materiali visivi (documenti, immagini di schermate, tabelle e grafici)Testo e materiali visivi (revisione integrata di codice, documenti e materiali su schermo)
Orientamento progettualeGestisce le attività quotidiane di knowledge work e sviluppo, con particolare attenzione alla velocità di risposta, all'efficienza dei costi e al throughput.Gestisce attività complesse che integrano più materiali e condizioni e collegano i risultati dell'analisi alle attività concrete.
Utilizzo degli input lunghiEsamina insieme più documenti, file di codice e cronologie delle conversazioni.Gestisce insieme un'enorme quantità di materiali di riferimento e cronologie delle attività ed esegue attività agentiche in cui ricerca, esecuzione e verifica si susseguono in più fasi.

cip-5.5-im è adatto per attività con obiettivi e ambito di lavoro chiari. Tra gli esempi principali rientrano l’estrazione delle informazioni necessarie dai materiali forniti, la stesura dei risultati nel formato specificato e la modifica del codice in base ai requisiti. L’output massimo di 64K viene utilizzato per redigere report dettagliati o risultati composti da più parti.

  • Assistenza allo sviluppo: scrive funzioni e funzionalità, corregge bug con ambito definito e implementa seguendo i pattern esistenti.
  • Generazione di test: prepara bozze di test e casi di verifica sulla base dei requisiti e dell’implementazione.
  • Elaborazione dei documenti: si occupa di riepiloghi, classificazione, estrazione di elementi, conversione dei formati e stesura di bozze.
  • Analisi multimodale: esamina immagini dello schermo e tabelle e grafici nei documenti insieme alle relative spiegazioni.
  • Supporto interattivo alle attività: risponde alle domande basandosi sui materiali di lavoro e redige i risultati necessari.
  • Elaborazione in batch: viene utilizzato per riepiloghi individuali di numerosi documenti, classificazione delle richieste e trasformazione dei dati.
  • Subagenti: gestiscono sottoattività con confini chiari, come l’esplorazione del codice, la revisione di file specifici e l’organizzazione dei materiali.

Ad esempio, viene utilizzato per ricevere i requisiti funzionali e il codice correlato e redigere una proposta di modifica, i test e la descrizione delle modifiche, oppure per classificare i documenti ricevuti e creare riepiloghi per i responsabili.

cip-5.5-mm è adatto per attività che richiedono di comprendere le relazioni tra le informazioni e mantenere la coerenza dell’intero lavoro. Nello sviluppo, esamina i collegamenti tra requisiti, progettazione, implementazione e test; nell’analisi dei documenti, integra le affermazioni e le prove, le differenze e le contraddizioni presenti in più materiali.

  • Implementazione di funzionalità complesse: modifica congiuntamente codice, test e documentazione tenendo conto dei contratti e del comportamento di più moduli.
  • Analisi di basi di codice di grandi dimensioni: esamina le relazioni tra le chiamate, i flussi di dati e l’ambito degli effetti delle modifiche.
  • Analisi delle cause dei malfunzionamenti: confronta log, configurazioni, codice e risultati di esecuzione per organizzare ipotesi sulle cause e procedure di verifica.
  • Supporto alla progettazione e alle decisioni: struttura requisiti e vincoli e analizza l’impatto delle alternative di implementazione.
  • Analisi integrata di più documenti: organizza in modo basato sulle prove i punti in comune, le differenze e le contraddizioni tra report e documentazione tecnica.
  • Revisione integrata multimodale: interpreta congiuntamente testo e materiali visivi per analizzare problemi e requisiti.
  • Agenti multi-step: viene utilizzato per attività che comprendono ricerca, pianificazione, esecuzione di strumenti e revisione dei risultati.
  • Redazione di documentazione professionale: redige report tecnici, proposte di progettazione e documenti di revisione dettagliati che riflettono condizioni e prove complesse.

Ad esempio, viene utilizzato per esaminare insieme i codici correlati e i log degli errori verificatisi in più servizi, oppure per attività che vanno dall’analisi dei requisiti di una funzionalità complessa all’implementazione e alla revisione dei risultati della verifica.

cip-5.5-sm

cip-5.5-sm esegue inferenza locale e automatizza le attività su server edge e in ambienti on-premises. Poiché le dimensioni del modello possono essere regolate nell’intervallo da 24B a 40B, è possibile scegliere la configurazione in base alle risorse di calcolo dell’hardware di distribuzione e alle prestazioni richieste sul campo. L’elaborazione avviene vicino al punto in cui vengono generati i dati, quindi il modello può essere utilizzato per l’integrazione con i sistemi sul campo e per l’impiego dei dati interni. Configurando localmente i modelli e gli strumenti necessari, può essere utilizzato anche in ambienti con connettività esterna limitata.

Svolge il ruolo di interpretare le informazioni generate sul campo e collegarle alle procedure di elaborazione. Classifica log e richieste, estrae le informazioni necessarie dai dati ed esegue attività ripetitive tramite strumenti interni e script collegati.

  • Elaborazione degli eventi sul campo: classifica i log delle apparecchiature e le informazioni sullo stato, selezionando gli eventi che richiedono verifica.
  • Pre-elaborazione dei dati: estrae gli elementi chiave dai registri delle attività e li classifica, etichetta e normalizza.
  • Instradamento delle richieste: inoltra le richieste ricevute al sistema responsabile o alla procedura di elaborazione appropriata.
  • Agente locale per le attività: esegue attività ripetitive consultando i sistemi interni ed eseguendo script.
  • Supporto alle attività on-premises: risponde alle domande sulla base dei materiali interni e organizza i contenuti delle attività.
  • Supporto all’analisi successiva: seleziona i materiali che richiedono un’ulteriore revisione e ne organizza i contenuti principali.

Ad esempio, viene utilizzato per classificare i log operativi su un server aziendale, consultare la cronologia correlata e redigere un riepilogo dell’incidente destinato al responsabile.

Cosa

Cosa è una famiglia di prodotti vocali che converte il testo in voce, riconosce l’audio in ingresso come testo e consente di registrare e riutilizzare la voce desiderata. Viene utilizzata per le indicazioni sul servizio, la creazione di contenuti, il supporto all’accessibilità e le interfacce vocali degli agenti conversazionali.

La generazione vocale è gestita da cosa-a e cosa-b, mentre il riconoscimento vocale è gestito da cosa-asr. cosa-a e cosa-b sono modelli distinti, ciascuno con il proprio elenco di voci e le proprie impostazioni di sintesi, selezionabili dalla stessa interfaccia del servizio. Le funzionalità comuni ai due modelli sono le seguenti.

  • Sintesi vocale: sintetizza il testo inserito con la voce selezionata.
  • Clonazione vocale: registra una voce e sintetizza nuove frasi sulla base di una registrazione di riferimento per la quale si dispone dei diritti di utilizzo.
  • Progettazione vocale: crea e registra una voce descrivendone le caratteristiche desiderate.
  • Riutilizzo della voce: utilizza una voce registrata per le sintesi successive.
  • Impostazioni di sintesi: regola la velocità di parlato, la lingua e altri parametri.
  • Trasmissione in streaming: sintetizza il testo in unità di frasi man mano che arriva e trasmette l’audio in sequenza.
  • Controllo della riproduzione: supporta la pausa, la ripresa, l’interruzione e l’inserimento di frasi aggiuntive.

Con l’inserimento progressivo del testo, è possibile avviare la riproduzione vocale prima che l’intera risposta sia completata. Mentre CIP elabora la risposta, è possibile configurare un servizio in cui Cosa legge le frasi già pronte.

cosa-a

cosa-a supporta la sintesi vocale, la clonazione vocale, la progettazione vocale e l’output in streaming. Oltre alle funzioni di base per selezionare voce, lingua e velocità di parlato, offre ulteriori opzioni di controllo, tra cui impostazioni relative al numero di passaggi di sintesi, all’intensità della guida e alla lunghezza della generazione. Viene utilizzato per regolare le impostazioni durante la produzione vocale e verificare i risultati, oppure per applicare più configurazioni allo stesso copione e scegliere il risultato migliore.

  • Sintetizza indicazioni e notifiche per app, chioschi e sistemi aziendali.
  • Crea materiali didattici e manuali utente in formato audio.
  • Produce la narrazione per contenuti video e audio.
  • Crea contenuti ricorrenti con una voce registrata.
  • Viene utilizzato per l’output vocale in streaming degli agenti conversazionali.
  • Viene utilizzato per la produzione vocale con regolazione dettagliata delle impostazioni di sintesi.

cosa-b

cosa-b supporta la selezione di voci preimpostate, la progettazione vocale basata su descrizioni, la clonazione basata su voci di riferimento e l’output in streaming. È possibile scegliere una voce dall’elenco di voci disponibile oppure registrarne una nuova da utilizzare nel servizio.

La clonazione vocale utilizza una registrazione di riferimento e il testo corrispondente. Supporta anche un flusso in cui il testo di riferimento viene generato tramite riconoscimento vocale durante la registrazione; le voci registrate vengono riutilizzate nelle sintesi successive.

  • Configura la personalità vocale di servizi e personaggi.
  • Crea voci personalizzate a partire da una descrizione o da una registrazione di riferimento.
  • Sintetizza indicazioni del brand, battute dei personaggi e narrazioni per contenuti.
  • Viene utilizzato per le risposte vocali degli agenti conversazionali.
  • Sintetizza messaggi di 안내 e copioni modificati mantenendo la stessa voce.

Quando scegliete tra cosa-a e cosa-b, basatevi sulla voce desiderata, sul risultato della sintesi e sugli elementi di controllo necessari.

Elementocosa-acosa-b
Impostazioni di sintesiOltre alla voce, alla lingua e alla velocità di parlato, include impostazioni relative al numero di passaggi di sintesi, all'intensità della guida e alla lunghezza della generazioneImpostazioni comuni come la velocità di parlato e la lingua
Input per la clonazioneUna registrazione di riferimento per cui si dispone dell'autorizzazione all'usoUna registrazione di riferimento e il testo corrispondente. Durante la registrazione è possibile generare il testo di riferimento tramite il riconoscimento vocale
RuoloGenerazione vocale con controllo dettagliato della sintesiSelezione della voce e generazione di voci personalizzate

cosa-asr

cosa-asr converte l'audio in ingresso in testo. Documenta le registrazioni o trasforma le richieste ricevute tramite voce in input che i sistemi operativi successivi possono elaborare.

  • Trascrive memo vocali e registrazioni.
  • Trasforma domande e richieste di lavoro basate sulla voce in input.
  • Genera il testo di riferimento per la clonazione vocale.
  • Viene utilizzato per processi successivi alla trascrizione, come riepilogo, classificazione e ricerca.

Trasmettendo i risultati della trascrizione a CIP, si procede con il riepilogo dei contenuti, la classificazione delle richieste e la preparazione di bozze operative. Sintetizzando i risultati elaborati con cosa-a o cosa-b, si ottiene un servizio operativo con input e output vocali.

Cova

cova-1 è un modello LLM specializzato nell'OCR visivo. Riconosce il testo nei documenti e nelle immagini, estrae il layout e la struttura delle tabelle e fornisce brevi descrizioni degli elementi visivi.

Converte i documenti destinati alla lettura umana in un formato più adatto agli agenti e ai sistemi operativi. Estrae il testo principale e le tabelle come contenuti strutturati e fornisce brevi descrizioni delle immagini incluse nei documenti, consentendo agli agenti successivi di comprendere sia il contenuto sia il contesto visivo del documento. Organizzando un flusso in cui i materiali vengono analizzati inizialmente tramite il testo e le descrizioni estratti e vengono esaminati in dettaglio solo gli originali che richiedono una verifica approfondita, è possibile ridurre la quantità di immagini originali inserite ripetutamente e risparmiare token di contesto.

FunzioneDescrizione
Riconoscimento del testoEstrae il testo dai documenti acquisiti tramite scansione o fotografia.
Interpretazione del layoutTiene conto della disposizione del documento e suddivide il contenuto in blocchi.
Fornitura delle informazioni sulla posizioneFornisce la posizione dei blocchi riconosciuti per collegare i risultati estratti al testo originale.
Estrazione della struttura delle tabelleStruttura il contenuto delle tabelle per utilizzarlo nella ricerca e nell'elaborazione dei dati.
Descrizione sintetica delle immaginiDescrive brevemente il contenuto delle immagini e degli elementi visivi, fornendo agli agenti indicazioni per l'interpretazione.
Ottimizzazione del contestoRiduce l'inserimento ripetuto dell'immagine originale trasmettendo le informazioni principalmente attraverso descrizioni del testo, della struttura e delle immagini.
Analisi dettagliata selettivaAiuta l'agente a determinare quali immagini originali esaminare ulteriormente.
Conversione del formato dei documentiOrganizza i risultati del riconoscimento in HTML o Markdown.
  • Digitalizzazione dei documenti: converte i documenti cartacei e i materiali acquisiti tramite scansione in materiali basati sul testo.
  • Acquisizione dei documenti aziendali: estrae i contenuti da moduli di richiesta, documenti giustificativi e report.
  • Elaborazione dei dati tabellari: utilizza le tabelle incluse nei documenti per le successive elaborazioni dei dati.
  • Pre-elaborazione per la ricerca nella knowledge base: converte le immagini dei documenti e i materiali visivi in testo e strutture ricercabili.
  • Automazione della revisione dei documenti: trasmette i risultati estratti a CIP per verificare le voci, creare riepiloghi e confrontare i materiali.
  • Ottimizzazione degli input per gli agenti: organizza il corpo del testo, le tabelle e le descrizioni delle immagini dei documenti lunghi per trasmettere solo le informazioni necessarie.

Ad esempio, estrae il corpo del testo e le tabelle di un report e descrive il grafico inserito come un grafico che mostra l'andamento trimestrale delle vendite. L'agente utilizza questa descrizione per comprendere l'esistenza e lo scopo del grafico e, quando sono necessari valori o tendenze precise, esamina ulteriormente l'originale corrispondente.

Collegamento delle famiglie di prodotti

Collegando i prodotti, è possibile configurare il seguente flusso.

  • Attività basate sui documenti: Cova estrae il corpo del testo, le tabelle e le descrizioni delle immagini; CIP seleziona ed esamina i materiali originali necessari per eseguire analisi ed elaborare le attività; Cosa comunica i risultati tramite la voce.
  • Attività basate sulla voce: Cosa ASR converte le richieste vocali in testo e cosa-a o cosa-b legge le risposte elaborate da CIP.
  • Automazione sul campo: cip-5.5-sm classifica i dati sul campo ed esegue le attività locali, quindi trasferisce a cip-5.5-im o cip-5.5-mm i materiali che richiedono un'ulteriore analisi complessiva.

Chiamate consentite dal gateway

I piani del gateway determinano le chiamate consentite per ciascun modello. La tabella seguente mostra l'ambito abilitato dai piani LLM_FREE, TTS_FREE e STT_FREE, applicati automaticamente senza richiesta. Non include i modelli abilitati tramite altri percorsi.

ID modelloChiamate consentitePiano di riferimento
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm e cova-1 non sono presenti in questa tabella del piano. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm e ivy-4-mm nella tabella sono ID modello non inclusi nelle descrizioni dei prodotti sopra. Il percorso corrispondente alla chiave di chiamata è indicato nella documentazione per effettuare chiamate API.

CLEVI

Lingua e regione

Le lingue tradotte automaticamente sono contrassegnate. La disponibilità segue il pacchetto del sito pubblicato.

136 lingue

Consigliato

1

Asia orientale

7

Sud-est asiatico

11

Asia del Sud

18

Asia centrale

5

Medio Oriente e Caucaso

10

Europa occidentale e Europa meridionale

16

Regno Unito e Irlanda

4

Europa settentrionale

10

Europa centrale e Balcani

14

Europa orientale

5

Africa orientale

8

Africa occidentale e Africa centrale

9

Africa del Sud

8

Americhe

5

Oceania

5