Developer guide

Model

Souhrn modelů

Modely CLEVI se dělí do tří produktových řad: CIP pro obecnou inteligenci a automatizaci pracovních úkolů, Cosa pro generování a rozpoznávání hlasu a Cova pro extrakci informací z dokumentů a obrázků. Každý produkt lze používat samostatně nebo je lze propojit do služeb zahrnujících rozpoznávání dokumentů, analýzu, provádění úkolů a hlasové pokyny.

ProduktID modeluHlavní specifikaceHlavní účel
CIP-5.5-SMcip-5.5-sm24B–40B upravovanýAutomatizace místních pracovních úkolů a edge servery
CIP-5.5-IMcip-5.5-im360B · vstup 256K · výstup 64K · multimodálníObecné zpracování pracovních úkolů. Prioritou jsou rychlost odezvy a propustnost
CIP-5.5-MMcip-5.5-mm800B · vstup 512K · výstup 64K · multimodálníAnalýza dlouhého kontextu a řešení komplexních problémů
Cosa-Acosa-aSyntéza·klonování·návrh·streamování hlasuGenerování hlasu s využitím podrobného řízení syntézy
Cosa-Bcosa-bSyntéza·klonování·návrh·streamování hlasuVýběr hlasu a generování přizpůsobeného hlasu
Cosa ASRcosa-asrRozpoznávání hlasuPřevod hlasového vstupu na text
Covacova-1Specializovaný OCR pro vidění založený na LLMExtrakce textu, rozvržení a tabulek a jednoduchý popis obrázků

CIP

CIP zajišťuje obecnou inteligenci a automatizaci pracovních úkolů. Skládá se z cip-5.5-im a cip-5.5-mm, které se volají prostřednictvím brány, a z cip-5.5-sm, který se nasazuje na edge servery a v on-premise prostředích.

cip-5.5-im a cip-5.5-mm

Položkacip-5.5-imcip-5.5-mm
Velikost360B800B
Limit vstupu256K512K
Maximální výstup64K64K
Formát vstupuText a vizuální materiály (dokumenty, snímky obrazovky, tabulky a grafy)Text a vizuální materiály (integrované posouzení kódu, dokumentů a materiálů z obrazovky)
ZaměřeníZpracovává běžné znalostní pracovní a vývojové úkoly se zaměřením na rychlost odezvy, nákladovou efektivitu a propustnost.Zpracovává komplexní úkoly, které kombinují a analyzují více materiálů a podmínek a propojují výsledky analýzy s praktickými úkoly.
Využití dlouhých vstupůSpolečně kontroluje více dokumentů, souborů kódu a historii konverzací.Pracuje s rozsáhlými referenčními materiály a historií úkolů a provádí agentní úkoly, v nichž se výzkum, provádění a ověřování uskutečňují v několika krocích.

cip-5.5-im se hodí pro úkoly s jasně definovaným cílem a rozsahem práce. Typickými příklady jsou extrahování potřebných informací z poskytnutých materiálů, tvorba výstupů v určeném formátu a úprava kódu podle požadavků. Maximální výstup o délce 64K tokenů je určen k tvorbě podrobných zpráv nebo výstupů složených z více částí.

  • Vývojová asistence: píše funkce a implementuje funkcionality, opravuje chyby s jasně vymezeným rozsahem a implementuje řešení podle stávajících vzorů.
  • Generování testů: na základě požadavků a implementace vytváří návrhy testů a ověřovací případy.
  • Zpracování dokumentů: zajišťuje sumarizaci, klasifikaci, extrakci položek, převod formátů a tvorbu návrhů.
  • Multimodální analýza: kontroluje snímky obrazovek a tabulky či grafy v dokumentech spolu s příslušnými popisy.
  • Interaktivní podpora pracovních úkolů: odpovídá na otázky na základě pracovních materiálů a vytváří potřebné výstupy.
  • Dávkové zpracování: používá se k individuální sumarizaci velkého počtu dokumentů, klasifikaci požadavků a převodu dat.
  • Dílčí agent: zajišťuje dílčí úkoly s jasně vymezenými hranicemi, jako je prozkoumání kódu, kontrola konkrétních souborů nebo uspořádání materiálů.

Používá se například k vytvoření návrhu úprav, testů a popisu změn na základě funkčních požadavků a souvisejícího kódu nebo k vytvoření shrnutí pro odpovědné pracovníky po klasifikaci přijatých dokumentů.

cip-5.5-mm se hodí pro úkoly, při nichž je nutné porozumět vztahům mezi informacemi a zachovat konzistenci celého úkolu. Ve vývoji kontroluje propojení požadavků, návrhu, implementace a testů; při analýze dokumentů syntetizuje tvrzení a důkazy, rozdíly a rozpory z více materiálů.

  • Implementace komplexních funkcí: s ohledem na smlouvy a chování více modulů současně mění kód, testy i dokumentaci.
  • Analýza rozsáhlého kódu: kontroluje vztahy mezi voláními, tok dat a rozsah dopadu změn.
  • Analýza příčin incidentů: porovnává protokoly, konfiguraci, kód a výsledky provedení a uspořádává hypotézy příčin a postupy jejich ověření.
  • Podpora návrhu a rozhodování: strukturuje požadavky a omezení a analyzuje dopady alternativ implementace.
  • Syntéza více dokumentů: na základě důkazů uspořádává shody, rozdíly a rozpory mezi zprávami a technickou dokumentací.
  • Integrovaná multimodální kontrola: společně interpretuje textové a vizuální materiály a analyzuje problémy a požadavky.
  • Vícekrokový agent: používá se pro úkoly navazující průzkumem, plánováním, spuštěním nástrojů a kontrolou výsledků.
  • Tvorba odborných dokumentů: vytváří technické zprávy, návrhy řešení a podrobné kontrolní dokumenty zohledňující komplexní podmínky a důkazy.

Například se používá k souběžné kontrole souvisejících kódů a protokolů chyb z více služeb nebo k úkolům, které zahrnují vše od analýzy požadavků na komplexní funkce přes implementaci až po kontrolu výsledků ověření.

cip-5.5-sm

cip-5.5-sm provádí lokální inferenci a automatizaci úloh na edge serverech a v on-premise prostředích. Protože lze velikost modelu nastavit v rozsahu 24B–40B, konfiguraci lze zvolit podle výpočetních zdrojů nasazovaného zařízení a požadovaného výkonu v daném prostředí. Zpracování probíhá v blízkosti místa vzniku dat, takže se používá k propojení s provozními systémy a k využití interních dat. Pokud jsou potřebné modely a nástroje nakonfigurovány lokálně, lze systém provozovat i v prostředích s omezeným externím připojením.

Jeho úlohou je interpretovat informace vznikající v provozním prostředí a převádět je do postupů zpracování. Klasifikuje protokoly a požadavky, extrahuje z dat potřebné informace a pomocí propojených interních nástrojů a skriptů provádí opakující se úkoly.

  • Zpracování událostí v provozním prostředí: Klasifikuje protokoly zařízení a stavové informace a vybírá události vyžadující kontrolu.
  • Předzpracování dat: Extrahuje z pracovních záznamů klíčové položky a klasifikuje, označuje a normalizuje je.
  • Směrování požadavků: Předává přijaté požadavky příslušnému systému nebo postupu zpracování.
  • Lokální pracovní agent: Provádí opakující se úkoly pomocí dotazů do interních systémů a spouštění skriptů.
  • Podpora práce v on-premise prostředí: Odpovídá na otázky na základě interních materiálů a shrnuje pracovní obsah.
  • Podpora následné analýzy: Vybírá materiály vyžadující další kontrolu a shrnuje jejich klíčový obsah.

Například se používá k toku práce, který na serveru pracoviště klasifikuje provozní protokoly, vyhledá související historii a následně vytvoří shrnutí incidentu pro odpovědnou osobu.

Cosa

Cosa je řada hlasových produktů, která převádí text na řeč, rozpoznává vstupní řeč jako text a umožňuje zaregistrovat a znovu používat požadovaný hlas. Používá se pro hlasová rozhraní v rámci poskytování informací o službách, tvorby obsahu, podpory přístupnosti a konverzačních agentů.

Generování řeči zajišťují cosa-a a cosa-b, zatímco rozpoznávání řeči zajišťuje cosa-asr. cosa-a a cosa-b jsou samostatné modely, z nichž každý poskytuje vlastní seznam hlasů a nastavení syntézy; vybírají se ve stejném servisním rozhraní. Funkce společné pro oba modely jsou následující:

  • Převod textu na řeč: Syntetizuje zadané věty vybraným hlasem.
  • Klonování hlasu: Na základě referenční nahrávky, k jejímuž použití máte oprávnění, zaregistruje hlas a syntetizuje nové věty.
  • Návrh hlasu: Vytvoří a zaregistruje hlas na základě popisu požadovaných vlastností.
  • Opětovné použití hlasu: Použije zaregistrovaný hlas pro následnou syntézu.
  • Nastavení syntézy: Upravuje rychlost mluvení, jazyk a další parametry.
  • Streamování výstupu: Syntetizuje text po připravených úsecích, jakmile dorazí, a postupně předává zvuk.
  • Ovládání přehrávání: Podporuje pozastavení, obnovení, zastavení a zadání dalších vět.

Pomocí postupného zadávání textu lze spustit přehrávání hlasu ještě před dokončením celé odpovědi. Zatímco CIP vytváří odpověď, lze nakonfigurovat službu, ve které Cosa přečte připravené úseky.

cosa-a

cosa-a podporuje převod textu na řeč, klonování hlasu, návrh hlasu a streamovaný výstup. Kromě základních funkcí pro výběr hlasu, jazyka a rychlosti mluvení nabízí další možnosti ovládání, například nastavení počtu kroků syntézy, síly vedení a délky generování. Používá se při tvorbě hlasu k úpravě nastavení a kontrole výsledků nebo k použití více nastavení na stejný scénář a výběru výsledku.

  • Syntetizuje pokyny a upozornění pro aplikace, kiosky a podnikové systémy.
  • Vytváří zvukové vzdělávací materiály a uživatelské příručky.
  • Vytváří namluvený komentář pro video a audio obsah.
  • Vytváří opakovaně používaný obsah pomocí zaregistrovaného hlasu.
  • Používá se pro streamovaný hlasový výstup konverzačních agentů.
  • Používá se při tvorbě hlasu s úpravou podrobných nastavení syntézy.

cosa-b

cosa-b podporuje výběr přednastaveného hlasu, návrh hlasu na základě popisu, klonování na základě referenčního hlasu a streamovaný výstup. Umožňuje vybrat hlas z vlastní nabídky hlasů nebo zaregistrovat nový hlas pro použití ve službě.

Klonování hlasu používá referenční nahrávku a odpovídající text. Podporuje také postup, při kterém se referenční text během registrace vytvoří rozpoznáním řeči, a zaregistrovaný hlas lze znovu použít při následné syntéze.

  • Vytváří hlasovou personu služby a postav.
  • Vytváří vlastní hlas pomocí popisu nebo referenční nahrávky.
  • Syntetizuje oznámení značky, dialogy postav a komentáře k obsahu.
  • Používá se pro hlasové odpovědi konverzačních agentů.
  • Syntetizuje aktualizované oznámení a scénáře stejným hlasem.

Při výběru mezi cosa-a a cosa-b vycházejte z požadovaného hlasu, skutečného výsledku syntézy a potřebných možností řízení.

Položkacosa-acosa-b
Nastavení syntézyKromě hlasu, jazyka a rychlosti řeči také nastavení počtu kroků syntézy, intenzity vedení a délky generovaného výstupuSpolečná nastavení, jako je rychlost řeči a jazyk
Vstup pro klonováníReferenční nahrávka, k jejímuž použití máte oprávněníReferenční nahrávka a odpovídající text. Během registrace lze referenční text vygenerovat pomocí rozpoznávání řeči
ÚlohaGenerování hlasu s využitím podrobného řízení syntézyVýběr hlasu a generování přizpůsobeného hlasu

cosa-asr

cosa-asr převádí vstupní řeč na text. Dokumentuje nahrávky nebo převádí požadavky přijaté hlasem na vstup, který mohou následné pracovní systémy zpracovat.

  • Přepisuje hlasové poznámky a nahrávky.
  • Převádí hlasové dotazy a pracovní požadavky na vstup.
  • Generuje referenční text pro klonování hlasu.
  • Používá se pro zpracování navazující na přepis, například shrnutí, klasifikaci a vyhledávání.

Předáním výsledků přepisu do CIP lze pokračovat shrnutím obsahu, klasifikací požadavků a tvorbou pracovních návrhů. Syntézou výsledků pomocí cosa-a nebo cosa-b vznikne pracovní služba s hlasovým vstupem a výstupem.

Cova

cova-1 je model založený na LLM určený výhradně pro vizuální OCR. Rozpoznává text v dokumentech a obrázcích, extrahuje rozvržení a strukturu tabulek a poskytuje stručné popisy vizuálních prvků.

Převádí dokumenty určené ke čtení lidmi do podoby, kterou mohou využívat agenti a pracovní systémy. Text a tabulky extrahuje jako strukturovaný obsah a obrázky obsažené v dokumentech předává jako stručné popisy, takže následní agenti mohou současně porozumět obsahu dokumentu i jeho vizuálnímu kontextu. Pokud nejprve porozumíte materiálům pomocí extrahovaného textu a popisů a následně podrobně zkontrolujete pouze originály vyžadující ověření, můžete omezit opakované zadávání původních obrázků a ušetřit kontextové tokeny.

FunkcePopis
Rozpoznávání textuExtrahuje text z naskenovaných nebo vyfotografovaných dokumentů.
Interpretace rozvrženíS ohledem na rozvržení dokumentu rozděluje obsah do bloků.
Poskytování informací o umístěníPoskytuje umístění rozpoznaných bloků a propojuje výsledky extrakce s původním textem.
Extrakce struktury tabulekStrukturuje obsah tabulek pro vyhledávání a zpracování dat.
Stručný popis obrázkuStručně popisuje obsah obrázků a vizuálních prvků a poskytuje agentovi vodítka pro interpretaci.
Zefektivnění kontextuPředává informace se zaměřením na text, strukturu a popis obrázků, čímž omezuje opakované zadávání původních obrázků.
Selektivní podrobná analýzaPomáhá agentovi určit, které původní obrázky je třeba dále ověřit.
Převod formátu dokumentuUspořádává výsledky rozpoznávání do formátu HTML nebo Markdown.
  • Digitalizace dokumentů: Převádí papírové dokumenty a naskenované materiály na textové podklady.
  • Příjem pracovních dokumentů: Extrahuje obsah z žádostí, podkladů a zpráv.
  • Zpracování tabulkových dat: Využívá tabulky obsažené v dokumentech pro následné zpracování dat.
  • Předzpracování pro vyhledávání ve znalostech: Převádí obrázky dokumentů a vizuální materiály na text a strukturu s možností vyhledávání.
  • Automatizace kontroly dokumentů: Předává výsledky extrakce do CIP za účelem kontroly položek, shrnutí a porovnání materiálů.
  • Optimalizace vstupu pro agenty: Uspořádává hlavní text, tabulky a popisy obrázků v dlouhých dokumentech a předává pouze potřebné informace.

Například při extrakci hlavního textu a tabulek ze zprávy popíše vložený graf jako graf znázorňující čtvrtletní vývoj tržeb. Agent z tohoto popisu zjistí existenci a účel grafu a v případě potřeby přesných hodnot nebo trendů následně zkontroluje příslušný originál.

Propojení produktů

Po propojení produktů lze sestavit následující tok.

  • Práce s dokumenty: Cova extrahuje hlavní text, tabulky a popisy obrázků, CIP selektivně ověří potřebné originály a provede analýzu a zpracování úkolů a Cosa předá výsledky hlasem.
  • Práce na bázi hlasu: Cosa ASR převede hlasový požadavek na text a cosa-a nebo cosa-b přečte odpověď zpracovanou systémem CIP.
  • Automatizace v terénu: cip-5.5-sm klasifikuje data z terénu a provádí lokální úkoly, zatímco materiály vyžadující další komplexní analýzu předá systému cip-5.5-im nebo cip-5.5-mm.

Povolená volání na bráně

Plány gateway určují povolená volání pro jednotlivé modely. Níže uvedená tabulka uvádí rozsah zpřístupněný plány LLM_FREE, TTS_FREE a STT_FREE, které se automaticky uplatní bez podání žádosti. Modely zpřístupněné jinými cestami nejsou zahrnuty.

ID modeluPovolená voláníZdrojový plán
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm a cova-1 nejsou v této tabulce plánů uvedeny. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm a ivy-4-mm v této tabulce jsou ID modelů, která nejsou zahrnuta v popisech produktů výše. Která cesta odpovídá volacímu klíči, najdete v dokumentu Volání API.

CLEVI

Jazyk a region

Jazyky přeložené strojově jsou označeny. Dostupnost odpovídá zveřejněnému balíčku webu.

136 jazyků

Doporučeno

1

východní Asie

7

jihovýchodní Asie

11

jižní Asie

18

Střední Asie

5

Blízký východ a Kavkaz

10

západní Evropa a jižní Evropa

16

Spojené království a Irsko

4

severní Evropa

10

Střední Evropa a Balkán

14

východní Evropa

5

východní Afrika

8

západní Afrika a střední Afrika

9

jižní Afrika

8

Amerika

5

Oceánie

5