Developer guide
Model
Souhrn modelů
Modely CLEVI se dělí do tří produktových řad: CIP pro obecnou inteligenci a automatizaci pracovních úkolů, Cosa pro generování a rozpoznávání hlasu a Cova pro extrakci informací z dokumentů a obrázků. Každý produkt lze používat samostatně nebo je lze propojit do služeb zahrnujících rozpoznávání dokumentů, analýzu, provádění úkolů a hlasové pokyny.
| Produkt | ID modelu | Hlavní specifikace | Hlavní účel |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B–40B upravovaný | Automatizace místních pracovních úkolů a edge servery |
| CIP-5.5-IM | cip-5.5-im | 360B · vstup 256K · výstup 64K · multimodální | Obecné zpracování pracovních úkolů. Prioritou jsou rychlost odezvy a propustnost |
| CIP-5.5-MM | cip-5.5-mm | 800B · vstup 512K · výstup 64K · multimodální | Analýza dlouhého kontextu a řešení komplexních problémů |
| Cosa-A | cosa-a | Syntéza·klonování·návrh·streamování hlasu | Generování hlasu s využitím podrobného řízení syntézy |
| Cosa-B | cosa-b | Syntéza·klonování·návrh·streamování hlasu | Výběr hlasu a generování přizpůsobeného hlasu |
| Cosa ASR | cosa-asr | Rozpoznávání hlasu | Převod hlasového vstupu na text |
| Cova | cova-1 | Specializovaný OCR pro vidění založený na LLM | Extrakce textu, rozvržení a tabulek a jednoduchý popis obrázků |
CIP
CIP zajišťuje obecnou inteligenci a automatizaci pracovních úkolů. Skládá se z cip-5.5-im a cip-5.5-mm, které se volají prostřednictvím brány, a z cip-5.5-sm, který se nasazuje na edge servery a v on-premise prostředích.
cip-5.5-im a cip-5.5-mm
| Položka | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Velikost | 360B | 800B |
| Limit vstupu | 256K | 512K |
| Maximální výstup | 64K | 64K |
| Formát vstupu | Text a vizuální materiály (dokumenty, snímky obrazovky, tabulky a grafy) | Text a vizuální materiály (integrované posouzení kódu, dokumentů a materiálů z obrazovky) |
| Zaměření | Zpracovává běžné znalostní pracovní a vývojové úkoly se zaměřením na rychlost odezvy, nákladovou efektivitu a propustnost. | Zpracovává komplexní úkoly, které kombinují a analyzují více materiálů a podmínek a propojují výsledky analýzy s praktickými úkoly. |
| Využití dlouhých vstupů | Společně kontroluje více dokumentů, souborů kódu a historii konverzací. | Pracuje s rozsáhlými referenčními materiály a historií úkolů a provádí agentní úkoly, v nichž se výzkum, provádění a ověřování uskutečňují v několika krocích. |
cip-5.5-im se hodí pro úkoly s jasně definovaným cílem a rozsahem práce. Typickými příklady jsou extrahování potřebných informací z poskytnutých materiálů, tvorba výstupů v určeném formátu a úprava kódu podle požadavků. Maximální výstup o délce 64K tokenů je určen k tvorbě podrobných zpráv nebo výstupů složených z více částí.
- Vývojová asistence: píše funkce a implementuje funkcionality, opravuje chyby s jasně vymezeným rozsahem a implementuje řešení podle stávajících vzorů.
- Generování testů: na základě požadavků a implementace vytváří návrhy testů a ověřovací případy.
- Zpracování dokumentů: zajišťuje sumarizaci, klasifikaci, extrakci položek, převod formátů a tvorbu návrhů.
- Multimodální analýza: kontroluje snímky obrazovek a tabulky či grafy v dokumentech spolu s příslušnými popisy.
- Interaktivní podpora pracovních úkolů: odpovídá na otázky na základě pracovních materiálů a vytváří potřebné výstupy.
- Dávkové zpracování: používá se k individuální sumarizaci velkého počtu dokumentů, klasifikaci požadavků a převodu dat.
- Dílčí agent: zajišťuje dílčí úkoly s jasně vymezenými hranicemi, jako je prozkoumání kódu, kontrola konkrétních souborů nebo uspořádání materiálů.
Používá se například k vytvoření návrhu úprav, testů a popisu změn na základě funkčních požadavků a souvisejícího kódu nebo k vytvoření shrnutí pro odpovědné pracovníky po klasifikaci přijatých dokumentů.
cip-5.5-mm se hodí pro úkoly, při nichž je nutné porozumět vztahům mezi informacemi a zachovat konzistenci celého úkolu. Ve vývoji kontroluje propojení požadavků, návrhu, implementace a testů; při analýze dokumentů syntetizuje tvrzení a důkazy, rozdíly a rozpory z více materiálů.
- Implementace komplexních funkcí: s ohledem na smlouvy a chování více modulů současně mění kód, testy i dokumentaci.
- Analýza rozsáhlého kódu: kontroluje vztahy mezi voláními, tok dat a rozsah dopadu změn.
- Analýza příčin incidentů: porovnává protokoly, konfiguraci, kód a výsledky provedení a uspořádává hypotézy příčin a postupy jejich ověření.
- Podpora návrhu a rozhodování: strukturuje požadavky a omezení a analyzuje dopady alternativ implementace.
- Syntéza více dokumentů: na základě důkazů uspořádává shody, rozdíly a rozpory mezi zprávami a technickou dokumentací.
- Integrovaná multimodální kontrola: společně interpretuje textové a vizuální materiály a analyzuje problémy a požadavky.
- Vícekrokový agent: používá se pro úkoly navazující průzkumem, plánováním, spuštěním nástrojů a kontrolou výsledků.
- Tvorba odborných dokumentů: vytváří technické zprávy, návrhy řešení a podrobné kontrolní dokumenty zohledňující komplexní podmínky a důkazy.
Například se používá k souběžné kontrole souvisejících kódů a protokolů chyb z více služeb nebo k úkolům, které zahrnují vše od analýzy požadavků na komplexní funkce přes implementaci až po kontrolu výsledků ověření.
cip-5.5-sm
cip-5.5-sm provádí lokální inferenci a automatizaci úloh na edge serverech a v on-premise prostředích. Protože lze velikost modelu nastavit v rozsahu 24B–40B, konfiguraci lze zvolit podle výpočetních zdrojů nasazovaného zařízení a požadovaného výkonu v daném prostředí. Zpracování probíhá v blízkosti místa vzniku dat, takže se používá k propojení s provozními systémy a k využití interních dat. Pokud jsou potřebné modely a nástroje nakonfigurovány lokálně, lze systém provozovat i v prostředích s omezeným externím připojením.
Jeho úlohou je interpretovat informace vznikající v provozním prostředí a převádět je do postupů zpracování. Klasifikuje protokoly a požadavky, extrahuje z dat potřebné informace a pomocí propojených interních nástrojů a skriptů provádí opakující se úkoly.
- Zpracování událostí v provozním prostředí: Klasifikuje protokoly zařízení a stavové informace a vybírá události vyžadující kontrolu.
- Předzpracování dat: Extrahuje z pracovních záznamů klíčové položky a klasifikuje, označuje a normalizuje je.
- Směrování požadavků: Předává přijaté požadavky příslušnému systému nebo postupu zpracování.
- Lokální pracovní agent: Provádí opakující se úkoly pomocí dotazů do interních systémů a spouštění skriptů.
- Podpora práce v on-premise prostředí: Odpovídá na otázky na základě interních materiálů a shrnuje pracovní obsah.
- Podpora následné analýzy: Vybírá materiály vyžadující další kontrolu a shrnuje jejich klíčový obsah.
Například se používá k toku práce, který na serveru pracoviště klasifikuje provozní protokoly, vyhledá související historii a následně vytvoří shrnutí incidentu pro odpovědnou osobu.
Cosa
Cosa je řada hlasových produktů, která převádí text na řeč, rozpoznává vstupní řeč jako text a umožňuje zaregistrovat a znovu používat požadovaný hlas. Používá se pro hlasová rozhraní v rámci poskytování informací o službách, tvorby obsahu, podpory přístupnosti a konverzačních agentů.
Generování řeči zajišťují cosa-a a cosa-b, zatímco rozpoznávání řeči zajišťuje cosa-asr. cosa-a a cosa-b jsou samostatné modely, z nichž každý poskytuje vlastní seznam hlasů a nastavení syntézy; vybírají se ve stejném servisním rozhraní. Funkce společné pro oba modely jsou následující:
- Převod textu na řeč: Syntetizuje zadané věty vybraným hlasem.
- Klonování hlasu: Na základě referenční nahrávky, k jejímuž použití máte oprávnění, zaregistruje hlas a syntetizuje nové věty.
- Návrh hlasu: Vytvoří a zaregistruje hlas na základě popisu požadovaných vlastností.
- Opětovné použití hlasu: Použije zaregistrovaný hlas pro následnou syntézu.
- Nastavení syntézy: Upravuje rychlost mluvení, jazyk a další parametry.
- Streamování výstupu: Syntetizuje text po připravených úsecích, jakmile dorazí, a postupně předává zvuk.
- Ovládání přehrávání: Podporuje pozastavení, obnovení, zastavení a zadání dalších vět.
Pomocí postupného zadávání textu lze spustit přehrávání hlasu ještě před dokončením celé odpovědi. Zatímco CIP vytváří odpověď, lze nakonfigurovat službu, ve které Cosa přečte připravené úseky.
cosa-a
cosa-a podporuje převod textu na řeč, klonování hlasu, návrh hlasu a streamovaný výstup. Kromě základních funkcí pro výběr hlasu, jazyka a rychlosti mluvení nabízí další možnosti ovládání, například nastavení počtu kroků syntézy, síly vedení a délky generování. Používá se při tvorbě hlasu k úpravě nastavení a kontrole výsledků nebo k použití více nastavení na stejný scénář a výběru výsledku.
- Syntetizuje pokyny a upozornění pro aplikace, kiosky a podnikové systémy.
- Vytváří zvukové vzdělávací materiály a uživatelské příručky.
- Vytváří namluvený komentář pro video a audio obsah.
- Vytváří opakovaně používaný obsah pomocí zaregistrovaného hlasu.
- Používá se pro streamovaný hlasový výstup konverzačních agentů.
- Používá se při tvorbě hlasu s úpravou podrobných nastavení syntézy.
cosa-b
cosa-b podporuje výběr přednastaveného hlasu, návrh hlasu na základě popisu, klonování na základě referenčního hlasu a streamovaný výstup. Umožňuje vybrat hlas z vlastní nabídky hlasů nebo zaregistrovat nový hlas pro použití ve službě.
Klonování hlasu používá referenční nahrávku a odpovídající text. Podporuje také postup, při kterém se referenční text během registrace vytvoří rozpoznáním řeči, a zaregistrovaný hlas lze znovu použít při následné syntéze.
- Vytváří hlasovou personu služby a postav.
- Vytváří vlastní hlas pomocí popisu nebo referenční nahrávky.
- Syntetizuje oznámení značky, dialogy postav a komentáře k obsahu.
- Používá se pro hlasové odpovědi konverzačních agentů.
- Syntetizuje aktualizované oznámení a scénáře stejným hlasem.
Při výběru mezi cosa-a a cosa-b vycházejte z požadovaného hlasu, skutečného výsledku syntézy a potřebných možností řízení.
| Položka | cosa-a | cosa-b |
|---|---|---|
| Nastavení syntézy | Kromě hlasu, jazyka a rychlosti řeči také nastavení počtu kroků syntézy, intenzity vedení a délky generovaného výstupu | Společná nastavení, jako je rychlost řeči a jazyk |
| Vstup pro klonování | Referenční nahrávka, k jejímuž použití máte oprávnění | Referenční nahrávka a odpovídající text. Během registrace lze referenční text vygenerovat pomocí rozpoznávání řeči |
| Úloha | Generování hlasu s využitím podrobného řízení syntézy | Výběr hlasu a generování přizpůsobeného hlasu |
cosa-asr
cosa-asr převádí vstupní řeč na text. Dokumentuje nahrávky nebo převádí požadavky přijaté hlasem na vstup, který mohou následné pracovní systémy zpracovat.
- Přepisuje hlasové poznámky a nahrávky.
- Převádí hlasové dotazy a pracovní požadavky na vstup.
- Generuje referenční text pro klonování hlasu.
- Používá se pro zpracování navazující na přepis, například shrnutí, klasifikaci a vyhledávání.
Předáním výsledků přepisu do CIP lze pokračovat shrnutím obsahu, klasifikací požadavků a tvorbou pracovních návrhů. Syntézou výsledků pomocí cosa-a nebo cosa-b vznikne pracovní služba s hlasovým vstupem a výstupem.
Cova
cova-1 je model založený na LLM určený výhradně pro vizuální OCR. Rozpoznává text v dokumentech a obrázcích, extrahuje rozvržení a strukturu tabulek a poskytuje stručné popisy vizuálních prvků.
Převádí dokumenty určené ke čtení lidmi do podoby, kterou mohou využívat agenti a pracovní systémy. Text a tabulky extrahuje jako strukturovaný obsah a obrázky obsažené v dokumentech předává jako stručné popisy, takže následní agenti mohou současně porozumět obsahu dokumentu i jeho vizuálnímu kontextu. Pokud nejprve porozumíte materiálům pomocí extrahovaného textu a popisů a následně podrobně zkontrolujete pouze originály vyžadující ověření, můžete omezit opakované zadávání původních obrázků a ušetřit kontextové tokeny.
| Funkce | Popis |
|---|---|
| Rozpoznávání textu | Extrahuje text z naskenovaných nebo vyfotografovaných dokumentů. |
| Interpretace rozvržení | S ohledem na rozvržení dokumentu rozděluje obsah do bloků. |
| Poskytování informací o umístění | Poskytuje umístění rozpoznaných bloků a propojuje výsledky extrakce s původním textem. |
| Extrakce struktury tabulek | Strukturuje obsah tabulek pro vyhledávání a zpracování dat. |
| Stručný popis obrázku | Stručně popisuje obsah obrázků a vizuálních prvků a poskytuje agentovi vodítka pro interpretaci. |
| Zefektivnění kontextu | Předává informace se zaměřením na text, strukturu a popis obrázků, čímž omezuje opakované zadávání původních obrázků. |
| Selektivní podrobná analýza | Pomáhá agentovi určit, které původní obrázky je třeba dále ověřit. |
| Převod formátu dokumentu | Uspořádává výsledky rozpoznávání do formátu HTML nebo Markdown. |
- Digitalizace dokumentů: Převádí papírové dokumenty a naskenované materiály na textové podklady.
- Příjem pracovních dokumentů: Extrahuje obsah z žádostí, podkladů a zpráv.
- Zpracování tabulkových dat: Využívá tabulky obsažené v dokumentech pro následné zpracování dat.
- Předzpracování pro vyhledávání ve znalostech: Převádí obrázky dokumentů a vizuální materiály na text a strukturu s možností vyhledávání.
- Automatizace kontroly dokumentů: Předává výsledky extrakce do CIP za účelem kontroly položek, shrnutí a porovnání materiálů.
- Optimalizace vstupu pro agenty: Uspořádává hlavní text, tabulky a popisy obrázků v dlouhých dokumentech a předává pouze potřebné informace.
Například při extrakci hlavního textu a tabulek ze zprávy popíše vložený graf jako graf znázorňující čtvrtletní vývoj tržeb. Agent z tohoto popisu zjistí existenci a účel grafu a v případě potřeby přesných hodnot nebo trendů následně zkontroluje příslušný originál.
Propojení produktů
Po propojení produktů lze sestavit následující tok.
- Práce s dokumenty: Cova extrahuje hlavní text, tabulky a popisy obrázků, CIP selektivně ověří potřebné originály a provede analýzu a zpracování úkolů a Cosa předá výsledky hlasem.
- Práce na bázi hlasu: Cosa ASR převede hlasový požadavek na text a cosa-a nebo cosa-b přečte odpověď zpracovanou systémem CIP.
- Automatizace v terénu: cip-5.5-sm klasifikuje data z terénu a provádí lokální úkoly, zatímco materiály vyžadující další komplexní analýzu předá systému cip-5.5-im nebo cip-5.5-mm.
Povolená volání na bráně
Plány gateway určují povolená volání pro jednotlivé modely. Níže uvedená tabulka uvádí rozsah zpřístupněný plány LLM_FREE, TTS_FREE a STT_FREE, které se automaticky uplatní bez podání žádosti. Modely zpřístupněné jinými cestami nejsou zahrnuty.
| ID modelu | Povolená volání | Zdrojový plán |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm a cova-1 nejsou v této tabulce plánů uvedeny. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm a ivy-4-mm v této tabulce jsou ID modelů, která nejsou zahrnuta v popisech produktů výše. Která cesta odpovídá volacímu klíči, najdete v dokumentu Volání API.
