Developer guide
Model
Sažetak modela
CLEVI modeli podijeljeni su u tri linije proizvoda: CIP, zadužen za opću inteligenciju i automatizaciju rada; Cosa, zadužen za generisanje i prepoznavanje govora; i Cova, zadužen za izdvajanje informacija iz dokumenata i slika. Svaki proizvod može se koristiti samostalno ili povezati u usluge koje obuhvataju prepoznavanje dokumenata, analizu, izvršavanje zadataka i glasovno vođenje.
| Proizvod | ID modela | Glavne specifikacije | Primarna uloga |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B podesivi model | Lokalna automatizacija rada i edge serveri |
| CIP-5.5-IM | cip-5.5-im | 360B · ulaz 256K · izlaz 64K · multimodalan | Opća obrada poslovnih zadataka. Prioritet su brzina odgovora i propusnost |
| CIP-5.5-MM | cip-5.5-mm | 800B · ulaz 512K · izlaz 64K · multimodalan | Analiza dugog konteksta i rješavanje složenih problema |
| Cosa-A | cosa-a | Sinteza·kloniranje·dizajn·streaming glasa | Generisanje glasa uz detaljnu kontrolu sinteze |
| Cosa-B | cosa-b | Sinteza·kloniranje·dizajn·streaming glasa | Odabir glasa i generisanje prilagođenog glasa |
| Cosa ASR | cosa-asr | Prepoznavanje govora | Pretvaranje glasovnog unosa u tekst |
| Cova | cova-1 | Specijalizovan za vizuelni OCR zasnovan na LLM-u | Izdvajanje teksta, rasporeda i tabela te jednostavan opis slika |
CIP
CIP je zadužen za opću inteligenciju i automatizaciju rada. Sastoji se od cip-5.5-im i cip-5.5-mm, koji se pozivaju putem gatewaya, te cip-5.5-sm, koji se postavlja na edge servere i u lokalnom okruženju.
cip-5.5-im i cip-5.5-mm
| Stavka | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Veličina | 360B | 800B |
| Ulazno ograničenje | 256K | 512K |
| Maksimalni izlaz | 64K | 64K |
| Ulazni format | Tekst i vizuelni materijali (dokumenti, slike ekrana, tabele i grafikoni) | Tekst i vizuelni materijali (objedinjeni pregled koda, dokumenata i materijala sa ekrana) |
| Smjer konfiguracije | Obrađuje svakodnevne poslove zasnovane na znanju i razvojne zadatke, s fokusom na brzinu odgovora, troškovnu efikasnost i propusnost. | Obrađuje složene zadatke koji objedinjuju više materijala i uslova te povezuju rezultate analize sa stvarnim radom. |
| Namjena dugog unosa | Zajednički pregled više dokumenata, datoteka koda i historije razgovora. | Istovremeno upravlja obimnim referentnim materijalima i historijom rada te izvršava agentske zadatke u kojima se istraživanje, izvršavanje i provjera odvijaju kroz više koraka. |
cip-5.5-im je pogodan za zadatke s jasno definisanim ciljem i opsegom. Tipični zadaci uključuju izdvajanje potrebnih informacija iz dostavljenih materijala, izradu rezultata u navedenom formatu i izmjenu koda u skladu sa zahtjevima. Maksimalni izlaz od 64K tokena koristi se za izradu detaljnih izvještaja ili rezultata sastavljenih iz više dijelova.
- Pomoć pri razvoju: piše funkcije i funkcionalnosti, ispravlja greške jasno definisanog opsega i implementira rješenja u skladu s postojećim obrascima.
- Generisanje testova: na osnovu zahtjeva i implementacije izrađuje nacrte testova i slučajeve za provjeru.
- Obrada dokumenata: izrađuje sažetke, klasifikuje sadržaj, izdvaja stavke, pretvara formate i priprema nacrte.
- Multimodalna analiza: pregledava slike ekrana i tabele i grafikone u dokumentima, zajedno s relevantnim objašnjenjima.
- Interaktivna poslovna podrška: odgovara na pitanja na osnovu poslovnih materijala i izrađuje potrebne rezultate.
- Serijska obrada: koristi se za pojedinačne sažetke velikog broja dokumenata, klasifikaciju zahtjeva i transformaciju podataka.
- Podagent: preuzima jasno ograničene podzadatke poput istraživanja koda, pregleda određenih datoteka i organizovanja materijala.
Na primjer, koristi se za izradu prijedloga izmjena, testova i opisa promjena na osnovu funkcionalnih zahtjeva i povezanog koda, ili za klasifikaciju prijemnih dokumenata i izradu sažetaka za odgovorne osobe.
cip-5.5-mm je pogodan za zadatke koji zahtijevaju razumijevanje odnosa između informacija i održavanje dosljednosti cjelokupnog rada. U razvoju provjerava povezanost zahtjeva, dizajna, implementacije i testiranja, dok u analizi dokumenata objedinjuje tvrdnje i dokaze, razlike i proturječnosti iz više materijala.
- Implementacija složenih funkcionalnosti: istovremeno mijenja kod, testove i dokumentaciju uzimajući u obzir ugovore i ponašanje više modula.
- Analiza velikih baza koda: pregledava odnose poziva, tokove podataka i opseg uticaja promjena.
- Analiza uzroka incidenta: upoređuje dnevnike, konfiguracije, kod i rezultate izvršavanja te organizuje hipoteze o uzroku i postupke provjere.
- Podrška dizajnu i donošenju odluka: strukturira zahtjeve i ograničenja te analizira uticaj alternativa za implementaciju.
- Objedinjena analiza više dokumenata: na osnovu dokaza organizuje sličnosti, razlike i proturječnosti u izvještajima i tehničkoj dokumentaciji.
- Integrisani multimodalni pregled: zajedno tumači tekstualne i vizuelne materijale radi analize problema i zahtjeva.
- Višefazni agent: koristi se za zadatke koji obuhvataju istraživanje, planiranje, izvršavanje alata i pregled rezultata.
- Izrada stručne dokumentacije: izrađuje tehničke izvještaje, prijedloge dizajna i detaljne dokumente za pregled koji odražavaju složene uslove i dokaze.
Na primjer, koristi se za istovremeni pregled povezanih kodova grešaka i logova iz više servisa ili za poslove koji obuhvataju sve, od analize zahtjeva za složene funkcije do implementacije i pregleda rezultata provjere.
cip-5.5-sm
cip-5.5-sm obavlja lokalno zaključivanje i automatizaciju poslova na rubnim serverima i u on-premises okruženjima. Budući da se veličina modela može prilagoditi u rasponu od 24B do 40B, konfiguracija se može odabrati u skladu s računarskim resursima opreme za implementaciju i potrebnim performansama na lokaciji. Obrada se obavlja blizu mjesta nastanka podataka, pa se koristi za povezivanje s lokalnim sistemima i upotrebu internih podataka. Ako se potrebni modeli i alati konfigurišu lokalno, može se koristiti i u okruženjima s ograničenom vanjskom povezanošću.
Njegova uloga je da tumači informacije nastale na lokaciji i povezuje ih s postupcima obrade. Klasifikuje logove i zahtjeve, izdvaja potrebne informacije iz podataka te obavlja ponavljajuće poslove pomoću povezanih internih alata i skripti.
- Obrada događaja na lokaciji: Klasifikuje logove opreme i informacije o statusu te izdvaja događaje koje treba provjeriti.
- Predobrada podataka: Iz poslovnih zapisa izdvaja ključne stavke te ih klasifikuje, označava i normalizuje.
- Usmjeravanje zahtjeva: Prosljeđuje zaprimljene zahtjeve nadležnom sistemu ili postupku obrade.
- Lokalni poslovni agent: Obavlja ponavljajuće poslove pregledom internih sistema i izvršavanjem skripti.
- Podrška poslovanju u on-premises okruženju: Odgovara na pitanja na osnovu internih materijala i sažima poslovni sadržaj.
- Podrška naknadnoj analizi: Izdvaja materijale koji zahtijevaju dodatni pregled i sažima ključni sadržaj.
Na primjer, koristi se za tok rada u kojem se na serveru poslovne lokacije klasifikuju operativni logovi, pregledaju povezani zapisi, a zatim sastavlja sažetak incidenta za odgovornu osobu.
Cosa
Cosa je porodica govornih proizvoda koja pretvara tekst u govor, prepoznaje ulazni govor kao tekst te omogućava registraciju i ponovnu upotrebu željenog glasa. Koristi se za obavještenja o uslugama, izradu sadržaja, podršku pristupačnosti i glasovne interfejse konverzacijskih agenata.
Generisanje govora obavljaju cosa-a i cosa-b, a prepoznavanje govora cosa-asr. cosa-a i cosa-b su zasebni modeli koji pružaju vlastite liste glasova i postavke sinteze, a biraju se putem istog servisnog interfejsa. Funkcije koje oba modela zajednički pružaju su sljedeće.
- Pretvaranje teksta u govor: Sintetizujte unesene rečenice odabranim glasom.
- Kloniranje glasa: Registrujte glas na osnovu referentnog snimka za koji imate dozvolu za korištenje i sintetizujte nove rečenice.
- Dizajn glasa: Kreirajte i registrujte glas opisujući njegove željene karakteristike.
- Ponovna upotreba glasa: Koristite registrovani glas u narednim sintezama.
- Postavke sinteze: Prilagodite brzinu govora, jezik i druge opcije.
- Strimovanje: Sintetizujte tekst u jedinicama fraza čim stigne i uzastopno isporučujte audio.
- Kontrola reprodukcije: Podržavajte pauziranje, nastavak, prekid i unos dodatnih rečenica.
Postepeni unos teksta omogućava početak reprodukcije glasa prije nego što se cijeli odgovor završi. Dok CIP sastavlja odgovor, možete konfigurisati uslugu u kojoj Cosa čita pripremljene fraze čim budu dostupne.
cosa-a
cosa-a podržava pretvaranje teksta u govor, kloniranje glasa, dizajn glasa i strimovani izlaz. Pored osnovnih funkcija za odabir glasa, jezika i brzine govora, nudi dodatne opcije kontrole, kao što su postavke povezane s brojem koraka sinteze, intenzitetom vođenja i dužinom generisanja. Koristi se za prilagođavanje postavki i pregled rezultata tokom izrade glasa ili za primjenu više postavki na isti tekst i odabir najboljeg rezultata.
- Sintetizujte upute i obavještenja za aplikacije, kioske i poslovne sisteme.
- Kreirajte obrazovne materijale i korisnička uputstva u audio obliku.
- Izrađujte naraciju za video i audio sadržaj.
- Kreirajte ponavljajući sadržaj registrovanim glasom.
- Koristite ga za strimovani glasovni izlaz interaktivnih agenata.
- Koristite ga za izradu glasa uz prilagođavanje detaljnih postavki sinteze.
cosa-b
cosa-b podržava odabir unaprijed podešenih glasova, dizajn glasa na osnovu opisa, kloniranje na osnovu referentnog glasa i strimovani izlaz. Možete odabrati glas iz vlastite liste glasova ili registrovati novi glas za korištenje u usluzi.
Za kloniranje glasa koriste se referentni snimak i tekst koji mu odgovara. Podržan je i postupak generisanja referentnog teksta pomoću prepoznavanja govora tokom registracije, a registrovani glas može se ponovo koristiti u narednim sintezama.
- Kreirajte glasovne persone za usluge i likove.
- Izradite prilagođeni glas na osnovu opisa ili referentnog snimka.
- Sintetizujte brendirane upute, replike likova i naraciju sadržaja.
- Koristite ga za glasovne odgovore interaktivnih agenata.
- Sintetizujte promjenjive poruke s uputama i tekstove istim glasom.
Kada birate između cosa-a i cosa-b, uzmite u obzir željeni glas, stvarni rezultat sinteze i potrebne stavke za kontrolu.
| Stavka | cosa-a | cosa-b |
|---|---|---|
| Postavke sinteze | Pored glasa, jezika i brzine govora, uključuje postavke povezane s brojem koraka sinteze, jačinom vođenja i dužinom generisanja | Zajedničke postavke kao što su brzina govora i jezik |
| Unos za kloniranje | Referentni snimak za koji imate pravo korištenja | Referentni snimak i odgovarajući tekst. Tokom registracije referentni tekst se može generisati prepoznavanjem govora |
| Uloga | Generisanje glasa uz detaljnu kontrolu sinteze | Odabir glasa i generisanje prilagođenog glasa |
cosa-asr
cosa-asr pretvara ulazni govor u tekst. Koristi se za dokumentovanje snimljenih materijala ili pretvaranje zahtjeva primljenih glasom u ulaz koji naknadni poslovni sistemi mogu obraditi.
- Transkribuje glasovne bilješke i snimljene materijale.
- Pretvara pitanja i poslovne zahtjeve zasnovane na glasu u ulaz.
- Generiše referentni tekst za kloniranje glasa.
- Koristi se za obradu koja nakon transkripcije uključuje sažimanje, klasifikaciju i pretragu.
Prosljeđivanjem rezultata transkripcije u CIP možete nastaviti sa sažimanjem sadržaja, klasifikacijom zahtjeva i izradom nacrta poslovnih zadataka. Sintezom rezultata pomoću cosa-a ili cosa-b dobijate poslovnu uslugu s glasovnim ulazom i izlazom.
Cova
cova-1 je model zasnovan na LLM-u namijenjen isključivo vizuelnom OCR-u. Prepoznaje tekst u dokumentima i slikama, izdvaja raspored i strukturu tabela te pruža kratke opise vizuelnih elemenata.
Pretvara dokumente koje ljudi čitaju u oblik pogodan za korištenje u agentima i poslovnim sistemima. Glavni tekst i tabele izdvaja kao strukturirani sadržaj, a slike uključene u dokument prenosi kroz kratke opise, tako da naknadni agent može istovremeno razumjeti sadržaj dokumenta i vizuelni kontekst. Ako organizujete tok rada u kojem se materijal prvo sagledava na osnovu izdvojenog teksta i opisa, a zatim se dodatno pregledaju samo originali koji zahtijevaju detaljnu provjeru, smanjujete količinu ponovljenih unosa originalnih slika i štedite kontekstne tokene.
| Funkcija | Opis |
|---|---|
| Prepoznavanje teksta | Izvlači tekst iz skeniranih ili fotografisanih dokumenata. |
| Tumačenje rasporeda | Razdvaja sadržaj u blokove uzimajući u obzir raspored dokumenta. |
| Pružanje informacija o položaju | Pruža položaj prepoznatih blokova kako bi se rezultati ekstrakcije povezali s izvornim tekstom. |
| Ekstrakcija strukture tabela | Strukturira sadržaj tabela za pretraživanje i obradu podataka. |
| Jednostavan opis slike | Ukratko opisuje sadržaj slike i vizuelnih elemenata kako bi agentu pružio naznake za tumačenje. |
| Optimizacija konteksta | Prenosi informacije usmjerene na tekst, strukturu i opis slike, čime smanjuje ponovni unos izvorne slike. |
| Selektivna detaljna analiza | Pomaže agentu da odluči koje izvorne slike treba dodatno provjeriti. |
| Konverzija formata dokumenta | Organizuje rezultate prepoznavanja u HTML ili Markdown. |
- Digitalizacija dokumenata: Pretvara papirne dokumente i skenirane materijale u tekstualne materijale.
- Prijem poslovnih dokumenata: Izvlači sadržaj iz prijavnih obrazaca, dokazne dokumentacije i izvještaja.
- Obrada tabelarnih podataka: Koristi tabele sadržane u dokumentima za naknadnu obradu podataka.
- Predobrada za pretraživanje znanja: Pretvara slike dokumenata i vizuelne materijale u tekst i strukturu koji se mogu pretraživati.
- Automatizacija pregleda dokumenata: Prosljeđuje rezultate ekstrakcije CIP-u radi provjere stavki, sažimanja i poređenja materijala.
- Optimizacija unosa za agenta: Organizuje tekst, tabele i opise slika iz dugih dokumenata kako bi se prenijele samo potrebne informacije.
Na primjer, dok izvlači tekst i tabele izvještaja, opisuje umetnuti grafikon kao grafikon koji prikazuje kvartalni trend prihoda. Agent pomoću ovog opisa prepoznaje postojanje i svrhu grafikona, a kada su potrebne tačne vrijednosti ili trendovi, dodatno pregledava odgovarajući izvorni materijal.
Povezivanje proizvoda
Povezivanjem proizvoda možete konfigurisati sljedeće tokove.
- Poslovi zasnovani na dokumentima: Cova izvlači tekst, tabele i opise slika, CIP selektivno provjerava potrebne izvorne materijale i obavlja analizu i obradu poslova, a Cosa rezultate prenosi glasom.
- Poslovi zasnovani na glasu: Cosa ASR pretvara glasovne zahtjeve u tekst, a cosa-a ili cosa-b čita odgovore koje je obradio CIP.
- Automatizacija na terenu: cip-5.5-sm klasifikuje podatke s terena i obavlja lokalne poslove, a materijale za koje je potrebna dodatna objedinjena analiza prosljeđuje modelima cip-5.5-im ili cip-5.5-mm.
Pozivi dozvoljeni na gatewayu
Planovi gatewaya određuju dozvoljene pozive za svaki model. Tabela u nastavku prikazuje opseg koji omogućavaju planovi LLM_FREE, TTS_FREE i STT_FREE, a ovi planovi se automatski primjenjuju bez podnošenja zahtjeva. Ne uključuje modele koji su omogućeni drugim rutama.
| ID modela | Dozvoljeni pozivi | Osnovni plan |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm i cova-1 nisu navedeni u ovoj tabeli plana. ID-ovi modela cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm i ivy-4-mm u ovoj tabeli nisu uključeni u gornji opis proizvoda. Dokumentacija o upućivanju API poziva navodi kojoj putanji pripada ključ za poziv.
