Developer guide

Modelo

Buod ng modelo

Ang mga modelo ng CLEVI ay nahahati sa tatlong linya ng produkto: CIP para sa pangkalahatang intelligence at automation ng trabaho, Cosa para sa voice generation at recognition, at Cova para sa pagkuha ng impormasyon mula sa mga dokumento at larawan. Maaaring gamitin nang hiwalay ang bawat produkto o pag-ugnayin bilang serbisyo na nagsisimula sa document recognition at nagpapatuloy sa pagsusuri, pagsasagawa ng mga gawain, at voice guidance.

ProduktoModel IDMga pangunahing espesipikasyonPangunahing gamit
CIP-5.5-SMcip-5.5-sm24B~40B na adjustableEdge server at lokal na automation ng trabaho
CIP-5.5-IMcip-5.5-im360B · input 256K · output 64K · multimodalPangkalahatang pagproseso ng trabaho. Prayoridad ang bilis ng pagtugon at throughput
CIP-5.5-MMcip-5.5-mm800B · input 512K · output 64K · multimodalPagsusuri ng mahabang konteksto at paglutas ng mga kumplikadong problema
Cosa-Acosa-aVoice synthesis · cloning · design · streamingPagbuo ng boses gamit ang detalyadong kontrol sa synthesis
Cosa-Bcosa-bVoice synthesis · cloning · design · streamingPagpili ng boses at pagbuo ng custom na boses
Cosa ASRcosa-asrVoice recognitionPag-convert ng voice input sa text
Covacova-1LLM-based na eksklusibo para sa vision OCRPagkuha ng text, layout, at mga talahanayan, pati simpleng paglalarawan ng larawan

CIP

Ang CIP ang nangangasiwa sa pangkalahatang intelligence at automation ng trabaho. Binubuo ito ng cip-5.5-im at cip-5.5-mm na tinatawag sa pamamagitan ng gateway, at cip-5.5-sm na dine-deploy sa mga edge server at on-premises.

cip-5.5-im at cip-5.5-mm

Itemcip-5.5-imcip-5.5-mm
Scale360B800B
Limitasyon sa input256K512K
Maximum na output64K64K
Format ng inputText at visual na materyal (mga dokumento, screenshot, talahanayan at chart)Text at visual na materyal (pinagsamang pagsusuri ng code, mga dokumento, at screen material)
Direksiyon ng disenyoPinoproseso nito ang mga karaniwang knowledge work at development task na nakatuon sa bilis ng pagtugon, cost efficiency, at throughput.Pinoproseso nito ang mga kumplikadong gawain na pinagsasama at sinusuri ang maraming materyal at kundisyon, at iniuugnay ang mga resulta ng pagsusuri sa aktuwal na trabaho.
Gamit ng mahahabang inputSabay-sabay na sinusuri ang maraming dokumento, code file, at history ng pag-uusap.Sabay-sabay na pinangangasiwaan ang malawak na reference material at history ng trabaho, at isinasagawa ang mga agent task kung saan nagpapatuloy sa maraming yugto ang pananaliksik, pagsasagawa, at beripikasyon.

Ang cip-5.5-im ay angkop para sa mga gawaing malinaw ang layunin at saklaw. Kabilang sa mga tipikal na gawain ang pagkuha ng kinakailangang impormasyon mula sa ibinigay na materyal, pagsulat ng output sa tinukoy na format, at pagbabago ng code ayon sa mga kinakailangan. Ang maximum na 64K output ay ginagamit sa pagsulat ng detalyadong ulat o mga output na binubuo ng maraming bahagi.

  • Tulong sa development: Sumulat ng mga function at feature, ayusin ang mga bug na malinaw ang saklaw, at magpatupad ayon sa mga umiiral na pattern.
  • Pagbuo ng mga test: Sumulat ng mga draft ng test at mga kaso ng validation batay sa mga kinakailangan at implementasyon.
  • Pagproseso ng dokumento: Pangasiwaan ang pagbubuod, pag-uuri, pagkuha ng mga item, conversion ng format, at pagsulat ng draft.
  • Multimodal na pagsusuri: Suriin ang mga larawan ng screen at ang mga talahanayan at chart sa mga dokumento, kasama ang kaugnay na paliwanag.
  • Interaktibong suporta sa trabaho: Sagutin ang mga tanong batay sa mga materyal sa trabaho at ihanda ang kinakailangang output.
  • Maramihang pagproseso: Gamitin para sa indibidwal na pagbubuod ng maraming dokumento, pag-uuri ng mga kahilingan, at conversion ng data.
  • Subagent: Pangasiwaan ang mga subtask na malinaw ang hangganan, gaya ng pag-explore ng code, pagsusuri ng partikular na file, at pag-aayos ng materyal.

Halimbawa, ginagamit ito para tumanggap ng mga functional requirement at kaugnay na code at gumawa ng panukalang pagbabago, mga test, at paliwanag ng mga pagbabago, o para uriin ang mga dokumento ng pagtanggap at gumawa ng buod para sa taong responsable.

Ang cip-5.5-mm ay angkop para sa mga gawaing kailangang tukuyin ang mga ugnayan sa pagitan ng impormasyon at mapanatili ang pagkakapare-pareho ng buong gawain. Sa development, sinusuri nito ang mga koneksyon sa pagitan ng mga requirement, disenyo, implementasyon, at test; sa pagsusuri ng dokumento, pinagsasama nito ang mga pahayag at ebidensya, pagkakaiba, at kontradiksyon mula sa maraming materyal.

  • Implementasyon ng kumplikadong feature: Baguhin nang magkakasama ang code, test, at dokumentasyon habang isinasaalang-alang ang mga kontrata at gawi ng maraming module.
  • Malakihang pagsusuri ng code: Suriin ang mga relasyon ng pagtawag, daloy ng data, at saklaw ng epekto ng mga pagbabago.
  • Pagsusuri ng sanhi ng insidente: Ihambing ang mga log, configuration, code, at resulta ng pagpapatupad upang ayusin ang mga hypothesis tungkol sa sanhi at mga pamamaraan ng pag-verify.
  • Suporta sa disenyo at paggawa ng desisyon: I-structure ang mga requirement at constraint at suriin ang epekto ng mga alternatibo sa implementasyon.
  • Pinagsamang pagsusuri ng maraming dokumento: Ibuod batay sa ebidensya ang mga pagkakatulad, pagkakaiba, at kontradiksyon sa mga ulat at teknikal na dokumento.
  • Pinagsamang pagsusuring multimodal: Suriin ang mga problema at requirement sa pamamagitan ng sabay na pag-unawa sa teksto at visual na materyal.
  • Multi-step agent: Gamitin para sa mga gawaing nagpapatuloy mula sa pagsisiyasat, pagpaplano, at pagpapatupad ng tool hanggang sa pagsusuri ng resulta.
  • Pagsulat ng espesyalisadong dokumento: Sumulat ng mga teknikal na ulat, panukalang disenyo, at detalyadong dokumento ng pagsusuri na isinasaalang-alang ang mga kumplikadong kondisyon at ebidensya.

Halimbawa, ginagamit ito upang sabay na suriin ang mga kaugnay na code at log ng mga error mula sa maraming serbisyo, o sa mga gawaing mula sa pagsusuri ng mga kinakailangan para sa kumplikadong feature hanggang sa implementasyon at pagsusuri ng mga resulta ng validation.

cip-5.5-sm

Ang cip-5.5-sm ay nagsasagawa ng lokal na inference at automation ng gawain sa mga edge server at on-premises na kapaligiran. Dahil maaaring ayusin ang laki ng modelo sa saklaw na 24B~40B, maaaring piliin ang configuration ayon sa computational resources ng deployment device at kinakailangang performance sa lugar. Pinoproseso nito ang data malapit sa pinagmumulan nito, kaya ginagamit ito para sa integration sa mga sistema sa lugar at paggamit ng internal na data. Kung iko-configure nang lokal ang mga kinakailangang modelo at tool, maaari rin itong patakbuhin sa mga kapaligirang limitado ang external connectivity.

Tungkulin nitong mag-interpret ng impormasyong nagmumula sa lugar at iugnay ito sa mga pamamaraan ng pagproseso. Inuuri at sinusuri nito ang mga log at request, kinukuha ang kinakailangang impormasyon mula sa data, at nagsasagawa ng mga paulit-ulit na gawain gamit ang mga konektadong internal na tool at script.

  • Pagproseso ng mga event sa lugar: Inuuri at sinusuri ang mga log ng kagamitan at impormasyon ng status, at pinipili ang mga event na nangangailangan ng pagsusuri.
  • Preprocessing ng data: Kinukuha ang mahahalagang item mula sa mga rekord ng gawain at isinasagawa ang pag-uuri, pagta-tag, at normalization.
  • Pag-route ng request: Ipinapasa ang mga natanggap na request sa responsableng sistema o pamamaraan ng pagproseso.
  • Lokal na agent para sa gawain: Isinasagawa ang mga paulit-ulit na gawain sa pamamagitan ng pag-query sa mga internal na sistema at pagpapatakbo ng mga script.
  • Suporta sa mga gawain on-premises: Sinasagot ang mga tanong batay sa internal na materyales at inaayos ang mga detalye ng gawain.
  • Suporta sa follow-up analysis: Pinipili ang mga materyales na nangangailangan ng karagdagang pagsusuri at binubuod ang mahahalagang nilalaman.

Halimbawa, ginagamit ito sa workflow na inuuri ang mga operational log sa server ng isang site, kumukuha ng kaugnay na history, at gumagawa ng buod ng insidente para sa taong responsable.

Cosa

Ang Cosa ay isang pamilya ng mga produktong pang-voice na nagko-convert ng teksto sa speech, kumikilala ng input na speech bilang teksto, at nagpaparehistro at muling gumagamit ng gustong boses. Ginagamit ito para sa service guidance, paggawa ng content, suporta sa accessibility, at voice interface ng mga conversational agent.

Ang cosa-a at cosa-b ang nangangasiwa sa voice generation, habang ang cosa-asr naman ang nangangasiwa sa speech recognition. Ang cosa-a at cosa-b ay magkahiwalay na mga modelo na nagbibigay ng kani-kanilang listahan ng mga boses at mga setting ng synthesis, at pinipili ang mga ito sa iisang service interface. Ang mga sumusunod na feature ay parehong ibinibigay ng dalawang modelo.

  • Text-to-speech: Sini-synthesize ang inilagay na pangungusap gamit ang napiling boses.
  • Voice cloning: Nirerehistro ang boses batay sa reference recording na may pahintulot gamitin at sini-synthesize ang mga bagong pangungusap.
  • Voice design: Gumagawa at nagrerehistro ng boses sa pamamagitan ng paglalarawan sa mga katangian ng nais na boses.
  • Muling paggamit ng boses: Ginagamit ang nakarehistrong boses sa mga kasunod na synthesis.
  • Mga setting ng synthesis: Ina-adjust ang bilis ng pagsasalita at wika, bukod sa iba pa.
  • Streaming delivery: Sini-synthesize ang teksto bawat parirala habang dumarating ito at sunod-sunod na ipinapadala ang audio.
  • Mga kontrol sa playback: Sinusuportahan ang pag-pause, pagpapatuloy, paghinto, at pagdaragdag ng mga bagong pangungusap.

Sa pamamagitan ng unti-unting pag-input ng teksto, maaaring simulan ang pag-playback ng boses bago pa makumpleto ang buong sagot. Habang binubuo ng CIP ang sagot, maaaring i-configure ang isang serbisyo kung saan binabasa ng Cosa ang mga inihandang parirala.

cosa-a

Sinusuportahan ng cosa-a ang text-to-speech, voice cloning, voice design, at streaming output. Bukod sa mga pangunahing function para sa pagpili ng boses, wika, at bilis ng pagsasalita, nagbibigay rin ito ng mga karagdagang kontrol gaya ng bilang ng mga hakbang sa synthesis, lakas ng guidance, at mga setting na nauugnay sa haba ng nabubuong output. Ginagamit ito sa mga proseso ng voice production kung saan ina-adjust ang mga setting at sinusuri ang resulta, o inilalapat ang maraming setting sa parehong script upang pumili ng pinakamagandang resulta.

  • Sini-synthesize ang mga anunsyo at notification para sa mga app, kiosk, at business system.
  • Gumagawa ng mga audio training material at user manual.
  • Gumagawa ng narration para sa video at audio content.
  • Gumagawa ng paulit-ulit na content gamit ang nakarehistrong boses.
  • Ginagamit para sa streaming voice output ng mga conversational agent.
  • Ginagamit sa voice production kung saan ina-adjust ang mga detalyadong setting ng synthesis.

cosa-b

Sinusuportahan ng cosa-b ang pagpili ng preset na boses, voice design batay sa paglalarawan, cloning batay sa reference voice, at streaming output. Maaaring pumili ng boses mula sa sariling listahan ng mga boses o magrehistro ng bagong boses na gagamitin sa serbisyo.

Para sa voice cloning, ginagamit ang reference recording at ang katumbas nitong teksto. Sinusuportahan din ang proseso kung saan bumubuo ng reference text gamit ang speech recognition habang nagrerehistro, at muling ginagamit ang nakarehistrong boses sa mga kasunod na synthesis.

  • Binubuo ang voice persona ng serbisyo at karakter.
  • Gumagawa ng custom na boses mula sa paglalarawan o reference recording.
  • Sini-synthesize ang mga anunsyo ng brand, linya ng karakter, at narration ng content.
  • Ginagamit para sa mga voice response ng mga conversational agent.
  • Sini-synthesize ang mga nagbabagong mensahe ng anunsyo at script gamit ang parehong boses.

Kapag pumipili sa pagitan ng cosa-a at cosa-b, isaalang-alang ang nais na boses, aktuwal na resulta ng synthesis, at mga kontrol na kailangan.

Itemcosa-acosa-b
Mga setting ng synthesisBilang ng mga hakbang sa synthesis, tindi ng guidance, at mga setting kaugnay ng haba ng pagbuo, bukod sa boses, wika, at bilis ng pagsasalitaMga karaniwang setting gaya ng bilis ng pagsasalita at wika
Input para sa cloningReference recording na mayroon kang pahintulot na gamitinReference recording at katumbas na teksto. Maaaring bumuo ng reference text sa pamamagitan ng speech recognition sa proseso ng pagpaparehistro
TungkulinPagbuo ng boses gamit ang detalyadong kontrol sa synthesisPagpili ng boses at pagbuo ng custom na boses

cosa-asr

Kino-convert ng cosa-asr ang input na boses sa teksto. Ginagamit ito upang idokumento ang mga recording o gawing input na maaaring iproseso ng mga susunod na sistema ng trabaho ang mga kahilingang ipinadala sa pamamagitan ng boses.

  • Itina-transcribe nito ang mga voice memo at recording.
  • Ginagawa nitong input ang mga tanong at kahilingan sa trabaho na nakabatay sa boses.
  • Bumubuo ito ng reference text para sa voice cloning.
  • Ginagamit ito para sa mga prosesong nagpapatuloy sa buod, klasipikasyon, at paghahanap pagkatapos ng transcription.

Kapag ipinasa ang resulta ng transcription sa CIP, maaari itong humantong sa pagbubuod ng nilalaman, pagkaklasipika ng mga kahilingan, at pagbuo ng mga draft para sa trabaho. Kapag isinynthesize ang resulta gamit ang cosa-a o cosa-b, nagiging serbisyo ito sa trabaho na may voice input at output.

Cova

Ang cova-1 ay isang LLM-based na modelong eksklusibo para sa vision OCR. Kinikilala nito ang teksto mula sa mga dokumento at larawan, kinukuha ang layout at istruktura ng mga talahanayan, at nagbibigay ng maiikling paglalarawan ng mga visual na elemento.

Kino-convert nito ang mga dokumentong nakikita ng tao sa anyong madaling gamitin ng mga ahente at sistema ng trabaho. Kinukuha ang katawan ng teksto at mga talahanayan bilang naka-istrukturang nilalaman, at ipinapasa ang mga larawang kasama sa dokumento bilang maiikling paglalarawan, kaya nauunawaan ng mga susunod na ahente ang nilalaman ng dokumento pati ang biswal na konteksto nito. Sa pagbuo ng daloy kung saan unang sinusuri ang materyal gamit ang nakuhang teksto at mga paglalarawan, at saka lamang sinusuri ang orihinal na kinakailangan ng detalyadong kumpirmasyon, nababawasan ang paulit-ulit na pag-input ng orihinal na larawan at nakatitipid ng mga context token.

FeaturePaglalarawan
Pagkilala sa tekstoKinukuha ang mga letra mula sa mga dokumentong ini-scan o kinukunan ng larawan.
Pagbibigay-kahulugan sa layoutHinahati ang nilalaman sa mga bloke batay sa pagkakaayos ng dokumento.
Pagbibigay ng impormasyon sa lokasyonIbinibigay ang lokasyon ng mga nakilalang bloke upang maiugnay ang mga resulta ng pagkuha sa orihinal na nilalaman.
Pagkuha ng istruktura ng talahanayanBinubuo sa istruktura ang nilalaman ng mga talahanayan para magamit sa paghahanap at pagproseso ng datos.
Maikling paglalarawan ng larawanMaikling inilalarawan ang nilalaman ng larawan at mga biswal na elemento upang magbigay sa agent ng mga pahiwatig para sa interpretasyon.
Pagpapahusay ng kahusayan ng kontekstoIpinapasa ang impormasyon na nakatuon sa teksto, istruktura, at paglalarawan ng larawan upang mabawasan ang paulit-ulit na pag-input ng orihinal na larawan.
Piling detalyadong pagsusuriTinutulungan ang agent na matukoy kung aling mga orihinal na larawan ang kailangan nitong suriin pa.
Pag-convert ng format ng dokumentoInaayos ang mga resulta ng pagkilala sa HTML o Markdown.
  • Pagdi-digitize ng dokumento: Kino-convert ang mga papel na dokumento at na-scan na materyal sa tekstuwal na sanggunian.
  • Pagtanggap ng mga dokumento sa trabaho: Kinukuha ang nilalaman mula sa mga application form, dokumentong patunay, at ulat.
  • Pagproseso ng datos sa talahanayan: Ginagamit ang mga talahanayang kasama sa dokumento para sa kasunod na pagproseso ng datos.
  • Paunang pagproseso para sa paghahanap ng kaalaman: Kino-convert ang mga larawan ng dokumento at biswal na materyal sa mahahanap na teksto at istruktura.
  • Awtomasyon ng pagsusuri ng dokumento: Ipinapasa ang mga resulta ng pagkuha sa CIP upang magsagawa ng pagsusuri ng mga item, pagbubuod, at paghahambing sa pagitan ng mga materyal.
  • Pag-optimize ng input para sa agent: Inaayos ang pangunahing teksto, mga talahanayan, at paglalarawan ng mga larawan sa mahahabang dokumento upang maipasa lamang ang kinakailangang impormasyon.

Halimbawa, habang kinukuha ang pangunahing teksto at mga talahanayan ng isang ulat, inilalarawan nito ang nakasingit na graph bilang isang graph na nagpapakita ng mga pagbabago sa benta kada quarter. Gamit ang paglalarawang ito, nauunawaan ng agent ang presensya at gamit ng graph, at sinusuri pa ang orihinal na materyal kapag kailangan ang eksaktong mga numero o trend.

Pagkonekta ng mga produkto

Sa pagkonekta ng mga produkto, maaaring buuin ang sumusunod na daloy.

  • Trabahong batay sa dokumento: Kinukuha ng Cova ang pangunahing teksto, mga talahanayan, at paglalarawan ng mga larawan; piling sinusuri ng CIP ang mga kinakailangang orihinal na materyal upang magsagawa ng pagsusuri at pagproseso ng trabaho; at ipinapahayag ng Cosa ang mga resulta sa pamamagitan ng boses.
  • Trabahong batay sa boses: Kino-convert ng Cosa ASR ang mga kahilingan sa boses sa teksto, at binabasa ng cosa-a o cosa-b ang sagot na pinroseso ng CIP.
  • Awtomasyon sa lugar ng trabaho: Inuuri ng cip-5.5-sm ang datos mula sa lugar ng trabaho at nagsasagawa ng lokal na trabaho, at ipinapasa ang mga materyal na nangangailangan ng karagdagang komprehensibong pagsusuri sa cip-5.5-im o cip-5.5-mm.

Mga tawag na pinapayagan sa gateway

Tinutukoy ng mga plan ng gateway ang mga tawag na pinapayagan para sa bawat modelo. Ipinapakita ng talahanayan sa ibaba ang saklaw na binubuksan ng mga plan na LLM_FREE, TTS_FREE, at STT_FREE, at awtomatikong inilalapat ang mga plan na ito nang walang kinakailangang aplikasyon. Hindi kasama rito ang mga modelong binubuksan sa pamamagitan ng iba pang mga ruta.

ID ng modeloMga pinapayagang tawagBatayang plan
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

Ang cip-5.5-sm at cova-1 ay wala sa talahanayan ng planong ito. Ang cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm, at ivy-4-mm sa talahanayan ay mga model ID na hindi kasama sa mga paglalarawan ng produkto sa itaas. Makikita sa dokumentong API 호출하기 kung aling path ang nauugnay sa calling key.

CLEVI

Wika at rehiyon

Minarkahan ang mga wikang isinalin ng makina. Ang availability ay nakabatay sa inilathalang bundle ng site.

136 wika

Inirerekomenda

1

Silangang Asya

7

Timog-Silangang Asya

11

Katimugang Asya

18

Gitnang Asya

5

Gitnang Silangan at Caucasus

10

Kanlurang Europe at Katimugang Europe

16

United Kingdom at Ireland

4

Hilagang Europe

10

Gitnang Europa at Balkan

14

Silangang Europe

5

Silangang Africa

8

Kanlurang Africa at Gitnang Africa

9

Katimugang Africa

8

Americas

5

Oceania

5