Developer guide

Model

Ringkasan model

Model CLEVI terbagi menjadi tiga kelompok produk: CIP untuk kecerdasan umum dan otomatisasi pekerjaan, Cosa untuk pembuatan dan pengenalan suara, serta Cova untuk ekstraksi informasi dari dokumen dan gambar. Setiap produk dapat digunakan secara mandiri atau dihubungkan menjadi layanan yang mencakup pengenalan dokumen, analisis, pelaksanaan pekerjaan, dan panduan suara.

ProdukID modelSpesifikasi utamaPeran utama
CIP-5.5-SMcip-5.5-sm24B~40B yang dapat disesuaikanOtomatisasi pekerjaan di server edge dan lokal
CIP-5.5-IMcip-5.5-im360B · input 256K · output 64K · multimodalPemrosesan pekerjaan umum. Mengutamakan kecepatan respons dan throughput
CIP-5.5-MMcip-5.5-mm800B · input 512K · output 64K · multimodalAnalisis konteks panjang dan penyelesaian masalah kompleks
Cosa-Acosa-aSintesis·replikasi·desain·streaming suaraPembuatan suara dengan kontrol sintesis terperinci
Cosa-Bcosa-bSintesis·replikasi·desain·streaming suaraPemilihan suara dan pembuatan suara yang disesuaikan
Cosa ASRcosa-asrPengenalan suaraKonversi input suara menjadi teks
Covacova-1Khusus untuk OCR visi berbasis LLMEkstraksi teks·tata letak·tabel dan deskripsi gambar sederhana

CIP

CIP menangani kecerdasan umum dan otomatisasi pekerjaan. CIP terdiri dari cip-5.5-im dan cip-5.5-mm yang dipanggil melalui gateway, serta cip-5.5-sm yang diterapkan di server edge dan lingkungan on-premises.

cip-5.5-im dan cip-5.5-mm

Itemcip-5.5-imcip-5.5-mm
Skala360B800B
Batas input256K512K
Output maksimum64K64K
Format inputTeks dan materi visual (dokumen, gambar layar, tabel·diagram)Teks dan materi visual (meninjau kode·dokumen·materi layar secara terpadu)
Arah penggunaanMenangani pekerjaan pengetahuan dan tugas pengembangan sehari-hari dengan mengutamakan kecepatan respons, efisiensi biaya, dan throughput.Menangani pekerjaan kompleks yang menggabungkan berbagai materi dan kondisi, serta menghubungkan hasil analisis dengan pekerjaan nyata.
Penggunaan input panjangMeninjau beberapa dokumen, file kode, dan riwayat percakapan secara bersamaan.Menangani referensi dan riwayat pekerjaan dalam jumlah besar secara bersamaan, serta menjalankan pekerjaan agen yang melibatkan penelitian·pelaksanaan·verifikasi dalam beberapa tahap.

cip-5.5-im cocok untuk pekerjaan dengan tujuan dan cakupan tugas yang jelas. Contoh utamanya adalah mengekstrak informasi yang diperlukan dari materi yang diberikan, menyusun hasil dalam format yang ditentukan, serta memodifikasi kode sesuai persyaratan. Output maksimum 64K digunakan untuk menyusun laporan terperinci atau hasil yang terdiri dari beberapa bagian.

  • Bantuan pengembangan: menulis fungsi dan fitur, memperbaiki bug dengan cakupan yang jelas, serta menerapkan implementasi sesuai pola yang ada.
  • Pembuatan pengujian: menyusun draf pengujian dan kasus verifikasi berdasarkan persyaratan dan implementasi.
  • Pemrosesan dokumen: menangani peringkasan, klasifikasi, ekstraksi item, konversi format, dan penyusunan draf.
  • Analisis multimodal: meninjau gambar layar serta tabel dan diagram dalam dokumen bersama dengan penjelasan terkait.
  • Dukungan pekerjaan interaktif: menjawab pertanyaan berdasarkan materi pekerjaan dan menyusun hasil yang diperlukan.
  • Pemrosesan dalam jumlah besar: digunakan untuk meringkas banyak dokumen secara individual, mengklasifikasikan permintaan, dan mengonversi data.
  • Sub-agen: menangani sub-tugas dengan batasan yang jelas, seperti menjelajahi kode, meninjau file tertentu, dan merapikan materi.

Misalnya, cip-5.5-im digunakan untuk menerima persyaratan fitur dan kode terkait, lalu menyusun usulan perubahan, pengujian, dan penjelasan perubahan, atau mengklasifikasikan dokumen pengajuan dan membuat ringkasan untuk penanggung jawab.

cip-5.5-mm cocok untuk pekerjaan yang memerlukan pemahaman hubungan antar-informasi dan pemeliharaan konsistensi keseluruhan pekerjaan. Dalam pengembangan, model ini meninjau keterkaitan antara persyaratan, desain, implementasi, dan pengujian; dalam analisis dokumen, model ini menggabungkan klaim dan bukti, perbedaan, serta kontradiksi dari berbagai materi.

  • Implementasi fitur kompleks: mengubah kode, pengujian, dan dokumentasi secara bersamaan dengan mempertimbangkan kontrak dan perilaku beberapa modul.
  • Analisis kode berskala besar: meninjau hubungan pemanggilan, aliran data, dan cakupan dampak perubahan.
  • Analisis penyebab gangguan: membandingkan log, konfigurasi, kode, dan hasil eksekusi untuk merangkum hipotesis penyebab serta prosedur verifikasi.
  • Dukungan desain dan pengambilan keputusan: menyusun persyaratan dan batasan secara terstruktur serta menganalisis dampak alternatif implementasi.
  • Analisis sintesis multi-dokumen: merangkum persamaan, perbedaan, dan kontradiksi dalam laporan serta dokumen teknis berdasarkan bukti.
  • Tinjauan integrasi multimodal: menafsirkan teks dan materi visual secara bersamaan untuk menganalisis masalah dan persyaratan.
  • Agen multi-tahap: digunakan untuk pekerjaan yang mencakup rangkaian investigasi, perencanaan, eksekusi alat, dan peninjauan hasil.
  • Penulisan dokumen profesional: menyusun laporan teknis, proposal desain, dan dokumen tinjauan terperinci yang mencerminkan kondisi kompleks dan bukti.

Misalnya, digunakan untuk meninjau kode terkait dan log dari kesalahan yang terjadi di berbagai layanan secara bersamaan, atau untuk pekerjaan yang mencakup analisis persyaratan fitur kompleks hingga implementasi dan peninjauan hasil verifikasi.

cip-5.5-sm

cip-5.5-sm melakukan inferensi lokal dan otomatisasi pekerjaan di server edge dan lingkungan on-premise. Karena ukuran model dapat disesuaikan dalam rentang 24B~40B, konfigurasinya dapat dipilih sesuai sumber daya komputasi perangkat deployment dan tingkat kinerja yang dibutuhkan di lapangan. Karena pemrosesan dilakukan dekat dengan lokasi data dihasilkan, cip-5.5-sm digunakan untuk integrasi dengan sistem lapangan dan pemanfaatan data internal. Jika model dan alat yang diperlukan dikonfigurasi secara lokal, cip-5.5-sm juga dapat dioperasikan di lingkungan dengan koneksi eksternal terbatas.

Perannya adalah menafsirkan informasi yang muncul di lapangan dan menghubungkannya dengan prosedur pemrosesan. Peran ini mengklasifikasikan log dan permintaan, mengekstrak informasi yang diperlukan dari data, serta menjalankan pekerjaan berulang menggunakan alat internal dan skrip yang terhubung.

  • Pemrosesan peristiwa lapangan: Mengklasifikasikan log perangkat dan informasi status, lalu menyeleksi peristiwa yang perlu diperiksa.
  • Prapemrosesan data: Mengekstrak item utama dari catatan pekerjaan, lalu mengklasifikasikan, memberi tag, dan menormalkannya.
  • Perutean permintaan: Meneruskan permintaan yang diterima ke sistem atau prosedur pemrosesan yang bertanggung jawab.
  • Agen pekerjaan lokal: Melakukan pekerjaan berulang dengan mengakses sistem internal dan menjalankan skrip.
  • Dukungan pekerjaan on-premise: Menjawab pertanyaan berdasarkan materi internal dan merangkum isi pekerjaan.
  • Dukungan analisis lanjutan: Menyeleksi materi yang memerlukan peninjauan tambahan dan merangkum hal-hal utamanya.

Misalnya, digunakan dalam alur kerja untuk mengklasifikasikan log operasional di server lokasi kerja, menelusuri riwayat terkait, lalu membuat ringkasan insiden untuk penanggung jawab.

Cosa

Cosa adalah rangkaian produk suara yang mengubah teks menjadi suara, mengenali suara masukan menjadi teks, serta mendaftarkan dan menggunakan kembali suara yang diinginkan. Cosa digunakan untuk panduan layanan, pembuatan konten, dukungan aksesibilitas, dan antarmuka suara untuk agen interaktif.

cosa-a dan cosa-b menangani pembuatan suara, sedangkan cosa-asr menangani pengenalan suara. cosa-a dan cosa-b merupakan model terpisah yang masing-masing menyediakan daftar suara dan pengaturan sintesisnya, lalu dapat dipilih melalui antarmuka layanan yang sama. Fitur yang disediakan bersama oleh kedua model tersebut adalah sebagai berikut.

  • Text ke suara: Mensintesis kalimat yang dimasukkan dengan suara yang dipilih.
  • Kloning suara: Mendaftarkan suara berdasarkan rekaman referensi yang memiliki izin penggunaan, lalu mensintesis kalimat baru.
  • Desain suara: Membuat dan mendaftarkan suara dengan menjelaskan karakteristik suara yang diinginkan.
  • Penggunaan kembali suara: Menggunakan suara yang telah didaftarkan untuk sintesis berikutnya.
  • Pengaturan sintesis: Menyesuaikan kecepatan bicara, bahasa, dan lainnya.
  • Pengiriman streaming: Mensintesis per frasa segera setelah teks tiba dan mengirimkan audio secara berurutan.
  • Kontrol pemutaran: Mendukung jeda, melanjutkan, menghentikan, dan memasukkan kalimat tambahan.

Dengan menggunakan input teks bertahap, pemutaran suara dapat dimulai sebelum seluruh jawaban selesai. Saat CIP menyusun jawaban, Anda dapat mengonfigurasi layanan agar Cosa membacakan frasa yang telah siap terlebih dahulu.

cosa-a

cosa-a mendukung text-to-speech, kloning suara, desain suara, dan output streaming. Selain fungsi dasar untuk memilih suara, bahasa, dan kecepatan bicara, tersedia juga opsi kontrol tambahan seperti jumlah tahap sintesis, intensitas panduan, serta pengaturan terkait panjang hasil generasi. Fitur ini digunakan untuk menyesuaikan pengaturan selama proses pembuatan suara dan meninjau hasilnya, atau menerapkan beberapa pengaturan pada naskah yang sama lalu memilih hasilnya.

  • Mensintesis panduan dan notifikasi untuk aplikasi, kios, dan sistem kerja.
  • Membuat materi pelatihan dan panduan penggunaan dalam bentuk suara.
  • Membuat narasi untuk konten video dan audio.
  • Membuat konten berulang dengan suara yang telah didaftarkan.
  • Digunakan untuk output suara streaming agen interaktif.
  • Digunakan dalam pembuatan suara dengan menyesuaikan pengaturan sintesis secara terperinci.

cosa-b

cosa-b mendukung pemilihan suara preset, desain suara berbasis deskripsi, kloning berbasis suara referensi, dan output streaming. Anda dapat memilih suara dari daftar suara bawaan atau mendaftarkan suara baru untuk digunakan dalam layanan.

Kloning suara menggunakan rekaman referensi dan teks yang sesuai dengannya. Alur yang menghasilkan teks referensi melalui pengenalan suara selama proses pendaftaran juga didukung, dan suara yang telah didaftarkan dapat digunakan kembali dalam sintesis berikutnya.

  • Membangun persona suara untuk layanan dan karakter.
  • Membuat suara khusus melalui deskripsi atau rekaman referensi.
  • Mensintesis panduan merek, dialog karakter, dan narasi konten.
  • Digunakan untuk respons suara agen interaktif.
  • Mensintesis pesan panduan dan naskah yang berubah dengan suara yang sama.

Saat memilih antara cosa-a dan cosa-b, jadikan suara yang diinginkan, hasil sintesis aktual, dan item kontrol yang diperlukan sebagai pertimbangan.

Itemcosa-acosa-b
Pengaturan sintesisSelain suara, bahasa, dan kecepatan bicara, pengaturan terkait jumlah langkah sintesis, kekuatan panduan, dan panjang generasiPengaturan umum seperti kecepatan bicara dan bahasa
Input kloningRekaman referensi yang Anda miliki hak untuk menggunakannyaRekaman referensi dan teks yang sesuai. Teks referensi dapat dibuat melalui pengenalan suara selama proses pendaftaran
PeranPembuatan suara dengan memanfaatkan kontrol sintesis yang terperinciPemilihan suara dan pembuatan suara khusus

cosa-asr

cosa-asr mengubah suara masukan menjadi teks. Model ini mendokumentasikan materi rekaman atau mengubah permintaan yang disampaikan melalui suara menjadi masukan yang dapat diproses oleh sistem kerja lanjutan.

  • Mentranskripsikan memo suara dan materi rekaman.
  • Mengubah pertanyaan dan permintaan kerja berbasis suara menjadi masukan.
  • Membuat teks referensi untuk kloning suara.
  • Menggunakannya untuk pemrosesan lanjutan setelah transkripsi, seperti peringkasan, klasifikasi, dan pencarian.

Dengan meneruskan hasil transkripsi ke CIP, proses dapat dilanjutkan ke peringkasan konten, klasifikasi permintaan, dan pembuatan draf pekerjaan. Dengan mensintesis hasil pemrosesan menggunakan cosa-a atau cosa-b, Anda dapat membuat layanan kerja dengan input dan output suara.

Cova

cova-1 adalah model khusus OCR visi berbasis LLM. Model ini mengenali teks dari dokumen dan gambar, mengekstrak tata letak serta struktur tabel, dan memberikan deskripsi singkat tentang elemen visual.

Model ini mengubah dokumen yang dilihat manusia menjadi format yang mudah digunakan oleh agen dan sistem kerja. Isi utama dan tabel diekstrak sebagai konten terstruktur, sedangkan gambar yang terdapat dalam dokumen disampaikan sebagai deskripsi singkat, sehingga agen lanjutan dapat memahami isi dokumen sekaligus konteks visualnya. Dengan menyusun alur kerja yang terlebih dahulu memahami materi melalui teks dan deskripsi hasil ekstraksi, lalu hanya meninjau sumber asli yang memerlukan pemeriksaan terperinci, jumlah input gambar asli yang berulang dapat dikurangi sehingga menghemat token konteks.

FungsiDeskripsi
Pengenalan teksMengekstrak teks dari dokumen yang dipindai atau difoto.
Interpretasi tata letakMembagi konten menjadi blok dengan mempertimbangkan tata letak dokumen.
Penyediaan informasi posisiMenyediakan posisi blok yang dikenali untuk menghubungkan hasil ekstraksi dengan dokumen asli.
Ekstraksi struktur tabelMenyusun isi tabel secara terstruktur untuk digunakan dalam pencarian dan pemrosesan data.
Deskripsi gambar sederhanaMenjelaskan secara singkat isi gambar dan elemen visual untuk memberikan petunjuk interpretasi kepada agen.
Efisiensi konteksMengurangi pengiriman ulang gambar asli dengan menyampaikan informasi yang berfokus pada teks, struktur, dan deskripsi gambar.
Analisis mendetail secara selektifMembantu agen menentukan gambar asli yang perlu diperiksa lebih lanjut.
Konversi format dokumenMenyusun hasil pengenalan ke dalam HTML atau Markdown.
  • Digitalisasi dokumen: Mengubah dokumen kertas dan bahan hasil pemindaian menjadi materi berbasis teks.
  • Penerimaan dokumen kerja: Mengekstrak konten dari formulir, dokumen pendukung, dan laporan.
  • Pemrosesan data tabel: Menggunakan tabel yang terdapat dalam dokumen untuk pemrosesan data lanjutan.
  • Prapemrosesan pencarian pengetahuan: Mengubah gambar dokumen dan materi visual menjadi teks dan struktur yang dapat dicari.
  • Otomatisasi peninjauan dokumen: Meneruskan hasil ekstraksi ke CIP untuk melakukan pemeriksaan item, peringkasan, dan perbandingan antar materi.
  • Optimalisasi input agen: Menyusun isi, tabel, dan deskripsi gambar dari dokumen panjang agar hanya informasi yang diperlukan yang disampaikan.

Misalnya, saat mengekstrak isi dan tabel laporan, grafik yang disisipkan dijelaskan sebagai grafik yang menunjukkan tren penjualan per kuartal. Dengan deskripsi ini, agen memahami keberadaan dan tujuan grafik, lalu meninjau sumber asli secara tambahan ketika memerlukan angka atau tren yang akurat.

Menghubungkan rangkaian produk

Dengan menghubungkan produk, Anda dapat membangun alur berikut.

  • Pekerjaan berbasis dokumen: Cova mengekstrak isi, tabel, dan deskripsi gambar, CIP secara selektif memeriksa sumber asli yang diperlukan untuk melakukan analisis dan pemrosesan pekerjaan, lalu Cosa menyampaikan hasilnya melalui suara.
  • Pekerjaan berbasis suara: Cosa ASR mengubah permintaan suara menjadi teks, lalu cosa-a atau cosa-b membacakan jawaban yang diproses CIP.
  • Otomatisasi di lapangan: cip-5.5-sm mengklasifikasikan data lapangan dan menjalankan pekerjaan lokal, lalu meneruskan materi yang memerlukan analisis komprehensif tambahan ke cip-5.5-im atau cip-5.5-mm.

Panggilan yang diizinkan di gateway

Paket gateway menentukan panggilan yang diizinkan untuk setiap model. Tabel di bawah ini menunjukkan cakupan yang dibuka oleh paket LLM_FREE, TTS_FREE, dan STT_FREE, yang diterapkan secara otomatis tanpa pengajuan. Model yang dibuka melalui jalur lain tidak tercantum.

ID ModelPanggilan yang diizinkanPaket dasar
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm과 cova-1 tidak ada dalam tabel paket ini. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm, dan ivy-4-mm dalam tabel ini adalah ID model yang tidak termasuk dalam deskripsi produk di atas. Jalur yang sesuai dengan kunci pemanggilan dijelaskan dalam dokumen Pemanggilan API.

CLEVI

Bahasa dan wilayah

Bahasa yang diterjemahkan oleh mesin ditandai. Ketersediaan mengikuti paket situs yang dipublikasikan.

136 bahasa

Direkomendasikan

1

Asia Bagian Timur

7

Asia Tenggara

11

Asia Bagian Selatan

18

Asia Tengah

5

Timur Tengah dan Kaukasus

10

Eropa Bagian Barat dan Eropa Bagian Selatan

16

Inggris Raya dan Irlandia

4

Eropa Bagian Utara

10

Eropa Tengah dan Balkan

14

Eropa Bagian Timur

5

Afrika Bagian Timur

8

Afrika Bagian Barat dan Afrika Bagian Tengah

9

Afrika Bagian Selatan

8

Amerika

5

Oseania

5