Developer guide
Model
Ringkasan model
Model CLEVI terbagi menjadi tiga kelompok produk: CIP untuk kecerdasan umum dan otomatisasi pekerjaan, Cosa untuk pembuatan dan pengenalan suara, serta Cova untuk ekstraksi informasi dari dokumen dan gambar. Setiap produk dapat digunakan secara mandiri atau dihubungkan menjadi layanan yang mencakup pengenalan dokumen, analisis, pelaksanaan pekerjaan, dan panduan suara.
| Produk | ID model | Spesifikasi utama | Peran utama |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B yang dapat disesuaikan | Otomatisasi pekerjaan di server edge dan lokal |
| CIP-5.5-IM | cip-5.5-im | 360B · input 256K · output 64K · multimodal | Pemrosesan pekerjaan umum. Mengutamakan kecepatan respons dan throughput |
| CIP-5.5-MM | cip-5.5-mm | 800B · input 512K · output 64K · multimodal | Analisis konteks panjang dan penyelesaian masalah kompleks |
| Cosa-A | cosa-a | Sintesis·replikasi·desain·streaming suara | Pembuatan suara dengan kontrol sintesis terperinci |
| Cosa-B | cosa-b | Sintesis·replikasi·desain·streaming suara | Pemilihan suara dan pembuatan suara yang disesuaikan |
| Cosa ASR | cosa-asr | Pengenalan suara | Konversi input suara menjadi teks |
| Cova | cova-1 | Khusus untuk OCR visi berbasis LLM | Ekstraksi teks·tata letak·tabel dan deskripsi gambar sederhana |
CIP
CIP menangani kecerdasan umum dan otomatisasi pekerjaan. CIP terdiri dari cip-5.5-im dan cip-5.5-mm yang dipanggil melalui gateway, serta cip-5.5-sm yang diterapkan di server edge dan lingkungan on-premises.
cip-5.5-im dan cip-5.5-mm
| Item | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Skala | 360B | 800B |
| Batas input | 256K | 512K |
| Output maksimum | 64K | 64K |
| Format input | Teks dan materi visual (dokumen, gambar layar, tabel·diagram) | Teks dan materi visual (meninjau kode·dokumen·materi layar secara terpadu) |
| Arah penggunaan | Menangani pekerjaan pengetahuan dan tugas pengembangan sehari-hari dengan mengutamakan kecepatan respons, efisiensi biaya, dan throughput. | Menangani pekerjaan kompleks yang menggabungkan berbagai materi dan kondisi, serta menghubungkan hasil analisis dengan pekerjaan nyata. |
| Penggunaan input panjang | Meninjau beberapa dokumen, file kode, dan riwayat percakapan secara bersamaan. | Menangani referensi dan riwayat pekerjaan dalam jumlah besar secara bersamaan, serta menjalankan pekerjaan agen yang melibatkan penelitian·pelaksanaan·verifikasi dalam beberapa tahap. |
cip-5.5-im cocok untuk pekerjaan dengan tujuan dan cakupan tugas yang jelas. Contoh utamanya adalah mengekstrak informasi yang diperlukan dari materi yang diberikan, menyusun hasil dalam format yang ditentukan, serta memodifikasi kode sesuai persyaratan. Output maksimum 64K digunakan untuk menyusun laporan terperinci atau hasil yang terdiri dari beberapa bagian.
- Bantuan pengembangan: menulis fungsi dan fitur, memperbaiki bug dengan cakupan yang jelas, serta menerapkan implementasi sesuai pola yang ada.
- Pembuatan pengujian: menyusun draf pengujian dan kasus verifikasi berdasarkan persyaratan dan implementasi.
- Pemrosesan dokumen: menangani peringkasan, klasifikasi, ekstraksi item, konversi format, dan penyusunan draf.
- Analisis multimodal: meninjau gambar layar serta tabel dan diagram dalam dokumen bersama dengan penjelasan terkait.
- Dukungan pekerjaan interaktif: menjawab pertanyaan berdasarkan materi pekerjaan dan menyusun hasil yang diperlukan.
- Pemrosesan dalam jumlah besar: digunakan untuk meringkas banyak dokumen secara individual, mengklasifikasikan permintaan, dan mengonversi data.
- Sub-agen: menangani sub-tugas dengan batasan yang jelas, seperti menjelajahi kode, meninjau file tertentu, dan merapikan materi.
Misalnya, cip-5.5-im digunakan untuk menerima persyaratan fitur dan kode terkait, lalu menyusun usulan perubahan, pengujian, dan penjelasan perubahan, atau mengklasifikasikan dokumen pengajuan dan membuat ringkasan untuk penanggung jawab.
cip-5.5-mm cocok untuk pekerjaan yang memerlukan pemahaman hubungan antar-informasi dan pemeliharaan konsistensi keseluruhan pekerjaan. Dalam pengembangan, model ini meninjau keterkaitan antara persyaratan, desain, implementasi, dan pengujian; dalam analisis dokumen, model ini menggabungkan klaim dan bukti, perbedaan, serta kontradiksi dari berbagai materi.
- Implementasi fitur kompleks: mengubah kode, pengujian, dan dokumentasi secara bersamaan dengan mempertimbangkan kontrak dan perilaku beberapa modul.
- Analisis kode berskala besar: meninjau hubungan pemanggilan, aliran data, dan cakupan dampak perubahan.
- Analisis penyebab gangguan: membandingkan log, konfigurasi, kode, dan hasil eksekusi untuk merangkum hipotesis penyebab serta prosedur verifikasi.
- Dukungan desain dan pengambilan keputusan: menyusun persyaratan dan batasan secara terstruktur serta menganalisis dampak alternatif implementasi.
- Analisis sintesis multi-dokumen: merangkum persamaan, perbedaan, dan kontradiksi dalam laporan serta dokumen teknis berdasarkan bukti.
- Tinjauan integrasi multimodal: menafsirkan teks dan materi visual secara bersamaan untuk menganalisis masalah dan persyaratan.
- Agen multi-tahap: digunakan untuk pekerjaan yang mencakup rangkaian investigasi, perencanaan, eksekusi alat, dan peninjauan hasil.
- Penulisan dokumen profesional: menyusun laporan teknis, proposal desain, dan dokumen tinjauan terperinci yang mencerminkan kondisi kompleks dan bukti.
Misalnya, digunakan untuk meninjau kode terkait dan log dari kesalahan yang terjadi di berbagai layanan secara bersamaan, atau untuk pekerjaan yang mencakup analisis persyaratan fitur kompleks hingga implementasi dan peninjauan hasil verifikasi.
cip-5.5-sm
cip-5.5-sm melakukan inferensi lokal dan otomatisasi pekerjaan di server edge dan lingkungan on-premise. Karena ukuran model dapat disesuaikan dalam rentang 24B~40B, konfigurasinya dapat dipilih sesuai sumber daya komputasi perangkat deployment dan tingkat kinerja yang dibutuhkan di lapangan. Karena pemrosesan dilakukan dekat dengan lokasi data dihasilkan, cip-5.5-sm digunakan untuk integrasi dengan sistem lapangan dan pemanfaatan data internal. Jika model dan alat yang diperlukan dikonfigurasi secara lokal, cip-5.5-sm juga dapat dioperasikan di lingkungan dengan koneksi eksternal terbatas.
Perannya adalah menafsirkan informasi yang muncul di lapangan dan menghubungkannya dengan prosedur pemrosesan. Peran ini mengklasifikasikan log dan permintaan, mengekstrak informasi yang diperlukan dari data, serta menjalankan pekerjaan berulang menggunakan alat internal dan skrip yang terhubung.
- Pemrosesan peristiwa lapangan: Mengklasifikasikan log perangkat dan informasi status, lalu menyeleksi peristiwa yang perlu diperiksa.
- Prapemrosesan data: Mengekstrak item utama dari catatan pekerjaan, lalu mengklasifikasikan, memberi tag, dan menormalkannya.
- Perutean permintaan: Meneruskan permintaan yang diterima ke sistem atau prosedur pemrosesan yang bertanggung jawab.
- Agen pekerjaan lokal: Melakukan pekerjaan berulang dengan mengakses sistem internal dan menjalankan skrip.
- Dukungan pekerjaan on-premise: Menjawab pertanyaan berdasarkan materi internal dan merangkum isi pekerjaan.
- Dukungan analisis lanjutan: Menyeleksi materi yang memerlukan peninjauan tambahan dan merangkum hal-hal utamanya.
Misalnya, digunakan dalam alur kerja untuk mengklasifikasikan log operasional di server lokasi kerja, menelusuri riwayat terkait, lalu membuat ringkasan insiden untuk penanggung jawab.
Cosa
Cosa adalah rangkaian produk suara yang mengubah teks menjadi suara, mengenali suara masukan menjadi teks, serta mendaftarkan dan menggunakan kembali suara yang diinginkan. Cosa digunakan untuk panduan layanan, pembuatan konten, dukungan aksesibilitas, dan antarmuka suara untuk agen interaktif.
cosa-a dan cosa-b menangani pembuatan suara, sedangkan cosa-asr menangani pengenalan suara. cosa-a dan cosa-b merupakan model terpisah yang masing-masing menyediakan daftar suara dan pengaturan sintesisnya, lalu dapat dipilih melalui antarmuka layanan yang sama. Fitur yang disediakan bersama oleh kedua model tersebut adalah sebagai berikut.
- Text ke suara: Mensintesis kalimat yang dimasukkan dengan suara yang dipilih.
- Kloning suara: Mendaftarkan suara berdasarkan rekaman referensi yang memiliki izin penggunaan, lalu mensintesis kalimat baru.
- Desain suara: Membuat dan mendaftarkan suara dengan menjelaskan karakteristik suara yang diinginkan.
- Penggunaan kembali suara: Menggunakan suara yang telah didaftarkan untuk sintesis berikutnya.
- Pengaturan sintesis: Menyesuaikan kecepatan bicara, bahasa, dan lainnya.
- Pengiriman streaming: Mensintesis per frasa segera setelah teks tiba dan mengirimkan audio secara berurutan.
- Kontrol pemutaran: Mendukung jeda, melanjutkan, menghentikan, dan memasukkan kalimat tambahan.
Dengan menggunakan input teks bertahap, pemutaran suara dapat dimulai sebelum seluruh jawaban selesai. Saat CIP menyusun jawaban, Anda dapat mengonfigurasi layanan agar Cosa membacakan frasa yang telah siap terlebih dahulu.
cosa-a
cosa-a mendukung text-to-speech, kloning suara, desain suara, dan output streaming. Selain fungsi dasar untuk memilih suara, bahasa, dan kecepatan bicara, tersedia juga opsi kontrol tambahan seperti jumlah tahap sintesis, intensitas panduan, serta pengaturan terkait panjang hasil generasi. Fitur ini digunakan untuk menyesuaikan pengaturan selama proses pembuatan suara dan meninjau hasilnya, atau menerapkan beberapa pengaturan pada naskah yang sama lalu memilih hasilnya.
- Mensintesis panduan dan notifikasi untuk aplikasi, kios, dan sistem kerja.
- Membuat materi pelatihan dan panduan penggunaan dalam bentuk suara.
- Membuat narasi untuk konten video dan audio.
- Membuat konten berulang dengan suara yang telah didaftarkan.
- Digunakan untuk output suara streaming agen interaktif.
- Digunakan dalam pembuatan suara dengan menyesuaikan pengaturan sintesis secara terperinci.
cosa-b
cosa-b mendukung pemilihan suara preset, desain suara berbasis deskripsi, kloning berbasis suara referensi, dan output streaming. Anda dapat memilih suara dari daftar suara bawaan atau mendaftarkan suara baru untuk digunakan dalam layanan.
Kloning suara menggunakan rekaman referensi dan teks yang sesuai dengannya. Alur yang menghasilkan teks referensi melalui pengenalan suara selama proses pendaftaran juga didukung, dan suara yang telah didaftarkan dapat digunakan kembali dalam sintesis berikutnya.
- Membangun persona suara untuk layanan dan karakter.
- Membuat suara khusus melalui deskripsi atau rekaman referensi.
- Mensintesis panduan merek, dialog karakter, dan narasi konten.
- Digunakan untuk respons suara agen interaktif.
- Mensintesis pesan panduan dan naskah yang berubah dengan suara yang sama.
Saat memilih antara cosa-a dan cosa-b, jadikan suara yang diinginkan, hasil sintesis aktual, dan item kontrol yang diperlukan sebagai pertimbangan.
| Item | cosa-a | cosa-b |
|---|---|---|
| Pengaturan sintesis | Selain suara, bahasa, dan kecepatan bicara, pengaturan terkait jumlah langkah sintesis, kekuatan panduan, dan panjang generasi | Pengaturan umum seperti kecepatan bicara dan bahasa |
| Input kloning | Rekaman referensi yang Anda miliki hak untuk menggunakannya | Rekaman referensi dan teks yang sesuai. Teks referensi dapat dibuat melalui pengenalan suara selama proses pendaftaran |
| Peran | Pembuatan suara dengan memanfaatkan kontrol sintesis yang terperinci | Pemilihan suara dan pembuatan suara khusus |
cosa-asr
cosa-asr mengubah suara masukan menjadi teks. Model ini mendokumentasikan materi rekaman atau mengubah permintaan yang disampaikan melalui suara menjadi masukan yang dapat diproses oleh sistem kerja lanjutan.
- Mentranskripsikan memo suara dan materi rekaman.
- Mengubah pertanyaan dan permintaan kerja berbasis suara menjadi masukan.
- Membuat teks referensi untuk kloning suara.
- Menggunakannya untuk pemrosesan lanjutan setelah transkripsi, seperti peringkasan, klasifikasi, dan pencarian.
Dengan meneruskan hasil transkripsi ke CIP, proses dapat dilanjutkan ke peringkasan konten, klasifikasi permintaan, dan pembuatan draf pekerjaan. Dengan mensintesis hasil pemrosesan menggunakan cosa-a atau cosa-b, Anda dapat membuat layanan kerja dengan input dan output suara.
Cova
cova-1 adalah model khusus OCR visi berbasis LLM. Model ini mengenali teks dari dokumen dan gambar, mengekstrak tata letak serta struktur tabel, dan memberikan deskripsi singkat tentang elemen visual.
Model ini mengubah dokumen yang dilihat manusia menjadi format yang mudah digunakan oleh agen dan sistem kerja. Isi utama dan tabel diekstrak sebagai konten terstruktur, sedangkan gambar yang terdapat dalam dokumen disampaikan sebagai deskripsi singkat, sehingga agen lanjutan dapat memahami isi dokumen sekaligus konteks visualnya. Dengan menyusun alur kerja yang terlebih dahulu memahami materi melalui teks dan deskripsi hasil ekstraksi, lalu hanya meninjau sumber asli yang memerlukan pemeriksaan terperinci, jumlah input gambar asli yang berulang dapat dikurangi sehingga menghemat token konteks.
| Fungsi | Deskripsi |
|---|---|
| Pengenalan teks | Mengekstrak teks dari dokumen yang dipindai atau difoto. |
| Interpretasi tata letak | Membagi konten menjadi blok dengan mempertimbangkan tata letak dokumen. |
| Penyediaan informasi posisi | Menyediakan posisi blok yang dikenali untuk menghubungkan hasil ekstraksi dengan dokumen asli. |
| Ekstraksi struktur tabel | Menyusun isi tabel secara terstruktur untuk digunakan dalam pencarian dan pemrosesan data. |
| Deskripsi gambar sederhana | Menjelaskan secara singkat isi gambar dan elemen visual untuk memberikan petunjuk interpretasi kepada agen. |
| Efisiensi konteks | Mengurangi pengiriman ulang gambar asli dengan menyampaikan informasi yang berfokus pada teks, struktur, dan deskripsi gambar. |
| Analisis mendetail secara selektif | Membantu agen menentukan gambar asli yang perlu diperiksa lebih lanjut. |
| Konversi format dokumen | Menyusun hasil pengenalan ke dalam HTML atau Markdown. |
- Digitalisasi dokumen: Mengubah dokumen kertas dan bahan hasil pemindaian menjadi materi berbasis teks.
- Penerimaan dokumen kerja: Mengekstrak konten dari formulir, dokumen pendukung, dan laporan.
- Pemrosesan data tabel: Menggunakan tabel yang terdapat dalam dokumen untuk pemrosesan data lanjutan.
- Prapemrosesan pencarian pengetahuan: Mengubah gambar dokumen dan materi visual menjadi teks dan struktur yang dapat dicari.
- Otomatisasi peninjauan dokumen: Meneruskan hasil ekstraksi ke CIP untuk melakukan pemeriksaan item, peringkasan, dan perbandingan antar materi.
- Optimalisasi input agen: Menyusun isi, tabel, dan deskripsi gambar dari dokumen panjang agar hanya informasi yang diperlukan yang disampaikan.
Misalnya, saat mengekstrak isi dan tabel laporan, grafik yang disisipkan dijelaskan sebagai grafik yang menunjukkan tren penjualan per kuartal. Dengan deskripsi ini, agen memahami keberadaan dan tujuan grafik, lalu meninjau sumber asli secara tambahan ketika memerlukan angka atau tren yang akurat.
Menghubungkan rangkaian produk
Dengan menghubungkan produk, Anda dapat membangun alur berikut.
- Pekerjaan berbasis dokumen: Cova mengekstrak isi, tabel, dan deskripsi gambar, CIP secara selektif memeriksa sumber asli yang diperlukan untuk melakukan analisis dan pemrosesan pekerjaan, lalu Cosa menyampaikan hasilnya melalui suara.
- Pekerjaan berbasis suara: Cosa ASR mengubah permintaan suara menjadi teks, lalu cosa-a atau cosa-b membacakan jawaban yang diproses CIP.
- Otomatisasi di lapangan: cip-5.5-sm mengklasifikasikan data lapangan dan menjalankan pekerjaan lokal, lalu meneruskan materi yang memerlukan analisis komprehensif tambahan ke cip-5.5-im atau cip-5.5-mm.
Panggilan yang diizinkan di gateway
Paket gateway menentukan panggilan yang diizinkan untuk setiap model. Tabel di bawah ini menunjukkan cakupan yang dibuka oleh paket LLM_FREE, TTS_FREE, dan STT_FREE, yang diterapkan secara otomatis tanpa pengajuan. Model yang dibuka melalui jalur lain tidak tercantum.
| ID Model | Panggilan yang diizinkan | Paket dasar |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm과 cova-1 tidak ada dalam tabel paket ini. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm, dan ivy-4-mm dalam tabel ini adalah ID model yang tidak termasuk dalam deskripsi produk di atas. Jalur yang sesuai dengan kunci pemanggilan dijelaskan dalam dokumen Pemanggilan API.
