Developer guide

مدل

خلاصه مدل

مدل‌های CLEVI به سه خانواده محصول تقسیم می‌شوند: CIP که مسئول هوش عمومی و خودکارسازی وظایف است، Cosa که مسئول تولید و تشخیص صداست، و Cova که مسئول استخراج اطلاعات از اسناد و تصاویر است. هر محصول را می‌توان به‌صورت مستقل استفاده کرد یا آن‌ها را به خدماتی متصل کرد که از تشخیص اسناد و تحلیل تا انجام وظایف و راهنمایی صوتی ادامه می‌یابند.

محصولشناسه مدلمشخصات اصلینقش اصلی
CIP-5.5-SMcip-5.5-sm24B~40B قابل تنظیمخودکارسازی وظایف روی سرور لبه و به‌صورت محلی
CIP-5.5-IMcip-5.5-im360B · ورودی 256K · خروجی 64K · چندوجهیپردازش عمومی وظایف. اولویت با سرعت پاسخ‌گویی و توان عملیاتی
CIP-5.5-MMcip-5.5-mm800B · ورودی 512K · خروجی 64K · چندوجهیتحلیل زمینه‌های طولانی و حل مسائل پیچیده
Cosa-Acosa-aترکیب، شبیه‌سازی، طراحی و پخش جریانی صداتولید صدا با استفاده از کنترل دقیق ترکیب
Cosa-Bcosa-bترکیب، شبیه‌سازی، طراحی و پخش جریانی صداانتخاب صدا و تولید صدای سفارشی
Cosa ASRcosa-asrتشخیص صداتبدیل ورودی صوتی به متن
Covacova-1مخصوص OCR بینایی مبتنی بر LLMاستخراج متن، طرح‌بندی و جدول، و توضیح ساده تصاویر

CIP

CIP مسئول هوش عمومی و خودکارسازی وظایف است. این مجموعه شامل cip-5.5-im و cip-5.5-mm است که از طریق درگاه فراخوانی می‌شوند، و cip-5.5-sm که روی سرورهای لبه و به‌صورت درون‌سازمانی مستقر می‌شود.

cip-5.5-im و cip-5.5-mm

موردcip-5.5-imcip-5.5-mm
مقیاس360B800B
محدودیت ورودی256K512K
حداکثر خروجی64K64K
قالب ورودیمتن و محتوای بصری (اسناد، تصاویر صفحه، جداول و نمودارها)متن و محتوای بصری (بررسی یکپارچه کد، اسناد و محتوای صفحه)
جهت‌گیری طراحیوظایف دانشی روزمره و کارهای توسعه را با تمرکز بر سرعت پاسخ‌گویی، بهره‌وری هزینه و توان عملیاتی پردازش می‌کند.وظایف پیچیده‌ای را پردازش می‌کند که در آن‌ها منابع و شرایط متعدد ترکیب و تحلیل می‌شوند و نتایج تحلیل به کارهای واقعی پیوند می‌خورند.
کاربرد ورودی‌های طولانیچندین سند، فایل کد و سابقه مکالمه را به‌طور هم‌زمان بررسی می‌کند.حجم زیادی از منابع مرجع و سابقه کار را به‌طور هم‌زمان مدیریت می‌کند و وظایف عامل‌محوری را انجام می‌دهد که در آن‌ها پژوهش، اجرا و اعتبارسنجی در چند مرحله ادامه می‌یابند.

cip-5.5-im برای کارهایی مناسب است که هدف و دامنه کار مشخصی دارند. استخراج اطلاعات موردنیاز از منابع ارائه‌شده، تهیه خروجی در قالب تعیین‌شده و اصلاح کد مطابق با الزامات، نمونه‌های شاخص این کارها هستند. حداکثر خروجی 64K برای تهیه گزارش‌های 상세 یا خروجی‌های متشکل از چند بخش استفاده می‌شود.

  • کمک به توسعه: نوشتن توابع و قابلیت‌ها، رفع باگ‌هایی با دامنه مشخص و پیاده‌سازی مطابق با الگوهای موجود.
  • ایجاد تست: تهیه پیش‌نویس تست‌ها و موارد اعتبارسنجی بر اساس الزامات و پیاده‌سازی.
  • پردازش اسناد: انجام خلاصه‌سازی، دسته‌بندی، استخراج موارد، تبدیل قالب و تهیه پیش‌نویس.
  • تحلیل چندوجهی: بررسی تصاویر صفحه‌نمایش و جدول‌ها و نمودارهای اسناد، همراه با توضیحات مرتبط.
  • پشتیبانی تعاملی از کارها: پاسخ‌گویی به پرسش‌ها بر اساس منابع کاری و تهیه خروجی‌های موردنیاز.
  • پردازش انبوه: استفاده برای خلاصه‌سازی جداگانه اسناد متعدد، دسته‌بندی درخواست‌ها و تبدیل داده‌ها.
  • عامل فرعی: انجام کارهای فرعی با مرز مشخص، مانند بررسی کد، بازبینی فایل‌های خاص و سازمان‌دهی منابع.

برای مثال، از آن برای دریافت الزامات قابلیت و کد مرتبط و تهیه پیشنهاد اصلاح، تست و توضیح تغییرات، یا دسته‌بندی اسناد دریافتی و تهیه خلاصه برای مسئول مربوطه استفاده می‌شود.

cip-5.5-mm برای کارهایی مناسب است که نیازمند درک روابط میان اطلاعات و حفظ انسجام کل کار هستند. در توسعه، ارتباط میان الزامات، طراحی، پیاده‌سازی و تست را بررسی می‌کند و در تحلیل اسناد، ادعاها و شواهد، تفاوت‌ها و تناقض‌های موجود در چندین منبع را به‌صورت جامع تحلیل می‌کند.

  • پیاده‌سازی قابلیت‌های پیچیده: با درنظرگرفتن قراردادها و رفتار چندین ماژول، کد، تست و مستندات را به‌طور هم‌زمان تغییر می‌دهد.
  • تحلیل کد در مقیاس بزرگ: روابط فراخوانی، جریان داده و دامنه تأثیر تغییرات را بررسی می‌کند.
  • تحلیل علت اختلال: گزارش‌ها، تنظیمات، کد و نتایج اجرا را با یکدیگر تطبیق می‌دهد و فرضیه‌های علت و روش‌های بررسی آن‌ها را سازمان‌دهی می‌کند.
  • پشتیبانی از طراحی و تصمیم‌گیری: الزامات و محدودیت‌ها را ساختاربندی می‌کند و تأثیر گزینه‌های پیاده‌سازی را تحلیل می‌کند.
  • تحلیل جامع چندسندی: شباهت‌ها، تفاوت‌ها و تناقض‌های گزارش‌ها و اسناد فنی را بر اساس شواهد سازمان‌دهی می‌کند.
  • بازبینی یکپارچه چندوجهی: متن و منابع بصری را هم‌زمان تفسیر می‌کند و مسائل و الزامات را تحلیل می‌کند.
  • عامل چندمرحله‌ای: برای کارهایی استفاده می‌شود که شامل بررسی، برنامه‌ریزی، اجرای ابزار و بازبینی نتایج هستند.
  • تهیه اسناد تخصصی: گزارش‌های فنی، طرح‌های طراحی و اسناد بررسی 상세 را با انعکاس شرایط پیچیده و شواهد تهیه می‌کند.

برای مثال، برای بررسی هم‌زمان کدها و گزارش‌های مرتبط با خطاهای رخ‌داده در چندین سرویس، یا انجام فرایندهایی از تحلیل نیازمندی‌های قابلیت‌های پیچیده تا پیاده‌سازی و بررسی نتایج اعتبارسنجی استفاده می‌شود.

cip-5.5-sm

cip-5.5-sm استنتاج محلی و خودکارسازی فرایندهای کاری را در سرورهای لبه و محیط‌های درون‌سازمانی انجام می‌دهد. از آنجا که می‌توان اندازه مدل را در محدوده 24B~40B تنظیم کرد، پیکربندی را متناسب با منابع محاسباتی تجهیزات استقرار و عملکرد موردنیاز در محل انتخاب می‌کنید. پردازش در نزدیکی محل تولید داده انجام می‌شود؛ بنابراین از آن برای اتصال به سیستم‌های محل و استفاده از داده‌های داخلی بهره می‌گیرند. با پیکربندی مدل‌ها و ابزارهای موردنیاز به‌صورت محلی، می‌توان آن را حتی در محیط‌هایی با اتصال خارجی محدود نیز عملیاتی کرد.

نقش آن تفسیر اطلاعات رخ‌داده در محل و تبدیل آن به فرایندهای پردازشی است. گزارش‌ها و درخواست‌ها را دسته‌بندی می‌کند، اطلاعات موردنیاز را از داده‌ها استخراج می‌کند و با ابزارها و اسکریپت‌های داخلی متصل، کارهای تکراری را انجام می‌دهد.

  • پردازش رویدادهای محل: گزارش‌های تجهیزات و اطلاعات وضعیت را دسته‌بندی کرده و رویدادهایی را که نیاز به بررسی دارند، انتخاب می‌کند.
  • پیش‌پردازش داده: موارد کلیدی را از سوابق کاری استخراج کرده و آن‌ها را دسته‌بندی، برچسب‌گذاری و نرمال‌سازی می‌کند.
  • مسیریابی درخواست: درخواست‌های ثبت‌شده را به سیستم مسئول یا فرایند پردازش مربوطه منتقل می‌کند.
  • عامل کاری محلی: با جست‌وجو در سیستم‌های داخلی و اجرای اسکریپت‌ها، کارهای تکراری را انجام می‌دهد.
  • پشتیبانی کاری درون‌سازمانی: بر اساس منابع داخلی به پرسش‌ها پاسخ می‌دهد و محتوای کاری را整理 می‌کند.
  • پشتیبانی از تحلیل‌های بعدی: مطالبی را که نیاز به بررسی بیشتر دارند، انتخاب کرده و نکات کلیدی را整理 می‌کند.

برای مثال، برای فرایندی استفاده می‌شود که در آن گزارش‌های عملیاتی در سرور محل دسته‌بندی می‌شوند، سوابق مرتبط جست‌وجو می‌شوند و سپس خلاصه‌ای از رویداد برای مسئول مربوطه تهیه می‌شود.

Cosa

Cosa مجموعه‌ای از محصولات صوتی است که متن را به گفتار تبدیل می‌کند، گفتار ورودی را به‌صورت متنی تشخیص می‌دهد و امکان ثبت و استفاده مجدد از صدای دلخواه را فراهم می‌کند. از آن برای راهنمایی خدمات، تولید محتوا، پشتیبانی از دسترس‌پذیری و رابط صوتی عامل‌های تعاملی استفاده می‌شود.

تولید صوت بر عهده cosa-a و cosa-b است و تشخیص گفتار را cosa-asr انجام می‌دهد. cosa-a و cosa-b مدل‌های جداگانه‌ای هستند که هرکدام فهرست صداها و تنظیمات ترکیب صدای خود را ارائه می‌کنند و در همان رابط سرویس انتخاب می‌شوند. قابلیت‌های مشترک این دو مدل عبارت‌اند از:

  • تبدیل متن به گفتار: متن واردشده را با صدای انتخابی ترکیب می‌کند.
  • شبیه‌سازی صدا: بر اساس یک ضبط مرجع که مجوز استفاده از آن را دارید، صدا را ثبت کرده و متن‌های جدید را ترکیب می‌کند.
  • طراحی صدا: با توضیح ویژگی‌های صدای موردنظر، صدا ایجاد و ثبت می‌کند.
  • استفاده مجدد از صدا: صدای ثبت‌شده را برای ترکیب‌های بعدی به کار می‌برد.
  • تنظیمات ترکیب: سرعت گفتار، زبان و موارد دیگر را تنظیم می‌کند.
  • تحویل جریانی: به‌محض رسیدن متن، آن را در واحدهای عبارتی ترکیب کرده و صدا را به‌صورت ترتیبی ارسال می‌کند.
  • کنترل پخش: از مکث، ادامه، توقف و وارد کردن متن‌های اضافی پشتیبانی می‌کند.

با استفاده از ورود تدریجی متن، می‌توان پخش صدا را پیش از تکمیل پاسخ کامل آغاز کرد. در حالی که CIP پاسخ را تولید می‌کند، می‌توان سرویسی 구성 کرد که cosa عبارت‌های آماده را برای شما بخواند.

cosa-a

cosa-a از تبدیل متن به گفتار، شبیه‌سازی صدا، طراحی صدا و خروجی جریانی پشتیبانی می‌کند. افزون بر قابلیت‌های پایه مانند انتخاب صدا، زبان و سرعت گفتار، گزینه‌های کنترلی بیشتری از جمله تنظیمات مربوط به تعداد مراحل ترکیب، شدت راهنمایی و طول تولید ارائه می‌دهد. از آن برای تنظیم گزینه‌ها و بررسی نتیجه در فرایند تولید صدا، یا اعمال تنظیمات متعدد روی یک متن یکسان و انتخاب نتیجه استفاده می‌شود.

  • راهنماها و اعلان‌های اپلیکیشن‌ها، کیوسک‌ها و سیستم‌های کاری را ترکیب می‌کند.
  • مطالب آموزشی و راهنماهای کاربری را به صدا تبدیل می‌کند.
  • روایت ویدئوها و محتوای صوتی را تولید می‌کند.
  • با صدای ثبت‌شده، محتوای تکرارشونده تولید می‌کند.
  • برای خروجی صوتی جریانی عامل‌های تعاملی استفاده می‌شود.
  • برای تولید صدا با تنظیم دقیق گزینه‌های ترکیب استفاده می‌شود.

cosa-b

cosa-b از انتخاب صدای ازپیش‌تنظیم‌شده، طراحی صدا بر اساس توضیحات، شبیه‌سازی بر اساس صدای مرجع و خروجی جریانی پشتیبانی می‌کند. می‌توانید از فهرست صداهای موجود، صدا انتخاب کنید یا صدای جدیدی برای استفاده در سرویس ثبت کنید.

برای شبیه‌سازی صدا از ضبط مرجع و متن متناظر با آن استفاده می‌شود. این فرایند همچنین از روندی پشتیبانی می‌کند که در آن متن مرجع با تشخیص گفتار تولید می‌شود؛ صدای ثبت‌شده نیز در ترکیب‌های بعدی دوباره استفاده می‌شود.

  • پرسونای صوتی سرویس و شخصیت را ایجاد می‌کند.
  • با استفاده از توضیحات یا ضبط مرجع، صدای سفارشی تولید می‌کند.
  • راهنماهای برند، دیالوگ‌های شخصیت‌ها و روایت محتوا را ترکیب می‌کند.
  • برای پاسخ‌های صوتی عامل‌های تعاملی استفاده می‌شود.
  • پیام‌های راهنما و متن‌هایی را که تغییر می‌کنند، با یک صدای یکسان ترکیب می‌کند.

هنگام انتخاب بین cosa-a و cosa-b، صدای موردنظر، نتیجه واقعی سنتز و موارد کنترلی موردنیاز را مبنا قرار دهید.

موردcosa-acosa-b
تنظیمات سنتزعلاوه بر صدا، زبان و سرعت گفتار، تنظیمات مربوط به تعداد مراحل سنتز، شدت راهنمایی و طول تولیدتنظیمات مشترک مانند سرعت گفتار و زبان
ورودی شبیه‌سازی صداضبط مرجعی که مجوز استفاده از آن را داریدضبط مرجع و متن متناظر با آن. در فرایند ثبت، امکان تولید متن مرجع با استفاده از تشخیص گفتار وجود دارد
نقشتولید صدا با استفاده از کنترل دقیق سنتزانتخاب صدا و تولید صدای سفارشی

cosa-asr

cosa-asr صدای ورودی را به متن تبدیل می‌کند. از آن برای مستندسازی مطالب ضبط‌شده یا تبدیل درخواست‌های صوتی به ورودی قابل پردازش توسط سیستم‌های کاری بعدی استفاده می‌شود.

  • یادداشت‌های صوتی و مطالب ضبط‌شده را رونویسی می‌کند.
  • پرسش‌ها و درخواست‌های کاری مبتنی بر صدا را به ورودی تبدیل می‌کند.
  • متن مرجع برای شبیه‌سازی صدا تولید می‌کند.
  • برای پردازش‌های پس از رونویسی مانند خلاصه‌سازی، دسته‌بندی و جست‌وجو استفاده می‌شود.

با انتقال نتیجه رونویسی به CIP، فرایند به خلاصه‌سازی محتوا، دسته‌بندی درخواست‌ها و تهیه پیش‌نویس کارها ادامه می‌یابد. با سنتز نتیجه پردازش توسط cosa-a یا cosa-b، یک سرویس کاری با ورودی و خروجی صوتی ایجاد می‌شود.

Cova

cova-1 یک مدل اختصاصی OCR بینایی مبتنی بر LLM است. این مدل متن را از اسناد و تصاویر تشخیص می‌دهد، چیدمان و ساختار جدول‌ها را استخراج می‌کند و توضیحی ساده درباره عناصر بصری ارائه می‌دهد.

اسناد قابل مشاهده برای انسان را به شکلی تبدیل می‌کند که ایجنت‌ها و سیستم‌های کاری بتوانند به‌راحتی از آن استفاده کنند. متن اصلی و جدول‌ها به‌صورت محتوای ساختاریافته استخراج می‌شوند و تصاویر موجود در سند با توضیحی کوتاه ارائه می‌شوند؛ بنابراین ایجنت‌های بعدی می‌توانند هم محتوای سند و هم زمینه بصری آن را درک کنند. با ایجاد فرایندی که ابتدا منابع را با استفاده از متن و توضیحات استخراج‌شده بررسی کند و فقط برای مواردی که به تأیید دقیق نیاز دارند، اصل تصویر را دوباره بررسی کند، می‌توان میزان ورود مکرر تصاویر اصلی را کاهش داد و در توکن‌های زمینه صرفه‌جویی کرد.

قابلیتتوضیح
تشخیص متنحروف را از اسنادی که اسکن یا تصویربرداری شده‌اند استخراج می‌کند.
تفسیر چیدمانبا در نظر گرفتن چیدمان سند، محتوا را به بلوک‌ها تقسیم می‌کند.
ارائه اطلاعات موقعیتموقعیت بلوک‌های شناسایی‌شده را ارائه می‌کند تا نتایج استخراج‌شده به متن اصلی مرتبط شوند.
استخراج ساختار جدولمحتوای جدول را ساختارمند می‌کند تا برای جست‌وجو و پردازش داده استفاده شود.
توضیح ساده تصویرمحتوای تصویر و عناصر بصری را به‌اختصار توضیح می‌دهد تا سرنخ‌هایی برای تفسیر در اختیار عامل قرار دهد.
بهینه‌سازی زمینهبا انتقال اطلاعات بر اساس متن، ساختار و توضیحات تصویر، ورود مکرر تصویر اصلی را کاهش می‌دهد.
تحلیل جزئی انتخابیبه عامل کمک می‌کند تشخیص دهد کدام تصاویر اصلی را باید برای بررسی بیشتر مشاهده کند.
تبدیل قالب سندنتایج شناسایی را به‌صورت HTML یا Markdown سازمان‌دهی می‌کند.
  • دیجیتالی‌سازی اسناد: اسناد کاغذی و مطالب اسکن‌شده را به منابع مبتنی بر متن تبدیل می‌کند.
  • دریافت اسناد کاری: محتوا را از فرم‌ها، مدارک پشتیبان و گزارش‌ها استخراج می‌کند.
  • پردازش داده‌های جدولی: جدول‌های موجود در اسناد را برای پردازش‌های بعدی داده استفاده می‌کند.
  • پیش‌پردازش جست‌وجوی دانش: تصاویر اسناد و مطالب بصری را به متن و ساختار قابل جست‌وجو تبدیل می‌کند.
  • خودکارسازی بررسی اسناد: نتایج استخراج‌شده را به CIP منتقل می‌کند تا بررسی موارد، خلاصه‌سازی و مقایسه بین مطالب انجام شود.
  • بهینه‌سازی ورودی عامل: متن اصلی، جدول‌ها و توضیحات تصاویر اسناد طولانی را سازمان‌دهی می‌کند تا فقط اطلاعات موردنیاز منتقل شود.

برای مثال، هنگام استخراج متن اصلی و جدول‌های یک گزارش، نمودار درج‌شده را به‌عنوان نموداری توضیح می‌دهد که روند درآمد فصلی را نشان می‌دهد. عامل با استفاده از این توضیح، وجود و کاربرد نمودار را تشخیص می‌دهد و هرگاه به اعداد یا روندهای دقیق نیاز داشته باشد، منبع اصلی مربوطه را بررسی می‌کند.

اتصال محصولات

با اتصال محصولات می‌توان جریان زیر را 구성 کرد.

  • کار مبتنی بر سند: Cova متن اصلی، جدول‌ها و توضیحات تصاویر را استخراج می‌کند، CIP منابع اصلی موردنیاز را به‌صورت انتخابی بررسی کرده و تحلیل و پردازش کار را انجام می‌دهد، و Cosa نتیجه را به‌صورت صوتی ارائه می‌کند.
  • کار مبتنی بر صدا: Cosa ASR درخواست صوتی را به متن تبدیل می‌کند و cosa-a یا cosa-b پاسخ پردازش‌شده توسط CIP را می‌خواند.
  • خودکارسازی میدانی: cip-5.5-sm داده‌های میدانی را دسته‌بندی کرده و کارهای محلی را انجام می‌دهد و مطالبی را که به تحلیل جامع بیشتری نیاز دارند به cip-5.5-im یا cip-5.5-mm منتقل می‌کند.

فراخوانی‌های مجاز در دروازه

پلن‌های درگاه، فراخوانی‌های مجاز برای هر مدل را تعیین می‌کنند. جدول زیر محدوده‌ای را نشان می‌دهد که پلن‌های LLM_FREE، TTS_FREE و STT_FREE فعال می‌کنند؛ این پلن‌ها بدون نیاز به درخواست، به‌صورت خودکار اعمال می‌شوند. مدل‌هایی که از مسیرهای دیگری فعال شده‌اند، در این جدول گنجانده نشده‌اند.

شناسه مدلفراخوانی‌های مجازپلن مبنا
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm و cova-1 در این جدول طرح وجود ندارند. cip-5.5-im-chat، cip-5.5-mm-h، cosa-tts، ivy-4-embedding، ivy-4-embedding-mm و ivy-4-mm در این جدول، شناسه‌های مدلی هستند که در توضیحات محصولات بالا گنجانده نشده‌اند. مسیر مربوط به کلید فراخوانی در سند فراخوانی API آمده است.

CLEVI

زبان و منطقه

زبان‌های ترجمه‌شده با ماشین علامت‌گذاری شده‌اند. دسترس‌پذیری بر اساس بسته منتشرشده سایت است.

۱۳۶ زبان

پیشنهادی

1

شرق آسیا

7

جنوب شرق آسیا

11

جنوب آسیا

18

آسیای مرکزی

5

خاورمیانه و قفقاز

10

غرب اروپا و جنوب اروپا

16

بریتانیا و ایرلند

4

شمال اروپا

10

اروپای مرکزی و بالکان

14

شرق اروپا

5

شرق افریقا

8

غرب افریقا و مرکز افریقا

9

جنوب افریقا

8

امریکا

5

اقیانوسیه

5