Developer guide
مدل
خلاصه مدل
مدلهای CLEVI به سه خانواده محصول تقسیم میشوند: CIP که مسئول هوش عمومی و خودکارسازی وظایف است، Cosa که مسئول تولید و تشخیص صداست، و Cova که مسئول استخراج اطلاعات از اسناد و تصاویر است. هر محصول را میتوان بهصورت مستقل استفاده کرد یا آنها را به خدماتی متصل کرد که از تشخیص اسناد و تحلیل تا انجام وظایف و راهنمایی صوتی ادامه مییابند.
| محصول | شناسه مدل | مشخصات اصلی | نقش اصلی |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B قابل تنظیم | خودکارسازی وظایف روی سرور لبه و بهصورت محلی |
| CIP-5.5-IM | cip-5.5-im | 360B · ورودی 256K · خروجی 64K · چندوجهی | پردازش عمومی وظایف. اولویت با سرعت پاسخگویی و توان عملیاتی |
| CIP-5.5-MM | cip-5.5-mm | 800B · ورودی 512K · خروجی 64K · چندوجهی | تحلیل زمینههای طولانی و حل مسائل پیچیده |
| Cosa-A | cosa-a | ترکیب، شبیهسازی، طراحی و پخش جریانی صدا | تولید صدا با استفاده از کنترل دقیق ترکیب |
| Cosa-B | cosa-b | ترکیب، شبیهسازی، طراحی و پخش جریانی صدا | انتخاب صدا و تولید صدای سفارشی |
| Cosa ASR | cosa-asr | تشخیص صدا | تبدیل ورودی صوتی به متن |
| Cova | cova-1 | مخصوص OCR بینایی مبتنی بر LLM | استخراج متن، طرحبندی و جدول، و توضیح ساده تصاویر |
CIP
CIP مسئول هوش عمومی و خودکارسازی وظایف است. این مجموعه شامل cip-5.5-im و cip-5.5-mm است که از طریق درگاه فراخوانی میشوند، و cip-5.5-sm که روی سرورهای لبه و بهصورت درونسازمانی مستقر میشود.
cip-5.5-im و cip-5.5-mm
| مورد | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| مقیاس | 360B | 800B |
| محدودیت ورودی | 256K | 512K |
| حداکثر خروجی | 64K | 64K |
| قالب ورودی | متن و محتوای بصری (اسناد، تصاویر صفحه، جداول و نمودارها) | متن و محتوای بصری (بررسی یکپارچه کد، اسناد و محتوای صفحه) |
| جهتگیری طراحی | وظایف دانشی روزمره و کارهای توسعه را با تمرکز بر سرعت پاسخگویی، بهرهوری هزینه و توان عملیاتی پردازش میکند. | وظایف پیچیدهای را پردازش میکند که در آنها منابع و شرایط متعدد ترکیب و تحلیل میشوند و نتایج تحلیل به کارهای واقعی پیوند میخورند. |
| کاربرد ورودیهای طولانی | چندین سند، فایل کد و سابقه مکالمه را بهطور همزمان بررسی میکند. | حجم زیادی از منابع مرجع و سابقه کار را بهطور همزمان مدیریت میکند و وظایف عاملمحوری را انجام میدهد که در آنها پژوهش، اجرا و اعتبارسنجی در چند مرحله ادامه مییابند. |
cip-5.5-im برای کارهایی مناسب است که هدف و دامنه کار مشخصی دارند. استخراج اطلاعات موردنیاز از منابع ارائهشده، تهیه خروجی در قالب تعیینشده و اصلاح کد مطابق با الزامات، نمونههای شاخص این کارها هستند. حداکثر خروجی 64K برای تهیه گزارشهای 상세 یا خروجیهای متشکل از چند بخش استفاده میشود.
- کمک به توسعه: نوشتن توابع و قابلیتها، رفع باگهایی با دامنه مشخص و پیادهسازی مطابق با الگوهای موجود.
- ایجاد تست: تهیه پیشنویس تستها و موارد اعتبارسنجی بر اساس الزامات و پیادهسازی.
- پردازش اسناد: انجام خلاصهسازی، دستهبندی، استخراج موارد، تبدیل قالب و تهیه پیشنویس.
- تحلیل چندوجهی: بررسی تصاویر صفحهنمایش و جدولها و نمودارهای اسناد، همراه با توضیحات مرتبط.
- پشتیبانی تعاملی از کارها: پاسخگویی به پرسشها بر اساس منابع کاری و تهیه خروجیهای موردنیاز.
- پردازش انبوه: استفاده برای خلاصهسازی جداگانه اسناد متعدد، دستهبندی درخواستها و تبدیل دادهها.
- عامل فرعی: انجام کارهای فرعی با مرز مشخص، مانند بررسی کد، بازبینی فایلهای خاص و سازماندهی منابع.
برای مثال، از آن برای دریافت الزامات قابلیت و کد مرتبط و تهیه پیشنهاد اصلاح، تست و توضیح تغییرات، یا دستهبندی اسناد دریافتی و تهیه خلاصه برای مسئول مربوطه استفاده میشود.
cip-5.5-mm برای کارهایی مناسب است که نیازمند درک روابط میان اطلاعات و حفظ انسجام کل کار هستند. در توسعه، ارتباط میان الزامات، طراحی، پیادهسازی و تست را بررسی میکند و در تحلیل اسناد، ادعاها و شواهد، تفاوتها و تناقضهای موجود در چندین منبع را بهصورت جامع تحلیل میکند.
- پیادهسازی قابلیتهای پیچیده: با درنظرگرفتن قراردادها و رفتار چندین ماژول، کد، تست و مستندات را بهطور همزمان تغییر میدهد.
- تحلیل کد در مقیاس بزرگ: روابط فراخوانی، جریان داده و دامنه تأثیر تغییرات را بررسی میکند.
- تحلیل علت اختلال: گزارشها، تنظیمات، کد و نتایج اجرا را با یکدیگر تطبیق میدهد و فرضیههای علت و روشهای بررسی آنها را سازماندهی میکند.
- پشتیبانی از طراحی و تصمیمگیری: الزامات و محدودیتها را ساختاربندی میکند و تأثیر گزینههای پیادهسازی را تحلیل میکند.
- تحلیل جامع چندسندی: شباهتها، تفاوتها و تناقضهای گزارشها و اسناد فنی را بر اساس شواهد سازماندهی میکند.
- بازبینی یکپارچه چندوجهی: متن و منابع بصری را همزمان تفسیر میکند و مسائل و الزامات را تحلیل میکند.
- عامل چندمرحلهای: برای کارهایی استفاده میشود که شامل بررسی، برنامهریزی، اجرای ابزار و بازبینی نتایج هستند.
- تهیه اسناد تخصصی: گزارشهای فنی، طرحهای طراحی و اسناد بررسی 상세 را با انعکاس شرایط پیچیده و شواهد تهیه میکند.
برای مثال، برای بررسی همزمان کدها و گزارشهای مرتبط با خطاهای رخداده در چندین سرویس، یا انجام فرایندهایی از تحلیل نیازمندیهای قابلیتهای پیچیده تا پیادهسازی و بررسی نتایج اعتبارسنجی استفاده میشود.
cip-5.5-sm
cip-5.5-sm استنتاج محلی و خودکارسازی فرایندهای کاری را در سرورهای لبه و محیطهای درونسازمانی انجام میدهد. از آنجا که میتوان اندازه مدل را در محدوده 24B~40B تنظیم کرد، پیکربندی را متناسب با منابع محاسباتی تجهیزات استقرار و عملکرد موردنیاز در محل انتخاب میکنید. پردازش در نزدیکی محل تولید داده انجام میشود؛ بنابراین از آن برای اتصال به سیستمهای محل و استفاده از دادههای داخلی بهره میگیرند. با پیکربندی مدلها و ابزارهای موردنیاز بهصورت محلی، میتوان آن را حتی در محیطهایی با اتصال خارجی محدود نیز عملیاتی کرد.
نقش آن تفسیر اطلاعات رخداده در محل و تبدیل آن به فرایندهای پردازشی است. گزارشها و درخواستها را دستهبندی میکند، اطلاعات موردنیاز را از دادهها استخراج میکند و با ابزارها و اسکریپتهای داخلی متصل، کارهای تکراری را انجام میدهد.
- پردازش رویدادهای محل: گزارشهای تجهیزات و اطلاعات وضعیت را دستهبندی کرده و رویدادهایی را که نیاز به بررسی دارند، انتخاب میکند.
- پیشپردازش داده: موارد کلیدی را از سوابق کاری استخراج کرده و آنها را دستهبندی، برچسبگذاری و نرمالسازی میکند.
- مسیریابی درخواست: درخواستهای ثبتشده را به سیستم مسئول یا فرایند پردازش مربوطه منتقل میکند.
- عامل کاری محلی: با جستوجو در سیستمهای داخلی و اجرای اسکریپتها، کارهای تکراری را انجام میدهد.
- پشتیبانی کاری درونسازمانی: بر اساس منابع داخلی به پرسشها پاسخ میدهد و محتوای کاری را整理 میکند.
- پشتیبانی از تحلیلهای بعدی: مطالبی را که نیاز به بررسی بیشتر دارند، انتخاب کرده و نکات کلیدی را整理 میکند.
برای مثال، برای فرایندی استفاده میشود که در آن گزارشهای عملیاتی در سرور محل دستهبندی میشوند، سوابق مرتبط جستوجو میشوند و سپس خلاصهای از رویداد برای مسئول مربوطه تهیه میشود.
Cosa
Cosa مجموعهای از محصولات صوتی است که متن را به گفتار تبدیل میکند، گفتار ورودی را بهصورت متنی تشخیص میدهد و امکان ثبت و استفاده مجدد از صدای دلخواه را فراهم میکند. از آن برای راهنمایی خدمات، تولید محتوا، پشتیبانی از دسترسپذیری و رابط صوتی عاملهای تعاملی استفاده میشود.
تولید صوت بر عهده cosa-a و cosa-b است و تشخیص گفتار را cosa-asr انجام میدهد. cosa-a و cosa-b مدلهای جداگانهای هستند که هرکدام فهرست صداها و تنظیمات ترکیب صدای خود را ارائه میکنند و در همان رابط سرویس انتخاب میشوند. قابلیتهای مشترک این دو مدل عبارتاند از:
- تبدیل متن به گفتار: متن واردشده را با صدای انتخابی ترکیب میکند.
- شبیهسازی صدا: بر اساس یک ضبط مرجع که مجوز استفاده از آن را دارید، صدا را ثبت کرده و متنهای جدید را ترکیب میکند.
- طراحی صدا: با توضیح ویژگیهای صدای موردنظر، صدا ایجاد و ثبت میکند.
- استفاده مجدد از صدا: صدای ثبتشده را برای ترکیبهای بعدی به کار میبرد.
- تنظیمات ترکیب: سرعت گفتار، زبان و موارد دیگر را تنظیم میکند.
- تحویل جریانی: بهمحض رسیدن متن، آن را در واحدهای عبارتی ترکیب کرده و صدا را بهصورت ترتیبی ارسال میکند.
- کنترل پخش: از مکث، ادامه، توقف و وارد کردن متنهای اضافی پشتیبانی میکند.
با استفاده از ورود تدریجی متن، میتوان پخش صدا را پیش از تکمیل پاسخ کامل آغاز کرد. در حالی که CIP پاسخ را تولید میکند، میتوان سرویسی 구성 کرد که cosa عبارتهای آماده را برای شما بخواند.
cosa-a
cosa-a از تبدیل متن به گفتار، شبیهسازی صدا، طراحی صدا و خروجی جریانی پشتیبانی میکند. افزون بر قابلیتهای پایه مانند انتخاب صدا، زبان و سرعت گفتار، گزینههای کنترلی بیشتری از جمله تنظیمات مربوط به تعداد مراحل ترکیب، شدت راهنمایی و طول تولید ارائه میدهد. از آن برای تنظیم گزینهها و بررسی نتیجه در فرایند تولید صدا، یا اعمال تنظیمات متعدد روی یک متن یکسان و انتخاب نتیجه استفاده میشود.
- راهنماها و اعلانهای اپلیکیشنها، کیوسکها و سیستمهای کاری را ترکیب میکند.
- مطالب آموزشی و راهنماهای کاربری را به صدا تبدیل میکند.
- روایت ویدئوها و محتوای صوتی را تولید میکند.
- با صدای ثبتشده، محتوای تکرارشونده تولید میکند.
- برای خروجی صوتی جریانی عاملهای تعاملی استفاده میشود.
- برای تولید صدا با تنظیم دقیق گزینههای ترکیب استفاده میشود.
cosa-b
cosa-b از انتخاب صدای ازپیشتنظیمشده، طراحی صدا بر اساس توضیحات، شبیهسازی بر اساس صدای مرجع و خروجی جریانی پشتیبانی میکند. میتوانید از فهرست صداهای موجود، صدا انتخاب کنید یا صدای جدیدی برای استفاده در سرویس ثبت کنید.
برای شبیهسازی صدا از ضبط مرجع و متن متناظر با آن استفاده میشود. این فرایند همچنین از روندی پشتیبانی میکند که در آن متن مرجع با تشخیص گفتار تولید میشود؛ صدای ثبتشده نیز در ترکیبهای بعدی دوباره استفاده میشود.
- پرسونای صوتی سرویس و شخصیت را ایجاد میکند.
- با استفاده از توضیحات یا ضبط مرجع، صدای سفارشی تولید میکند.
- راهنماهای برند، دیالوگهای شخصیتها و روایت محتوا را ترکیب میکند.
- برای پاسخهای صوتی عاملهای تعاملی استفاده میشود.
- پیامهای راهنما و متنهایی را که تغییر میکنند، با یک صدای یکسان ترکیب میکند.
هنگام انتخاب بین cosa-a و cosa-b، صدای موردنظر، نتیجه واقعی سنتز و موارد کنترلی موردنیاز را مبنا قرار دهید.
| مورد | cosa-a | cosa-b |
|---|---|---|
| تنظیمات سنتز | علاوه بر صدا، زبان و سرعت گفتار، تنظیمات مربوط به تعداد مراحل سنتز، شدت راهنمایی و طول تولید | تنظیمات مشترک مانند سرعت گفتار و زبان |
| ورودی شبیهسازی صدا | ضبط مرجعی که مجوز استفاده از آن را دارید | ضبط مرجع و متن متناظر با آن. در فرایند ثبت، امکان تولید متن مرجع با استفاده از تشخیص گفتار وجود دارد |
| نقش | تولید صدا با استفاده از کنترل دقیق سنتز | انتخاب صدا و تولید صدای سفارشی |
cosa-asr
cosa-asr صدای ورودی را به متن تبدیل میکند. از آن برای مستندسازی مطالب ضبطشده یا تبدیل درخواستهای صوتی به ورودی قابل پردازش توسط سیستمهای کاری بعدی استفاده میشود.
- یادداشتهای صوتی و مطالب ضبطشده را رونویسی میکند.
- پرسشها و درخواستهای کاری مبتنی بر صدا را به ورودی تبدیل میکند.
- متن مرجع برای شبیهسازی صدا تولید میکند.
- برای پردازشهای پس از رونویسی مانند خلاصهسازی، دستهبندی و جستوجو استفاده میشود.
با انتقال نتیجه رونویسی به CIP، فرایند به خلاصهسازی محتوا، دستهبندی درخواستها و تهیه پیشنویس کارها ادامه مییابد. با سنتز نتیجه پردازش توسط cosa-a یا cosa-b، یک سرویس کاری با ورودی و خروجی صوتی ایجاد میشود.
Cova
cova-1 یک مدل اختصاصی OCR بینایی مبتنی بر LLM است. این مدل متن را از اسناد و تصاویر تشخیص میدهد، چیدمان و ساختار جدولها را استخراج میکند و توضیحی ساده درباره عناصر بصری ارائه میدهد.
اسناد قابل مشاهده برای انسان را به شکلی تبدیل میکند که ایجنتها و سیستمهای کاری بتوانند بهراحتی از آن استفاده کنند. متن اصلی و جدولها بهصورت محتوای ساختاریافته استخراج میشوند و تصاویر موجود در سند با توضیحی کوتاه ارائه میشوند؛ بنابراین ایجنتهای بعدی میتوانند هم محتوای سند و هم زمینه بصری آن را درک کنند. با ایجاد فرایندی که ابتدا منابع را با استفاده از متن و توضیحات استخراجشده بررسی کند و فقط برای مواردی که به تأیید دقیق نیاز دارند، اصل تصویر را دوباره بررسی کند، میتوان میزان ورود مکرر تصاویر اصلی را کاهش داد و در توکنهای زمینه صرفهجویی کرد.
| قابلیت | توضیح |
|---|---|
| تشخیص متن | حروف را از اسنادی که اسکن یا تصویربرداری شدهاند استخراج میکند. |
| تفسیر چیدمان | با در نظر گرفتن چیدمان سند، محتوا را به بلوکها تقسیم میکند. |
| ارائه اطلاعات موقعیت | موقعیت بلوکهای شناساییشده را ارائه میکند تا نتایج استخراجشده به متن اصلی مرتبط شوند. |
| استخراج ساختار جدول | محتوای جدول را ساختارمند میکند تا برای جستوجو و پردازش داده استفاده شود. |
| توضیح ساده تصویر | محتوای تصویر و عناصر بصری را بهاختصار توضیح میدهد تا سرنخهایی برای تفسیر در اختیار عامل قرار دهد. |
| بهینهسازی زمینه | با انتقال اطلاعات بر اساس متن، ساختار و توضیحات تصویر، ورود مکرر تصویر اصلی را کاهش میدهد. |
| تحلیل جزئی انتخابی | به عامل کمک میکند تشخیص دهد کدام تصاویر اصلی را باید برای بررسی بیشتر مشاهده کند. |
| تبدیل قالب سند | نتایج شناسایی را بهصورت HTML یا Markdown سازماندهی میکند. |
- دیجیتالیسازی اسناد: اسناد کاغذی و مطالب اسکنشده را به منابع مبتنی بر متن تبدیل میکند.
- دریافت اسناد کاری: محتوا را از فرمها، مدارک پشتیبان و گزارشها استخراج میکند.
- پردازش دادههای جدولی: جدولهای موجود در اسناد را برای پردازشهای بعدی داده استفاده میکند.
- پیشپردازش جستوجوی دانش: تصاویر اسناد و مطالب بصری را به متن و ساختار قابل جستوجو تبدیل میکند.
- خودکارسازی بررسی اسناد: نتایج استخراجشده را به CIP منتقل میکند تا بررسی موارد، خلاصهسازی و مقایسه بین مطالب انجام شود.
- بهینهسازی ورودی عامل: متن اصلی، جدولها و توضیحات تصاویر اسناد طولانی را سازماندهی میکند تا فقط اطلاعات موردنیاز منتقل شود.
برای مثال، هنگام استخراج متن اصلی و جدولهای یک گزارش، نمودار درجشده را بهعنوان نموداری توضیح میدهد که روند درآمد فصلی را نشان میدهد. عامل با استفاده از این توضیح، وجود و کاربرد نمودار را تشخیص میدهد و هرگاه به اعداد یا روندهای دقیق نیاز داشته باشد، منبع اصلی مربوطه را بررسی میکند.
اتصال محصولات
با اتصال محصولات میتوان جریان زیر را 구성 کرد.
- کار مبتنی بر سند: Cova متن اصلی، جدولها و توضیحات تصاویر را استخراج میکند، CIP منابع اصلی موردنیاز را بهصورت انتخابی بررسی کرده و تحلیل و پردازش کار را انجام میدهد، و Cosa نتیجه را بهصورت صوتی ارائه میکند.
- کار مبتنی بر صدا: Cosa ASR درخواست صوتی را به متن تبدیل میکند و cosa-a یا cosa-b پاسخ پردازششده توسط CIP را میخواند.
- خودکارسازی میدانی: cip-5.5-sm دادههای میدانی را دستهبندی کرده و کارهای محلی را انجام میدهد و مطالبی را که به تحلیل جامع بیشتری نیاز دارند به cip-5.5-im یا cip-5.5-mm منتقل میکند.
فراخوانیهای مجاز در دروازه
پلنهای درگاه، فراخوانیهای مجاز برای هر مدل را تعیین میکنند. جدول زیر محدودهای را نشان میدهد که پلنهای LLM_FREE، TTS_FREE و STT_FREE فعال میکنند؛ این پلنها بدون نیاز به درخواست، بهصورت خودکار اعمال میشوند. مدلهایی که از مسیرهای دیگری فعال شدهاند، در این جدول گنجانده نشدهاند.
| شناسه مدل | فراخوانیهای مجاز | پلن مبنا |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm و cova-1 در این جدول طرح وجود ندارند. cip-5.5-im-chat، cip-5.5-mm-h، cosa-tts، ivy-4-embedding، ivy-4-embedding-mm و ivy-4-mm در این جدول، شناسههای مدلی هستند که در توضیحات محصولات بالا گنجانده نشدهاند. مسیر مربوط به کلید فراخوانی در سند فراخوانی API آمده است.
