Developer guide
Мадэль
Кароткі агляд мадэляў
Мадэлі CLEVI падзяляюцца на тры лінейкі прадуктаў: CIP, які адказвае за ўніверсальны інтэлект і аўтаматызацыю працоўных працэсаў; Cosa, які адказвае за сінтэз і распазнаванне маўлення; і Cova, які адказвае за выманне інфармацыі з дакументаў і малюнкаў. Кожны прадукт можна выкарыстоўваць самастойна або аб’ядноўваць у сэрвісы, якія ахопліваюць распазнаванне дакументаў, аналіз, выкананне задач і галасавыя інструкцыі.
| Прадукт | Ідэнтыфікатар мадэлі | Асноўныя характарыстыкі | Асноўная роля |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B, наладжвальная | Аўтаматызацыя лакальных працоўных працэсаў і перыферыйныя серверы |
| CIP-5.5-IM | cip-5.5-im | 360B · уваход 256K · выхад 64K · мультымадальная | Універсальная апрацоўка працоўных задач. Прыярытэт — хуткасць адказу і прапускная здольнасць |
| CIP-5.5-MM | cip-5.5-mm | 800B · уваход 512K · выхад 64K · мультымадальная | Аналіз доўгага кантэксту і рашэнне складаных задач |
| Cosa-A | cosa-a | Сінтэз · кланаванне · дызайн · струменевае прайграванне маўлення | Генерацыя маўлення з дэталёвым кіраваннем сінтэзам |
| Cosa-B | cosa-b | Сінтэз · кланаванне · дызайн · струменевае прайграванне маўлення | Выбар голасу і стварэнне персаналізаванага маўлення |
| Cosa ASR | cosa-asr | Распазнаванне маўлення | Пераўтварэнне галасавога ўводу ў тэкст |
| Cova | cova-1 | Спецыялізаваная OCR для зроку на базе LLM | Выманне тэксту, макета і табліц, а таксама простае апісанне малюнкаў |
CIP
CIP адказвае за ўніверсальны інтэлект і аўтаматызацыю працоўных працэсаў. Ён уключае cip-5.5-im і cip-5.5-mm, якія выклікаюцца праз шлюз, а таксама cip-5.5-sm, якая разгортваецца на перыферыйных серверах і ў лакальнай інфраструктуры.
cip-5.5-im і cip-5.5-mm
| Параметр | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Памер | 360B | 800B |
| Ліміт уводу | 256K | 512K |
| Максімальны выхад | 64K | 64K |
| Фарматы ўводу | Тэкст і візуальныя матэрыялы (дакументы, выявы экрана, табліцы і дыяграмы) | Тэкст і візуальныя матэрыялы (інтэграваны аналіз кода, дакументаў і матэрыялаў з экрана) |
| Напрамак выкарыстання | Апрацоўвае паўсядзённыя інтэлектуальныя працоўныя і задачы распрацоўкі з акцэнтам на хуткасць адказу, эканамічную эфектыўнасць і прапускную здольнасць. | Апрацоўвае складаныя працоўныя задачы, якія патрабуюць аб’яднання і аналізу некалькіх матэрыялаў і ўмоў, а таксама пераўтварэння вынікаў аналізу ў рэальныя дзеянні. |
| Прызначэнне доўгага ўводу | Адначасовы аналіз некалькіх дакументаў, файлаў кода і гісторыі дыялогаў. | Адначасовая праца з вялікім аб’ёмам даведачных матэрыялаў і гісторыяй задач, а таксама выкананне агентных задач, у якіх даследаванне, выкананне і праверка адбываюцца ў некалькі этапаў. |
cip-5.5-im падыходзіць для задач з выразна вызначанымі мэтамі і аб’ёмам работ. Тыповыя прыклады — здабыванне неабходнай інфармацыі з прадстаўленых матэрыялаў, падрыхтоўка вынікаў у зададзеным фармаце і ўнясенне змяненняў у код у адпаведнасці з патрабаваннямі. Максімальны вывад у 64K токенаў выкарыстоўваецца для падрыхтоўкі падрабязных справаздач або вынікаў, якія складаюцца з некалькіх частак.
- Дапамога ў распрацоўцы: напісанне функцый і магчымасцей, выпраўленне памылак з выразна вызначанай вобласцю і рэалізацыя ў адпаведнасці з існуючымі шаблонамі.
- Стварэнне тэстаў: падрыхтоўка чарнавікоў тэстаў і праверачных прыкладаў на аснове патрабаванняў і рэалізацыі.
- Апрацоўка дакументаў: падрыхтоўка рэзюмэ і чарнавікоў, класіфікацыя, здабыванне пунктаў і пераўтварэнне фарматаў.
- Мультымадальны аналіз: аналіз відарысаў экранаў, а таксама табліц і дыяграм у дакументах разам з адпаведнымі тлумачэннямі.
- Інтэрактыўная падтрымка працоўных задач: адказы на пытанні на аснове рабочых матэрыялаў і падрыхтоўка неабходных вынікаў.
- Масавая апрацоўка: падрыхтоўка індывідуальных рэзюмэ для вялікай колькасці дакументаў, класіфікацыя запытаў і пераўтварэнне даных.
- Субагент: выкананне дакладна акрэсленых падзадач, такіх як даследаванне кода, праверка пэўных файлаў і ўпарадкаванне матэрыялаў.
Напрыклад, гэта выкарыстоўваецца для атрымання функцыянальных патрабаванняў і звязанага кода з падрыхтоўкай варыянту змяненняў, тэстаў і апісання змяненняў, а таксама для класіфікацыі дакументаў, атрыманых ад заяўнікаў, і стварэння рэзюмэ для адказных супрацоўнікаў.
cip-5.5-mm падыходзіць для задач, у якіх неабходна выяўляць сувязі паміж інфармацыяй і захоўваць узгодненасць усёй працы. У распрацоўцы ён правярае сувязі паміж патрабаваннямі, праектаваннем, рэалізацыяй і тэставаннем, а пры аналізе дакументаў абагульняе сцвярджэнні, доказы, адрозненні і супярэчнасці ў некалькіх матэрыялах.
- Рэалізацыя складаных функцый: адначасовае змяненне кода, тэстаў і дакументацыі з улікам кантрактаў і паводзін некалькіх модуляў.
- Маштабны аналіз кода: праверка сувязяў выклікаў, патокаў даных і дыяпазону ўплыву змяненняў.
- Аналіз прычын збояў: супастаўленне журналаў, налад, кода і вынікаў выканання, а таксама структураванне гіпотэз пра прычыны і працэдур іх праверкі.
- Падтрымка праектавання і прыняцця рашэнняў: структураванне патрабаванняў і абмежаванняў, а таксама аналіз уплыву варыянтаў рэалізацыі.
- Сінтэзны аналіз некалькіх дакументаў: абагульненне падабенстваў, адрозненняў і супярэчнасцяў у справаздачах і тэхнічных дакументах на аснове доказаў.
- Інтэграваная мультымадальная праверка: сумесная інтэрпрэтацыя тэксту і візуальных матэрыялаў для аналізу праблем і патрабаванняў.
- Шматэтапны агент: выкарыстоўваецца для задач, якія ўключаюць даследаванне, планаванне, выкананне дзеянняў з дапамогай інструментаў і праверку вынікаў.
- Падрыхтоўка спецыялізаваных дакументаў: напісанне тэхнічных справаздач, праектных прапаноў і падрабязных аглядных дакументаў з улікам складаных умоў і доказаў.
Напрыклад, гэта выкарыстоўваецца для сумеснага аналізу адпаведных кодаў памылак і журналаў з некалькіх сэрвісаў або для выканання задач, якія ахопліваюць увесь працэс — ад аналізу патрабаванняў да складаных функцый да рэалізацыі і праверкі вынікаў.
cip-5.5-sm
cip-5.5-sm выконвае лакальныя высновы і аўтаматызацыю працоўных працэсаў на перыферыйных серверах і ў лакальных асяроддзях. Паколькі памер мадэлі можна наладжваць у дыяпазоне ад 24B да 40B, канфігурацыю можна выбіраць з улікам вылічальных рэсурсаў абсталявання для разгортвання і патрабаванняў да прадукцыйнасці на месцы. Апрацоўка выконваецца бліжэй да крыніцы даных, таму рашэнне выкарыстоўваецца для інтэграцыі з сістэмамі на месцы і працы з унутранымі данымі. Калі неабходныя мадэлі і інструменты наладзіць лакальна, сістэму можна эксплуатаваць нават у асяроддзі з абмежаваным знешнім падключэннем.
Гэтая роля заключаецца ў інтэрпрэтацыі інфармацыі, якая ўзнікае на месцы, і пераўтварэнні яе ў працэдуры апрацоўкі. Сістэма класіфікуе журналы і запыты, здабывае неабходную інфармацыю з даных, а таксама выконвае паўторныя задачы з дапамогай падключаных унутраных інструментаў і скрыптоў.
- Апрацоўка падзей на месцы: класіфікуе журналы абсталявання і інфармацыю пра стан, а таксама адбірае падзеі, якія патрабуюць праверкі.
- Папярэдняя апрацоўка даных: здабывае ключавыя элементы з працоўных запісаў і выконвае іх класіфікацыю, пазначэнне і нармалізацыю.
- Маршрутызацыя запытаў: перадае атрыманыя запыты ў адказную сістэму або працэдуру апрацоўкі.
- Лакальны працоўны агент: выконвае паўторныя задачы шляхам атрымання даных з унутраных сістэм і запуску скрыптоў.
- Падтрымка працы ў лакальнай інфраструктуры: адказвае на пытанні на аснове ўнутраных матэрыялаў і структуруе змест працоўных задач.
- Падтрымка наступнага аналізу: адбірае матэрыялы, якія патрабуюць дадатковага разгляду, і абагульняе іх асноўны змест.
Напрыклад, гэта выкарыстоўваецца ў працэсе, які ўключае класіфікацыю аперацыйных журналаў на серверы прадпрыемства, пошук адпаведнай гісторыі і падрыхтоўку рэзюмэ інцыдэнту для адказнай асобы.
Cosa
Cosa — гэта набор галасавых прадуктаў, які пераўтварае тэкст у маўленне, распазнае ўведзенае маўленне як тэкст і дазваляе зарэгістраваць патрэбны голас для паўторнага выкарыстання. Ён выкарыстоўваецца для інструкцый па сэрвісах, стварэння кантэнту, падтрымкі даступнасці і галасавога інтэрфейсу дыялогавых агентаў.
Генерацыю маўлення забяспечваюць cosa-a і cosa-b, а распазнаванне маўлення — cosa-asr. cosa-a і cosa-b — асобныя мадэлі, кожная з якіх прапануе ўласны спіс галасоў і налады сінтэзу; іх можна выбіраць у адным і тым жа сэрвісным інтэрфейсе. Функцыі, агульныя для абедзвюх мадэляў, наступныя:
- Сінтэз маўлення з тэксту: сінтэзуе ўведзеныя сказы абраным голасам.
- Кланаванне голасу: рэгіструе голас на аснове эталоннага запісу, на выкарыстанне якога ёсць дазвол, і сінтэзуе новыя сказы.
- Дызайн голасу: стварае і рэгіструе голас на аснове апісання яго жаданых характарыстык.
- Паўторнае выкарыстанне голасу: выкарыстоўвае зарэгістраваны голас для наступнага сінтэзу.
- Налады сінтэзу: рэгулюе хуткасць маўлення, мову і іншыя параметры.
- Струменевая перадача: сінтэзуе тэкст па фразах па меры яго паступлення і паслядоўна перадае аўдыя.
- Кіраванне прайграваннем: падтрымлівае прыпыненне, аднаўленне, спыненне і ўвод дадатковых сказаў.
Паступовы ўвод тэксту дазваляе пачаць прайграванне голасу да таго, як будзе завершаны ўвесь адказ. Пакуль CIP фарміруе адказ, можна наладзіць сэрвіс, у якім Cosa чытае падрыхтаваныя фразы па меры іх гатоўнасці.
cosa-a
cosa-a падтрымлівае сінтэз маўлення з тэксту, кланаванне голасу, дызайн голасу і струменевы вывад. Акрамя базавых функцый выбару голасу, мовы і хуткасці маўлення, ён прапануе дадатковыя элементы кіравання, у тым ліку налады колькасці этапаў сінтэзу, сілы кіравання і даўжыні генерацыі. Гэта выкарыстоўваецца для карэкціроўкі налад і праверкі вынікаў у працэсе стварэння голасу або для прымянення некалькіх набораў налад да аднаго і таго ж сцэнарыя і выбару найлепшага выніку.
- Сінтэзуе інструкцыі і апавяшчэнні для праграм, кіёскаў і рабочых сістэм.
- Стварае аўдыя для навучальных матэрыялаў і кіраўніцтваў карыстальніка.
- Стварае наратыў для відэа- і аўдыякантэнту.
- Стварае кантэнт, які паўтараецца, з выкарыстаннем зарэгістраванага голасу.
- Выкарыстоўвае для струменевага галасавога вываду інтэрактыўных агентаў.
- Выкарыстоўвае для стварэння голасу з карэкціроўкай дэталёвых налад сінтэзу.
cosa-b
cosa-b падтрымлівае выбар прадусталяванага голасу, дызайн голасу на аснове апісання, кланаванне на аснове эталоннага голасу і струменевы вывад. Можна выбраць голас з уласнага спісу або зарэгістраваць новы голас для выкарыстання ў сэрвісе.
Для кланавання голасу выкарыстоўваюцца эталонны запіс і адпаведны яму тэкст. Таксама падтрымліваецца працэс стварэння эталоннага тэксту з дапамогай распазнавання маўлення падчас рэгістрацыі, а зарэгістраваны голас можна паўторна выкарыстоўваць для наступнага сінтэзу.
- Стварае галасавую персону сэрвісу і персанажа.
- Стварае індывідуальны голас на аснове апісання або эталоннага запісу.
- Сінтэзуе брэндавыя інструкцыі, рэплікі персанажаў і наратыў для кантэнту.
- Выкарыстоўвае для галасавых адказаў інтэрактыўных агентаў.
- Сінтэзуе абноўленыя паведамленні і сцэнарыі інструкцый адным і тым жа голасам.
Калі выбіраеце паміж cosa-a і cosa-b, арыентуйцеся на жаданы голас, фактычны вынік сінтэзу і неабходныя элементы кіравання.
| Элемент | cosa-a | cosa-b |
|---|---|---|
| Налады сінтэзу | Акрамя голасу, мовы і хуткасці маўлення, налады колькасці этапаў сінтэзу, сілы guidance і даўжыні генерацыі | Агульныя налады, такія як хуткасць маўлення і мова |
| Уваходныя даныя для кланавання | Эталонны запіс, на выкарыстанне якога ёсць дазвол | Эталонны запіс і адпаведны тэкст. Падчас рэгістрацыі эталонны тэкст можна згенераваць з дапамогай распазнавання маўлення |
| Роля | Генерацыя голасу з выкарыстаннем дэталёвага кіравання сінтэзам | Выбар голасу і генерацыя персаналізаванага голасу |
cosa-asr
cosa-asr пераўтварае ўводны аўдыязапіс у тэкст. Ён дакументуе запісы або пераўтварае запыты, атрыманыя ў выглядзе маўлення, ва ўваходныя даныя, якія могуць апрацоўвацца наступнымі рабочымі сістэмамі.
- Транскрыбуе галасавыя нататкі і запісы.
- Пераўтварае пытанні і рабочыя запыты на аснове голасу ва ўваходныя даныя.
- Генеруе эталонны тэкст для кланавання голасу.
- Выкарыстоўваецца для апрацоўкі пасля транскрыпцыі, уключаючы рэзюмаванне, класіфікацыю і пошук.
Перадаючы вынік транскрыпцыі ў CIP, можна перайсці да рэзюмавання зместу, класіфікацыі запытаў і падрыхтоўкі рабочых чарнавікоў. Калі сінтэзаваць вынікі апрацоўкі з дапамогай cosa-a або cosa-b, атрымаецца рабочы сэрвіс з галасавым уводам і вывадам.
Cova
cova-1 — гэта спецыялізаваная LLM-мадэль для візуальнага OCR. Яна распазнае тэкст у дакументах і выявах, здабывае структуру макета і табліц, а таксама дае кароткае апісанне візуальных элементаў.
Пераўтварае дакументы, прызначаныя для прагляду людзьмі, у фармат, зручны для выкарыстання агентамі і рабочымі сістэмамі. Асноўны тэкст і табліцы здабываюцца ў структураваным выглядзе, а выявы ў дакуменце перадаюцца ў выглядзе кароткіх апісанняў, дзякуючы чаму наступны агент можа адначасова зразумець змест дакумента і яго візуальны кантэкст. Калі спачатку аналізаваць матэрыялы па здабытым тэксце і апісаннях, а затым дадаткова правяраць толькі арыгіналы, якія патрабуюць дэталёвага пацверджання, можна скараціць колькасць паўторных уводаў арыгінальных выяў і зэканоміць кантэкстныя токены.
| Функцыя | Апісанне |
|---|---|
| Распазнаванне тэксту | Выманне тэксту з адсканаваных або сфатаграфаваных дакументаў. |
| Інтэрпрэтацыя макета | Раздзяленне змесціва на блокі з улікам размяшчэння ў дакуменце. |
| Прадастаўленне інфармацыі аб размяшчэнні | Прадастаўленне размяшчэння распазнаных блокаў для сувязі вынікаў вымання з арыгінальным тэкстам. |
| Выманне структуры табліц | Структураванне змесціва табліц для пошуку і апрацоўкі даных. |
| Кароткае апісанне выявы | Кароткае апісанне змесціва выявы і візуальных элементаў, якое дае агенту падказкі для інтэрпрэтацыі. |
| Аптымізацыя кантэксту | Перадача інфармацыі з акцэнтам на тэксце, структуры і апісанні выявы скарачае паўторны ўвод арыгінальнай выявы. |
| Выбарачны дэталёвы аналіз | Дапамога агенту ў вызначэнні арыгінальных выяў, якія неабходна дадаткова праверыць. |
| Пераўтварэнне фармату дакумента | Арганізацыя вынікаў распазнавання ў HTML або Markdown. |
- Лічбавізацыя дакументаў: пераўтварэнне папяровых і адсканаваных матэрыялаў у тэкставыя матэрыялы.
- Прыём працоўных дакументаў: выманне змесціва з заявак, пацвярджальных матэрыялаў і справаздач.
- Апрацоўка таблічных даных: выкарыстанне табліц з дакументаў для наступнай апрацоўкі даных.
- Папярэдняя апрацоўка для пошуку ведаў: пераўтварэнне выяў дакументаў і візуальных матэрыялаў у тэкст і структуру, даступныя для пошуку.
- Аўтаматызацыя праверкі дакументаў: перадача вынікаў вымання ў CIP для праверкі пунктаў, стварэння рэзюмэ і параўнання матэрыялаў.
- Аптымізацыя ўводу для агента: упарадкаванне асноўнага тэксту, табліц і апісанняў выяў у доўгіх дакументах для перадачы толькі неабходнай інфармацыі.
Напрыклад, пры выманні асноўнага тэксту і табліц са справаздачы ўбудаваны графік апісваецца як графік, які паказвае квартальную дынаміку продажаў. З дапамогай гэтага апісання агент вызначае наяўнасць і прызначэнне графіка, а калі патрэбныя дакладныя значэнні або тэндэнцыі, дадаткова правярае адпаведную арыгінальную выяву.
Злучэнне прадуктаў
Пасля злучэння прадуктаў можна наладзіць наступны працэс.
- Праца на аснове дакументаў: Cova здабывае асноўны тэкст, табліцы і апісанні выяў, CIP выбарачна правярае неабходныя арыгіналы для аналізу і выканання працоўных задач, а Cosa перадае вынікі ў галасавой форме.
- Праца на аснове голасу: Cosa ASR пераўтварае галасавыя запыты ў тэкст, а cosa-a або cosa-b зачытвае адказы, апрацаваныя CIP.
- Аўтаматызацыя на месцы: cip-5.5-sm класіфікуе даныя з месца працы і выконвае лакальныя працоўныя задачы, а матэрыялы, якія патрабуюць дадатковага комплекснага аналізу, перадаюцца ў cip-5.5-im або cip-5.5-mm.
Дазволеныя выклікі на шлюзе
Планы шлюза вызначаюць дазволеныя выклікі для кожнай мадэлі. У табліцы ніжэй паказаны вобласць, даступная ў рамках планаў LLM_FREE, TTS_FREE і STT_FREE, якія прымяняюцца аўтаматычна без падачы заяўкі. Мадэлі, даступныя праз іншыя маршруты, не ўключаны.
| Ідэнтыфікатар мадэлі | Дазволеныя выклікі | План-падстава |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm і cova-1 адсутнічаюць у гэтай табліцы плана. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm і ivy-4-mm у гэтай табліцы — гэта ідэнтыфікатары мадэляў, якія не ўключаны ў апісанне прадуктаў вышэй. Інфармацыя пра тое, якому шляху адпавядае ключ выкліку, змешчана ў дакументацыі па выкліку API.
