Developer guide

Мадэль

Кароткі агляд мадэляў

Мадэлі CLEVI падзяляюцца на тры лінейкі прадуктаў: CIP, які адказвае за ўніверсальны інтэлект і аўтаматызацыю працоўных працэсаў; Cosa, які адказвае за сінтэз і распазнаванне маўлення; і Cova, які адказвае за выманне інфармацыі з дакументаў і малюнкаў. Кожны прадукт можна выкарыстоўваць самастойна або аб’ядноўваць у сэрвісы, якія ахопліваюць распазнаванне дакументаў, аналіз, выкананне задач і галасавыя інструкцыі.

ПрадуктІдэнтыфікатар мадэліАсноўныя характарыстыкіАсноўная роля
CIP-5.5-SMcip-5.5-sm24B~40B, наладжвальнаяАўтаматызацыя лакальных працоўных працэсаў і перыферыйныя серверы
CIP-5.5-IMcip-5.5-im360B · уваход 256K · выхад 64K · мультымадальнаяУніверсальная апрацоўка працоўных задач. Прыярытэт — хуткасць адказу і прапускная здольнасць
CIP-5.5-MMcip-5.5-mm800B · уваход 512K · выхад 64K · мультымадальнаяАналіз доўгага кантэксту і рашэнне складаных задач
Cosa-Acosa-aСінтэз · кланаванне · дызайн · струменевае прайграванне маўленняГенерацыя маўлення з дэталёвым кіраваннем сінтэзам
Cosa-Bcosa-bСінтэз · кланаванне · дызайн · струменевае прайграванне маўленняВыбар голасу і стварэнне персаналізаванага маўлення
Cosa ASRcosa-asrРаспазнаванне маўленняПераўтварэнне галасавога ўводу ў тэкст
Covacova-1Спецыялізаваная OCR для зроку на базе LLMВыманне тэксту, макета і табліц, а таксама простае апісанне малюнкаў

CIP

CIP адказвае за ўніверсальны інтэлект і аўтаматызацыю працоўных працэсаў. Ён уключае cip-5.5-im і cip-5.5-mm, якія выклікаюцца праз шлюз, а таксама cip-5.5-sm, якая разгортваецца на перыферыйных серверах і ў лакальнай інфраструктуры.

cip-5.5-im і cip-5.5-mm

Параметрcip-5.5-imcip-5.5-mm
Памер360B800B
Ліміт уводу256K512K
Максімальны выхад64K64K
Фарматы ўводуТэкст і візуальныя матэрыялы (дакументы, выявы экрана, табліцы і дыяграмы)Тэкст і візуальныя матэрыялы (інтэграваны аналіз кода, дакументаў і матэрыялаў з экрана)
Напрамак выкарыстанняАпрацоўвае паўсядзённыя інтэлектуальныя працоўныя і задачы распрацоўкі з акцэнтам на хуткасць адказу, эканамічную эфектыўнасць і прапускную здольнасць.Апрацоўвае складаныя працоўныя задачы, якія патрабуюць аб’яднання і аналізу некалькіх матэрыялаў і ўмоў, а таксама пераўтварэння вынікаў аналізу ў рэальныя дзеянні.
Прызначэнне доўгага ўводуАдначасовы аналіз некалькіх дакументаў, файлаў кода і гісторыі дыялогаў.Адначасовая праца з вялікім аб’ёмам даведачных матэрыялаў і гісторыяй задач, а таксама выкананне агентных задач, у якіх даследаванне, выкананне і праверка адбываюцца ў некалькі этапаў.

cip-5.5-im падыходзіць для задач з выразна вызначанымі мэтамі і аб’ёмам работ. Тыповыя прыклады — здабыванне неабходнай інфармацыі з прадстаўленых матэрыялаў, падрыхтоўка вынікаў у зададзеным фармаце і ўнясенне змяненняў у код у адпаведнасці з патрабаваннямі. Максімальны вывад у 64K токенаў выкарыстоўваецца для падрыхтоўкі падрабязных справаздач або вынікаў, якія складаюцца з некалькіх частак.

  • Дапамога ў распрацоўцы: напісанне функцый і магчымасцей, выпраўленне памылак з выразна вызначанай вобласцю і рэалізацыя ў адпаведнасці з існуючымі шаблонамі.
  • Стварэнне тэстаў: падрыхтоўка чарнавікоў тэстаў і праверачных прыкладаў на аснове патрабаванняў і рэалізацыі.
  • Апрацоўка дакументаў: падрыхтоўка рэзюмэ і чарнавікоў, класіфікацыя, здабыванне пунктаў і пераўтварэнне фарматаў.
  • Мультымадальны аналіз: аналіз відарысаў экранаў, а таксама табліц і дыяграм у дакументах разам з адпаведнымі тлумачэннямі.
  • Інтэрактыўная падтрымка працоўных задач: адказы на пытанні на аснове рабочых матэрыялаў і падрыхтоўка неабходных вынікаў.
  • Масавая апрацоўка: падрыхтоўка індывідуальных рэзюмэ для вялікай колькасці дакументаў, класіфікацыя запытаў і пераўтварэнне даных.
  • Субагент: выкананне дакладна акрэсленых падзадач, такіх як даследаванне кода, праверка пэўных файлаў і ўпарадкаванне матэрыялаў.

Напрыклад, гэта выкарыстоўваецца для атрымання функцыянальных патрабаванняў і звязанага кода з падрыхтоўкай варыянту змяненняў, тэстаў і апісання змяненняў, а таксама для класіфікацыі дакументаў, атрыманых ад заяўнікаў, і стварэння рэзюмэ для адказных супрацоўнікаў.

cip-5.5-mm падыходзіць для задач, у якіх неабходна выяўляць сувязі паміж інфармацыяй і захоўваць узгодненасць усёй працы. У распрацоўцы ён правярае сувязі паміж патрабаваннямі, праектаваннем, рэалізацыяй і тэставаннем, а пры аналізе дакументаў абагульняе сцвярджэнні, доказы, адрозненні і супярэчнасці ў некалькіх матэрыялах.

  • Рэалізацыя складаных функцый: адначасовае змяненне кода, тэстаў і дакументацыі з улікам кантрактаў і паводзін некалькіх модуляў.
  • Маштабны аналіз кода: праверка сувязяў выклікаў, патокаў даных і дыяпазону ўплыву змяненняў.
  • Аналіз прычын збояў: супастаўленне журналаў, налад, кода і вынікаў выканання, а таксама структураванне гіпотэз пра прычыны і працэдур іх праверкі.
  • Падтрымка праектавання і прыняцця рашэнняў: структураванне патрабаванняў і абмежаванняў, а таксама аналіз уплыву варыянтаў рэалізацыі.
  • Сінтэзны аналіз некалькіх дакументаў: абагульненне падабенстваў, адрозненняў і супярэчнасцяў у справаздачах і тэхнічных дакументах на аснове доказаў.
  • Інтэграваная мультымадальная праверка: сумесная інтэрпрэтацыя тэксту і візуальных матэрыялаў для аналізу праблем і патрабаванняў.
  • Шматэтапны агент: выкарыстоўваецца для задач, якія ўключаюць даследаванне, планаванне, выкананне дзеянняў з дапамогай інструментаў і праверку вынікаў.
  • Падрыхтоўка спецыялізаваных дакументаў: напісанне тэхнічных справаздач, праектных прапаноў і падрабязных аглядных дакументаў з улікам складаных умоў і доказаў.

Напрыклад, гэта выкарыстоўваецца для сумеснага аналізу адпаведных кодаў памылак і журналаў з некалькіх сэрвісаў або для выканання задач, якія ахопліваюць увесь працэс — ад аналізу патрабаванняў да складаных функцый да рэалізацыі і праверкі вынікаў.

cip-5.5-sm

cip-5.5-sm выконвае лакальныя высновы і аўтаматызацыю працоўных працэсаў на перыферыйных серверах і ў лакальных асяроддзях. Паколькі памер мадэлі можна наладжваць у дыяпазоне ад 24B да 40B, канфігурацыю можна выбіраць з улікам вылічальных рэсурсаў абсталявання для разгортвання і патрабаванняў да прадукцыйнасці на месцы. Апрацоўка выконваецца бліжэй да крыніцы даных, таму рашэнне выкарыстоўваецца для інтэграцыі з сістэмамі на месцы і працы з унутранымі данымі. Калі неабходныя мадэлі і інструменты наладзіць лакальна, сістэму можна эксплуатаваць нават у асяроддзі з абмежаваным знешнім падключэннем.

Гэтая роля заключаецца ў інтэрпрэтацыі інфармацыі, якая ўзнікае на месцы, і пераўтварэнні яе ў працэдуры апрацоўкі. Сістэма класіфікуе журналы і запыты, здабывае неабходную інфармацыю з даных, а таксама выконвае паўторныя задачы з дапамогай падключаных унутраных інструментаў і скрыптоў.

  • Апрацоўка падзей на месцы: класіфікуе журналы абсталявання і інфармацыю пра стан, а таксама адбірае падзеі, якія патрабуюць праверкі.
  • Папярэдняя апрацоўка даных: здабывае ключавыя элементы з працоўных запісаў і выконвае іх класіфікацыю, пазначэнне і нармалізацыю.
  • Маршрутызацыя запытаў: перадае атрыманыя запыты ў адказную сістэму або працэдуру апрацоўкі.
  • Лакальны працоўны агент: выконвае паўторныя задачы шляхам атрымання даных з унутраных сістэм і запуску скрыптоў.
  • Падтрымка працы ў лакальнай інфраструктуры: адказвае на пытанні на аснове ўнутраных матэрыялаў і структуруе змест працоўных задач.
  • Падтрымка наступнага аналізу: адбірае матэрыялы, якія патрабуюць дадатковага разгляду, і абагульняе іх асноўны змест.

Напрыклад, гэта выкарыстоўваецца ў працэсе, які ўключае класіфікацыю аперацыйных журналаў на серверы прадпрыемства, пошук адпаведнай гісторыі і падрыхтоўку рэзюмэ інцыдэнту для адказнай асобы.

Cosa

Cosa — гэта набор галасавых прадуктаў, які пераўтварае тэкст у маўленне, распазнае ўведзенае маўленне як тэкст і дазваляе зарэгістраваць патрэбны голас для паўторнага выкарыстання. Ён выкарыстоўваецца для інструкцый па сэрвісах, стварэння кантэнту, падтрымкі даступнасці і галасавога інтэрфейсу дыялогавых агентаў.

Генерацыю маўлення забяспечваюць cosa-a і cosa-b, а распазнаванне маўлення — cosa-asr. cosa-a і cosa-b — асобныя мадэлі, кожная з якіх прапануе ўласны спіс галасоў і налады сінтэзу; іх можна выбіраць у адным і тым жа сэрвісным інтэрфейсе. Функцыі, агульныя для абедзвюх мадэляў, наступныя:

  • Сінтэз маўлення з тэксту: сінтэзуе ўведзеныя сказы абраным голасам.
  • Кланаванне голасу: рэгіструе голас на аснове эталоннага запісу, на выкарыстанне якога ёсць дазвол, і сінтэзуе новыя сказы.
  • Дызайн голасу: стварае і рэгіструе голас на аснове апісання яго жаданых характарыстык.
  • Паўторнае выкарыстанне голасу: выкарыстоўвае зарэгістраваны голас для наступнага сінтэзу.
  • Налады сінтэзу: рэгулюе хуткасць маўлення, мову і іншыя параметры.
  • Струменевая перадача: сінтэзуе тэкст па фразах па меры яго паступлення і паслядоўна перадае аўдыя.
  • Кіраванне прайграваннем: падтрымлівае прыпыненне, аднаўленне, спыненне і ўвод дадатковых сказаў.

Паступовы ўвод тэксту дазваляе пачаць прайграванне голасу да таго, як будзе завершаны ўвесь адказ. Пакуль CIP фарміруе адказ, можна наладзіць сэрвіс, у якім Cosa чытае падрыхтаваныя фразы па меры іх гатоўнасці.

cosa-a

cosa-a падтрымлівае сінтэз маўлення з тэксту, кланаванне голасу, дызайн голасу і струменевы вывад. Акрамя базавых функцый выбару голасу, мовы і хуткасці маўлення, ён прапануе дадатковыя элементы кіравання, у тым ліку налады колькасці этапаў сінтэзу, сілы кіравання і даўжыні генерацыі. Гэта выкарыстоўваецца для карэкціроўкі налад і праверкі вынікаў у працэсе стварэння голасу або для прымянення некалькіх набораў налад да аднаго і таго ж сцэнарыя і выбару найлепшага выніку.

  • Сінтэзуе інструкцыі і апавяшчэнні для праграм, кіёскаў і рабочых сістэм.
  • Стварае аўдыя для навучальных матэрыялаў і кіраўніцтваў карыстальніка.
  • Стварае наратыў для відэа- і аўдыякантэнту.
  • Стварае кантэнт, які паўтараецца, з выкарыстаннем зарэгістраванага голасу.
  • Выкарыстоўвае для струменевага галасавога вываду інтэрактыўных агентаў.
  • Выкарыстоўвае для стварэння голасу з карэкціроўкай дэталёвых налад сінтэзу.

cosa-b

cosa-b падтрымлівае выбар прадусталяванага голасу, дызайн голасу на аснове апісання, кланаванне на аснове эталоннага голасу і струменевы вывад. Можна выбраць голас з уласнага спісу або зарэгістраваць новы голас для выкарыстання ў сэрвісе.

Для кланавання голасу выкарыстоўваюцца эталонны запіс і адпаведны яму тэкст. Таксама падтрымліваецца працэс стварэння эталоннага тэксту з дапамогай распазнавання маўлення падчас рэгістрацыі, а зарэгістраваны голас можна паўторна выкарыстоўваць для наступнага сінтэзу.

  • Стварае галасавую персону сэрвісу і персанажа.
  • Стварае індывідуальны голас на аснове апісання або эталоннага запісу.
  • Сінтэзуе брэндавыя інструкцыі, рэплікі персанажаў і наратыў для кантэнту.
  • Выкарыстоўвае для галасавых адказаў інтэрактыўных агентаў.
  • Сінтэзуе абноўленыя паведамленні і сцэнарыі інструкцый адным і тым жа голасам.

Калі выбіраеце паміж cosa-a і cosa-b, арыентуйцеся на жаданы голас, фактычны вынік сінтэзу і неабходныя элементы кіравання.

Элементcosa-acosa-b
Налады сінтэзуАкрамя голасу, мовы і хуткасці маўлення, налады колькасці этапаў сінтэзу, сілы guidance і даўжыні генерацыіАгульныя налады, такія як хуткасць маўлення і мова
Уваходныя даныя для кланаванняЭталонны запіс, на выкарыстанне якога ёсць дазволЭталонны запіс і адпаведны тэкст. Падчас рэгістрацыі эталонны тэкст можна згенераваць з дапамогай распазнавання маўлення
РоляГенерацыя голасу з выкарыстаннем дэталёвага кіравання сінтэзамВыбар голасу і генерацыя персаналізаванага голасу

cosa-asr

cosa-asr пераўтварае ўводны аўдыязапіс у тэкст. Ён дакументуе запісы або пераўтварае запыты, атрыманыя ў выглядзе маўлення, ва ўваходныя даныя, якія могуць апрацоўвацца наступнымі рабочымі сістэмамі.

  • Транскрыбуе галасавыя нататкі і запісы.
  • Пераўтварае пытанні і рабочыя запыты на аснове голасу ва ўваходныя даныя.
  • Генеруе эталонны тэкст для кланавання голасу.
  • Выкарыстоўваецца для апрацоўкі пасля транскрыпцыі, уключаючы рэзюмаванне, класіфікацыю і пошук.

Перадаючы вынік транскрыпцыі ў CIP, можна перайсці да рэзюмавання зместу, класіфікацыі запытаў і падрыхтоўкі рабочых чарнавікоў. Калі сінтэзаваць вынікі апрацоўкі з дапамогай cosa-a або cosa-b, атрымаецца рабочы сэрвіс з галасавым уводам і вывадам.

Cova

cova-1 — гэта спецыялізаваная LLM-мадэль для візуальнага OCR. Яна распазнае тэкст у дакументах і выявах, здабывае структуру макета і табліц, а таксама дае кароткае апісанне візуальных элементаў.

Пераўтварае дакументы, прызначаныя для прагляду людзьмі, у фармат, зручны для выкарыстання агентамі і рабочымі сістэмамі. Асноўны тэкст і табліцы здабываюцца ў структураваным выглядзе, а выявы ў дакуменце перадаюцца ў выглядзе кароткіх апісанняў, дзякуючы чаму наступны агент можа адначасова зразумець змест дакумента і яго візуальны кантэкст. Калі спачатку аналізаваць матэрыялы па здабытым тэксце і апісаннях, а затым дадаткова правяраць толькі арыгіналы, якія патрабуюць дэталёвага пацверджання, можна скараціць колькасць паўторных уводаў арыгінальных выяў і зэканоміць кантэкстныя токены.

ФункцыяАпісанне
Распазнаванне тэкстуВыманне тэксту з адсканаваных або сфатаграфаваных дакументаў.
Інтэрпрэтацыя макетаРаздзяленне змесціва на блокі з улікам размяшчэння ў дакуменце.
Прадастаўленне інфармацыі аб размяшчэнніПрадастаўленне размяшчэння распазнаных блокаў для сувязі вынікаў вымання з арыгінальным тэкстам.
Выманне структуры табліцСтруктураванне змесціва табліц для пошуку і апрацоўкі даных.
Кароткае апісанне выявыКароткае апісанне змесціва выявы і візуальных элементаў, якое дае агенту падказкі для інтэрпрэтацыі.
Аптымізацыя кантэкстуПерадача інфармацыі з акцэнтам на тэксце, структуры і апісанні выявы скарачае паўторны ўвод арыгінальнай выявы.
Выбарачны дэталёвы аналізДапамога агенту ў вызначэнні арыгінальных выяў, якія неабходна дадаткова праверыць.
Пераўтварэнне фармату дакументаАрганізацыя вынікаў распазнавання ў HTML або Markdown.
  • Лічбавізацыя дакументаў: пераўтварэнне папяровых і адсканаваных матэрыялаў у тэкставыя матэрыялы.
  • Прыём працоўных дакументаў: выманне змесціва з заявак, пацвярджальных матэрыялаў і справаздач.
  • Апрацоўка таблічных даных: выкарыстанне табліц з дакументаў для наступнай апрацоўкі даных.
  • Папярэдняя апрацоўка для пошуку ведаў: пераўтварэнне выяў дакументаў і візуальных матэрыялаў у тэкст і структуру, даступныя для пошуку.
  • Аўтаматызацыя праверкі дакументаў: перадача вынікаў вымання ў CIP для праверкі пунктаў, стварэння рэзюмэ і параўнання матэрыялаў.
  • Аптымізацыя ўводу для агента: упарадкаванне асноўнага тэксту, табліц і апісанняў выяў у доўгіх дакументах для перадачы толькі неабходнай інфармацыі.

Напрыклад, пры выманні асноўнага тэксту і табліц са справаздачы ўбудаваны графік апісваецца як графік, які паказвае квартальную дынаміку продажаў. З дапамогай гэтага апісання агент вызначае наяўнасць і прызначэнне графіка, а калі патрэбныя дакладныя значэнні або тэндэнцыі, дадаткова правярае адпаведную арыгінальную выяву.

Злучэнне прадуктаў

Пасля злучэння прадуктаў можна наладзіць наступны працэс.

  • Праца на аснове дакументаў: Cova здабывае асноўны тэкст, табліцы і апісанні выяў, CIP выбарачна правярае неабходныя арыгіналы для аналізу і выканання працоўных задач, а Cosa перадае вынікі ў галасавой форме.
  • Праца на аснове голасу: Cosa ASR пераўтварае галасавыя запыты ў тэкст, а cosa-a або cosa-b зачытвае адказы, апрацаваныя CIP.
  • Аўтаматызацыя на месцы: cip-5.5-sm класіфікуе даныя з месца працы і выконвае лакальныя працоўныя задачы, а матэрыялы, якія патрабуюць дадатковага комплекснага аналізу, перадаюцца ў cip-5.5-im або cip-5.5-mm.

Дазволеныя выклікі на шлюзе

Планы шлюза вызначаюць дазволеныя выклікі для кожнай мадэлі. У табліцы ніжэй паказаны вобласць, даступная ў рамках планаў LLM_FREE, TTS_FREE і STT_FREE, якія прымяняюцца аўтаматычна без падачы заяўкі. Мадэлі, даступныя праз іншыя маршруты, не ўключаны.

Ідэнтыфікатар мадэліДазволеныя выклікіПлан-падстава
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm і cova-1 адсутнічаюць у гэтай табліцы плана. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm і ivy-4-mm у гэтай табліцы — гэта ідэнтыфікатары мадэляў, якія не ўключаны ў апісанне прадуктаў вышэй. Інфармацыя пра тое, якому шляху адпавядае ключ выкліку, змешчана ў дакументацыі па выкліку API.

CLEVI

Мова і рэгіён

Пазначаны мовы, перакладзеныя машынай. Даступнасць адпавядае апублікаванаму набору сайта.

136 моў

Рэкамендуецца

1

Усходняя Азія

7

Паўднёва-Усходняя Азія

11

Паўднёвая Азія

18

Цэнтральная Азія

5

Блізкі Усход і Каўказ

10

Заходняя Еўропа і Паўднёвая Еўропа

16

Вялікабрытанія і Ірландыя

4

Паўночная Еўропа

10

Цэнтральная Еўропа і Балканы

14

Усходняя Еўропа

5

Усходняя Афрыка

8

Заходняя Афрыка і Сярэдняя Афрыка

9

Паўднёвая Афрыка

8

Паўночная і Паўднёвая Амерыкі

5

Акіянія

5