Developer guide
Model
Modeloversigt
CLEVI-modellerne er opdelt i tre produktserier: CIP, der varetager generel intelligens og arbejdsautomatisering, Cosa, der varetager talegenerering og talegenkendelse, og Cova, der varetager informationsudtræk fra dokumenter og billeder. Hvert produkt kan bruges selvstændigt eller forbindes til tjenester, der strækker sig fra dokumentgenkendelse og analyse til opgaveudførelse og stemmevejledning.
| Produkt | Model-ID | Vigtigste specifikationer | Primær rolle |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B, justerbar | Lokale arbejdsautomatisering på edge-servere |
| CIP-5.5-IM | cip-5.5-im | 360B · input 256K · output 64K · multimodal | Generel opgavebehandling. Prioriterer svarhastighed og gennemløb |
| CIP-5.5-MM | cip-5.5-mm | 800B · input 512K · output 64K · multimodal | Analyse af lange kontekster og løsning af komplekse problemer |
| Cosa-A | cosa-a | Talesyntese · stemmekloning · design · streaming | Talegenerering med detaljeret syntesestyring |
| Cosa-B | cosa-b | Talesyntese · stemmekloning · design · streaming | Valg af stemme og generering af tilpasset tale |
| Cosa ASR | cosa-asr | Talegenkendelse | Konvertering af taleinput til tekst |
| Cova | cova-1 | LLM-baseret vision-OCR til specifikke formål | Udtræk af tekst, layout og tabeller samt enkel billedbeskrivelse |
CIP
CIP varetager generel intelligens og arbejdsautomatisering. Den består af cip-5.5-im og cip-5.5-mm, der kaldes via en gateway, samt cip-5.5-sm, der implementeres på edge-servere og lokalt.
cip-5.5-im og cip-5.5-mm
| Element | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Størrelse | 360B | 800B |
| Inputgrænse | 256K | 512K |
| Maksimalt output | 64K | 64K |
| Inputformat | Tekst og visuelt materiale (dokumenter, skærmbilleder, tabeller og diagrammer) | Tekst og visuelt materiale (samlet gennemgang af kode, dokumenter og skærmmateriale) |
| Fokus | Behandler dagligt vidensarbejde og udviklingsopgaver med fokus på svarhastighed, omkostningseffektivitet og gennemløb. | Behandler komplekse opgaver, der kombinerer flere materialer og betingelser og forbinder analyseresultater med faktiske arbejdsopgaver. |
| Anvendelse af lange input | Gennemgår flere dokumenter, kodefiler og samtalehistorikker samlet. | Håndterer omfattende referencemateriale og arbejdshistorik samlet og udfører agentopgaver, hvor research, udførelse og verifikation foregår i flere trin. |
cip-5.5-im er velegnet til opgaver med klart definerede mål og et tydeligt arbejdsomfang. Typiske opgaver er at udtrække de nødvendige oplysninger fra det leverede materiale, udarbejde resultater i det angivne format og ændre kode i overensstemmelse med kravene. Den maksimale outputlængde på 64K bruges til at udarbejde detaljerede rapporter eller resultater, der består af flere dele.
- Udviklingsassistance: Skriver funktioner og features, retter velafgrænsede fejl og implementerer i overensstemmelse med eksisterende mønstre.
- Testgenerering: Udarbejder udkast til tests og verifikationscases baseret på krav og implementering.
- Dokumentbehandling: Håndterer opsummering, klassificering, udtræk af punkter, formatkonvertering og udarbejdelse af udkast.
- Multimodal analyse: Gennemgår tabeller og diagrammer i skærmbilleder og dokumenter sammen med relevante forklaringer.
- Interaktiv arbejdsassistance: Besvarer spørgsmål baseret på arbejdsmateriale og udarbejder de nødvendige resultater.
- Massebehandling: Bruges til individuelle opsummeringer af mange dokumenter, klassificering af forespørgsler og datakonvertering.
- Underagent: Håndterer klart afgrænsede underopgaver såsom kodeudforskning, gennemgang af bestemte filer og organisering af materiale.
Det bruges eksempelvis til opgaver som at modtage funktionskrav og relateret kode og udarbejde ændringsforslag, tests og en beskrivelse af ændringerne eller at klassificere modtagne dokumenter og udarbejde opsummeringer til de ansvarlige.
cip-5.5-mm er velegnet til opgaver, der kræver forståelse af relationerne mellem oplysninger og opretholdelse af konsistens i hele opgaven. I udvikling gennemgås sammenhængen mellem krav, design, implementering og tests, mens påstande og belæg samt forskelle og modsigelser på tværs af flere materialer sammenfattes i dokumentanalyse.
- Implementering af komplekse funktioner: Ændrer kode, tests og dokumentation samlet under hensyntagen til kontrakter og adfærd på tværs af flere moduler.
- Storskala-kodeanalyse: Gennemgår kaldrelationer, dataflow og omfanget af ændringers påvirkning.
- Analyse af årsager til driftsforstyrrelser: Sammenholder logfiler, konfiguration, kode og kørselsresultater for at opstille hypoteser om årsager og procedurer til verifikation.
- Understøttelse af design og beslutningstagning: Strukturerer krav og begrænsninger og analyserer konsekvenserne af implementeringsalternativer.
- Synteseanalyse af flere dokumenter: Sammenfatter ligheder, forskelle og modsigelser i rapporter og tekniske dokumenter med fokus på belæg.
- Integreret multimodal gennemgang: Fortolker tekst og visuelt materiale samlet for at analysere problemer og krav.
- Agentopgaver i flere trin: Bruges til opgaver, der omfatter undersøgelse, planlægning, værktøjsudførelse og gennemgang af resultater.
- Udarbejdelse af fagspecifik dokumentation: Udarbejder tekniske rapporter, designforslag og detaljerede gennemgangsdokumenter, der afspejler komplekse betingelser og belæg.
Bruges for eksempel til sammen at gennemgå relevante koder og logge fra fejl, der er opstået i flere tjenester, eller til opgaver, der strækker sig fra kravsanalyse af komplekse funktioner til implementering og gennemgang af valideringsresultater.
cip-5.5-sm
cip-5.5-sm udfører lokal inferens og automatisering af arbejdsopgaver på edge-servere og i on-premises-miljøer. Da modelstørrelsen kan justeres i intervallet 24B~40B, kan konfigurationen vælges efter det implementerede udstyrs beregningsressourcer og de nødvendige ydeevnekrav på stedet. Da behandlingen foregår tæt på det sted, hvor dataene opstår, bruges den til integration med systemer på stedet og udnyttelse af interne data. Hvis de nødvendige modeller og værktøjer konfigureres lokalt, kan den også drives i miljøer med begrænset ekstern forbindelse.
Dens rolle er at fortolke oplysninger, der opstår på stedet, og forbinde dem med behandlingsprocedurer. Den klassificerer logge og anmodninger, udtrækker nødvendige oplysninger fra data og udfører gentagne opgaver med tilknyttede interne værktøjer og scripts.
- Behandling af hændelser på stedet: Klassificerer udstyrslogge og statusoplysninger og udvælger hændelser, der kræver kontrol.
- Forbehandling af data: Udtrækker centrale elementer fra arbejdsregistreringer og klassificerer, tagger og normaliserer dem.
- Routning af anmodninger: Sender modtagne anmodninger videre til det ansvarlige system eller den relevante behandlingsprocedure.
- Lokal arbejdsagent: Udfører gentagne opgaver ved at slå op i interne systemer og køre scripts.
- Understøttelse af arbejdsopgaver on-premises: Besvarer spørgsmål på baggrund af interne materialer og strukturerer arbejdsindhold.
- Understøttelse af opfølgende analyse: Udvælger materialer, der kræver yderligere gennemgang, og sammenfatter det centrale indhold.
Bruges for eksempel i et flow, hvor driftslogge på en virksomhedsserver klassificeres, relateret historik slås op, og der derefter udarbejdes et hændelsesresumé til den ansvarlige.
Cosa
Cosa er en produktserie til tale, der konverterer tekst til tale, genkender indtalt tale som tekst og registrerer og genbruger ønskede stemmer. Den bruges til servicevejledning, indholdsproduktion, tilgængelighedsstøtte og stemmegrænseflader til interaktive agenter.
Talegenerering varetages af cosa-a og cosa-b, mens talegenkendelse varetages af cosa-asr. cosa-a og cosa-b er separate modeller, der hver har deres egen liste over stemmer og synteseindstillinger, og de vælges via den samme tjenestegrænseflade. Funktionerne, som begge modeller tilbyder, er som følger.
- Tekst-til-tale: Syntetiserer den indtastede tekst med den valgte stemme.
- Stemmekloning: Registrerer en stemme baseret på en referenceoptagelse, som du har tilladelse til at bruge, og syntetiserer nye sætninger.
- Stemmedesign: Opretter og registrerer en stemme ud fra en beskrivelse af de ønskede stemmeegenskaber.
- Genbrug af stemmer: Bruger en registreret stemme til efterfølgende syntese.
- Synteseindstillinger: Justerer blandt andet talehastighed og sprog.
- Streaminglevering: Syntetiserer teksten i fraseenheder, efterhånden som den ankommer, og leverer lyden sekventielt.
- Afspilningsstyring: Understøtter pause, genoptagelse, afbrydelse og indtastning af yderligere sætninger.
Med progressiv tekstinput kan taleafspilningen begynde, før hele svaret er færdigt. Mens CIP skriver svaret, kan du konfigurere en tjeneste, hvor Cosa læser de fraseenheder op, der er klar.
cosa-a
cosa-a understøtter tekst-til-tale, stemmekloning, stemmedesign og streamingoutput. Ud over grundlæggende funktioner som valg af stemme, sprog og talehastighed tilbyder den yderligere kontrolmuligheder, herunder indstillinger for antal syntesetrin, styrken af vejledningen og genereringslængden. Den bruges til at justere indstillinger og gennemgå resultater under stemmeproduktionen eller til at anvende flere indstillinger på det samme manuskript og vælge det bedste resultat.
- Syntetiserer vejledninger og meddelelser i apps, kiosker og arbejdssystemer.
- Opretter undervisningsmaterialer og brugervejledninger som lyd.
- Producerer voiceover til video- og lydindhold.
- Producerer gentaget indhold med en registreret stemme.
- Bruges til streaming af taleoutput fra interaktive agenter.
- Bruges til stemmeproduktion, hvor detaljerede synteseindstillinger justeres.
cosa-b
cosa-b understøtter valg af forudindstillede stemmer, beskrivelsesbaseret stemmedesign, kloning baseret på referencestemmer og streamingoutput. Du kan vælge en stemme fra den interne stemmeliste eller registrere en ny stemme til brug i tjenesten.
Stemmekloning bruger en referenceoptagelse og den tilhørende tekst. Den understøtter også et flow, hvor referenceteksten genereres ved hjælp af talegenkendelse under registreringen, og den registrerede stemme kan genbruges til efterfølgende syntese.
- Konfigurerer tjenestens og karakterens stemmepersona.
- Opretter en tilpasset stemme ud fra en beskrivelse eller en referenceoptagelse.
- Syntetiserer brandvejledninger, karakterreplikker og voiceover til indhold.
- Bruges til tale-svar fra interaktive agenter.
- Syntetiserer skiftende vejledningsmeddelelser og manuskripter med den samme stemme.
Når du vælger mellem cosa-a og cosa-b, bør du tage udgangspunkt i den ønskede stemme, det faktiske synteseresultat og de nødvendige kontrolmuligheder.
| Element | cosa-a | cosa-b |
|---|---|---|
| Synteseindstillinger | Ud over stemme, sprog og talehastighed: indstillinger relateret til antallet af syntesetrin, styrken af guidance og genereringslængden | Fælles indstillinger såsom talehastighed og sprog |
| Input til kloning | En referenceoptagelse, som du har tilladelse til at bruge | En referenceoptagelse og den tilhørende tekst. Referenceteksten kan genereres ved hjælp af talegenkendelse under registreringen |
| Rolle | Stemmegenerering med detaljeret kontrol over syntesen | Valg af stemme og generering af en tilpasset stemme |
cosa-asr
cosa-asr konverterer inputtale til tekst. Den dokumenterer optagelser eller konverterer anmodninger, der modtages som tale, til input, som efterfølgende arbejdssystemer kan behandle.
- Transskriberer stemmememoer og optagelser.
- Konverterer stemmebaserede spørgsmål og arbejdsanmodninger til input.
- Genererer referencetekst til stemmekloning.
- Bruges til processer, der fortsætter med opsummering, klassificering og søgning efter transskription.
Når transskriptionsresultatet sendes til CIP, kan processen fortsætte med opsummering af indhold, klassificering af anmodninger og udarbejdelse af arbejdsudkast. Hvis behandlingsresultatet syntetiseres med cosa-a eller cosa-b, bliver det en arbejdsservice med taleinput og -output.
Cova
cova-1 er en LLM-baseret model dedikeret til visuel OCR. Den genkender tekst i dokumenter og billeder, udtrækker layout og tabelstruktur og giver korte beskrivelser af visuelle elementer.
Den konverterer dokumenter, som mennesker ser, til et format, der er lettere for agenter og arbejdssystemer at bruge. Brødtekst og tabeller udtrækkes som struktureret indhold, mens billeder i dokumentet formidles som korte beskrivelser, så efterfølgende agenter kan forstå både dokumentets indhold og den visuelle kontekst. Ved først at forstå materialet ud fra den udtrukne tekst og beskrivelser og derefter kun gennemgå originalerne, der kræver detaljeret kontrol, kan man reducere mængden af gentagne input af originalbilleder og spare konteksttokens.
| Funktion | Beskrivelse |
|---|---|
| Tekstgenkendelse | Udtrækker tekst fra dokumenter, der er scannet eller fotograferet. |
| Layoutfortolkning | Opdeler indholdet i blokke under hensyntagen til dokumentets layout. |
| Angivelse af positionsoplysninger | Angiver placeringen af de genkendte blokke, så udtræksresultaterne kan forbindes med originalteksten. |
| Udtræk af tabelstruktur | Strukturerer tabellens indhold til søgning og databehandling. |
| Kort billedbeskrivelse | Beskriver kort indholdet af billeder og visuelle elementer for at give agenten spor til fortolkning. |
| Konteksteffektivisering | Reducerer gentagen input af originalbilledet ved primært at overføre tekst, struktur og billedbeskrivelse. |
| Selektiv detaljeret analyse | Hjælper agenten med at afgøre, hvilke originalbilleder der skal undersøges yderligere. |
| Konvertering af dokumentformat | Strukturerer genkendelsesresultaterne som HTML eller Markdown. |
- Digitalisering af dokumenter: Konverterer papirdokumenter og scannet materiale til tekstbaserede data.
- Modtagelse af arbejdsdokumenter: Udtrækker indhold fra ansøgningsformularer, bilag og rapporter.
- Behandling af tabeldata: Bruger tabeller i dokumenter til efterfølgende databehandling.
- Forbehandling til videnssøgning: Konverterer dokumentbilleder og visuelt materiale til søgbar tekst og struktur.
- Automatisering af dokumentgennemgang: Overfører udtræksresultater til CIP for at kontrollere punkter, opsummere og sammenligne materialer.
- Optimering af agentinput: Organiserer brødtekst, tabeller og billedbeskrivelser i lange dokumenter, så kun nødvendige oplysninger overføres.
For eksempel udtrækkes brødteksten og tabellerne i en rapport, mens en indsat graf beskrives som en graf, der viser den kvartalsvise omsætningstendens. Agenten bruger denne beskrivelse til at forstå grafens tilstedeværelse og formål og undersøger den pågældende original yderligere, når der er behov for præcise tal eller tendenser.
Forbindelse af produktserier
Ved at forbinde produkterne kan følgende flow konfigureres.
- Dokumentbaseret arbejde: Cova udtrækker brødtekst, tabeller og billedbeskrivelser, CIP vælger og undersøger nødvendige originaler selektivt for at udføre analyse og arbejdsbehandling, og Cosa leverer resultaterne som tale.
- Stemmebaseret arbejde: Cosa ASR konverterer stemmeanmodninger til tekst, og cosa-a eller cosa-b læser svarene, som CIP har behandlet, op.
- Automatisering på stedet: cip-5.5-sm klassificerer data på stedet og udfører lokale opgaver, mens materiale, der kræver yderligere samlet analyse, videresendes til cip-5.5-im eller cip-5.5-mm.
Tilladte kald på gatewayen
Gatewayens planer bestemmer, hvilke kald der er tilladt for hver model. Tabellen nedenfor viser de områder, som planerne LLM_FREE, TTS_FREE og STT_FREE åbner, og disse planer anvendes automatisk uden ansøgning. Modeller, der er åbnet via andre ruter, er ikke inkluderet.
| Model-ID | Tilladte kald | Grundlag for plan |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm og cova-1 findes ikke i denne plantabel. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm og ivy-4-mm i tabellen er model-ID'er, som ikke er inkluderet i produktbeskrivelserne ovenfor. Du kan se, hvilken sti opkaldsnøglen svarer til, i dokumentet om API-kald.
