Developer guide

Modell

Modellübersicht

Die CLEVI-Modelle sind in drei Produktfamilien unterteilt: CIP für allgemeine Intelligenz und Arbeitsautomatisierung, Cosa für Sprachgenerierung und -erkennung sowie Cova für die Informationsextraktion aus Dokumenten und Bildern. Jedes Produkt kann eigenständig eingesetzt oder zu einem Service verbunden werden, der von der Dokumentenerkennung und Analyse über die Aufgabenausführung bis zur Sprachführung reicht.

ProduktModell-IDWichtige SpezifikationenHauptaufgabe
CIP-5.5-SMcip-5.5-sm24B–40B konfigurierbarLokale Arbeitsautomatisierung und Edge-Server
CIP-5.5-IMcip-5.5-im360B · Eingabe 256K · Ausgabe 64K · multimodalAllgemeine Arbeitsverarbeitung. Priorisiert Antwortgeschwindigkeit und Durchsatz
CIP-5.5-MMcip-5.5-mm800B · Eingabe 512K · Ausgabe 64K · multimodalAnalyse langer Kontexte und Lösung komplexer Probleme
Cosa-Acosa-aSprachsynthese · Sprachklonen · Sprachdesign · StreamingSprachgenerierung mit detaillierter Synthesesteuerung
Cosa-Bcosa-bSprachsynthese · Sprachklonen · Sprachdesign · StreamingAuswahl von Stimmen und Generierung individueller Stimmen
Cosa ASRcosa-asrSpracherkennungUmwandlung von Spracheingaben in Text
Covacova-1LLM-basierte Vision-OCRExtraktion von Text, Layouts und Tabellen sowie einfache Bildbeschreibung

CIP

CIP ist für allgemeine Intelligenz und Arbeitsautomatisierung zuständig. Es besteht aus cip-5.5-im und cip-5.5-mm, die über ein Gateway aufgerufen werden, sowie cip-5.5-sm, das auf Edge-Servern und On-Premises bereitgestellt wird.

cip-5.5-im und cip-5.5-mm

Elementcip-5.5-imcip-5.5-mm
Größe360B800B
Eingabelimit256K512K
Maximale Ausgabe64K64K
EingabeformateText und visuelle Materialien (Dokumente, Bildschirmbilder, Tabellen und Diagramme)Text und visuelle Materialien (integrierte Prüfung von Code, Dokumenten und Bildschirmmaterialien)
AusrichtungVerarbeitet alltägliche Wissens- und Entwicklungsaufgaben mit Schwerpunkt auf Antwortgeschwindigkeit, Kosteneffizienz und Durchsatz.Verarbeitet komplexe Aufgaben, bei denen mehrere Materialien und Bedingungen zusammengeführt und analysiert und die Analyseergebnisse in konkrete Arbeitsschritte überführt werden.
Verwendung langer EingabenPrüft mehrere Dokumente, Codedateien und Gesprächsverläufe gemeinsam.Verarbeitet umfangreiche Referenzmaterialien und Arbeitsverläufe gemeinsam und führt agentische Aufgaben aus, bei denen Recherche, Ausführung und Validierung über mehrere Schritte hinweg erfolgen.

cip-5.5-im eignet sich für Aufgaben mit klaren Zielen und einem klar abgegrenzten Arbeitsumfang. Typische Aufgaben sind das Extrahieren der benötigten Informationen aus bereitgestellten Materialien, das Erstellen von Ergebnissen in einem vorgegebenen Format sowie das Anpassen von Code gemäß den Anforderungen. Die maximale Ausgabe von 64K eignet sich für ausführliche Berichte oder Ergebnisse, die aus mehreren Teilen bestehen.

  • Entwicklungsunterstützung: Funktionen und Features erstellen, klar abgegrenzte Fehler beheben und Implementierungen an bestehende Muster anpassen.
  • Testgenerierung: Auf Grundlage der Anforderungen und der Implementierung Entwürfe für Tests und Validierungsfälle erstellen.
  • Dokumentenverarbeitung: Zusammenfassungen, Klassifizierungen, Extraktion von Elementen, Formatkonvertierungen und Entwürfe erstellen.
  • Multimodale Analyse: Bildschirmbilder sowie Tabellen und Diagramme in Dokumenten zusammen mit den zugehörigen Erläuterungen prüfen.
  • Interaktive Arbeitsunterstützung: Fragen auf Grundlage von Arbeitsmaterialien beantworten und die erforderlichen Ergebnisse erstellen.
  • Massenverarbeitung: Individuelle Zusammenfassungen zahlreicher Dokumente, Klassifizierung von Anfragen und Datentransformationen durchführen.
  • Subagent: Klar abgegrenzte Teilaufgaben wie die Erkundung von Code, die Prüfung bestimmter Dateien oder die Aufbereitung von Materialien übernehmen.

Beispielsweise wird es eingesetzt, um auf Grundlage von Funktionsanforderungen und zugehörigem Code Änderungsvorschläge, Tests und eine Beschreibung der Änderungen zu erstellen oder eingehende Dokumente zu klassifizieren und eine Zusammenfassung für die zuständigen Personen anzufertigen.

cip-5.5-mm eignet sich für Aufgaben, bei denen Beziehungen zwischen Informationen erfasst und die Konsistenz der gesamten Arbeit gewahrt werden muss. In der Entwicklung werden die Zusammenhänge zwischen Anforderungen, Entwurf, Implementierung und Tests geprüft; bei der Dokumentenanalyse werden Aussagen und Belege sowie Unterschiede und Widersprüche aus mehreren Materialien zusammengeführt.

  • Implementierung komplexer Funktionen: Code, Tests und Dokumentation gemeinsam ändern und dabei die Verträge und das Verhalten mehrerer Module berücksichtigen.
  • Analyse großer Codebasen: Aufrufbeziehungen, Datenflüsse und den Umfang der Änderungsauswirkungen prüfen.
  • Ursachenanalyse von Störungen: Protokolle, Konfigurationen, Code und Ausführungsergebnisse abgleichen sowie Hypothesen zu den Ursachen und Verfahren zu deren Überprüfung zusammenstellen.
  • Unterstützung bei Entwurf und Entscheidungsfindung: Anforderungen und Einschränkungen strukturieren und die Auswirkungen von Implementierungsalternativen analysieren.
  • Zusammenfassende Analyse mehrerer Dokumente: Gemeinsamkeiten, Unterschiede und Widersprüche in Berichten und technischen Dokumenten evidenzbasiert zusammenfassen.
  • Integrierte multimodale Prüfung: Text und visuelle Materialien gemeinsam interpretieren, um Probleme und Anforderungen zu analysieren.
  • Mehrstufiger Agent: Für Aufgaben einsetzen, die aus Recherche, Planung, Tool-Ausführung und anschließender Prüfung der Ergebnisse bestehen.
  • Erstellung fachlicher Dokumente: Technische Berichte, Entwürfe und ausführliche Prüfdokumente verfassen, die komplexe Bedingungen und Belege berücksichtigen.

Zum Beispiel wird es verwendet, um zugehörige Codes und Protokolle aus Fehlern mehrerer Services gemeinsam zu prüfen oder Aufgaben zu bearbeiten, die von der Anforderungsanalyse für komplexe Funktionen über die Implementierung bis zur Prüfung der Verifizierungsergebnisse reichen.

cip-5.5-sm

cip-5.5-sm führt lokale Inferenz und Aufgabenautomatisierung auf Edge-Servern und in On-Premises-Umgebungen durch. Da sich die Modellgröße im Bereich von 24B bis 40B anpassen lässt, kann die Konfiguration entsprechend den Rechenressourcen der Bereitstellungsgeräte und der erforderlichen Leistung vor Ort ausgewählt werden. Da die Verarbeitung nahe dem Ort erfolgt, an dem die Daten entstehen, wird es zur Anbindung von Systemen vor Ort und zur Nutzung interner Daten eingesetzt. Wenn die benötigten Modelle und Tools lokal konfiguriert werden, kann es auch in Umgebungen mit eingeschränkter externer Verbindung betrieben werden.

Es interpretiert vor Ort anfallende Informationen und überführt sie in Verarbeitungsschritte. Es klassifiziert Protokolle und Anfragen, extrahiert benötigte Informationen aus Daten und führt wiederkehrende Aufgaben mithilfe verbundener interner Tools und Skripte aus.

  • Verarbeitung von Ereignissen vor Ort: Klassifiziert Geräteprotokolle und Statusinformationen und filtert Ereignisse heraus, die überprüft werden müssen.
  • Datenvorverarbeitung: Extrahiert Kernelemente aus Arbeitsaufzeichnungen und führt Klassifizierung, Tagging und Normalisierung durch.
  • Anfragenweiterleitung: Leitet eingegangene Anfragen an das zuständige System oder den entsprechenden Verarbeitungsschritt weiter.
  • Lokaler Aufgabenagent: Führt wiederkehrende Aufgaben durch Abfragen interner Systeme und Ausführen von Skripten aus.
  • Unterstützung von On-Premises-Aufgaben: Beantwortet Fragen auf Grundlage interner Unterlagen und fasst Arbeitsinhalte zusammen.
  • Unterstützung bei der Folgeanalyse: Filtert Unterlagen heraus, die einer weiteren Prüfung bedürfen, und fasst die wesentlichen Inhalte zusammen.

Zum Beispiel wird es verwendet, um Betriebsprotokolle auf einem Server am Unternehmensstandort zu klassifizieren, den zugehörigen Verlauf abzurufen und anschließend eine Ereigniszusammenfassung für die zuständigen Mitarbeitenden zu erstellen.

Cosa

Cosa ist eine Produktfamilie für Sprache, die Text in Sprache umwandelt, Eingabesprache als Text erkennt und gewünschte Stimmen registriert und wiederverwendet. Sie wird für Serviceinformationen, die Inhaltserstellung, die Unterstützung der Barrierefreiheit und Sprachschnittstellen dialogorientierter Agenten eingesetzt.

Die Sprachgenerierung übernehmen cosa-a und cosa-b, die Spracherkennung cosa-asr. cosa-a und cosa-b sind separate Modelle, die jeweils eigene Stimmlisten und Syntheseeinstellungen bereitstellen, und werden über dieselbe Serviceschnittstelle ausgewählt. Die beiden Modelle bieten gemeinsam die folgenden Funktionen.

  • Text-zu-Sprache: Synthetisiert eingegebene Sätze mit der ausgewählten Stimme.
  • Stimmenklonen: Registriert eine Stimme auf Grundlage einer Referenzaufnahme, für die eine Nutzungserlaubnis vorliegt, und synthetisiert neue Sätze.
  • Stimmendesign: Erstellt und registriert eine Stimme, indem die gewünschten Merkmale der Stimme beschrieben werden.
  • Wiederverwendung von Stimmen: Verwendet eine registrierte Stimme für nachfolgende Synthesen.
  • Syntheseeinstellungen: Passt unter anderem Sprechgeschwindigkeit und Sprache an.
  • Streaming-Ausgabe: Synthetisiert den Text in Abschnitten, sobald er eintrifft, und überträgt das Audio fortlaufend.
  • Wiedergabesteuerung: Unterstützt das Pausieren, Fortsetzen, Beenden und die Eingabe zusätzlicher Sätze.

Mit der schrittweisen Texteingabe kann die Sprachwiedergabe beginnen, bevor die gesamte Antwort fertiggestellt ist. Während CIP die Antwort erstellt, lässt sich ein Dienst einrichten, bei dem Cosa bereits vorbereitete Abschnitte vorliest.

cosa-a

cosa-a unterstützt Text-zu-Sprache, Stimmenklonen, Stimmendesign und Streaming-Ausgabe. Zusätzlich zu den grundlegenden Funktionen zur Auswahl von Stimme, Sprache und Sprechgeschwindigkeit bietet es weitere Steuerungsoptionen, etwa Einstellungen zur Anzahl der Syntheseschritte, zur Guidance-Stärke und zur Generierungslänge. Es wird verwendet, um Einstellungen während der Sprachproduktion anzupassen und Ergebnisse zu prüfen oder mehrere Einstellungen auf dasselbe Skript anzuwenden und ein Ergebnis auszuwählen.

  • Erstellt Ansagen und Benachrichtigungen für Apps, Kiosksysteme und Geschäftssysteme.
  • Erstellt Audioversionen von Schulungsmaterialien und Benutzerhandbüchern.
  • Produziert Erzählungen für Video- und Audioinhalte.
  • Erstellt wiederkehrende Inhalte mit registrierten Stimmen.
  • Wird für die Streaming-Sprachausgabe interaktiver Agenten verwendet.
  • Wird für die Sprachproduktion mit Anpassung detaillierter Syntheseeinstellungen verwendet.

cosa-b

cosa-b unterstützt die Auswahl voreingestellter Stimmen, beschreibungsbasiertes Stimmendesign, Klonen auf Grundlage von Referenzstimmen und Streaming-Ausgabe. Sie können eine Stimme aus der eigenen Stimmenliste auswählen oder eine neue Stimme für den Einsatz in einem Dienst registrieren.

Für das Stimmenklonen werden eine Referenzaufnahme und der dazugehörige Text verwendet. Es wird auch ein Ablauf unterstützt, bei dem der Referenztext während der Registrierung per Spracherkennung erstellt wird. Registrierte Stimmen werden für nachfolgende Synthesen wiederverwendet.

  • Erstellt die stimmliche Persona von Diensten und Charakteren.
  • Erstellt benutzerdefinierte Stimmen anhand einer Beschreibung oder Referenzaufnahme.
  • Synthetisiert Markenansagen, Charakterdialoge und Inhaltserzählungen.
  • Wird für Sprachantworten interaktiver Agenten verwendet.
  • Synthetisiert wechselnde Ansagen und Skripte mit derselben Stimme.

Wenn Sie zwischen cosa-a und cosa-b wählen, sollten Sie sich an der gewünschten Stimme, dem tatsächlichen Syntheseergebnis und den benötigten Steuerungsmöglichkeiten orientieren.

Kriteriumcosa-acosa-b
SyntheseeinstellungenZusätzlich zu Stimme, Sprache und Sprechgeschwindigkeit Einstellungen für die Anzahl der Syntheseschritte, die Guidance-Stärke und die GenerierungslängeGemeinsame Einstellungen wie Sprechgeschwindigkeit und Sprache
Eingabe für die KlonungReferenzaufnahme, für die Sie über die erforderlichen Nutzungsrechte verfügenReferenzaufnahme und zugehöriger Text. Während der Registrierung kann der Referenztext per Spracherkennung erzeugt werden
RolleSprachgenerierung mit detaillierter SynthesesteuerungStimmauswahl und Generierung individueller Stimmen

cosa-asr

cosa-asr wandelt Eingangssprache in Text um. Damit lassen sich Aufnahmen dokumentieren oder sprachlich übermittelte Anfragen in Eingaben umwandeln, die nachgelagerte Arbeitssysteme verarbeiten können.

  • Sprachnotizen und Aufnahmen transkribieren.
  • Sprachbasierte Fragen und Arbeitsanfragen in Eingaben umwandeln.
  • Referenztexte für die Sprachklonung erzeugen.
  • Für anschließende Verarbeitung wie Zusammenfassung, Klassifizierung und Suche nach der Transkription verwenden.

Wenn Sie die Transkriptionsergebnisse an CIP übermitteln, können daraus Zusammenfassungen erstellt, Anfragen klassifiziert und Arbeitsentwürfe erstellt werden. Werden die Verarbeitungsergebnisse mit cosa-a oder cosa-b synthetisiert, entsteht ein Arbeitsservice mit Spracheingabe und -ausgabe.

Cova

cova-1 ist ein LLM-basiertes, speziell für visuelle OCR entwickeltes Modell. Es erkennt Text in Dokumenten und Bildern, extrahiert Layouts und Tabellenstrukturen und liefert kurze Beschreibungen visueller Elemente.

Es wandelt von Menschen gelesene Dokumente in eine Form um, die von Agenten und Arbeitssystemen besser verarbeitet werden kann. Fließtext und Tabellen werden als strukturierte Inhalte extrahiert, während in Dokumenten enthaltene Bilder mit kurzen Beschreibungen versehen werden. So können nachgelagerte Agenten sowohl den Inhalt als auch den visuellen Kontext eines Dokuments erfassen. Wenn Sie zunächst anhand des extrahierten Textes und der Beschreibungen einen Überblick gewinnen und nur die Originale, die einer detaillierten Prüfung bedürfen, zusätzlich überprüfen, können Sie die wiederholte Eingabe von Originalbildern reduzieren und Kontext-Token sparen.

FunktionBeschreibung
TexterkennungExtrahiert Text aus gescannten oder fotografierten Dokumenten.
LayoutinterpretationUnterteilt Inhalte unter Berücksichtigung des Dokumentlayouts in Blöcke.
Bereitstellung von PositionsinformationenStellt die Positionen der erkannten Blöcke bereit und verknüpft so die Extraktionsergebnisse mit dem Originaltext.
Extraktion von TabellenstrukturenStrukturiert Tabelleninhalte für die Suche und Datenverarbeitung.
Kurze BildbeschreibungBeschreibt den Inhalt von Bildern und visuellen Elementen kurz und liefert dem Agenten Hinweise für die Interpretation.
KontexteffizienzÜbermittelt Informationen mit Schwerpunkt auf Text, Struktur und Bildbeschreibung und reduziert so die wiederholte Eingabe des Originalbildes.
Selektive DetailanalyseHilft dem Agenten zu entscheiden, welche Originalbilder zusätzlich geprüft werden sollen.
Konvertierung von DokumentformatenBereitet die Erkennungsergebnisse als HTML oder Markdown auf.
  • Digitalisierung von Dokumenten: Wandelt Papierdokumente und gescannte Unterlagen in textbasierte Materialien um.
  • Erfassung von Geschäftsdokumenten: Extrahiert Inhalte aus Anträgen, Nachweisen und Berichten.
  • Verarbeitung von Tabellendaten: Verwendet in Dokumenten enthaltene Tabellen für die nachgelagerte Datenverarbeitung.
  • Vorverarbeitung für die Wissenssuche: Wandelt Dokumentbilder und visuelle Materialien in durchsuchbaren Text und Strukturen um.
  • Automatisierung der Dokumentenprüfung: Übermittelt die Extraktionsergebnisse an CIP, um Elemente zu prüfen, Zusammenfassungen zu erstellen und Materialien miteinander zu vergleichen.
  • Optimierung von Agenteneingaben: Strukturiert Fließtext, Tabellen und Bildbeschreibungen umfangreicher Dokumente und übermittelt nur die erforderlichen Informationen.

Beispielsweise werden der Fließtext und die Tabellen eines Berichts extrahiert, während ein eingefügtes Diagramm als Diagramm beschrieben wird, das die vierteljährliche Umsatzentwicklung zeigt. Anhand dieser Beschreibung erkennt der Agent das Vorhandensein und den Zweck des Diagramms und prüft das entsprechende Original zusätzlich, wenn genaue Zahlen oder Trends erforderlich sind.

Verknüpfung von Produktfamilien

Durch die Verknüpfung von Produkten können Sie den folgenden Ablauf konfigurieren.

  • Dokumentbasierte Arbeit: Cova extrahiert Fließtext, Tabellen und Bildbeschreibungen, CIP prüft selektiv die erforderlichen Originale und führt Analysen sowie die Bearbeitung von Aufgaben durch, und Cosa übermittelt die Ergebnisse per Sprache.
  • Sprachbasierte Arbeit: Cosa ASR wandelt Sprachanfragen in Text um, und cosa-a oder cosa-b lesen die von CIP verarbeitete Antwort vor.
  • Automatisierung vor Ort: cip-5.5-sm klassifiziert Daten vor Ort und führt lokale Aufgaben aus. Materialien, die eine zusätzliche umfassende Analyse erfordern, werden an cip-5.5-im oder cip-5.5-mm weitergeleitet.

Vom Gateway zugelassene Aufrufe

Die Pläne des Gateways legen fest, welche Aufrufe für jedes Modell zulässig sind. Die folgende Tabelle zeigt den Umfang, den die Pläne LLM_FREE, TTS_FREE und STT_FREE freischalten; diese Pläne werden automatisch angewendet, ohne dass ein Antrag erforderlich ist. Modelle, die über andere Wege freigeschaltet werden, sind nicht enthalten.

Modell-IDZulässige AufrufeZugrunde liegender Plan
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm und cova-1 sind in dieser Plantabelle nicht enthalten. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm und ivy-4-mm in der Tabelle sind Modell-IDs, die nicht in den obigen Produktbeschreibungen enthalten sind. In der Dokumentation zu API-Aufrufen erfahren Sie, welchem Pfad der Aufrufschlüssel entspricht.

CLEVI

Sprache und Region

Maschinell übersetzte Sprachen sind gekennzeichnet. Die Verfügbarkeit richtet sich nach dem veröffentlichten Website-Bundle.

136 Sprachen

Empfohlen

1

Ostasien

7

Südostasien

11

Südasien

18

Zentralasien

5

Naher Osten und Kaukasus

10

Westeuropa und Südeuropa

16

Vereinigtes Königreich und Irland

4

Nordeuropa

10

Mitteleuropa und Balkan

14

Osteuropa

5

Ostafrika

8

Westafrika und Zentralafrika

9

Südliches Afrika

8

Amerika

5

Ozeanien

5