Developer guide
Modelle
Modellübersicht
Die CLEVI-Modelle sind in drei Produktfamilien unterteilt: CIP für allgemeine Intelligenz und die Automatisierung von Arbeitsabläufen, Cosa für die Sprachgenerierung und -erkennung sowie Cova für die Extraktion von Informationen aus Dokumenten und Bildern. Jedes Produkt kann eigenständig eingesetzt oder zu Services verbunden werden, die von der Dokumentenerkennung über die Analyse und Aufgabenausführung bis zur Sprachführung reichen.
| Produkt | Modell-ID | Wichtige Spezifikationen | Hauptaufgabe |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B, abgestimmt | Edge-Server und lokale Automatisierung von Arbeitsabläufen |
| CIP-5.5-IM | cip-5.5-im | 360B · Eingabe 256K · Ausgabe 64K · multimodal | Allgemeine Aufgabenbearbeitung, mit Priorität auf Antwortgeschwindigkeit und Durchsatz |
| CIP-5.5-MM | cip-5.5-mm | 800B · Eingabe 512K · Ausgabe 64K · multimodal | Analyse langer Kontexte und Lösung komplexer Probleme |
| Cosa-A | cosa-a | Sprachsynthese · Sprachklonen · Sprachdesign · Streaming | Sprachgenerierung mit detaillierter Steuerung der Synthese |
| Cosa-B | cosa-b | Sprachsynthese · Sprachklonen · Sprachdesign · Streaming | Auswahl von Stimmen und individuelle Sprachgenerierung |
| Cosa ASR | cosa-asr | Spracherkennung | Umwandlung von Spracheingaben in Text |
| Cova | cova-1 | LLM-basierte, ausschließlich für visuelles OCR | Extraktion von Text, Layouts und Tabellen sowie einfache Bildbeschreibung |
CIP
CIP ist für allgemeine Intelligenz und die Automatisierung von Arbeitsabläufen zuständig. Es besteht aus cip-5.5-im und cip-5.5-mm, die über ein Gateway aufgerufen werden, sowie cip-5.5-sm, das auf Edge-Servern und on-premises bereitgestellt wird.
cip-5.5-im und cip-5.5-mm
| Element | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Größe | 360B | 800B |
| Eingabelimit | 256K | 512K |
| Maximale Ausgabe | 64K | 64K |
| Eingabeformate | Text und visuelle Materialien (Dokumente, Bildschirmbilder, Tabellen und Diagramme) | Text und visuelle Materialien (integrierte Prüfung von Code, Dokumenten und Bildschirmmaterialien) |
| Ausrichtung | Bearbeitet alltägliche Wissens- und Entwicklungsaufgaben mit Fokus auf Antwortgeschwindigkeit, Kosteneffizienz und Durchsatz. | Bearbeitet komplexe Aufgaben, bei denen mehrere Materialien und Bedingungen zusammengeführt werden und Analyseergebnisse in konkrete Arbeitsschritte überführt werden. |
| Verwendung langer Eingaben | Prüft mehrere Dokumente, Codedateien und Gesprächsverläufe gemeinsam. | Verarbeitet umfangreiche Referenzmaterialien und Arbeitsverläufe gemeinsam und führt Agentenaufgaben aus, bei denen Recherche, Ausführung und Validierung über mehrere Schritte hinweg erfolgen. |
cip-5.5-im eignet sich für Aufgaben mit klaren Zielen und einem klar abgegrenzten Arbeitsumfang. Typische Aufgaben sind das Extrahieren benötigter Informationen aus bereitgestellten Materialien, das Erstellen von Ergebnissen in einem vorgegebenen Format sowie das Anpassen von Code gemäß den Anforderungen. Die maximale Ausgabe von 64K wird für detaillierte Berichte oder Ergebnisse verwendet, die aus mehreren Teilen bestehen.
- Entwicklungsunterstützung: Funktionen und Features erstellen, klar abgegrenzte Fehler beheben und Implementierungen nach bestehenden Mustern vornehmen.
- Testgenerierung: Auf Grundlage der Anforderungen und der Implementierung Testentwürfe und Prüffälle erstellen.
- Dokumentenverarbeitung: Zusammenfassungen, Klassifizierungen, Elementextraktionen, Formatkonvertierungen und Entwürfe erstellen.
- Multimodale Analyse: Bildschirmbilder sowie Tabellen und Diagramme in Dokumenten zusammen mit den zugehörigen Erläuterungen prüfen.
- Interaktive Arbeitsunterstützung: Fragen auf Basis von Arbeitsmaterialien beantworten und benötigte Ergebnisse erstellen.
- Massenverarbeitung: Einzelzusammenfassungen zahlreicher Dokumente, Klassifizierung von Anfragen und Datentransformationen durchführen.
- Subagenten: Klar abgegrenzte Teilaufgaben wie die Codeerkundung, die Prüfung bestimmter Dateien oder die Aufbereitung von Materialien übernehmen.
Beispielsweise wird es eingesetzt, um auf Basis von Funktionsanforderungen und zugehörigem Code Änderungsvorschläge, Tests und eine Beschreibung der Änderungen zu erstellen oder eingegangene Dokumente zu klassifizieren und eine Zusammenfassung für die zuständige Person zu erstellen.
cip-5.5-mm eignet sich für Aufgaben, bei denen Beziehungen zwischen Informationen erfasst und die Konsistenz der Gesamtaufgabe gewahrt werden müssen. In der Entwicklung werden die Zusammenhänge zwischen Anforderungen, Entwurf, Implementierung und Tests geprüft; bei der Dokumentenanalyse werden Aussagen und Belege sowie Unterschiede und Widersprüche aus mehreren Materialien zusammengeführt.
- Implementierung komplexer Funktionen: Code, Tests und Dokumentation gemeinsam ändern und dabei die Verträge und das Verhalten mehrerer Module berücksichtigen.
- Analyse großer Codebasen: Aufrufbeziehungen, Datenflüsse und den Umfang der Auswirkungen von Änderungen prüfen.
- Analyse von Störungsursachen: Protokolle, Konfigurationen, Code und Ausführungsergebnisse abgleichen sowie Hypothesen zu den Ursachen und Verfahren zu deren Überprüfung strukturieren.
- Unterstützung bei Design und Entscheidungsfindung: Anforderungen und Einschränkungen strukturieren sowie die Auswirkungen von Implementierungsalternativen analysieren.
- Zusammenfassende Analyse mehrerer Dokumente: Gemeinsamkeiten, Unterschiede und Widersprüche in Berichten und technischen Dokumenten evidenzbasiert strukturieren.
- Multimodale Gesamtprüfung: Text und visuelle Materialien gemeinsam interpretieren, um Probleme und Anforderungen zu analysieren.
- Mehrstufige Agenten: Für Aufgaben mit aufeinanderfolgender Recherche, Planung, Toolausführung und Ergebnisprüfung einsetzen.
- Erstellung professioneller Dokumente: Technische Berichte, Entwürfe und detaillierte Prüfunterlagen unter Berücksichtigung komplexer Bedingungen und Belege erstellen.
Zum Beispiel wird es eingesetzt, um zugehörige Codes und Protokolle aus Fehlern mehrerer Services gemeinsam zu prüfen oder Aufgaben von der Anforderungsanalyse komplexer Funktionen über die Implementierung bis zur Prüfung der Validierungsergebnisse durchzuführen.
cip-5.5-sm
cip-5.5-sm führt lokale Inferenz und Arbeitsautomatisierung auf Edge-Servern und in On-Premises-Umgebungen durch. Da sich die Modellgröße im Bereich von 24B bis 40B anpassen lässt, kann die Konfiguration entsprechend den verfügbaren Rechenressourcen der Bereitstellungsgeräte und der erforderlichen Leistung vor Ort gewählt werden. Die Verarbeitung erfolgt nahe am Entstehungsort der Daten. Daher wird das Modell für die Anbindung von Systemen vor Ort und die Nutzung interner Daten eingesetzt. Wenn die erforderlichen Modelle und Tools lokal konfiguriert werden, ist auch ein Betrieb in Umgebungen mit eingeschränkter externer Verbindung möglich.
Es interpretiert und verarbeitet Informationen, die vor Ort entstehen, und überführt sie in Verarbeitungsschritte. Es klassifiziert Protokolle und Anfragen, extrahiert benötigte Informationen aus Daten und erledigt wiederkehrende Aufgaben mit angebundenen internen Tools und Skripten.
- Verarbeitung von Ereignissen vor Ort: Geräteprotokolle und Statusinformationen werden klassifiziert und Ereignisse ausgewählt, die überprüft werden müssen.
- Datenvorverarbeitung: Zentrale Elemente aus Arbeitsaufzeichnungen werden extrahiert sowie klassifiziert, getaggt und normalisiert.
- Anfragerouting: Eingegangene Anfragen werden an das zuständige System oder den entsprechenden Verarbeitungsschritt weitergeleitet.
- Lokaler Arbeitsagent: Wiederkehrende Aufgaben werden durch Abfragen interner Systeme und das Ausführen von Skripten erledigt.
- Arbeitsunterstützung On-Premises: Fragen werden auf Grundlage interner Unterlagen beantwortet und Arbeitsinhalte zusammengefasst.
- Unterstützung bei der nachgelagerten Analyse: Unterlagen, die einer zusätzlichen Prüfung bedürfen, werden ausgewählt und die wesentlichen Inhalte zusammengefasst.
Zum Beispiel wird es eingesetzt, um Betriebsprotokolle auf einem Unternehmensserver zu klassifizieren, die zugehörige Historie abzurufen und anschließend eine Ereigniszusammenfassung für die zuständige Person zu erstellen.
Cosa
Cosa ist eine Produktfamilie für Sprache, die Text in Sprache umwandelt, eingegebene Sprache als Text erkennt und gewünschte Stimmen registriert und zur Wiederverwendung speichert. Sie wird für Serviceinformationen, die Inhaltserstellung, Barrierefreiheit und Sprachschnittstellen dialogorientierter Agenten eingesetzt.
Die Sprachgenerierung wird von cosa-a und cosa-b übernommen, die Spracherkennung von cosa-asr. cosa-a und cosa-b sind separate Modelle mit jeweils eigenen Stimmenlisten und Syntheseeinstellungen, die über dieselbe Serviceschnittstelle ausgewählt werden. Die beiden Modelle bieten gemeinsam die folgenden Funktionen:
- Text-zu-Sprache: Synthetisiert den eingegebenen Text mit der ausgewählten Stimme.
- Stimmenklonierung: Registriert eine Stimme auf Grundlage einer Referenzaufnahme, für deren Nutzung eine Berechtigung vorliegt, und synthetisiert neue Texte.
- Stimmendesign: Erstellt und registriert eine Stimme, indem die gewünschten Eigenschaften beschrieben werden.
- Wiederverwendung von Stimmen: Verwendet registrierte Stimmen für nachfolgende Synthesen.
- Syntheseeinstellungen: Passt unter anderem Sprechgeschwindigkeit und Sprache an.
- Streaming-Ausgabe: Synthetisiert Text fortlaufend in Phrasen, sobald er eintrifft, und überträgt das Audio nacheinander.
- Wiedergabesteuerung: Unterstützt das Pausieren, Fortsetzen und Beenden der Wiedergabe sowie die Eingabe zusätzlicher Sätze.
Mit der schrittweisen Texteingabe kann die Sprachwiedergabe beginnen, bevor die gesamte Antwort fertiggestellt ist. Während CIP die Antwort verfasst, lässt sich ein Dienst konfigurieren, in dem Cosa bereits vorbereitete Phrasen vorliest.
cosa-a
cosa-a unterstützt Text-zu-Sprache, Stimmenklonierung, Stimmendesign und Streaming-Ausgabe. Zusätzlich zu den grundlegenden Funktionen zur Auswahl von Stimme, Sprache und Sprechgeschwindigkeit bietet es weitere Steuerungsmöglichkeiten, etwa Einstellungen zur Anzahl der Syntheseschritte, zur Guidance-Stärke und zur Generierungslänge. Es wird verwendet, um Einstellungen während der Sprachproduktion anzupassen und die Ergebnisse zu prüfen oder mehrere Einstellungen auf dasselbe Skript anzuwenden und das beste Ergebnis auszuwählen.
- Synthetisiert Ansagen und Benachrichtigungen für Apps, Kioske und Geschäftssysteme.
- Erstellt Audiomaterial aus Schulungsunterlagen und Benutzerhandbüchern.
- Produziert Erzählungen für Video- und Audioinhalte.
- Erstellt wiederkehrende Inhalte mit registrierten Stimmen.
- Wird für die Streaming-Sprachausgabe interaktiver Agenten verwendet.
- Wird für die Sprachproduktion mit detaillierten Syntheseeinstellungen verwendet.
cosa-b
cosa-b unterstützt die Auswahl voreingestellter Stimmen, beschreibungsbasiertes Stimmendesign, Klonierung auf Grundlage von Referenzstimmen und Streaming-Ausgabe. Wählt eine Stimme aus der eigenen Stimmenliste aus oder registriert eine neue Stimme für den Einsatz in einem Dienst.
Für die Stimmenklonierung werden eine Referenzaufnahme und der zugehörige Text verwendet. Es wird auch ein Ablauf unterstützt, bei dem der Referenztext während der Registrierung durch Spracherkennung erstellt wird. Registrierte Stimmen können für nachfolgende Synthesen wiederverwendet werden.
- Erstellt die stimmliche Persona von Diensten und Charakteren.
- Erstellt individuelle Stimmen anhand einer Beschreibung oder einer Referenzaufnahme.
- Synthetisiert Markenansagen, Charakterdialoge und Erzählungen für Inhalte.
- Wird für Sprachantworten interaktiver Agenten verwendet.
- Synthetisiert wechselnde Ansagen und Skripte mit derselben Stimme.
Wenn Sie zwischen cosa-a und cosa-b wählen, orientieren Sie sich an der gewünschten Stimme, dem tatsächlichen Syntheseergebnis und den benötigten Steuerungsmöglichkeiten.
| Kriterium | cosa-a | cosa-b |
|---|---|---|
| Syntheseeinstellungen | Zusätzlich zu Stimme, Sprache und Sprechgeschwindigkeit Einstellungen für die Anzahl der Syntheseschritte, die Stärke der Steuerung und die Generierungslänge | Gemeinsame Einstellungen wie Sprechgeschwindigkeit und Sprache |
| Eingaben für die Klonung | Referenzaufnahme, für die eine Nutzungsberechtigung vorliegt | Referenzaufnahme und zugehöriger Text. Während der Registrierung kann der Referenztext per Spracherkennung erstellt werden |
| Rolle | Sprachgenerierung mit detaillierten Synthesesteuerungen | Stimmauswahl und Erstellung einer individuellen Stimme |
cosa-asr
cosa-asr wandelt eingegebene Sprache in Text um. Damit lassen sich Aufnahmen dokumentieren oder per Sprache eingegangene Anfragen in Eingaben umwandeln, die nachgelagerte Geschäftssysteme verarbeiten können.
- Sprachnotizen und Aufnahmen transkribieren.
- Sprachbasierte Fragen und Geschäftsanforderungen in Eingaben umwandeln.
- Referenztexte für die Sprachklonung erstellen.
- Für Prozesse verwenden, die nach der Transkription mit Zusammenfassung, Klassifizierung und Suche fortgesetzt werden.
Wenn Sie die Transkriptionsergebnisse an CIP übergeben, können daraus eine Inhaltszusammenfassung, eine Klassifizierung der Anfrage und ein Entwurf für die weitere Bearbeitung erstellt werden. Werden die Verarbeitungsergebnisse mit cosa-a oder cosa-b synthetisiert, entsteht ein Geschäftsdienst mit Spracheingabe und -ausgabe.
Cova
cova-1 ist ein LLM-basiertes Modell speziell für visuelle OCR. Es erkennt Text in Dokumenten und Bildern, extrahiert Layouts und Tabellenstrukturen und liefert kurze Beschreibungen visueller Elemente.
Es wandelt von Menschen lesbare Dokumente in ein Format um, das sich für Agenten und Geschäftssysteme eignet. Fließtext und Tabellen werden als strukturierte Inhalte extrahiert, während in den Dokumenten enthaltene Bilder mit kurzen Beschreibungen übermittelt werden. So können nachgelagerte Agenten sowohl den Inhalt als auch den visuellen Kontext eines Dokuments erfassen. Wenn Sie zunächst anhand des extrahierten Textes und der Beschreibungen einen Überblick gewinnen und nur die Originale, bei denen eine detaillierte Prüfung erforderlich ist, zusätzlich überprüfen, lässt sich die wiederholte Eingabe von Originalbildern reduzieren und damit die Anzahl der Kontext-Tokens verringern.
| Funktion | Beschreibung |
|---|---|
| Texterkennung | Extrahiert Text aus gescannten oder fotografierten Dokumenten. |
| Layout-Interpretation | Unterteilt Inhalte unter Berücksichtigung des Dokumentlayouts in Blöcke. |
| Bereitstellung von Positionsinformationen | Stellt die Positionen der erkannten Blöcke bereit und verknüpft so die Extraktionsergebnisse mit dem Originaltext. |
| Extraktion von Tabellenstrukturen | Strukturiert Tabelleninhalte für die Suche und Datenverarbeitung. |
| Einfache Bildbeschreibung | Beschreibt den Inhalt von Bildern und visuellen Elementen kurz und liefert dem Agenten Hinweise für die Interpretation. |
| Kontexteffizienz | Übermittelt Informationen mit Schwerpunkt auf Text, Struktur und Bildbeschreibung und reduziert so die wiederholte Eingabe des Originalbilds. |
| Selektive Detailanalyse | Unterstützt den Agenten dabei, zu entscheiden, welche Originalbilder zusätzlich geprüft werden sollen. |
| Konvertierung von Dokumentformaten | Strukturiert die Erkennungsergebnisse als HTML oder Markdown. |
- Digitalisierung von Dokumenten: Wandelt Papierdokumente und gescannte Unterlagen in textbasierte Materialien um.
- Eingang von Geschäftsdokumenten: Extrahiert Inhalte aus Anträgen, Nachweisdokumenten und Berichten.
- Verarbeitung von Tabellendaten: Verwendet in Dokumenten enthaltene Tabellen für die nachgelagerte Datenverarbeitung.
- Vorverarbeitung für die Wissenssuche: Wandelt Dokumentbilder und visuelle Materialien in durchsuchbaren Text und Strukturen um.
- Automatisierung der Dokumentprüfung: Übermittelt die Extraktionsergebnisse an CIP, um Elemente zu prüfen, Zusammenfassungen zu erstellen und Materialien miteinander zu vergleichen.
- Optimierung von Agenteneingaben: Strukturiert Fließtext, Tabellen und Bildbeschreibungen langer Dokumente und übermittelt nur die benötigten Informationen.
Beispielsweise werden der Fließtext und die Tabellen eines Berichts extrahiert und ein eingefügtes Diagramm als Darstellung der vierteljährlichen Umsatzentwicklung beschrieben. Der Agent erfasst anhand dieser Beschreibung das Vorhandensein und den Zweck des Diagramms und prüft das entsprechende Original zusätzlich, wenn genaue Zahlen oder Trends benötigt werden.
Verknüpfung von Produktgruppen
Durch die Verknüpfung von Produkten können Sie folgenden Ablauf konfigurieren.
- Dokumentbasierte Arbeit: Cova extrahiert Fließtext, Tabellen und Bildbeschreibungen, CIP prüft selektiv die benötigten Originale und führt Analysen sowie die Bearbeitung von Aufgaben durch, und Cosa gibt die Ergebnisse als Sprache aus.
- Sprachbasierte Arbeit: Cosa ASR wandelt Sprachanfragen in Text um, und cosa-a oder cosa-b liest die von CIP verarbeitete Antwort vor.
- Automatisierung vor Ort: cip-5.5-sm klassifiziert Daten vor Ort und führt lokale Aufgaben aus. Materialien, für die eine zusätzliche umfassende Analyse erforderlich ist, werden an cip-5.5-im oder cip-5.5-mm übergeben.
Vom Gateway zugelassene Aufrufe
Die Pläne des Gateways legen fest, welche Aufrufe für die einzelnen Modelle zulässig sind. Die folgende Tabelle zeigt den Umfang, den die Pläne LLM_FREE, TTS_FREE und STT_FREE freischalten; diese Pläne werden automatisch und ohne Antrag angewendet. Modelle, die über andere Wege freigeschaltet werden, sind nicht enthalten.
| Modell-ID | Zulässige Aufrufe | Zugrunde liegender Plan |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm und cova-1 sind in dieser Plantabelle nicht enthalten. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm und ivy-4-mm in der Tabelle sind Modell-IDs, die in den obigen Produktbeschreibungen nicht enthalten sind. Welchem Pfad der Aufrufschlüssel entspricht, finden Sie in der Dokumentation zu API-Aufrufen.
