Developer guide

Modèles

Résumé des modèles

Les modèles CLEVI sont répartis en trois gammes de produits : CIP, qui prend en charge l’intelligence générale et l’automatisation des tâches; Cosa, qui prend en charge la génération et la reconnaissance vocales; et Cova, qui prend en charge l’extraction d’informations à partir de documents et d’images. Chaque produit peut être utilisé de façon autonome ou intégré à des services qui enchaînent la reconnaissance de documents, l’analyse, l’exécution des tâches et les instructions vocales.

ProduitID du modèlePrincipales spécificationsRôle principal
CIP-5.5-SMcip-5.5-sm24B à 40B, ajustableAutomatisation des tâches sur des serveurs périphériques et en local
CIP-5.5-IMcip-5.5-im360B · entrée 256K · sortie 64K · multimodalTraitement général des tâches. Priorité à la vitesse de réponse et au débit
CIP-5.5-MMcip-5.5-mm800B · entrée 512K · sortie 64K · multimodalAnalyse de longs contextes et résolution de problèmes complexes
Cosa-Acosa-aSynthèse, clonage, conception et diffusion vocalesGénération vocale avec contrôle détaillé de la synthèse
Cosa-Bcosa-bSynthèse, clonage, conception et diffusion vocalesSélection de voix et génération vocale personnalisée
Cosa ASRcosa-asrReconnaissance vocaleConversion des entrées vocales en texte
Covacova-1OCR visuel dédié, fondé sur un LLMExtraction de texte, de mise en page et de tableaux, ainsi que description simple d’images

CIP

CIP prend en charge l’intelligence générale et l’automatisation des tâches. Il comprend cip-5.5-im et cip-5.5-mm, appelés par l’intermédiaire de la passerelle, ainsi que cip-5.5-sm, déployé sur des serveurs périphériques et sur site.

cip-5.5-im et cip-5.5-mm

Élémentcip-5.5-imcip-5.5-mm
Taille360B800B
Limite d’entrée256K512K
Sortie maximale64K64K
Formats d’entréeTexte et éléments visuels (documents, images d’écran, tableaux et graphiques)Texte et éléments visuels (examen intégré de code, de documents et de contenus à l’écran)
OrientationTraite les tâches quotidiennes de connaissances et de développement en privilégiant la vitesse de réponse, la rentabilité et le débit.Traite les tâches complexes qui consistent à combiner et à analyser plusieurs sources et conditions, puis à transformer les résultats de l’analyse en tâches concrètes.
Utilisation des longues entréesExamine simultanément plusieurs documents, fichiers de code et historiques de conversation.Gère simultanément une grande quantité de documents de référence et d’historiques de travail, et exécute des tâches d’agent où la recherche, l’exécution et la validation s’enchaînent en plusieurs étapes.

cip-5.5-im convient aux tâches dont l’objectif et la portée sont clairement définis. Il est notamment utile pour extraire les informations nécessaires des documents fournis, produire des résultats dans le format indiqué et modifier du code conformément aux exigences. La sortie maximale de 64K tokens permet de rédiger des rapports détaillés ou des résultats composés de plusieurs parties.

  • Assistance au développement : écrire des fonctions et des fonctionnalités, corriger des bogues dont la portée est clairement définie et effectuer des implémentations conformes aux modèles existants.
  • Génération de tests : rédiger des ébauches de tests et des cas de validation à partir des exigences et de l’implémentation.
  • Traitement de documents : effectuer des résumés, des classifications, l’extraction d’éléments, la conversion de formats et la rédaction d’ébauches.
  • Analyse multimodale : examiner des images d’écran ainsi que les tableaux et graphiques de documents, avec les explications pertinentes.
  • Soutien interactif aux tâches : répondre aux questions à partir des documents de travail et produire les résultats nécessaires.
  • Traitement en lot : effectuer des résumés individuels de nombreux documents, la classification des demandes et la conversion de données.
  • Sous-agent : prendre en charge des sous-tâches à portée clairement délimitée, comme l’exploration de code, l’examen de fichiers particuliers et l’organisation de documents.

Par exemple, il peut servir à recevoir des exigences fonctionnelles et le code connexe afin de rédiger une proposition de modification, des tests et une description des changements, ou à classer des documents soumis et à produire un résumé destiné aux responsables.

cip-5.5-mm convient aux tâches qui nécessitent de comprendre les relations entre les informations et de maintenir la cohérence de l’ensemble du travail. En développement, il permet d’examiner les liens entre les exigences, la conception, l’implémentation et les tests. Pour l’analyse de documents, il synthétise les affirmations et les éléments probants, ainsi que les différences et les contradictions entre plusieurs documents.

  • Implémentation de fonctionnalités complexes : modifier conjointement le code, les tests et la documentation en tenant compte des contrats et du comportement de plusieurs modules.
  • Analyse de bases de code volumineuses : examiner les relations entre les appels, les flux de données et la portée des répercussions des changements.
  • Analyse des causes d’incidents : comparer les journaux, la configuration, le code et les résultats d’exécution afin de formuler des hypothèses sur les causes et de définir les procédures de vérification.
  • Soutien à la conception et à la prise de décision : structurer les exigences et les contraintes, puis analyser les répercussions des différentes options d’implémentation.
  • Analyse synthétique de plusieurs documents : organiser les points communs, les différences et les contradictions de rapports et de documents techniques en s’appuyant sur les éléments probants.
  • Examen multimodal intégré : interpréter conjointement le texte et les éléments visuels afin d’analyser les problèmes et les exigences.
  • Agent à plusieurs étapes : effectuer des tâches qui enchaînent la recherche, la planification, l’exécution d’outils et l’examen des résultats.
  • Rédaction de documents spécialisés : rédiger des rapports techniques, des propositions de conception et des documents d’examen détaillés qui tiennent compte de conditions complexes et des éléments probants.

Par exemple, il est utilisé pour examiner ensemble les codes associés et les journaux des erreurs survenues dans plusieurs services, ou pour les tâches qui vont de l’analyse des exigences d’une fonctionnalité complexe à sa mise en œuvre et à l’examen des résultats de validation.

cip-5.5-sm

cip-5.5-sm effectue des inférences locales et automatise les tâches dans des serveurs périphériques et des environnements sur site. Comme la taille du modèle peut être ajustée dans une plage de 24B à 40B, vous pouvez choisir une configuration adaptée aux ressources de calcul de l’équipement de déploiement et aux performances requises sur le terrain. Le traitement étant effectué à proximité de l’endroit où les données sont générées, il est utilisé pour intégrer les systèmes sur le terrain et exploiter les données internes. En configurant localement les modèles et les outils nécessaires, il peut également être exploité dans des environnements où les connexions externes sont limitées.

Il interprète les informations générées sur le terrain et les transforme en procédures de traitement. Il classe les journaux et les demandes, extrait les informations nécessaires des données et exécute les tâches répétitives à l’aide des outils et des scripts internes connectés.

  • Traitement des événements sur le terrain : classe les journaux des équipements et les informations d’état, puis sélectionne les événements nécessitant une vérification.
  • Prétraitement des données : extrait les éléments clés des dossiers opérationnels et les classe, les étiquette et les normalise.
  • Routage des demandes : transmet les demandes reçues au système responsable ou à la procédure de traitement appropriée.
  • Agent opérationnel local : effectue les tâches répétitives en consultant les systèmes internes et en exécutant des scripts.
  • Soutien aux opérations sur site : répond aux questions à partir des documents internes et organise le contenu des tâches.
  • Soutien à l’analyse ultérieure : sélectionne les documents nécessitant un examen supplémentaire et en résume les points essentiels.

Par exemple, il est utilisé dans un flux qui consiste à classer les journaux d’exploitation sur un serveur du site, à consulter l’historique connexe, puis à rédiger un résumé de l’incident destiné au responsable.

Cosa

Cosa est une gamme de produits vocaux qui convertit le texte en parole, reconnaît la parole saisie sous forme de texte et permet d’enregistrer puis de réutiliser la voix souhaitée. Elle est utilisée pour les guides de service, la création de contenu, le soutien à l’accessibilité et les interfaces vocales des agents conversationnels.

La génération vocale est assurée par cosa-a et cosa-b, tandis que la reconnaissance vocale est assurée par cosa-asr. cosa-a et cosa-b sont des modèles distincts qui fournissent chacun leur propre liste de voix et leurs propres paramètres de synthèse, et peuvent être sélectionnés dans la même interface de service. Les fonctionnalités offertes en commun par les deux modèles sont les suivantes.

  • Synthèse vocale : synthétise le texte saisi avec la voix sélectionnée.
  • Clonage vocal : enregistre une voix à partir d’un enregistrement de référence dont vous avez l’autorisation d’utiliser, puis synthétise de nouvelles phrases.
  • Conception vocale : crée et enregistre une voix en décrivant les caractéristiques souhaitées.
  • Réutilisation de la voix : utilise une voix enregistrée pour les synthèses ultérieures.
  • Paramètres de synthèse : ajuste la vitesse de parole, la langue et d’autres paramètres.
  • Diffusion en continu : synthétise le texte par segments au fur et à mesure de son arrivée et transmet l’audio séquentiellement.
  • Contrôle de la lecture : prend en charge la mise en pause, la reprise, l’arrêt et l’ajout de nouvelles phrases.

L’utilisation de la saisie progressive du texte permet de commencer la lecture vocale avant que toute la réponse soit terminée. Pendant que le CIP rédige la réponse, vous pouvez configurer un service dans lequel Cosa lit les segments prêts à être lus.

cosa-a

cosa-a prend en charge la synthèse vocale, le clonage vocal, la conception vocale et la sortie en continu. En plus des fonctions de base permettant de sélectionner la voix, la langue et la vitesse de parole, il offre des paramètres de contrôle supplémentaires liés au nombre d’étapes de synthèse, à l’intensité du guidage et à la longueur générée. Il peut être utilisé pour ajuster les paramètres pendant la création vocale et examiner les résultats, ou pour appliquer plusieurs configurations au même script et sélectionner le résultat souhaité.

  • Synthétise les instructions et les notifications des applications, des kiosques et des systèmes professionnels.
  • Crée des supports de formation et des manuels d’utilisation audio.
  • Produit la narration de contenus vidéo et audio.
  • Crée des contenus répétitifs avec une voix enregistrée.
  • S’utilise pour la sortie vocale en continu des agents conversationnels.
  • S’utilise pour la création vocale nécessitant l’ajustement détaillé des paramètres de synthèse.

cosa-b

cosa-b prend en charge la sélection de voix prédéfinies, la conception vocale fondée sur une description, le clonage à partir d’une voix de référence et la sortie en continu. Vous pouvez choisir une voix dans sa propre liste de voix ou en enregistrer une nouvelle à utiliser dans le service.

Le clonage vocal utilise un enregistrement de référence et le texte correspondant. Il prend également en charge un processus qui génère le texte de référence par reconnaissance vocale lors de l’enregistrement. Les voix enregistrées sont réutilisées pour les synthèses ultérieures.

  • Configure la persona vocale des services et des personnages.
  • Crée des voix personnalisées à partir d’une description ou d’un enregistrement de référence.
  • Synthétise les annonces de marque, les répliques de personnages et la narration de contenus.
  • S’utilise pour les réponses vocales des agents conversationnels.
  • Synthétise les messages d’information et les scripts qui changent, avec la même voix.

Lorsque vous choisissez entre cosa-a et cosa-b, basez-vous sur la voix souhaitée, le résultat de la synthèse et les éléments de contrôle requis.

Élémentcosa-acosa-b
Paramètres de synthèseEn plus de la voix, de la langue et de la vitesse de parole, paramètres liés au nombre d’étapes de synthèse, à l’intensité du guidage et à la longueur de générationParamètres communs comme la vitesse de parole et la langue
Entrée de clonageEnregistrement de référence dont vous détenez les droits d’utilisationEnregistrement de référence et texte correspondant. Le texte de référence peut être généré par reconnaissance vocale lors du processus d’enregistrement
RôleGénération vocale avec contrôle détaillé de la synthèseSélection de la voix et génération d’une voix personnalisée

cosa-asr

cosa-asr convertit la voix d’entrée en texte. Il sert à documenter des enregistrements ou à convertir des demandes reçues par la voix en entrées pouvant être traitées par les systèmes opérationnels en aval.

  • Transcrire des notes vocales et des enregistrements.
  • Convertir des questions et des demandes opérationnelles vocales en entrées.
  • Générer le texte de référence pour le clonage vocal.
  • L’utiliser dans des traitements qui se poursuivent après la transcription, comme le résumé, la classification et la recherche.

Transmettez les résultats de la transcription à CIP pour enchaîner avec le résumé du contenu, la classification des demandes et la rédaction d’ébauches opérationnelles. La synthèse des résultats avec cosa-a ou cosa-b permet de créer un service opérationnel doté d’entrées et de sorties vocales.

Cova

cova-1 est un modèle spécialisé en OCR visuel fondé sur un LLM. Il reconnaît le texte dans les documents et les images, extrait la mise en page et la structure des tableaux, et fournit de brèves descriptions des éléments visuels.

Il convertit les documents destinés à être lus par des personnes en un format plus facilement exploitable par les agents et les systèmes opérationnels. Le corps du texte et les tableaux sont extraits sous forme de contenu structuré, tandis que les images incluses dans les documents sont transmises sous forme de courtes descriptions. Les agents en aval peuvent ainsi comprendre à la fois le contenu du document et son contexte visuel. En configurant un flux qui commence par l’analyse des documents à partir du texte et des descriptions extraits, puis qui examine uniquement les originaux nécessitant une vérification détaillée, vous pouvez réduire la quantité d’images originales saisies à répétition et économiser des jetons de contexte.

FonctionnalitéDescription
Reconnaissance de texteExtrait les caractères des documents numérisés ou photographiés.
Interprétation de la mise en pageTient compte de la disposition du document pour diviser le contenu en blocs.
Fourniture des informations de positionFournit la position des blocs reconnus afin de relier les résultats extraits au document original.
Extraction de la structure des tableauxStructure le contenu des tableaux pour la recherche et le traitement des données.
Description sommaire des imagesDécrit brièvement le contenu des images et des éléments visuels afin de fournir des indices d’interprétation à l’agent.
Optimisation du contexteTransmet les informations principalement sous forme de texte, de structure et de descriptions d’images afin de réduire la saisie répétée de l’image originale.
Analyse détaillée sélectiveAide l’agent à déterminer quelles images originales doivent être examinées plus en détail.
Conversion du format des documentsOrganise les résultats de la reconnaissance en HTML ou en Markdown.
  • Numérisation des documents : convertit les documents papier et les documents numérisés en ressources textuelles.
  • Réception des documents opérationnels : extrait le contenu des formulaires, des pièces justificatives et des rapports.
  • Traitement des données des tableaux : utilise les tableaux contenus dans les documents pour le traitement ultérieur des données.
  • Prétraitement pour la recherche de connaissances : convertit les images de documents et les éléments visuels en texte et en structures consultables.
  • Automatisation de la révision des documents : transmet les résultats extraits à CIP pour vérifier et résumer les éléments et comparer les documents entre eux.
  • Optimisation des entrées de l’agent : organise le texte principal, les tableaux et les descriptions d’images des documents volumineux afin de transmettre uniquement les informations nécessaires.

Par exemple, il extrait le texte principal et les tableaux d’un rapport, tout en décrivant le graphique intégré comme un graphique présentant l’évolution des ventes par trimestre. Grâce à cette description, l’agent comprend la présence et l’utilité du graphique, puis examine l’original au besoin lorsque des chiffres ou des tendances précis sont nécessaires.

Connexion des produits

La connexion des produits permet de configurer le flux suivant.

  • Processus fondé sur les documents : Cova extrait le texte principal, les tableaux et les descriptions d’images, CIP sélectionne et examine au besoin les originaux nécessaires pour effectuer l’analyse et traiter les tâches, puis Cosa transmet les résultats vocalement.
  • Processus fondé sur la voix : Cosa ASR convertit les demandes vocales en texte, puis cosa-a ou cosa-b lit les réponses traitées par CIP.
  • Automatisation sur le terrain : cip-5.5-sm classe les données recueillies sur le terrain et exécute les tâches locales, puis transmet à cip-5.5-im ou cip-5.5-mm les documents nécessitant une analyse synthétique supplémentaire.

Appels autorisés par la passerelle

Les plans de la passerelle déterminent les appels autorisés pour chaque modèle. Le tableau ci-dessous présente les accès ouverts par les plans LLM_FREE, TTS_FREE et STT_FREE; ces plans sont appliqués automatiquement, sans demande. Les modèles rendus accessibles par d’autres voies ne sont pas inclus.

ID du modèleAppels autorisésPlan justificatif
cip-5.5-imanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-im-chatanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cip-5.5-mm-hanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE
cosa-aaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-baudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-ttsaudio.speech · audio.speech.clone · voices · voices.designTTS_FREE
cosa-asraudio.transcriptionsSTT_FREE
ivy-4-embeddingembeddingsLLM_FREE
ivy-4-embedding-mmembeddingsLLM_FREE
ivy-4-mmanthropic.messages · chat.completions · chat.completions.batch · completions · responsesLLM_FREE

cip-5.5-sm과 cova-1 ne figurent pas dans ce tableau des forfaits. Les ID de modèle cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm et ivy-4-mm dans le tableau ne sont pas inclus dans les descriptions des produits ci-dessus. La documentation sur les appels API indique à quel chemin correspond chaque clé d’appel.

CLEVI

Langue et région

Les langues traduites automatiquement sont indiquées. La disponibilité suit la version publiée du site.

136 langues

Recommandé

1

Asie orientale

7

Asie du Sud-Est

11

Asie du Sud

18

Asie centrale

5

Moyen-Orient et Caucase

10

Europe occidentale et Europe méridionale

16

Royaume-Uni et Irlande

4

Europe septentrionale

10

Europe centrale et Balkans

14

Europe orientale

5

Afrique orientale

8

Afrique occidentale et Afrique centrale

9

Afrique australe

8

Amériques

5

Océanie

5