Developer guide
Modèle
Résumé des modèles
Les modèles CLEVI sont répartis en trois gammes de produits : CIP, dédiée à l’intelligence générale et à l’automatisation des tâches, Cosa, dédiée à la génération et à la reconnaissance vocales, et Cova, dédiée à l’extraction d’informations à partir de documents et d’images. Chaque produit peut être utilisé indépendamment ou relié à des services allant de la reconnaissance de documents et de l’analyse à l’exécution de tâches et aux instructions vocales.
| Produit | ID du modèle | Spécifications principales | Rôle principal |
|---|---|---|---|
| CIP-5.5-SM | cip-5.5-sm | 24B~40B ajustable | Automatisation des tâches sur serveur edge et en local |
| CIP-5.5-IM | cip-5.5-im | 360B · entrée 256K · sortie 64K · multimodal | Traitement général des tâches. Priorité à la vitesse de réponse et au débit |
| CIP-5.5-MM | cip-5.5-mm | 800B · entrée 512K · sortie 64K · multimodal | Analyse de longs contextes et résolution de problèmes complexes |
| Cosa-A | cosa-a | Synthèse·clonage·conception·streaming vocaux | Génération vocale avec contrôle détaillé de la synthèse |
| Cosa-B | cosa-b | Synthèse·clonage·conception·streaming vocaux | Sélection de voix et génération vocale personnalisée |
| Cosa ASR | cosa-asr | Reconnaissance vocale | Conversion des entrées vocales en texte |
| Cova | cova-1 | OCR de vision dédié basé sur un LLM | Extraction de textes, de mises en page et de tableaux, avec description simple d’images |
CIP
CIP est dédié à l’intelligence générale et à l’automatisation des tâches. Il comprend cip-5.5-im et cip-5.5-mm, appelés via une passerelle, ainsi que cip-5.5-sm, déployé sur des serveurs edge et en local.
cip-5.5-im et cip-5.5-mm
| Élément | cip-5.5-im | cip-5.5-mm |
|---|---|---|
| Taille | 360B | 800B |
| Limite d’entrée | 256K | 512K |
| Sortie maximale | 64K | 64K |
| Formats d’entrée | Texte et supports visuels (documents, images d’écran, tableaux et graphiques) | Texte et supports visuels (examen intégré de codes, documents et supports d’écran) |
| Orientation | Traite les tâches quotidiennes de connaissance et de développement en privilégiant la vitesse de réponse, la rentabilité et le débit. | Traite des tâches complexes qui combinent et analysent plusieurs sources et conditions, puis relient les résultats de l’analyse à des actions concrètes. |
| Utilisation des longues entrées | Examine simultanément plusieurs documents, fichiers de code et historiques de conversation. | Gère simultanément de vastes sources de référence et historiques de tâches, et exécute des tâches d’agent où la recherche, l’exécution et la vérification s’enchaînent en plusieurs étapes. |
cip-5.5-im convient aux tâches dont les objectifs et le périmètre sont clairement définis. Il est notamment adapté à l’extraction des informations nécessaires à partir des documents fournis, à la rédaction de résultats dans un format spécifié et à la modification de code conformément aux exigences. La sortie maximale de 64K est utile pour rédiger des rapports détaillés ou des résultats composés de plusieurs parties.
- Assistance au développement : écrire des fonctions et des fonctionnalités, corriger des bogues dont le périmètre est clairement défini et implémenter des solutions conformément aux modèles existants.
- Génération de tests : rédiger des ébauches de tests et des cas de vérification à partir des exigences et de l’implémentation.
- Traitement de documents : prendre en charge la synthèse, la classification, l’extraction d’éléments, la conversion de formats et la rédaction d’ébauches.
- Analyse multimodale : examiner des captures d’écran ainsi que des tableaux et graphiques de documents, avec les explications correspondantes.
- Assistance interactive aux tâches : répondre aux questions à partir des documents de travail et produire les résultats nécessaires.
- Traitement en masse : effectuer la synthèse individuelle de nombreux documents, la classification des demandes et la transformation des données.
- Sous-agent : prendre en charge des sous-tâches au périmètre clairement défini, comme l’exploration de code, l’examen de fichiers spécifiques ou l’organisation de documents.
Par exemple, il peut être utilisé pour recevoir des exigences fonctionnelles et le code associé afin de rédiger une proposition de modification, des tests et une description des changements, ou pour classer des documents reçus et créer des synthèses destinées aux responsables.
cip-5.5-mm convient aux tâches qui nécessitent de comprendre les relations entre les informations et de préserver la cohérence de l’ensemble du travail. Dans le développement, il examine les liens entre les exigences, la conception, l’implémentation et les tests ; dans l’analyse documentaire, il synthétise les affirmations et les éléments probants, ainsi que les différences et les contradictions entre plusieurs documents.
- Implémentation de fonctionnalités complexes : modifier conjointement le code, les tests et la documentation en tenant compte des contrats et du comportement de plusieurs modules.
- Analyse de bases de code volumineuses : examiner les relations entre les appels, les flux de données et l’étendue des impacts des modifications.
- Analyse des causes d’incidents : comparer les journaux, la configuration, le code et les résultats d’exécution afin d’organiser les hypothèses sur les causes et les procédures de vérification.
- Assistance à la conception et à la prise de décision : structurer les exigences et les contraintes, puis analyser les répercussions des différentes options d’implémentation.
- Analyse de synthèse de plusieurs documents : présenter de manière fondée les points communs, les différences et les contradictions entre des rapports et des documents techniques.
- Examen intégré multimodal : interpréter conjointement le texte et les éléments visuels afin d’analyser les problèmes et les exigences.
- Agent à plusieurs étapes : s’utilise pour les tâches qui enchaînent recherche, planification, exécution d’outils et examen des résultats.
- Rédaction de documents spécialisés : rédiger des rapports techniques, des propositions de conception et des documents d’examen détaillés qui tiennent compte de conditions complexes et d’éléments probants.
Par exemple, il est utilisé pour examiner conjointement les codes associés et les journaux des erreurs survenues dans plusieurs services, ou pour mener des tâches allant de l’analyse des exigences d’une fonctionnalité complexe à son implémentation et à l’examen des résultats de validation.
cip-5.5-sm
cip-5.5-sm effectue des inférences locales et automatise les tâches sur des serveurs edge et dans des environnements sur site. Comme la taille du modèle peut être ajustée dans une plage de 24B à 40B, sa configuration peut être choisie en fonction des ressources de calcul de l’équipement de déploiement et des performances requises sur le terrain. Le traitement étant effectué à proximité du lieu où les données sont générées, il est utilisé pour l’intégration aux systèmes sur site et l’exploitation des données internes. En configurant localement les modèles et les outils nécessaires, il peut également être exploité dans des environnements où les connexions externes sont limitées.
Il interprète les informations générées sur le terrain et les relie aux procédures de traitement. Il classe les journaux et les requêtes, extrait les informations nécessaires des données et effectue les tâches répétitives à l’aide des outils et scripts internes connectés.
- Traitement des événements sur le terrain : il classe les journaux des équipements et les informations d’état, puis sélectionne les événements nécessitant une vérification.
- Prétraitement des données : il extrait les éléments clés des enregistrements professionnels, puis les classe, les étiquette et les normalise.
- Routage des requêtes : il transmet les requêtes reçues au système responsable ou à la procédure de traitement appropriée.
- Agent de tâches local : il effectue les tâches répétitives en consultant les systèmes internes et en exécutant des scripts.
- Assistance aux tâches sur site : il répond aux questions à partir des documents internes et synthétise le contenu des tâches.
- Assistance à l’analyse ultérieure : il sélectionne les documents nécessitant un examen complémentaire et en synthétise les points essentiels.
Par exemple, il est utilisé dans un flux qui consiste à classer les journaux d’exploitation sur un serveur du site, à consulter l’historique correspondant, puis à rédiger un résumé de l’incident destiné aux responsables.
Cosa
Cosa est une gamme de produits vocaux qui convertit du texte en parole, reconnaît la parole saisie sous forme de texte et permet d’enregistrer puis de réutiliser la voix souhaitée. Elle est utilisée pour les messages d’information des services, la création de contenu, l’accessibilité et les interfaces vocales des agents conversationnels.
La génération vocale est assurée par cosa-a et cosa-b, tandis que la reconnaissance vocale est assurée par cosa-asr. cosa-a et cosa-b sont des modèles distincts qui proposent chacun leur propre liste de voix et leurs paramètres de synthèse, et qui peuvent être sélectionnés depuis la même interface de service. Les fonctionnalités communes aux deux modèles sont les suivantes.
- Synthèse vocale : synthétise le texte saisi avec la voix sélectionnée.
- Clonage vocal : enregistre une voix à partir d’un enregistrement de référence dont vous avez l’autorisation d’utilisation, puis synthétise de nouvelles phrases.
- Conception vocale : crée et enregistre une voix en décrivant les caractéristiques souhaitées.
- Réutilisation de la voix : utilise une voix enregistrée pour les synthèses ultérieures.
- Paramètres de synthèse : ajuste la vitesse de parole, la langue et d’autres paramètres.
- Diffusion en continu : synthétise le texte par segments au fur et à mesure de son arrivée et diffuse l’audio séquentiellement.
- Contrôle de la lecture : prend en charge la mise en pause, la reprise, l’arrêt et l’ajout de phrases supplémentaires.
L’utilisation de la saisie progressive du texte permet de commencer la lecture audio avant que toute la réponse soit terminée. Pendant que CIP rédige la réponse, vous pouvez configurer un service permettant à cosa de lire les segments prêts à être lus.
cosa-a
cosa-a prend en charge la synthèse vocale, le clonage vocal, la conception vocale et la sortie en continu. En plus des fonctions de base permettant de sélectionner la voix, la langue et la vitesse de parole, il propose des paramètres de contrôle supplémentaires, tels que le nombre d’étapes de synthèse, l’intensité du guidage et la longueur de génération. Il peut être utilisé pour ajuster les paramètres et examiner les résultats lors de la création vocale, ou pour appliquer plusieurs configurations au même script et sélectionner le résultat souhaité.
- Synthétise les annonces et les notifications des applications, des kiosques et des systèmes professionnels.
- Convertit les supports de formation et les manuels d’utilisation en contenu audio.
- Produit la narration de contenus vidéo et audio.
- Produit des contenus récurrents avec une voix enregistrée.
- S’utilise pour la sortie vocale en continu des agents conversationnels.
- S’utilise pour la création vocale nécessitant l’ajustement détaillé des paramètres de synthèse.
cosa-b
cosa-b prend en charge la sélection de voix prédéfinies, la conception vocale à partir d’une description, le clonage à partir d’une voix de référence et la sortie en continu. Vous pouvez choisir une voix dans sa liste de voix ou en enregistrer une nouvelle à utiliser pour votre service.
Le clonage vocal utilise un enregistrement de référence et le texte correspondant. Il prend également en charge un processus de génération du texte de référence par reconnaissance vocale lors de l’enregistrement, et les voix enregistrées sont réutilisables pour les synthèses ultérieures.
- Configure la persona vocale des services et des personnages.
- Crée des voix personnalisées à partir d’une description ou d’un enregistrement de référence.
- Synthétise les annonces de marque, les répliques de personnages et la narration de contenus.
- S’utilise pour les réponses vocales des agents conversationnels.
- Synthétise les messages d’annonce et les scripts modifiés avec la même voix.
Pour choisir entre cosa-a et cosa-b, basez-vous sur la voix souhaitée, le résultat réel de la synthèse et les paramètres de contrôle nécessaires.
| Élément | cosa-a | cosa-b |
|---|---|---|
| Paramètres de synthèse | En plus de la voix, de la langue et de la vitesse de parole, paramètres liés au nombre d’étapes de synthèse, à l’intensité du guidage et à la longueur générée | Paramètres communs tels que la vitesse de parole et la langue |
| Entrées de clonage | Enregistrement de référence dont vous disposez des droits d’utilisation | Enregistrement de référence et texte correspondant. Le texte de référence peut être généré par reconnaissance vocale lors du processus d’enregistrement |
| Rôle | Génération vocale avec un contrôle détaillé de la synthèse | Sélection de la voix et génération d’une voix personnalisée |
cosa-asr
cosa-asr convertit la voix saisie en texte. Il permet de documenter des enregistrements ou de transformer des demandes vocales en entrées pouvant être traitées par les systèmes métier en aval.
- Transcrire des mémos vocaux et des enregistrements.
- Transformer des questions vocales et des demandes métier en entrées.
- Générer le texte de référence pour le clonage vocal.
- L’utiliser dans des processus qui se poursuivent après la transcription par un résumé, une classification ou une recherche.
Transmettez le résultat de la transcription à CIP pour enchaîner avec le résumé du contenu, la classification des demandes et la rédaction de brouillons métier. En synthétisant le résultat avec cosa-a ou cosa-b, vous obtenez un service métier doté d’entrées et de sorties vocales.
Cova
cova-1 est un modèle spécialisé dans l’OCR visuel basé sur un LLM. Il reconnaît le texte dans les documents et les images, extrait la mise en page et la structure des tableaux, et fournit de brèves descriptions des éléments visuels.
Il convertit les documents tels qu’ils sont vus par les humains dans un format adapté à l’utilisation par les agents et les systèmes métier. Le corps du texte et les tableaux sont extraits sous forme de contenu structuré, tandis que les images intégrées aux documents sont transmises sous forme de brèves descriptions. Les agents en aval peuvent ainsi comprendre à la fois le contenu du document et son contexte visuel. En mettant en place un flux qui commence par l’analyse des documents à partir du texte et des descriptions extraits, puis examine uniquement les originaux nécessitant une vérification détaillée, vous réduisez la quantité d’images originales saisies à répétition et économisez des jetons de contexte.
| Fonctionnalité | Description |
|---|---|
| Reconnaissance de texte | Extrait les caractères des documents numérisés ou photographiés. |
| Interprétation de la mise en page | Sépare le contenu en blocs en tenant compte de la mise en page du document. |
| Fourniture des informations de position | Fournit la position des blocs reconnus afin de relier les résultats extraits au document original. |
| Extraction de la structure des tableaux | Structure le contenu des tableaux pour la recherche et le traitement des données. |
| Description succincte des images | Décrit brièvement le contenu des images et des éléments visuels afin de fournir à l’agent des indications pour leur interprétation. |
| Optimisation du contexte | Transmet les informations principalement sous forme de texte, de structure et de descriptions d’images afin de réduire la saisie répétée de l’image originale. |
| Analyse détaillée sélective | Aide l’agent à déterminer quelles images originales doivent être examinées plus avant. |
| Conversion du format des documents | Organise les résultats de la reconnaissance au format HTML ou Markdown. |
- Numérisation des documents : convertit les documents papier et les documents numérisés en ressources textuelles.
- Réception des documents professionnels : extrait le contenu des formulaires, des pièces justificatives et des rapports.
- Traitement des données des tableaux : utilise les tableaux contenus dans les documents pour le traitement ultérieur des données.
- Prétraitement pour la recherche documentaire : convertit les images de documents et les ressources visuelles en texte et en structures interrogeables.
- Automatisation de la vérification des documents : transmet les résultats extraits à CIP pour vérifier les éléments, effectuer des synthèses et comparer les documents entre eux.
- Optimisation des entrées de l’agent : organise le corps du texte, les tableaux et les descriptions d’images des documents volumineux afin de ne transmettre que les informations nécessaires.
Par exemple, tout en extrayant le corps du texte et les tableaux d’un rapport, décrit le graphique intégré comme un graphique montrant l’évolution trimestrielle des ventes. Grâce à cette description, l’agent comprend la présence et la fonction du graphique et, lorsqu’il a besoin de chiffres ou de tendances précis, examine également l’original correspondant.
Connexion des produits
La connexion des produits permet de configurer le flux suivant.
- Opérations basées sur les documents : Cova extrait le corps du texte, les tableaux et les descriptions d’images, CIP vérifie sélectivement les originaux nécessaires pour effectuer l’analyse et le traitement des tâches, et Cosa transmet les résultats vocalement.
- Opérations basées sur la voix : Cosa ASR convertit les demandes vocales en texte, puis cosa-a ou cosa-b lit les réponses traitées par CIP.
- Automatisation sur site : cip-5.5-sm classe les données sur site et exécute les tâches locales, puis transmet à cip-5.5-im ou cip-5.5-mm les données nécessitant une analyse globale supplémentaire.
Appels autorisés depuis la passerelle
Les plans de la passerelle déterminent les appels autorisés pour chaque modèle. Le tableau ci-dessous présente les capacités ouvertes par les plans LLM_FREE, TTS_FREE et STT_FREE, qui sont automatiquement appliqués sans demande préalable. Les modèles ouverts par d’autres voies ne sont pas inclus.
| ID du modèle | Appels autorisés | Plan applicable |
|---|---|---|
| cip-5.5-im | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-im-chat | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cip-5.5-mm-h | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
| cosa-a | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-b | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-tts | audio.speech · audio.speech.clone · voices · voices.design | TTS_FREE |
| cosa-asr | audio.transcriptions | STT_FREE |
| ivy-4-embedding | embeddings | LLM_FREE |
| ivy-4-embedding-mm | embeddings | LLM_FREE |
| ivy-4-mm | anthropic.messages · chat.completions · chat.completions.batch · completions · responses | LLM_FREE |
cip-5.5-sm et cova-1 ne figurent pas dans ce tableau des forfaits. cip-5.5-im-chat, cip-5.5-mm-h, cosa-tts, ivy-4-embedding, ivy-4-embedding-mm et ivy-4-mm dans le tableau sont des ID de modèles qui ne sont pas inclus dans les descriptions des produits ci-dessus. La documentation sur les appels API indique à quel chemin correspond la clé d’appel.
