metadata standard de l’API Chat Completions. Cette page explique comment préserver l’identité de conversation, échantillonner des conversations complètes et interpréter les traces qui en résultent dans le projet.
Métadonnées réservées
Les clés
wandb.* contrôlent l’acheminement et la journalisation. Le proxy les supprime avant d’envoyer une requête au fournisseur, et lui transmet les autres métadonnées. Lorsque leur format le permet, le proxy ajoute également ces métadonnées à la trace.
Priorité des identifiants de conversation
Le proxy choisit le premier identifiant disponible :wandb.thread_idgen_ai.conversation.idcall.idde Vapi
Échantillonner des conversations complètes
L’échantillonnage des traces au niveau des conversations réduit le volume de trafic du projet enregistré dans W&B Weave, sans laisser de conversations partielles. L’échantillonnage par requête, lui, peut conserver des tours de conversation isolés et en supprimer le contexte, ce qui rend les données enregistrées moins utiles pour le débogage et la création de datasets. Pour configurer l’échantillonnage d’un projet :- Dans Model Distillation, ouvrez la page Routing du projet.
- Sous Models and traffic, définissez Weave trace sampling sur le pourcentage de conversations à enregistrer.
- Sélectionnez Save routing.
API : définir l’échantillonnage des traces de conversation (PUT /tasks/[PROXY-MODEL-NAME]/routing)
API : définir l’échantillonnage des traces de conversation (PUT /tasks/[PROXY-MODEL-NAME]/routing)
Pour configurer l’échantillonnage des traces au niveau des conversations sans passer par Model Distillation, utilisez l’API d’acheminement.Remplacez Pour une autre version du projet, utilisez
[PROXY-MODEL-NAME] par le nom du modèle proxy, [WANDB-ENTITY] par l’entity W&B et [MODEL-REF] par une référence de modèle cible existante.Définissez trace_sampling_rate sur une fraction comprise entre 0 et 1. Comme une mise à jour de l’acheminement remplace l’intégralité de la configuration, incluez toutes les cibles existantes dans la requête :PUT /v1/tasks/[PROXY-MODEL-NAME]/versions/[PROJECT-VERSION]/routing. Remplacez [PROXY-MODEL-NAME] par le nom du modèle proxy et [PROJECT-VERSION] par la version du projet. Avant de considérer le paramètre comme actif, attendez que le statut du déploiement passe à Applied pour la nouvelle révision d’acheminement.Contenu des traces de projet
Les traces de projet capturent les informations d’acheminement, de requête, de réponse et de métadonnées suivantes :- ID du projet (UUID), nom du modèle proxy et version
- Révision d’acheminement, ainsi que le fournisseur et le modèle sélectionnés
- La requête exacte que le proxy envoie au fournisseur et la réponse que le proxy reconstruit.
- Utilisation des jetons, motif de fin, durées et statut d’erreur
- Indication indiquant si la réponse a été rejouée depuis le cache de réponses exactes (
cache_hit) - Métadonnées de conversation, d’utilisateur, de scénario et métadonnées personnalisées non sensibles
- Un ID de requête proxy pour l’assistance et la comparaison des sorties de traces
API : envoyer une requête avec une identité de conversation (POST /chat/completions)
API : envoyer une requête avec une identité de conversation (POST /chat/completions)
Remplacez Le proxy supprime les valeurs réservées
[PROXY-MODEL-NAME] par le nom du modèle proxy, [WANDB-ENTITY] par l’entity W&B et [CONVERSATION-ID] par un identifiant de la conversation.Conservez le même wandb.thread_id pour chaque tour de conversation d’une même conversation :wandb.* avant d’envoyer une requête au fournisseur. Voir Créer une complétion de chat acheminée.