Skip to main content
Incluez les contrôles du proxy et les attributs de trace dans l’objet metadata standard de l’API Chat Completions. Cette page explique comment préserver l’identité de conversation, échantillonner des conversations complètes et interpréter les traces qui en résultent dans le projet.

Métadonnées réservées

Les clés wandb.* contrôlent l’acheminement et la journalisation. Le proxy les supprime avant d’envoyer une requête au fournisseur, et lui transmet les autres métadonnées. Lorsque leur format le permet, le proxy ajoute également ces métadonnées à la trace.

Priorité des identifiants de conversation

Le proxy choisit le premier identifiant disponible :
  1. wandb.thread_id
  2. gen_ai.conversation.id
  3. call.id de Vapi
Dans votre application, utilisez la même valeur pour tous les appels au fournisseur d’une même conversation. Cela facilite la navigation dans les traces, évite qu’une conversation ne soit répartie sur plusieurs splits du dataset et stabilise l’acheminement pondéré.

Échantillonner des conversations complètes

L’échantillonnage des traces au niveau des conversations réduit le volume de trafic du projet enregistré dans W&B Weave, sans laisser de conversations partielles. L’échantillonnage par requête, lui, peut conserver des tours de conversation isolés et en supprimer le contexte, ce qui rend les données enregistrées moins utiles pour le débogage et la création de datasets. Pour configurer l’échantillonnage d’un projet :
  1. Dans Model Distillation, ouvrez la page Routing du projet.
  2. Sous Models and traffic, définissez Weave trace sampling sur le pourcentage de conversations à enregistrer.
  3. Sélectionnez Save routing.
Une fois la configuration d’acheminement enregistrée, le proxy applique le pourcentage sélectionné à l’échantillonnage des traces au niveau des conversations. Pour les requêtes associées à une identité de conversation, le proxy attribue la conversation à un groupe d’échantillonnage stable, basé sur l’entity W&B, le projet Model Distillation et l’ID de conversation. Le taux d’échantillonnage par défaut est de 100 %. Le proxy enregistre ou ignore l’ensemble des requêtes associées à cette identité. La décision d’échantillonnage ne dépend ni de la sélection du modèle ni des révisions d’acheminement. Les traces ignorées n’empêchent pas le proxy de fournir des réponses d’inférence. Le proxy enregistre toujours les requêtes dépourvues d’identité de conversation. Ne modifiez pas le pourcentage d’échantillonnage tant que des conversations sont actives, car toute modification peut changer les conversations enregistrées.
Pour configurer l’échantillonnage des traces au niveau des conversations sans passer par Model Distillation, utilisez l’API d’acheminement.Remplacez [PROXY-MODEL-NAME] par le nom du modèle proxy, [WANDB-ENTITY] par l’entity W&B et [MODEL-REF] par une référence de modèle cible existante.Définissez trace_sampling_rate sur une fraction comprise entre 0 et 1. Comme une mise à jour de l’acheminement remplace l’intégralité de la configuration, incluez toutes les cibles existantes dans la requête :
Pour une autre version du projet, utilisez PUT /v1/tasks/[PROXY-MODEL-NAME]/versions/[PROJECT-VERSION]/routing. Remplacez [PROXY-MODEL-NAME] par le nom du modèle proxy et [PROJECT-VERSION] par la version du projet. Avant de considérer le paramètre comme actif, attendez que le statut du déploiement passe à Applied pour la nouvelle révision d’acheminement.

Contenu des traces de projet

Les traces de projet capturent les informations d’acheminement, de requête, de réponse et de métadonnées suivantes :
  • ID du projet (UUID), nom du modèle proxy et version
  • Révision d’acheminement, ainsi que le fournisseur et le modèle sélectionnés
  • La requête exacte que le proxy envoie au fournisseur et la réponse que le proxy reconstruit.
  • Utilisation des jetons, motif de fin, durées et statut d’erreur
  • Indication indiquant si la réponse a été rejouée depuis le cache de réponses exactes (cache_hit)
  • Métadonnées de conversation, d’utilisateur, de scénario et métadonnées personnalisées non sensibles
  • Un ID de requête proxy pour l’assistance et la comparaison des sorties de traces
L’Agent Span canonique contient une copie brute de la requête et de la réponse afin de préserver tous les détails. La reconstruction des datasets ne repose donc pas uniquement sur les colonnes d’affichage normalisées.
N’incluez pas d’identifiants d’authentification, de secrets ni de données personnelles superflues dans les messages ou les métadonnées. Les données de trace sont délibérément conservées durablement pour servir d’entrées à l’entraînement et au débogage.
Remplacez [PROXY-MODEL-NAME] par le nom du modèle proxy, [WANDB-ENTITY] par l’entity W&B et [CONVERSATION-ID] par un identifiant de la conversation.Conservez le même wandb.thread_id pour chaque tour de conversation d’une même conversation :
Le proxy supprime les valeurs réservées wandb.* avant d’envoyer une requête au fournisseur. Voir Créer une complétion de chat acheminée.
Dernière modification le 30 septembre 2026