Skip to main content
Ouvrir dans Colab Weave est conçu pour suivre et consigner automatiquement tous les appels effectués via la bibliothèque Python Verdict. Lorsque vous travaillez avec des pipelines d’évaluation d’IA, le débogage est essentiel. Qu’une étape du pipeline échoue, que les sorties soient inattendues ou que des opérations imbriquées compliquent la lecture, il peut être difficile de localiser précisément les problèmes. Les applications Verdict comportent souvent plusieurs étapes de pipeline, juges et transformations ; il est donc utile de bien comprendre le fonctionnement interne de vos flux de travail d’évaluation. Weave simplifie ce processus en capturant automatiquement les traces de vos applications Verdict. Vous pouvez ainsi surveiller et analyser les performances de votre pipeline pour déboguer et optimiser vos flux de travail d’évaluation d’IA.

Premiers pas

Pour activer le traçage Weave dans vos pipelines Verdict, appelez weave.init(project=...) au début de votre script. Utilisez l’argument project pour journaliser vers une équipe W&B précise avec team-name/project-name, ou transmettez project-name pour journaliser vers votre équipe ou votre entity par défaut.

Suivi des métadonnées des appels

Pour joindre des métadonnées personnalisées aux appels de votre pipeline Verdict, utilisez le gestionnaire de contexte weave.attributes. Ce gestionnaire de contexte vous permet d’étiqueter un bloc de code précis, comme l’exécution d’un pipeline ou un lot d’évaluation, afin de pouvoir ensuite filtrer et regrouper les traces associées dans l’interface de Weights & Biases.
Weave suit automatiquement les métadonnées associées à la trace de l’appel du pipeline Verdict. Vous pouvez consulter ces métadonnées dans l’interface web de Weave.

Traces

Stocker les traces de vos pipelines d’évaluation d’IA dans une base de données centralisée est utile aussi bien en développement qu’en production. Ces traces facilitent le débogage et l’amélioration de vos flux de travail d’évaluation, tout en constituant un jeu de données précieux. Weave capture automatiquement les traces de vos applications Verdict. Il suit et consigne tous les appels effectués via la bibliothèque Verdict, notamment :
  • Les étapes d’exécution de Pipeline.
  • Les évaluations JudgeUnit.
  • Les transformations Layer.
  • Les opérations de pooling.
  • Les unités et transformations personnalisées.
Vous pouvez consulter les traces dans l’interface web de Weave, qui présente la structure hiérarchique de l’exécution de votre pipeline.

Exemple de traçage de pipeline

L’exemple suivant montre comment Weave trace les opérations de pipeline imbriquées, ce qui vous permet de voir comment chaque étape d’un pipeline Verdict à plusieurs phases est capturée :
Vous obtenez ainsi une trace détaillée qui présente :
  • L’exécution principale du Pipeline.
  • Chaque évaluation JudgeUnit au sein de la Layer.
  • L’étape d’agrégation MeanPoolUnit.
  • Les informations de durée pour chaque opération.

Configuration

Lorsque vous appelez weave.init(), Weave active automatiquement le traçage des pipelines Verdict. L’intégration applique un patching à la méthode Pipeline.__init__() afin d’injecter un VerdictTracer qui transmet toutes les données de trace vers Weave. Aucune configuration supplémentaire n’est nécessaire. Weave se charge automatiquement des opérations suivantes :
  • Capture de toutes les opérations du pipeline.
  • Suivi de la durée d’exécution.
  • Journalisation des entrées et des sorties.
  • Conservation de la hiérarchie des traces.
  • Gestion de l’exécution simultanée des pipelines.

Traceurs personnalisés et Weave

Si vous utilisez déjà des traceurs Verdict personnalisés dans votre application, le VerdictTracer de Weave peut s’exécuter en parallèle, ce qui vous évite d’avoir à choisir entre les intégrations :

Modèles et évaluations

Organiser et évaluer des systèmes d’IA comportant plusieurs composants de pipeline peut s’avérer complexe. Avec weave.Model, vous pouvez capturer et organiser les détails de vos expériences, comme les prompts, les configurations de pipeline et les paramètres d’évaluation, ce qui facilite la comparaison de différentes itérations. L’exemple suivant montre comment encapsuler un pipeline Verdict dans un weave.Model :
Ce code crée un modèle que vous pouvez visualiser dans l’interface de Weights & Biases, avec à la fois la structure du pipeline et les résultats de l’évaluation.

Évaluations

Les évaluations vous permettent de mesurer les performances de vos pipelines d’évaluation eux-mêmes. La classe weave.Evaluation vous permet de capturer l’efficacité de vos pipelines Verdict sur des tâches ou des jeux de données spécifiques :
Vous obtenez ainsi une trace d’évaluation qui montre les performances de votre pipeline Verdict sur différents cas de test.

Bonnes pratiques

Les sections suivantes décrivent les bonnes pratiques de surveillance des performances et de gestion des erreurs lorsque vous utilisez Weave avec des pipelines Verdict.

Surveillance des performances

Weave capture automatiquement les informations de durée de toutes les opérations du pipeline, qui vous permettent d’identifier les goulots d’étranglement de performances d’un run à l’autre :

Gestion des erreurs

Weave capture automatiquement les exceptions levées pendant l’exécution du pipeline. Les échecs sont ainsi enregistrés dans la trace, même lorsque votre application gère l’exception :
L’intégration de Weave à Verdict vous offre une visibilité sur vos pipelines d’évaluation d’IA, ce qui facilite le débogage, l’optimisation et la compréhension de vos flux de travail d’évaluation.
Dernière modification le 30 septembre 2026