Skip to main content
Ceci est un notebook interactif. Vous pouvez l’exécuter localement ou utiliser les liens suivants :
Ce notebook présente les évaluations W&B Weave à l’aide d’un exemple minimal de bout en bout. Vous allez définir un Model Weave, l’exécuter sur un petit dataset, attribuer un score à ses sorties à l’aide d’une fonction de score personnalisée, puis examiner les résultats dans Weave. Il s’adresse aux développeurs qui découvrent Weave et recherchent un point de départ rapide et concret avant d’aborder des flux de travail d’évaluation plus avancés.

Prérequis

Avant d’exécuter une évaluation Weave, remplissez les prérequis suivants.
  1. Installez le SDK W&B Weave et connectez-vous avec votre clé API.
  2. Installez le SDK d’OpenAI et connectez-vous avec votre clé API.
  3. Initialisez votre projet Weights & Biases.

Exécuter votre première évaluation

Une fois votre environnement configuré, vous pouvez définir et exécuter une évaluation. L’exemple de code suivant montre comment évaluer un LLM à l’aide des API Model et Evaluation de Weave. Commencez par définir un modèle Weave en créant une sous-classe de weave.Model, en spécifiant le nom du modèle et le format du prompt, et en assurant le suivi d’une méthode predict avec @weave.op. La méthode predict envoie un prompt à OpenAI et convertit la réponse en sortie structurée à l’aide d’un schéma Pydantic (FruitExtract). Créez ensuite un petit dataset d’évaluation composé de phrases d’entrée et des cibles attendues. Définissez ensuite une fonction de score personnalisée (dont le suivi est également assuré par @weave.op) qui compare la sortie du modèle à l’étiquette cible. Enfin, encapsulez le tout dans un objet weave.Evaluation en spécifiant votre dataset et vos évaluateurs, puis appelez evaluate() pour exécuter le pipeline d’évaluation de manière asynchrone.
Une fois l’évaluation terminée, Weave journalise le modèle, le dataset et les scores par exemple dans votre projet, afin que vous puissiez examiner les résultats dans l’interface de Weights & Biases.

Vous cherchez d’autres exemples ?

Maintenant que vous avez effectué une évaluation de base, vous pouvez explorer des flux de travail plus avancés dans les tutoriels suivants :
Dernière modification le 30 septembre 2026