Ceci est un notebook interactif. Vous pouvez l’exécuter localement ou utiliser les liens suivants :
Model Weave, l’exécuter sur un petit dataset, attribuer un score à ses sorties à l’aide d’une fonction de score personnalisée, puis examiner les résultats dans Weave. Il s’adresse aux développeurs qui découvrent Weave et recherchent un point de départ rapide et concret avant d’aborder des flux de travail d’évaluation plus avancés.
Prérequis
Avant d’exécuter une évaluation Weave, remplissez les prérequis suivants.- Installez le SDK W&B Weave et connectez-vous avec votre clé API.
- Installez le SDK d’OpenAI et connectez-vous avec votre clé API.
- Initialisez votre projet Weights & Biases.
Exécuter votre première évaluation
Une fois votre environnement configuré, vous pouvez définir et exécuter une évaluation. L’exemple de code suivant montre comment évaluer un LLM à l’aide des APIModel et Evaluation de Weave. Commencez par définir un modèle Weave en créant une sous-classe de weave.Model, en spécifiant le nom du modèle et le format du prompt, et en assurant le suivi d’une méthode predict avec @weave.op. La méthode predict envoie un prompt à OpenAI et convertit la réponse en sortie structurée à l’aide d’un schéma Pydantic (FruitExtract). Créez ensuite un petit dataset d’évaluation composé de phrases d’entrée et des cibles attendues. Définissez ensuite une fonction de score personnalisée (dont le suivi est également assuré par @weave.op) qui compare la sortie du modèle à l’étiquette cible. Enfin, encapsulez le tout dans un objet weave.Evaluation en spécifiant votre dataset et vos évaluateurs, puis appelez evaluate() pour exécuter le pipeline d’évaluation de manière asynchrone.
Vous cherchez d’autres exemples ?
Maintenant que vous avez effectué une évaluation de base, vous pouvez explorer des flux de travail plus avancés dans les tutoriels suivants :- Découvrez comment créer un pipeline d’évaluation de bout en bout.
- Découvrez comment évaluer une application RAG.