
Configurer une évaluation dans le playground
Les sections suivantes expliquent comment ouvrir le playground d’évaluation, choisir un point de départ pour votre évaluation et configurer le dataset, les modèles et les évaluateurs. Pour configurer une évaluation dans le playground d’évaluation :- Ouvrez l’interface utilisateur de Weights & Biases, puis ouvrez le projet dans lequel vous souhaitez effectuer l’évaluation. La page Traces s’affiche.
- Depuis la page Traces, cliquez sur l’icône Playground dans le menu de gauche, puis sélectionnez l’onglet Evaluate sur la page Playground. Sur la page Evaluate, vous avez deux possibilités :
- Load a demo example : charge une configuration prédéfinie qui évalue le modèle MoonshotAI Kimi K2 par rapport à la sortie attendue et utilise un juge LLM pour déterminer l’exactitude de ses réponses. Vous pouvez utiliser cette configuration pour vous familiariser avec l’interface.
- Start from scratch : charge une configuration vierge que vous pouvez compléter.
- Si vous avez sélectionné Start from scratch, saisissez un titre et une description explicites pour votre évaluation dans les champs Title et Description.
Ajouter un dataset
Les Datasets sont des collections organisées d’exemples d’entrées utilisateur et des réponses que vous attendez des modèles. Pendant l’évaluation, le playground transmet chaque entrée de test à votre modèle, recueille la sortie, puis la note selon une métrique que vous avez sélectionnée, comme l’exactitude. Vous pouvez créer un dataset dans l’interface utilisateur, ajouter un dataset déjà enregistré dans votre projet ou téléverser un nouveau dataset. Vous pouvez téléverser des datasets aux formats suivants :.csv.tsv.json.jsonl
- Cliquez sur le menu déroulant, puis sélectionnez l’une des options suivantes :
- Start from scratch pour créer un nouveau dataset dans l’interface utilisateur.
- Upload a file pour téléverser un dataset depuis votre machine locale.
- Un dataset déjà enregistré dans votre projet.
- Facultatif : cliquez sur Save pour enregistrer le dataset dans votre projet afin de le réutiliser ultérieurement.
Seuls les nouveaux datasets peuvent être modifiés dans l’interface utilisateur.Veillez également à nommer les colonnes de votre dataset
user_input et expected_output afin que les évaluateurs puissent accéder aux données.Ajouter un modèle
Dans le contexte de Weave, les modèles associent un modèle d’IA (tel que GPT) et l’environnement (ici, le prompt système) qui définit le comportement du modèle pendant l’évaluation. Vous pouvez sélectionner des modèles existants dans votre projet ou en créer de nouveaux à évaluer. Vous pouvez également ajouter plusieurs modèles à la fois pour les évaluer simultanément avec le même dataset et le même évaluateur. Seuls les modèles créés avec la fonctionnalité playground peuvent être utilisés. Pour ajouter un modèle dans la section Models du playground d’évaluation :- Cliquez sur Add Model, puis sélectionnez New Model ou un modèle existant dans le menu déroulant.
-
Si vous avez sélectionné New Model, configurez les champs suivants :
- Name : attribuez un nom descriptif à votre nouveau modèle.
- LLM Model : sélectionnez le modèle de fondation sur lequel reposera votre nouveau modèle, par exemple GPT-4 d’OpenAI. Vous pouvez choisir parmi les modèles de fondation auxquels vous avez déjà configuré l’accès, ou ajouter l’accès à un modèle de fondation en sélectionnant Add AI provider, puis un modèle. Lorsque vous ajoutez un fournisseur, vous êtes invité à saisir vos identifiants d’authentification pour ce fournisseur. Consultez la documentation de votre fournisseur pour savoir où trouver votre clé API, vos points de terminaison et toute autre information de configuration nécessaire pour accéder au modèle avec Weave.
- System Prompt : indiquez au modèle comment il doit se comporter, par exemple
You are a helpful assistant specializing in Python programming.Leuser_inputde votre dataset est envoyé dans un message ultérieur ; il est donc inutile de l’inclure dans le prompt système.
- Facultatif : cliquez sur Save pour enregistrer le modèle dans votre projet afin de le réutiliser ultérieurement.
- Facultatif : pour évaluer plusieurs modèles simultanément, cliquez à nouveau sur Add Model et ajoutez d’autres modèles selon vos besoins.
Ajouter des évaluateurs
Les évaluateurs s’appuient sur des juges LLM pour mesurer et apprécier la qualité des sorties des modèles d’IA. Vous pouvez sélectionner des évaluateurs existants dans votre projet ou en créer de nouveaux pour évaluer vos modèles. Pour ajouter un évaluateur dans le playground d’évaluation :-
Cliquez sur Add Scorer, puis configurez les champs suivants :
- Name : attribuez un nom descriptif à votre évaluateur.
-
Type : sélectionnez le format des scores renvoyés, booléen ou numérique. Les évaluateurs booléens renvoient une valeur binaire
TrueouFalseselon que la sortie du modèle satisfait ou non les critères d’évaluation que vous avez définis. Les évaluateurs numériques renvoient un score compris entre0et1, qui donne une note globale indiquant dans quelle mesure la sortie du modèle satisfait vos critères d’évaluation. - LLM-as-a-judge-model : sélectionnez le modèle de fondation qui servira de juge à l’évaluateur. Comme pour le champ LLM Model de la section Models, vous pouvez choisir parmi les modèles de fondation auxquels vous avez déjà configuré l’accès, ou configurer l’accès à de nouveaux modèles de fondation.
-
Scoring Prompt : fournissez au juge LLM les critères permettant d’évaluer la sortie. Par exemple, pour détecter les hallucinations, saisissez un prompt d’évaluation semblable à celui-ci :
Vous pouvez utiliser les champs de vos datasets et de vos réponses comme variables dans le prompt d’évaluation, par exemple
{user_input},{expected_output}et{output}. Pour afficher la liste des variables disponibles, cliquez sur Insert variable dans l’interface utilisateur.
- Facultatif : cliquez sur Save pour enregistrer l’évaluateur dans votre projet afin de le réutiliser ultérieurement.
Exécuter l’évaluation
Une fois vos datasets, modèles et évaluateurs configurés, vous pouvez exécuter l’évaluation et générer des résultats.- Pour exécuter l’évaluation dans le playground d’évaluation, cliquez sur Run eval.
Examiner les résultats d’évaluation
Une fois l’évaluation terminée, vous pouvez examiner les résultats pour comparer les performances de chaque modèle sur votre dataset et avec vos évaluateurs. À la fin de l’évaluation, le playground ouvre un rapport qui affiche les métriques collectées pour chaque requête envoyée à vos modèles.