Ceci est un notebook interactif. Vous pouvez l’exécuter localement ou utiliser les liens ci-dessous :
Evaluation Weave. À la fin, vous disposerez d’un pipeline d’évaluation fonctionnel qui fait référence aux lignes d’un dataset HuggingFace par leur index, prétraite chaque ligne pour la convertir au format attendu par votre modèle et suit les résultats évalués dans Weave. Cette approche est utile lorsque vous souhaitez évaluer des modèles sur des datasets HuggingFace existants sans avoir à les convertir au préalable en dataset natif Weave.
Ce guide présente une solution de contournement pour utiliser des datasets HuggingFace avec les évaluations Weave. Cette approche fonctionne dès aujourd’hui, et des intégrations plus transparentes pour les datasets externes sont en cours de développement.
Configuration et importations
Commencez par initialiser Weave et par vous connecter à W&B afin que Weave suive les runs d’évaluation et leurs résultats dans votre projet Weave.Charger et préparer le dataset HuggingFace
Chargez ensuite le dataset HuggingFace et créez un index léger que l’évaluation parcourra. Au lieu de transmettre directement les lignes du dataset à Weave, transmettez une liste de références d’index, puis résolvez-les en lignes complètes lors du prétraitement. Cette approche permet de garder l’évaluation liée au dataset HuggingFace d’origine et d’en conserver les références.Dans l’index, encodez le
hf_hub_name avec le hf_id afin que chaque ligne dispose d’un identifiant unique. Weave utilise cette valeur de digest unique pour suivre et référencer des entrées précises du dataset lors des évaluations.Définir les fonctions de traitement et d’évaluation
Une fois l’index en place, définissez les trois fonctions qui composent le pipeline d’évaluation : l’une pour transformer chaque référence de l’index en exemple exploitable, une autre pour attribuer un score à la sortie du modèle, et une dernière qui représente le modèle évalué. Le pipeline de traitement utilise les fonctions suivantes :preprocess_example: transforme la référence de l’index en données effectivement nécessaires à l’évaluation.hf_eval: définit la façon d’attribuer un score aux sorties du modèle.function_to_evaluate: la fonction ou le modèle évalué proprement dit.
Créer et exécuter l’évaluation
Enfin, reliez l’index, le scorer et la fonction de prétraitement au sein d’un objetEvaluation Weave, puis exécutez-le sur le modèle. Pour chaque entrée de hf_index, Weave effectue les étapes suivantes :
preprocess_examplerécupère les données correspondantes dans le dataset HuggingFace.- Weave transmet les données prétraitées à
function_to_evaluate. hf_evalattribue un score à la sortie.- Weave assure le suivi des résultats.