Ceci est un notebook interactif. Vous pouvez l’exécuter localement ou utiliser les liens ci-dessous :
Démarrage rapide du Leaderboard
Ce guide de démarrage rapide vous montre comment utiliser le Leaderboard de W&B Weave pour comparer les performances de modèles sur plusieurs jeux de données et fonctions de score. À l’issue de ce guide, vous aurez publié un leaderboard qui classe plusieurs modèles selon un ensemble commun d’évaluations. Vous pourrez alors identifier le modèle le plus performant pour chaque métrique. Ce guide s’adresse aux développeurs qui savent déjà exécuter des évaluations Weave et qui souhaitent comparer les résultats côte à côte. Plus précisément, vous allez :- Générer un jeu de données fictif de codes postaux.
- Écrire quelques fonctions de score et évaluer un modèle de référence.
- Appliquer ces techniques pour évaluer une matrice croisant modèles et évaluations.
- Consulter le leaderboard dans l’interface de Weights & Biases.
Étape 1 : Générer un jeu de données de faux codes postaux
Commencez par créer une fonctiongenerate_dataset_rows qui génère une liste de fausses données de codes postaux. Ce jeu de données synthétique fournit au leaderboard un ensemble cohérent d’entrées et de valeurs attendues sur lequel évaluer chaque modèle.
Étape 2 : Écrire les fonctions de score
Écrivez ensuite trois fonctions de score. Chaque évaluateur évalue un aspect différent de la sortie du modèle, ce qui permet au leaderboard de classer les modèles selon plusieurs dimensions de qualité distinctes :check_concrete_fields: vérifie si la sortie du modèle correspond à la ville et à l’État attendus.check_value_fields: vérifie si la sortie du modèle s’écarte de moins de 10 % de la population et du revenu médian attendus.check_subjective_fields: utilise un LLM pour vérifier si la sortie du modèle correspond au champ “known for” attendu.
Étape 3 : Créer une évaluation
Définissez ensuite une évaluation à partir des données fictives et des fonctions de score. L’objetEvaluation associe le jeu de données aux évaluateurs, ce qui vous permet d’exécuter n’importe quel modèle sur le même benchmark.