Skip to main content
Ceci est un notebook interactif. Vous pouvez l’exécuter localement ou utiliser les liens ci-dessous :

Démarrage rapide du Leaderboard

Ce guide de démarrage rapide vous montre comment utiliser le Leaderboard de W&B Weave pour comparer les performances de modèles sur plusieurs jeux de données et fonctions de score. À l’issue de ce guide, vous aurez publié un leaderboard qui classe plusieurs modèles selon un ensemble commun d’évaluations. Vous pourrez alors identifier le modèle le plus performant pour chaque métrique. Ce guide s’adresse aux développeurs qui savent déjà exécuter des évaluations Weave et qui souhaitent comparer les résultats côte à côte. Plus précisément, vous allez :
  1. Générer un jeu de données fictif de codes postaux.
  2. Écrire quelques fonctions de score et évaluer un modèle de référence.
  3. Appliquer ces techniques pour évaluer une matrice croisant modèles et évaluations.
  4. Consulter le leaderboard dans l’interface de Weights & Biases.

Étape 1 : Générer un jeu de données de faux codes postaux

Commencez par créer une fonction generate_dataset_rows qui génère une liste de fausses données de codes postaux. Ce jeu de données synthétique fournit au leaderboard un ensemble cohérent d’entrées et de valeurs attendues sur lequel évaluer chaque modèle.

Étape 2 : Écrire les fonctions de score

Écrivez ensuite trois fonctions de score. Chaque évaluateur évalue un aspect différent de la sortie du modèle, ce qui permet au leaderboard de classer les modèles selon plusieurs dimensions de qualité distinctes :
  1. check_concrete_fields : vérifie si la sortie du modèle correspond à la ville et à l’État attendus.
  2. check_value_fields : vérifie si la sortie du modèle s’écarte de moins de 10 % de la population et du revenu médian attendus.
  3. check_subjective_fields : utilise un LLM pour vérifier si la sortie du modèle correspond au champ “known for” attendu.

Étape 3 : Créer une évaluation

Définissez ensuite une évaluation à partir des données fictives et des fonctions de score. L’objet Evaluation associe le jeu de données aux évaluateurs, ce qui vous permet d’exécuter n’importe quel modèle sur le même benchmark.

Étape 4 : Évaluer un modèle de référence

Évaluez maintenant un modèle de référence qui renvoie une réponse statique. Établir une référence vous fournit un point de comparaison dans le leaderboard, qui vous permet de mesurer les progrès de chaque modèle suivant par rapport à une implémentation statique.

Étape 5 : créer d’autres modèles

Créez maintenant deux autres modèles à comparer à la référence. L’un reçoit le code postal sans prompt supplémentaire, l’autre un prompt structuré. En les comparant dans le leaderboard, vous verrez l’impact du contexte fourni par le prompt sur la qualité des réponses.

Étape 6 : créer d’autres évaluations

Évaluez maintenant une matrice croisant modèles et évaluations. En exécutant chaque modèle sur plusieurs jeux de données (différentes régions et années), vous obtenez les données dont le leaderboard a besoin pour classer les modèles selon plusieurs conditions.

Étape 7 : consulter le leaderboard

Maintenant que les résultats de l’évaluation sont publiés, vous pouvez les regrouper dans un leaderboard pour les comparer côte à côte. Pour créer un leaderboard, accédez à l’onglet leaderboard dans l’interface utilisateur, puis cliquez sur Create Leaderboard. Vous pouvez également générer un leaderboard directement depuis Python :
Vous disposez désormais d’un leaderboard publié dans Weave, qui classe chaque modèle en fonction des trois évaluations et des métriques de notation que vous avez définies. Depuis l’interface de Weights & Biases, vous pouvez examiner les scores de chaque modèle, explorer en détail chaque run d’évaluation et comparer les futures itérations de vos modèles à la même référence.
Dernière modification le 30 septembre 2026