Skip to main content
La vue Compare evaluations de W&B Weave vous permet d’examiner côte à côte deux évaluations journalisées ou plus. Utilisez-la pour observer l’évolution des métriques d’un run à l’autre lorsque vous modifiez un prompt, un modèle ou un évaluateur, et pour détecter les incohérences de dataset ou d’évaluateur avant de tirer des conclusions des résultats. Ce guide s’adresse aux utilisateurs de Weave qui souhaitent comparer des évaluations journalisées dans l’interface de Weights & Biases. Il explique comment ouvrir la vue Compare evaluations, décrit le contenu des graphiques de synthèse et des tableaux de résultats, et présente les actions disponibles pour adapter la comparaison, notamment définir une référence, réorganiser les évaluations et retirer une évaluation de la comparaison.

Accéder à la vue Compare evaluations

Pour ouvrir la vue Compare evaluations :
  1. Dans la barre latérale du projet Weave, sélectionnez Evals.
  2. Dans le tableau des évaluations, cochez les cases d’au moins deux évaluations à comparer.
  3. Dans la barre d’outils du tableau des évaluations, sélectionnez Compare.
Tableau des évaluations avec trois évaluations sélectionnées. L’action Compare est mise en évidence dans la barre d’outils du tableau des évaluations.
La vue Compare evaluations s’ouvre et chaque évaluation sélectionnée s’affiche sous forme de jeton dans la barre de comparaison, en haut de la page. Par défaut, l’évaluation la plus à gauche sert de référence, et toutes les autres évaluations sont comparées à celle-ci.

Examiner la comparaison

La vue Compare evaluations comporte deux onglets :
  • Summary : des graphiques agrégés pour chaque métrique des évaluations comparées, suivis d’un tableau des propriétés et des métriques.
  • Dataset results : un tableau de résultats par exemple pour comparer les sorties ligne par ligne, ainsi que des nuages de points qui permettent de repérer les divergences lorsque vous comparez deux évaluations.
Vue Compare evaluations comparant trois évaluations. L’onglet Summary affiche des graphiques agrégés en haut et un tableau des propriétés et des métriques en dessous.

Onglet Summary

L’onglet Summary s’ouvre par défaut. Il comporte deux zones :
  • Charts : un graphique radar qui représente toutes les valeurs de métriques des évaluations comparées, suivi de graphiques par métrique (graphiques à barres pour les métriques numériques et graphiques de couverture pour les métriques de type réussite/échec).
  • Properties and metrics table : un tableau situé sous les graphiques, qui répertorie la configuration et les scores agrégés de chaque évaluation.
Le tableau des propriétés et métriques affiche les informations suivantes pour chaque évaluation comparée :
  • Evaluation : l’ID de l’évaluation.
  • Model : la version du modèle évaluée.
  • Dataset : la version du dataset utilisée pour exécuter l’évaluation.
  • Properties : les éventuelles propriétés supplémentaires enregistrées sur l’évaluation.
  • Metrics : la valeur agrégée de chaque métrique produite par les évaluateurs de l’évaluation.
Pour les métriques numériques, l’écart par rapport à la référence s’affiche sous forme de badge coloré à côté de la valeur. La couleur indique si la variation va dans le sens favorable ou défavorable pour cette métrique : par défaut, les valeurs plus élevées sont considérées comme meilleures ; un badge vert signale donc une hausse et un badge rouge une baisse. Pour les métriques configurées selon le principe « plus bas, c’est mieux », les couleurs sont inversées. Pour masquer les propriétés et métriques identiques dans toutes les évaluations comparées, activez Diff only. Weave affiche des avertissements dans le tableau lorsqu’il détecte des différences susceptibles d’influer sur l’interprétation de la comparaison :
  • Dataset inconsistency detected : le dataset n’est pas le même d’une évaluation comparée à l’autre. Les métriques agrégées ne sont pas forcément directement comparables, et l’onglet Dataset results se limite aux exemples communs à tous les datasets.
  • Scoring inconsistency detected : l’évaluateur n’est pas le même d’une évaluation comparée à l’autre. La logique d’évaluation différant, comparez les résultats avec prudence.
Weave masque également les champs de score qui ne sont pas communs à toutes les évaluations comparées, afin que la synthèse reste ciblée. Lorsque des champs sont masqués, la bannière d’information en haut de la vue en indique le nombre. Pour choisir les champs visibles, sélectionnez Manage fields.

Onglet Dataset results

Sélectionnez Dataset results pour comparer un à un les exemples du dataset entre les évaluations sélectionnées. Chaque ligne correspond à un exemple du dataset et affiche l’entrée du dataset ainsi que la sortie et les métriques des évaluateurs de chaque évaluation, ce qui vous permet de repérer précisément où un exemple donné diverge. Sélectionnez une ligne pour ouvrir une vue détaillée côte à côte. Lorsque vous comparez exactement deux évaluations, l’onglet affiche deux nuages de points au-dessus du tableau. Dans chaque graphique, chaque point représente un exemple du dataset, positionné selon sa valeur de métrique dans chacune des deux évaluations, ce qui fait ressortir les exemples sur lesquels les évaluations divergent. Sélectionnez une zone de points (par brossage) pour filtrer les exemples affichés dans le tableau, et utilisez le menu Dimension de chaque graphique pour choisir la métrique représentée. Pour utiliser l’onglet Dataset results, les évaluations comparées doivent avoir des lignes de dataset en commun. Si leurs datasets n’ont aucune ligne en commun, aucun tableau de résultats ne s’affiche.

Personnaliser la vue Compare evaluations

Dans la vue Compare evaluations, vous pouvez modifier l’ordre des évaluations et choisir celles à inclure dans la comparaison. Les sections suivantes décrivent les actions disponibles.

Définir une référence

Par défaut, l’évaluation la plus à gauche dans la barre de comparaison sert de référence, et toutes les autres évaluations sont comparées à celle-ci. Vous pouvez désigner une autre évaluation comme référence si vous souhaitez qu’une évaluation précise serve de point de repère pour toutes les comparaisons. Pour définir une évaluation comme référence :
  1. Dans la barre de comparaison, survolez l’évaluation que vous souhaitez définir comme référence.
  2. Cliquez sur le menu action () à droite de l’ID.
    Vue Compare evaluations affichant l’option Make baseline pour l’évaluation sélectionnée dans la barre de comparaison.
  3. Dans la liste, sélectionnez Make baseline. L’interface s’actualise : l’évaluation de référence s’affiche tout à gauche de la barre de comparaison, avec la mention Baseline à côté de l’ID.
    Vue Compare evaluations affichant l’évaluation de référence sélectionnée tout à gauche de la barre de comparaison.

Modifier l’ordre de comparaison

Faites glisser les évaluations dans la barre de comparaison pour les réorganiser. Les colonnes correspondantes du tableau de comparaison sont réorganisées en conséquence. Pour modifier l’ordre de comparaison :
  1. Dans la barre de comparaison, survolez l’ID que vous souhaitez déplacer.
  2. Cliquez sur les six points situés à gauche de l’ID, maintenez le bouton enfoncé, puis faites glisser l’ID vers la gauche ou vers la droite selon vos besoins.
  3. Déposez l’ID à la position souhaitée. Les données de comparaison sont actualisées selon le nouvel ordre.

Retirer de la comparaison

Cette option n’est disponible que si vous comparez au moins trois évaluations. Pour retirer une évaluation de la comparaison :
  1. Dans la barre de comparaison, trouvez l’évaluation à retirer.
  2. Cliquez sur le menu action () à droite de l’ID.
  3. Dans la liste, sélectionnez Remove from comparison. L’interface s’actualise et affiche un tableau mis à jour qui n’inclut plus l’évaluation retirée.
Dernière modification le 30 septembre 2026