Les tableaux d’évaluation vous permettent de comparer, sur plusieurs runs, les scores agrégés ainsi que les entrées, sorties et scores du modèle pour chaque exemple. Utilisez un tableau d’évaluation pour comparer des versions de modèle ou des étapes d’entraînement, examiner l’évolution des scores agrégés et analyser les exemples à l’origine des variations de performances du modèle.
L’image suivante montre un tableau d’évaluation nommé "validation_prediction_eval" qui compare deux runs, "summer-butterfly-9" et "gentle-flower-8" :
Un panneau Eval Table comporte trois sections :
- Sélecteur de comparaison de runs : sélectionnez les runs que vous souhaitez comparer.
- Scores agrégés : examinez les scores agrégés des runs sélectionnés et comparez leurs différences. Pour plus d’informations, voir Afficher les scores agrégés.
- Exemples : comparez les entrées, sorties et scores de chaque exemple d’un run sélectionné à l’autre.
L’image suivante met en évidence chaque section du panneau :
Créez un tableau d’évaluation avec la classe EvalTable du SDK Python W&B.
Vous pouvez également convertir des tableaux W&B existants en tableaux d’évaluation avec ARIA. Pour plus d’informations, voir Convertir un tableau W&B en tableau d’évaluation.
Convertissez vos tableaux W&B existants en tableaux d’évaluation pour améliorer les performances de rendu et accéder à des fonctionnalités de comparaison supplémentaires.
Pour créer votre premier tableau d’évaluation, voir Créer un tableau d’évaluation.