Skip to main content

Évaluer des modèles avec Weave

W&B Weave est une boîte à outils spécialement conçue pour évaluer les LLM et les applications d’IA générative. Weave offre des fonctionnalités d’évaluation complètes, notamment des évaluateurs, des juges et un traçage détaillé, pour vous aider à comprendre et à améliorer les performances de vos modèles. Weave s’intègre à W&B Models, ce qui vous permet d’évaluer les modèles stockés dans votre registre de modèles.
Tableau de bord d’évaluation Weave présentant les métriques de performances des modèles et les traces

Principales fonctionnalités pour l’évaluation des modèles

  • Évaluateurs et juges : métriques d’évaluation prédéfinies et personnalisées pour mesurer la précision, la pertinence, la cohérence et bien plus encore
  • Jeux de données d’évaluation : jeux de test structurés avec vérité terrain pour une évaluation systématique
  • Gestion des versions des modèles : suivez et comparez les différentes versions de vos modèles
  • Traçage détaillé : déboguez le comportement de vos modèles grâce à des traces complètes des entrées et des sorties
  • Suivi des coûts : surveillez les coûts d’API et l’utilisation des jetons sur l’ensemble de vos évaluations

Premiers pas : évaluer un modèle depuis le registre

Téléchargez un modèle depuis W&B Models Registry et évaluez-le avec Weave :

Intégrer les évaluations Weave à W&B Models

La démo Models and Weave Integration Demo présente le flux de travail complet pour :
  1. Charger des modèles depuis le registre : téléchargez des modèles affinés stockés dans le W&B Models Registry
  2. Créer des pipelines d’évaluation : concevez des évaluations complètes avec des évaluateurs personnalisés
  3. Journaliser les résultats dans W&B : associez les métriques d’évaluation aux runs de vos modèles
  4. Versionner les modèles évalués : réenregistrez les modèles améliorés dans le registre
Journalisez les résultats d’évaluation à la fois dans Weave et dans W&B Models :

Fonctionnalités avancées de Weave

Évaluateurs et juges personnalisés

Créez des métriques d’évaluation avancées, adaptées à votre cas d’usage :

Évaluations par lots

Évaluez plusieurs versions ou configurations d’un modèle :

Étapes suivantes

Évaluer des modèles avec des tableaux

Utilisez les tableaux W&B pour :
  • Comparer les prédictions des modèles : comparez côte à côte les performances de différents modèles sur le même jeu de test
  • Suivre l’évolution des prédictions : observez comment les prédictions évoluent au fil des époques d’entraînement ou des versions du modèle
  • Analyser les erreurs : filtrez et interrogez les données pour repérer les exemples fréquemment mal classés et les schémas d’erreur récurrents
  • Visualiser des médias enrichis : affichez des images, de l’audio, du texte et d’autres types de médias à côté des prédictions et des métriques
Exemple de tableau de prédictions affichant les sorties du modèle à côté des étiquettes de vérité terrain

Exemple de base : journaliser les résultats d’évaluation

Flux de travail avancés avec les tableaux

Comparer plusieurs modèles

Journalisez les tableaux d’évaluation de différents modèles sous la même clé pour les comparer directement :
Comparaison côte à côte des prédictions du modèle au fil des époques d’entraînement

Suivre les prédictions au fil du temps

Journalisez des tableaux à différentes époques d’entraînement pour visualiser l’amélioration du modèle :

Analyse interactive dans l’interface W&B

Une fois les données journalisées, vous pouvez :
  1. Filtrer les résultats : cliquez sur les en-têtes de colonne pour filtrer selon la précision des prédictions, des seuils de confiance ou des classes précises
  2. Comparer des tableaux : sélectionnez plusieurs versions d’un tableau pour les comparer côte à côte
  3. Interroger les données : utilisez la barre de requête pour trouver des motifs précis (par exemple, "correct" = false AND "confidence" > 0.8)
  4. Regrouper et agréger : regroupez par classe prédite pour afficher les métriques de précision par classe
Filtrage et interrogation interactifs des résultats d’évaluation dans un tableau W&B

Exemple : analyse des erreurs avec des tableaux enrichis

Last modified on September 30, 2026