Évaluer des modèles avec Weave
W&B Weave est une boîte à outils spécialement conçue pour évaluer les LLM et les applications d’IA générative. Weave offre des fonctionnalités d’évaluation complètes, notamment des évaluateurs, des juges et un traçage détaillé, pour vous aider à comprendre et à améliorer les performances de vos modèles. Weave s’intègre à W&B Models, ce qui vous permet d’évaluer les modèles stockés dans votre registre de modèles.
Principales fonctionnalités pour l’évaluation des modèles
- Évaluateurs et juges : métriques d’évaluation prédéfinies et personnalisées pour mesurer la précision, la pertinence, la cohérence et bien plus encore
- Jeux de données d’évaluation : jeux de test structurés avec vérité terrain pour une évaluation systématique
- Gestion des versions des modèles : suivez et comparez les différentes versions de vos modèles
- Traçage détaillé : déboguez le comportement de vos modèles grâce à des traces complètes des entrées et des sorties
- Suivi des coûts : surveillez les coûts d’API et l’utilisation des jetons sur l’ensemble de vos évaluations
Premiers pas : évaluer un modèle depuis le registre
Téléchargez un modèle depuis W&B Models Registry et évaluez-le avec Weave :
Intégrer les évaluations Weave à W&B Models
La démo Models and Weave Integration Demo présente le flux de travail complet pour :
- Charger des modèles depuis le registre : téléchargez des modèles affinés stockés dans le W&B Models Registry
- Créer des pipelines d’évaluation : concevez des évaluations complètes avec des évaluateurs personnalisés
- Journaliser les résultats dans W&B : associez les métriques d’évaluation aux runs de vos modèles
- Versionner les modèles évalués : réenregistrez les modèles améliorés dans le registre
Journalisez les résultats d’évaluation à la fois dans Weave et dans W&B Models :
Fonctionnalités avancées de Weave
Évaluateurs et juges personnalisés
Créez des métriques d’évaluation avancées, adaptées à votre cas d’usage :
Évaluations par lots
Évaluez plusieurs versions ou configurations d’un modèle :
Étapes suivantes
Évaluer des modèles avec des tableaux
Utilisez les tableaux W&B pour :
- Comparer les prédictions des modèles : comparez côte à côte les performances de différents modèles sur le même jeu de test
- Suivre l’évolution des prédictions : observez comment les prédictions évoluent au fil des époques d’entraînement ou des versions du modèle
- Analyser les erreurs : filtrez et interrogez les données pour repérer les exemples fréquemment mal classés et les schémas d’erreur récurrents
- Visualiser des médias enrichis : affichez des images, de l’audio, du texte et d’autres types de médias à côté des prédictions et des métriques
Exemple de base : journaliser les résultats d’évaluation
Flux de travail avancés avec les tableaux
Comparer plusieurs modèles
Journalisez les tableaux d’évaluation de différents modèles sous la même clé pour les comparer directement :
Suivre les prédictions au fil du temps
Journalisez des tableaux à différentes époques d’entraînement pour visualiser l’amélioration du modèle :
Analyse interactive dans l’interface W&B
Une fois les données journalisées, vous pouvez :
- Filtrer les résultats : cliquez sur les en-têtes de colonne pour filtrer selon la précision des prédictions, des seuils de confiance ou des classes précises
- Comparer des tableaux : sélectionnez plusieurs versions d’un tableau pour les comparer côte à côte
- Interroger les données : utilisez la barre de requête pour trouver des motifs précis (par exemple,
"correct" = false AND "confidence" > 0.8)
- Regrouper et agréger : regroupez par classe prédite pour afficher les métriques de précision par classe
Exemple : analyse des erreurs avec des tableaux enrichis
Last modified on September 30, 2026