Skip to main content
Verifiers est une bibliothèque de composants modulaires qui permet de créer des environnements d’apprentissage par renforcement (RL) et d’entraîner des agents LLM. Les environnements créés avec Verifiers peuvent servir à l’évaluation de LLM, à la création de pipelines de données synthétiques, de harness d’agents pour tout point de terminaison compatible avec OpenAI, ainsi qu’à l’entraînement RL. En plus d’enregistrer vos métriques d’entraînement avec W&B, vous pouvez intégrer Weave à vos flux de travail RL Verifiers pour observer les performances de votre modèle pendant l’entraînement. Weave enregistre les entrées, les sorties et les horodatages de chaque étape. Vous pouvez ainsi examiner la transformation des données à chaque tour de conversation, déboguer des conversations complexes à plusieurs tours et optimiser les résultats de l’entraînement. Vous pouvez également combiner Weave et Verifiers pour réaliser des évaluations. Ce guide s’adresse aux ingénieurs et chercheurs en ML qui souhaitent ajouter de l’observabilité à leurs flux de travail RL basés sur Verifiers. Il explique comment installer Verifiers, W&B et Weave, et fournit deux exemples d’utilisation de Verifiers avec Weave et W&B : le traçage des rollouts pendant l’évaluation, et le fine-tuning d’un modèle avec le suivi des expériences et le traçage activés.

Premiers pas

Pour intégrer Verifiers à Weave, commencez par installer la bibliothèque Verifiers avec uv (méthode recommandée par les auteurs de la bibliothèque). Pour installer la bibliothèque, utilisez l’une des commandes suivantes :
Installez ensuite Weave et W&B :
Weave active par défaut le patching implicite pour la bibliothèque. Vous pouvez ainsi utiliser Weave avec Verifiers sans avoir à appeler explicitement des fonctions de patch. Une fois les bibliothèques installées, vous pouvez exécuter les exemples des sections suivantes.

Tracer les rollouts et évaluer

Une fois les bibliothèques nécessaires installées, vous pouvez utiliser Weave conjointement avec Verifiers pour tracer les appels et exécuter des évaluations. L’exemple de script suivant montre comment exécuter une évaluation avec Verifiers et en journaliser les résultats dans Weave. Le script évalue la capacité du LLM à résoudre des problèmes mathématiques à l’aide du jeu de données GSM8K. Il demande à GPT-4 de résoudre deux problèmes mathématiques, extrait la valeur numérique de chaque réponse, puis note chaque tentative en s’appuyant sur Verifiers comme framework d’évaluation. Exécutez l’exemple et examinez les résultats dans Weave :

Effectuer le fine-tuning d’un modèle avec le suivi des expériences et le traçage

Weave vous permet de mieux comprendre les performances de vos modèles pendant le fine-tuning par RL. Utilisé conjointement avec W&B, il vous offre une observabilité sur l’ensemble du flux de travail : W&B suit les métriques d’entraînement et les graphiques de performances, tandis que Weave capture des traces détaillées de chaque interaction au cours de l’entraînement. Le dépôt verifiers inclut des exemples prêts à l’emploi pour vous aider à démarrer. L’exemple de pipeline d’entraînement RL suivant exécute un serveur d’inférence local et entraîne un modèle sur le jeu de données GSM8K. Le modèle répond aux problèmes mathématiques, puis la boucle d’entraînement évalue la sortie et met à jour le modèle en conséquence. W&B journalise les métriques d’entraînement, telles que la perte, la récompense et la précision, tandis que Weave capture l’entrée, la sortie, le raisonnement et la notation. Pour utiliser ce pipeline :
  1. Installez le framework à partir des sources. Les commandes suivantes installent la bibliothèque Verifiers depuis GitHub ainsi que les dépendances nécessaires :
  1. Installez un environnement prêt à l’emploi. La commande suivante installe l’environnement d’entraînement GSM8K préconfiguré :
  1. Entraînez votre modèle. Les commandes suivantes lancent respectivement le serveur d’inférence et la boucle d’entraînement. Cet exemple de flux de travail définit report_to=wandb par défaut ; vous n’avez donc pas besoin d’appeler wandb.init() séparément. Vous serez invité à authentifier cette machine afin de consigner des métriques dans W&B.
Cet exemple a été testé sur 2 H100, avec les variables d’environnement suivantes définies pour améliorer la stabilité :
Ces variables désactivent la mémoire unifiée CUDA (CuMem) pour les allocations de mémoire du GPU.
Une fois l’entraînement lancé, vous pouvez afficher les traces journalisées pendant votre run dans l’interface utilisateur. W&B capture les métriques d’entraînement et Weave enregistre les traces de chaque interaction. Vous disposez ainsi à la fois d’une vue d’ensemble des tendances de performances et d’une visibilité détaillée, étape par étape, sur votre run d’entraînement. Les traces omettent logprobs pour les méthodes Environment.a_generate et Rubric.score_rollouts. Les charges utiles restent ainsi légères, tandis que les données d’origine sont conservées intactes pour l’entraînement.

Voir aussi

Verifiers offre une intégration native avec W&B Models. Pour plus d’informations, voir le dépôt Verifiers.
Dernière modification le 30 septembre 2026