Premiers pas
Pour intégrer Verifiers à Weave, commencez par installer la bibliothèque Verifiers avecuv (méthode recommandée par les auteurs de la bibliothèque). Pour installer la bibliothèque, utilisez l’une des commandes suivantes :
Tracer les rollouts et évaluer
Une fois les bibliothèques nécessaires installées, vous pouvez utiliser Weave conjointement avec Verifiers pour tracer les appels et exécuter des évaluations. L’exemple de script suivant montre comment exécuter une évaluation avec Verifiers et en journaliser les résultats dans Weave. Le script évalue la capacité du LLM à résoudre des problèmes mathématiques à l’aide du jeu de données GSM8K. Il demande à GPT-4 de résoudre deux problèmes mathématiques, extrait la valeur numérique de chaque réponse, puis note chaque tentative en s’appuyant sur Verifiers comme framework d’évaluation. Exécutez l’exemple et examinez les résultats dans Weave :Effectuer le fine-tuning d’un modèle avec le suivi des expériences et le traçage
Weave vous permet de mieux comprendre les performances de vos modèles pendant le fine-tuning par RL. Utilisé conjointement avec W&B, il vous offre une observabilité sur l’ensemble du flux de travail : W&B suit les métriques d’entraînement et les graphiques de performances, tandis que Weave capture des traces détaillées de chaque interaction au cours de l’entraînement. Le dépôtverifiers inclut des exemples prêts à l’emploi pour vous aider à démarrer.
L’exemple de pipeline d’entraînement RL suivant exécute un serveur d’inférence local et entraîne un modèle sur le jeu de données GSM8K. Le modèle répond aux problèmes mathématiques, puis la boucle d’entraînement évalue la sortie et met à jour le modèle en conséquence. W&B journalise les métriques d’entraînement, telles que la perte, la récompense et la précision, tandis que Weave capture l’entrée, la sortie, le raisonnement et la notation.
Pour utiliser ce pipeline :
- Installez le framework à partir des sources. Les commandes suivantes installent la bibliothèque Verifiers depuis GitHub ainsi que les dépendances nécessaires :
- Installez un environnement prêt à l’emploi. La commande suivante installe l’environnement d’entraînement GSM8K préconfiguré :
- Entraînez votre modèle. Les commandes suivantes lancent respectivement le serveur d’inférence et la boucle d’entraînement. Cet exemple de flux de travail définit
report_to=wandbpar défaut ; vous n’avez donc pas besoin d’appelerwandb.init()séparément. Vous serez invité à authentifier cette machine afin de consigner des métriques dans W&B.
Cet exemple a été testé sur 2 H100, avec les variables d’environnement suivantes définies pour améliorer la stabilité :Ces variables désactivent la mémoire unifiée CUDA (CuMem) pour les allocations de mémoire du GPU.
logprobs pour les méthodes Environment.a_generate et Rubric.score_rollouts. Les charges utiles restent ainsi légères, tandis que les données d’origine sont conservées intactes pour l’entraînement.