Skip to main content
Verifiers は、強化学習 (RL) 環境の作成や LLM エージェントのトレーニングに使用するモジュール式コンポーネントのライブラリです。Verifiers で構築した環境は、LLM の評価、合成データパイプライン、任意の OpenAI 互換エンドポイント向けのエージェントハーネス、RL トレーニングとして利用できます。 W&B でトレーニングのメトリクスを記録するだけでなく、Weave を Verifiers の RL ワークフローに統合すると、トレーニング中にモデルがどのように動作しているかの可観測性を得られます。Weave は各ステップの入力、出力、タイムスタンプを記録するため、各ターンでデータがどのように変換されるかを確認したり、複雑な複数ラウンドの会話をデバッグしたり、トレーニング結果を最適化したりできます。 また、Weave と Verifiers を組み合わせて評価を実行することもできます。 このガイドは、Verifiers ベースの RL ワークフローに可観測性を追加したい ML エンジニアや研究者を対象としています。Verifiers、W&B、Weave のインストール方法を説明したうえで、Verifiers を Weave および W&B と組み合わせて使用する 2 つのサンプルを紹介します。1 つは評価中のロールアウトのトレース、もう 1 つは実験管理とトレースを有効にしたモデルのファインチューニングです。

はじめに

Verifiers を Weave と統合するには、まず uv を使用して Verifiers ライブラリをインストールします (ライブラリの作成者が推奨する方法です) 。次のいずれかのコマンドを使用して、ライブラリをインストールしてください。
次に、Weave と W&B をインストールします。
Weave では、このライブラリに対する暗黙的なパッチ適用がデフォルトで有効になっています。そのため、パッチ関数を明示的に呼び出さなくても、Verifiers で Weave を使用できます。 ライブラリをインストールすれば、以下のセクションのサンプルを実行する準備は完了です。

ロールアウトをトレースして評価する

必要なライブラリをインストールしたら、Weave と Verifiers を組み合わせて使用し、Call のトレースや評価の実行を行えます。 次のサンプルスクリプトは、Verifiers で評価を実行し、その結果を Weave にログする方法を示しています。このスクリプトでは、GSM8K データセットを使用して、LLM の数学の問題を解く能力をテストします。GPT-4 に 2 つの数学の問題を解かせ、各応答から数値を抽出したうえで、Verifiers を評価フレームワークとして使用して回答を採点します。 サンプルを実行し、Weave で結果を確認してください。

実験管理とトレースを使用してモデルをファインチューニングする

Weave を使用すると、RL ファインチューニング中のモデルのパフォーマンスを詳しく把握できます。W&B と組み合わせることで、ワークフロー全体にわたる可観測性が得られます。W&B はトレーニングのメトリクスとパフォーマンスのチャートをトラッキングし、Weave はトレーニングプロセス中の各インタラクションの詳細なトレースを取得します。 verifiers リポジトリには、すぐに実行できるサンプルが用意されているので、すぐに使い始めることができます。 次の RL トレーニングパイプラインの例では、ローカルの推論サーバーを起動し、GSM8K データセットを使用してモデルをトレーニングします。モデルが数学の問題に回答すると、トレーニングループがその出力をスコアリングし、結果に応じてモデルを更新します。W&B は損失、報酬、精度などのトレーニングメトリクスをログし、Weave は入力、出力、推論、スコアリングを取得します。 このパイプラインを使用するには、次の手順に従います。
  1. ソースからフレームワークをインストールします。次のコマンドを実行すると、GitHub から Verifiers ライブラリと必要な依存関係がインストールされます。
  1. 既製の環境をインストールします。次のコマンドで、事前設定済みの GSM8K トレーニング環境をインストールします:
  1. モデルをトレーニングします。次のコマンドで、推論サーバーとトレーニングループをそれぞれ起動します。このサンプルワークフローではデフォルトで report_to=wandb が設定されているため、wandb.init() を別途呼び出す必要はありません。W&B にメトリクスをログするため、このマシンの認証を求めるプロンプトが表示されます。
この例は、安定性を高めるために以下の環境変数を設定した 2xH100 環境でテストされています。
これらの変数は、デバイスメモリの割り当てにおける CUDA Unified Memory (CuMem) を無効にします。
トレーニングが始まると、run 中にログされたトレースを UI で確認できます。W&B がトレーニングメトリクスを取得し、Weave がインタラクションごとのトレースを記録します。これにより、パフォーマンスの大まかな傾向を把握できるだけでなく、トレーニング run の各ステップも詳細に可視化できます。 Environment.a_generate メソッドと Rubric.score_rollouts メソッドのトレースでは、logprobs が省略されます。これにより、トレーニングに使う元データはそのまま保持しつつ、ペイロードを小さく抑えられます。

関連項目

Verifiers は W&B Models とのインテグレーションを標準でサポートしています。詳細については、Verifiers リポジトリを参照してください。
最終更新日 2026年9月30日