前提条件
開始する前に、以下が揃っていることを確認してください。- Forge アカウント。 お持ちでない場合は、サインアップしてください。
- APIキー。 Forge でプロフィールアイコンをクリックし、Settings を選択して、Create new API key をクリックします。キーは後から再表示できないため、表示された時点でコピーしてください。このページのサンプルでは、
WANDB_API_KEY環境変数からキーを読み込みます。ART でキーをどこに設定するかについては、ART クイックスタートを参照してください。 - Weights & Biases の project。 トレーニングメトリクスの記録と、トレーニング済みアダプターの保存に使用します。詳しくは Projects を参照してください。
- 報酬関数。 エージェントの出力をスコアリングする関数です。Serverless RL は、この関数が報酬を与える挙動に向けてトレーニングを行うため、この関数がタスクそのものを定義することになります。作成方法は ART クイックスタートで説明されています。
- ART フレームワーク。 API を直接呼び出さずに ART を使用する場合に必要です。ART クイックスタートのインストール手順に従ってください。
エージェントをトレーニングする
- ART フレームワーク
- Serverless Training API
ART は Serverless Training API をラップし、ロールアウト、報酬、チェックポイントを自動的に管理します。まずは ART から始めることをおすすめします。ART クイックスタートの手順に沿って進めるか、2048 をプレイするエージェントをエンドツーエンドでトレーニングするサンプルノートブックを開いてください。
トレーニング済みモデルを使用する
モデルをトレーニングすると、そのモデルは自動的に推論に使用できるようになります。このセクションでは、トレーニング済みモデルのエンドポイントを構成してリクエストを送信する方法を説明します。これにより、モデルをアプリケーションや評価ワークフローに統合できます。Serverless SFT でトレーニングしたモデルにも同じ手順が適用されます。 トレーニング済みモデルにリクエストを送信するには、以下が必要です。- APIキー。Forge の Settings で作成できます。
- Serverless Training API のベース URL (
https://forge.coreweave.com/api/training/v1/) 。 - モデルのエンドポイント。
- entity (チーム名)
- モデルに関連付けられた project の名前
- トレーニング済みモデルの名前
- デプロイするモデルのトレーニングステップ。通常は、評価でモデルの性能が最も高かったステップを指定します。
email-specialists、project 名が mail-search、トレーニング済みモデルの名前が agent-001 で、ステップ 25 のモデルをデプロイする場合、エンドポイントは次のようになります。