Skip to main content
Serverless RL を使用すると、強化学習によって LLM をポストトレーニングできます。ユーザーは、エージェントの出力をスコアリングする報酬関数を定義します。Serverless RL は軌跡のバッチを収集し、スコアの高い動作が選ばれやすくなるように低ランクアダプター (LoRA アダプター) を更新します。アダプターは Weights & Biases アカウントにアーティファクトとして保存され、すべてのチェックポイントは Serverless Inference 上でホストされます。Serverless RL は現在パブリックプレビュー段階です。 Serverless RL は、OpenPipe の ART フレームワーク経由で実行することも、Serverless Training API から直接実行することもできます。

前提条件

開始する前に、以下が揃っていることを確認してください。
  • Forge アカウント。 お持ちでない場合は、サインアップしてください。
  • APIキー。 Forge でプロフィールアイコンをクリックし、Settings を選択して、Create new API key をクリックします。キーは後から再表示できないため、表示された時点でコピーしてください。このページのサンプルでは、WANDB_API_KEY 環境変数からキーを読み込みます。ART でキーをどこに設定するかについては、ART クイックスタートを参照してください。
  • Weights & Biases の project。 トレーニングメトリクスの記録と、トレーニング済みアダプターの保存に使用します。詳しくは Projects を参照してください。
  • 報酬関数。 エージェントの出力をスコアリングする関数です。Serverless RL は、この関数が報酬を与える挙動に向けてトレーニングを行うため、この関数がタスクそのものを定義することになります。作成方法は ART クイックスタートで説明されています。
  • ART フレームワーク。 API を直接呼び出さずに ART を使用する場合に必要です。ART クイックスタートのインストール手順に従ってください。
また、利用に関する情報と制限でコストと制約を確認したうえで、利用可能なモデルからベースモデルを選択してください。

エージェントをトレーニングする

ART は Serverless Training API をラップし、ロールアウト、報酬、チェックポイントを自動的に管理します。まずは ART から始めることをおすすめします。ART クイックスタートの手順に沿って進めるか、2048 をプレイするエージェントをエンドツーエンドでトレーニングするサンプルノートブックを開いてください。

トレーニング済みモデルを使用する

モデルをトレーニングすると、そのモデルは自動的に推論に使用できるようになります。このセクションでは、トレーニング済みモデルのエンドポイントを構成してリクエストを送信する方法を説明します。これにより、モデルをアプリケーションや評価ワークフローに統合できます。Serverless SFT でトレーニングしたモデルにも同じ手順が適用されます。 トレーニング済みモデルにリクエストを送信するには、以下が必要です。
  • APIキー。Forge の Settings で作成できます。
  • Serverless Training API のベース URL (https://forge.coreweave.com/api/training/v1/) 。
  • モデルのエンドポイント。
モデルのエンドポイントは次の形式です。
スキーマは次の要素で構成されます。
  • entity (チーム名)
  • モデルに関連付けられた project の名前
  • トレーニング済みモデルの名前
  • デプロイするモデルのトレーニングステップ。通常は、評価でモデルの性能が最も高かったステップを指定します。
たとえば、チーム名が email-specialists、project 名が mail-search、トレーニング済みモデルの名前が agent-001 で、ステップ 25 のモデルをデプロイする場合、エンドポイントは次のようになります。
エンドポイントを取得したら、通常の推論ワークフローに統合できます。以下の例では、cURL リクエストまたは Python OpenAI SDK を使用して、トレーニング済みモデルに推論リクエストを送信する方法を紹介します。ご利用の環境に合った例を選んでください。

cURL

OpenAI SDK

ストレージを節約するには、不要になったチェックポイントを削除してください。詳しくは、利用に関する情報と制限を参照してください。
最終更新日 2026年9月30日