Skip to main content
Serverless RL と Serverless SFT を使用すると、マネージドなサーバーレス インフラストラクチャー上で LLM のポストトレーニングとファインチューニングを行えます。CoreWeave 上のトレーニング インフラストラクチャーは Forge がプロビジョニングするため、環境の設定方法は自由に選択できます。数十基の GPU まで自動スケーリングするマネージド トレーニング クラスターをすぐに利用できます。Serverless Training は現在パブリック プレビュー段階です。 Serverless Trainingには 2 つの手法があります。
  • Serverless RL: 強化学習でモデルのポストトレーニングを行い、新しい動作を習得させるとともに、マルチターンのエージェント型タスクにおける信頼性、速度、コストを改善します。ユーザーは、エージェントの出力をスコアリングする報酬関数を定義します。Serverless RL はワークフローを推論フェーズとトレーニング フェーズに分割し、複数のジョブ間で多重化することで、GPU 使用率を高め、トレーニングにかかる時間とコストを削減します。
  • Serverless SFT: 厳選した入力と出力のサンプルを使用し、教師あり学習でモデルをファインチューニングします。SFT は、蒸留、出力のスタイルや形式の習得、RL 適用前のモデルのウォームアップなどに使用します。
どちらの手法でも、ベースモデルをタスク向けに特化させる低ランク アダプター (LoRA アダプター) をトレーニングします。トレーニングした LoRA アダプターは、Forge によって Weights & Biases アカウントにアーティファクトとして保存されます。バックアップ用にローカルやサードパーティーに保存することもできます。Serverless Inference はトレーニングしたすべてのチェックポイントを自動的にホストするため、トレーニングステップが完了するとすぐに、トレーニング済みモデルにリクエストを送信できます。

各手法の使い分け

Serverless RL は、結果の良し悪しは判断できても、理想的な回答を事前に書き出せないタスクに適しています。たとえば、次のようなタスクです。
  • 音声エージェント
  • ディープリサーチアシスタント
  • オンプレミスのモデル
  • コンテンツマーケティング分析エージェント
Serverless SFT は、目的とする動作の例がすでにある、または作成できるタスクに適しています。
  • 蒸留: より大規模で高性能なモデルの知識を、より小規模で高速なモデルに転移します。
  • 出力のスタイルと形式の学習: 特定の応答形式、トーン、構造に従うようにモデルをトレーニングします。
  • RL 前のウォームアップ: 強化学習でモデルを改良する前に、教師ありの例をモデルに与えます。

Serverless Training を選ぶ理由

  • トレーニングコストの削減: Serverless Training は共有インフラストラクチャーを多数のユーザーで多重化して利用し、ジョブごとのセットアップ処理を省略します。さらに、トレーニングを行っていないときは GPU コストがゼロになります。これにより、トレーニングコストを大幅に削減できます。
  • トレーニング時間の短縮: Serverless Training は推論リクエストを多数の GPU に分散し、必要になった時点ですぐにトレーニング インフラストラクチャーをプロビジョニングします。そのため、ジョブが早く完了し、イテレーションを高速に回せます。
  • 自動デプロイメント: Serverless Training はトレーニングしたすべてのチェックポイントをデプロイするため、ホスティング用のインフラストラクチャーを設定する必要はありません。トレーニング済みのモデルには、ローカル、ステージング、本番のいずれの環境からでもすぐにアクセスしてテストできます。

Serverless Training での Forge サービスの活用方法

Serverless Training は、以下の Forge コンポーネントを組み合わせて構成されています。
  • Serverless Inference: トレーニング済みのすべてのチェックポイントを含め、モデルを実行します。
  • Weights & Biases: LoRA アダプターのトレーニング中にパフォーマンスメトリクスをトラッキングします。
  • Artifacts: LoRA アダプターを保存し、バージョン管理します。
  • Weave (オプション): トレーニングループの各ステップにおけるモデルの応答を表示します。
公開デモ workspace では、以下の内容を確認できます。
Serverless RL と Serverless SFT は現在パブリックプレビュー中です。プレビュー期間中は、推論の使用量とアーティファクトのストレージに対してのみ課金され、アダプターのトレーニングは無料です。詳しくは、利用に関する情報と制限を参照してください。

次のステップ

  1. 利用可能なモデルを確認します。
  2. Serverless SFT を使用するまたはServerless RL を使用するの手順に従います。どちらのガイドも、前提条件として Forge アカウント、APIキー、project の準備から始まります。
  3. エンドポイントの詳細は、Serverless Training API リファレンスで確認できます。
最終更新日 2026年9月30日