> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Serverless Trainingについて

> Serverless RL と Serverless SFT を使用して、マネージドなサーバーレス インフラストラクチャー上で LLM のポストトレーニングとファインチューニングを行います。

Serverless RL と Serverless SFT を使用すると、マネージドなサーバーレス インフラストラクチャー上で LLM のポストトレーニングとファインチューニングを行えます。CoreWeave 上のトレーニング インフラストラクチャーは Forge がプロビジョニングするため、環境の設定方法は自由に選択できます。数十基の GPU まで自動スケーリングするマネージド トレーニング クラスターをすぐに利用できます。Serverless Training は現在パブリック プレビュー段階です。

Serverless Trainingには 2 つの手法があります。

* **[Serverless RL](/ja/products/post-training/serverless-training/rl)**: 強化学習でモデルのポストトレーニングを行い、新しい動作を習得させるとともに、マルチターンのエージェント型タスクにおける信頼性、速度、コストを改善します。ユーザーは、エージェントの出力をスコアリングする報酬関数を定義します。Serverless RL はワークフローを推論フェーズとトレーニング フェーズに分割し、複数のジョブ間で多重化することで、GPU 使用率を高め、トレーニングにかかる時間とコストを削減します。
* **[Serverless SFT](/ja/products/post-training/serverless-training/sft)**: 厳選した入力と出力のサンプルを使用し、教師あり学習でモデルをファインチューニングします。SFT は、蒸留、出力のスタイルや形式の習得、RL 適用前のモデルのウォームアップなどに使用します。

どちらの手法でも、ベースモデルをタスク向けに特化させる低ランク アダプター (LoRA アダプター) をトレーニングします。トレーニングした LoRA アダプターは、Forge によって Weights & Biases アカウントにアーティファクトとして保存されます。バックアップ用にローカルやサードパーティーに保存することもできます。[Serverless Inference](/ja/products/inference/serverless) はトレーニングしたすべてのチェックポイントを自動的にホストするため、トレーニングステップが完了するとすぐに、トレーニング済みモデルにリクエストを送信できます。

<h2 id="when-to-use-each-method">
  各手法の使い分け
</h2>

Serverless RL は、結果の良し悪しは判断できても、理想的な回答を事前に書き出せないタスクに適しています。たとえば、次のようなタスクです。

* 音声エージェント
* ディープリサーチアシスタント
* オンプレミスのモデル
* コンテンツマーケティング分析エージェント

Serverless SFT は、目的とする動作の例がすでにある、または作成できるタスクに適しています。

* **蒸留**: より大規模で高性能なモデルの知識を、より小規模で高速なモデルに転移します。
* **出力のスタイルと形式の学習**: 特定の応答形式、トーン、構造に従うようにモデルをトレーニングします。
* **RL 前のウォームアップ**: 強化学習でモデルを改良する前に、教師ありの例をモデルに与えます。

<h2 id="why-serverless-training">
  Serverless Training を選ぶ理由
</h2>

* **トレーニングコストの削減**: Serverless Training は共有インフラストラクチャーを多数のユーザーで多重化して利用し、ジョブごとのセットアップ処理を省略します。さらに、トレーニングを行っていないときは GPU コストがゼロになります。これにより、トレーニングコストを大幅に削減できます。
* **トレーニング時間の短縮**: Serverless Training は推論リクエストを多数の GPU に分散し、必要になった時点ですぐにトレーニング インフラストラクチャーをプロビジョニングします。そのため、ジョブが早く完了し、イテレーションを高速に回せます。
* **自動デプロイメント**: Serverless Training はトレーニングしたすべてのチェックポイントをデプロイするため、ホスティング用のインフラストラクチャーを設定する必要はありません。トレーニング済みのモデルには、ローカル、ステージング、本番のいずれの環境からでもすぐにアクセスしてテストできます。

<h2 id="how-serverless-training-uses-forge-services">
  Serverless Training での Forge サービスの活用方法
</h2>

Serverless Training は、以下の Forge コンポーネントを組み合わせて構成されています。

* [Serverless Inference](/ja/products/inference/serverless): トレーニング済みのすべてのチェックポイントを含め、モデルを実行します。
* [Weights & Biases](/ja/products/wandb): LoRA アダプターのトレーニング中にパフォーマンスメトリクスをトラッキングします。
* [Artifacts](/ja/products/wandb/artifacts): LoRA アダプターを保存し、バージョン管理します。
* [Weave](/ja/products/wandb/weave) (オプション): トレーニングループの各ステップにおけるモデルの応答を表示します。

[公開デモ workspace](https://forge.coreweave.com/wandb/wandb/demo-project-qwen-email-agent-with-art-weave-models/workspace) では、以下の内容を確認できます。

* OpenPipe RULER と [Weave Scorer](/ja/products/wandb/weave/guides/evaluation/scorers#create-your-own-scorers) を使用して Qwen モデルをトレーニングする。
* Weights & Biases でトレーニングの進捗をトラッキングし、[カスタムプロットを作成する](/ja/products/wandb/app/features/custom-charts)。
* [Weave Leaderboard](/ja/products/wandb/weave/cookbooks/leaderboard_quickstart#leaderboard-quickstart) で最終結果を評価する。

<Note>
  Serverless RL と Serverless SFT は現在パブリックプレビュー中です。プレビュー期間中は、推論の使用量とアーティファクトのストレージに対してのみ課金され、アダプターのトレーニングは無料です。詳しくは、[利用に関する情報と制限](/ja/products/post-training/serverless-training/usage-limits)を参照してください。
</Note>

<h2 id="next-steps">
  次のステップ
</h2>

1. [利用可能なモデル](/ja/products/post-training/serverless-training/available-models)を確認します。
2. [Serverless SFT を使用する](/ja/products/post-training/serverless-training/sft)または[Serverless RL を使用する](/ja/products/post-training/serverless-training/rl)の手順に従います。どちらのガイドも、前提条件として Forge アカウント、APIキー、project の準備から始まります。
3. エンドポイントの詳細は、[Serverless Training API リファレンス](/ja/products/post-training/serverless-training/api-reference)で確認できます。


## Related topics

- [Post-training](/ja/products/post-training.md)
