- Serverless RL: 強化学習でモデルのポストトレーニングを行い、新しい動作を習得させるとともに、マルチターンのエージェント型タスクにおける信頼性、速度、コストを改善します。ユーザーは、エージェントの出力をスコアリングする報酬関数を定義します。Serverless RL はワークフローを推論フェーズとトレーニング フェーズに分割し、複数のジョブ間で多重化することで、GPU 使用率を高め、トレーニングにかかる時間とコストを削減します。
- Serverless SFT: 厳選した入力と出力のサンプルを使用し、教師あり学習でモデルをファインチューニングします。SFT は、蒸留、出力のスタイルや形式の習得、RL 適用前のモデルのウォームアップなどに使用します。
各手法の使い分け
Serverless RL は、結果の良し悪しは判断できても、理想的な回答を事前に書き出せないタスクに適しています。たとえば、次のようなタスクです。- 音声エージェント
- ディープリサーチアシスタント
- オンプレミスのモデル
- コンテンツマーケティング分析エージェント
- 蒸留: より大規模で高性能なモデルの知識を、より小規模で高速なモデルに転移します。
- 出力のスタイルと形式の学習: 特定の応答形式、トーン、構造に従うようにモデルをトレーニングします。
- RL 前のウォームアップ: 強化学習でモデルを改良する前に、教師ありの例をモデルに与えます。
Serverless Training を選ぶ理由
- トレーニングコストの削減: Serverless Training は共有インフラストラクチャーを多数のユーザーで多重化して利用し、ジョブごとのセットアップ処理を省略します。さらに、トレーニングを行っていないときは GPU コストがゼロになります。これにより、トレーニングコストを大幅に削減できます。
- トレーニング時間の短縮: Serverless Training は推論リクエストを多数の GPU に分散し、必要になった時点ですぐにトレーニング インフラストラクチャーをプロビジョニングします。そのため、ジョブが早く完了し、イテレーションを高速に回せます。
- 自動デプロイメント: Serverless Training はトレーニングしたすべてのチェックポイントをデプロイするため、ホスティング用のインフラストラクチャーを設定する必要はありません。トレーニング済みのモデルには、ローカル、ステージング、本番のいずれの環境からでもすぐにアクセスしてテストできます。
Serverless Training での Forge サービスの活用方法
Serverless Training は、以下の Forge コンポーネントを組み合わせて構成されています。- Serverless Inference: トレーニング済みのすべてのチェックポイントを含め、モデルを実行します。
- Weights & Biases: LoRA アダプターのトレーニング中にパフォーマンスメトリクスをトラッキングします。
- Artifacts: LoRA アダプターを保存し、バージョン管理します。
- Weave (オプション): トレーニングループの各ステップにおけるモデルの応答を表示します。
- OpenPipe RULER と Weave Scorer を使用して Qwen モデルをトレーニングする。
- Weights & Biases でトレーニングの進捗をトラッキングし、カスタムプロットを作成する。
- Weave Leaderboard で最終結果を評価する。
Serverless RL と Serverless SFT は現在パブリックプレビュー中です。プレビュー期間中は、推論の使用量とアーティファクトのストレージに対してのみ課金され、アダプターのトレーニングは無料です。詳しくは、利用に関する情報と制限を参照してください。
次のステップ
- 利用可能なモデルを確認します。
- Serverless SFT を使用するまたはServerless RL を使用するの手順に従います。どちらのガイドも、前提条件として Forge アカウント、APIキー、project の準備から始まります。
- エンドポイントの詳細は、Serverless Training API リファレンスで確認できます。