Model Distillation
アプリケーションの実際のトラフィックからトレーニングデータを収集し、大規模なモデルに匹敵する小規模なモデルをトレーニングして両者を比較し、優れた方を段階的にデプロイします。
Serverless RL
強化学習でモデルをポストトレーニングし、報酬関数でスコア付けするマルチターンのタスクにおいてエージェントの性能を向上させます。
Serverless SFT
厳選した入力と出力の例でモデルをファインチューニングし、タスク、スタイル、またはフォーマットを学習させます。
サービスを選択する
- Model Distillation は、UI を備えたガイド付きのワークフローです。蒸留プロキシを介してアプリケーションを接続すると、サンプルの収集、候補モデルのトレーニングと評価、選択したモデルへのトラフィックのルーティングが行われます。すでに本番環境で LLM 機能を運用しており、より低コストで高速なモデルを求めている場合は、ここから始めてください。Model Distillation はプライベートプレビュー段階です。Forge の Post-training ページからアクセスをリクエストしてください。
- Serverless RL と Serverless SFT は、プログラムから利用します。OpenPipe ART フレームワークまたは Serverless Training API を介してコードから操作し、独自の報酬関数やデータセットを使用します。どちらもパブリックプレビュー段階です。両者の違いと共通点については、Serverless Training についてを参照してください。