- データセットを構築する
project の Datasets ページを開き、保持したい動作を最もよく表すトラフィックを選択します。
トレーニングする前にサンプルを確認します。悪いサンプルを削除し、データセットがお客様が実際に遭遇する状況をカバーしていることを確認してください。
Datasets クイックスタート
UI で最初のデータセットを作成して確認します。
- 必要に応じて回答を改善する
現在のモデルの回答は、そのままトレーニングのターゲットとして使用できます。回答に一貫性がない場合や、より良い動作を学習させたい場合は、より高性能なモデルでデータセットをリラベルします。
再ラベル付けでは、元の回答を置き換えずに別の回答セットを作成するため、両方を確認して、どちらをトレーニングに使用するか選択できます。
- 複数の候補をトレーニングする
トレーニングするモデルを選択します。あるタスクに最適なモデルが必ずしも最大のモデルとは限らないため、通常は単一の run よりも小規模な sweep の方が有用です。
UI がトレーニングワークフローを処理し、トレーニングが完了したモデルを比較やデプロイメントに使用できるようにします。
ファインチューニング クイックスタート
準備完了のデータセットからトレーニング run を開始します。
- 品質の比較
評価を作成し、保持したい回答と各候補を比較します。全体のスコアと個別の例の両方を見て、モデルが改善または性能が低下する箇所を理解してください。
不完全な評価からデプロイしないでください。失敗した比較を解決し、結果がプロダクトにとって重要な動作を表していることを確認してください。
評価 クイックスタート
UI でヘッドツーヘッド比較を実行します。
- 勝者を安全にデプロイ
最適なモデルを project のルーティングに追加します。本番のカナリアテストを行いたい場合は、トラフィックの一部から開始し、信頼度が高まるにつれてその割合を増やします。
完全なロールアウト後も、以前のモデルをルーティング設定に重みゼロで保持します。これにより、新しいトラフィックを送信せずに迅速にロールバックできます。
API: エージェント ワークフロー
API: エージェント ワークフロー
エージェントにプロキシモデル名、W&B entity、希望のデータセットウィンドウ、候補のベースモデル、judge model、およびロールアウトシェアを指定します。次に、以下のコピー可能なリクエストに誘導します:各非同期リクエストが正常な終端状態に到達するまで待機するよう指示します。その後、依存するステップを開始します。