最初のデータセットを作成する
ソース選択から行の検査までのステップバイステップガイドに従ってください。
ソースを選択する
UI では、その project 自体のトラフィックからデータセットを作成します。API では、既存の W&B プロジェクトや、アップロードした JSONL ファイルもソースとして受け入れます。以下のセクションでは、これら 3 種類のソースについて説明します。project のトラフィック
プロキシがトラフィックを記録した場合は、現在の project のトレースを使用します。UI では、Create Dataset ダイアログの Source data セクションで次の設定を選択できます。- Project version: トレースの選択に使用するプロンプトとルーティング方式を固定します。
- Served by: 1 つのモデルが処理したトレースのみを保持します。トレーニングデータを教師モデルのみに限定するには、教師モデルを選択します。All models は、そのバージョンを処理したすべてのモデルの出力を混在させます。
- After (UTC) と Before (UTC): 固定の時間ウィンドウです。UI では、直近 14 日間が固定のタイムスタンプとしてあらかじめ入力されます。
- 最大トレース数: フィルター適用後のランダムサンプル数です。デフォルトは 20,000、最大は 100,000 です。
filters はスカラー値のトレースメタデータも受け入れます。project をソースとする読み取りでは、project に紐づけられたエージェント スパンを使用し、プロバイダーの形式に従ったチャット補完のリクエストと応答を正確に再構築します。
既存の W&B プロジェクト
Model Distillation の project アイデンティティを持たない、互換性のある Weave Call (自分でログしたもの) をインポートするには、API リクエストのsource に文字列 "task" ではなく、entity と project を含むオブジェクトを指定します。このソースは UI ダイアログでは選択できません。
アップロードしたファイル
W&B にログされていないサンプルを取り込むには、API を通じて JSONL ファイルをアップロードします。Model Distillation が行を検証し、データセットを作成します。データセットのアップロードを参照してください。サンプリングと分割
- 最大トレース数 は、フィルタリング後に取得するランダムサンプル数の上限を設定します。
- Train / test split は、評価とモデル比較のためにテスト用の行を確保します。残りの行はトレーニングデータになります。デフォルトはトレーニング用が90%、テスト用が10%です。
固定の日付範囲を使用してください。移動ウィンドウを使用すると、同じデータセット構成でも、後で異なるトレーニングデータが生成されます。
行を確認してフィルターする
データセットワークベンチには、メッセージ、元の出力、リラベル後の出力、比較モデルの出力、推定トークン数、分割、行ごとの評価結果が表示されます。フィルターでは次の条件を指定できます。- 入力または元の出力に含まれるテキスト
- トレーニングまたはテストの分割
- リラベルのステータス
- 評価が適用されているかどうか
新しいトラフィックを追加する
除外されるもの
エラーが発生したトレース、不完全なストリーム、無効なチャット補完の構造、および忠実度のマッピングが不完全なトレースは、トレーニングの対象になりません。データセットを削除する
データセットは UI または API から削除できます。ファインチューンや評価がデータセットに依存している場合、依存する項目と一緒に削除できますが、データセットだけを削除することはできません。 キュー内または実行中のファインチューン、ルーティングが有効なモデル、実行中の評価がある場合、それらが完了するか削除されるまで、データセットは削除できません。進行中のインポートやリラベル run は削除を妨げません。これらは次のバッチで停止し、Model Distillation は削除開始後に届いた結果をすべて破棄します。 UI でデータセットを削除するには、次の手順に従ってください。- データセットの Settings を開き、Delete dataset を選択します。
- データセットに依存する項目がある場合は、Also delete the dependent fine-tunes and affected evaluations を選択し、表示された影響を確認します。
- 確認のため、データセット名を入力します。
- データセットに依存する項目がある場合は、Delete Dataset and Dependents を選択します。それ以外の場合は、Delete Dataset を選択します。
API: データセットを削除する (DELETE /tasks/{alias}/datasets/{datasetId})
API: データセットを削除する (DELETE /tasks/{alias}/datasets/{datasetId})
削除には 1 回のリクエストが必要で、サーバーが依存する項目と削除を妨げる項目を判断します。サーバーがリクエストを受け入れた時点で存在する、依存するファインチューンと影響を受ける評価も削除するには、リクエストは、削除操作とそのステータスを含む
cascade=true を設定します。この設定がない場合、依存する項目があるデータセットは、タイプ dataset_in_use の 409 Conflict を返します。次のリクエストは、データセットを依存する項目と一緒に削除します。202 Accepted を返します。リクエストを繰り返すと、その操作がキュー内、実行中、または完了済みである間は、同じ操作が返されます。繰り返されたリクエストは、元のリクエストで記録された範囲内で、失敗したクリーンアップも再試行します。データセットがすでに存在せず、操作も存在しない場合、リクエストは 204 No Content を返し、データセットに対する GET は 404 Not Found を返します。削除前に依存する項目と削除を妨げる項目を確認するには、GET /tasks/{alias}/datasets/{datasetId}/deletion-plan を呼び出します。このプレビューは情報提供を目的としており、実行中の削除のステータスも示します。リファレンスの詳細については、データセットを削除するとデータセットの削除をプレビューするを参照してください。API: project のデータセットを一覧表示する (GET /tasks/{alias}/datasets)
API: project のデータセットを一覧表示する (GET /tasks/{alias}/datasets)
エージェントは、再ラベル付け、トレーニング、評価を開始する前に、準備完了のデータセット ID を取得できます。データを作成または追加するには、データセットのクイックスタートにあるコピー可能なリクエストに従ってください。この操作のリファレンスの詳細については、データセットを一覧表示するを参照してください。