Skip to main content
このクイックスタートでは、project にすでに記録されているトレースからデータセットを構築する方法を説明します。完成したデータセットは、再ラベル付け、ファインチューニング、評価に使用するトレーニング行とテスト行で構成されます。
開始する前に、代表的なトラフィックを project に送信しておいてください。UI では、その project 自体のトレースからデータセットを構築します。project の外部でログされた W&B Weave の Call からデータセットを構築するには、Datasets で説明している API ソースを使用してください。手元にある JSONL ファイルからデータセットを構築する場合は、データセットをアップロードするを参照してください。
1

project を開く

改善したい project を選択し、Datasets を開いて、New Dataset を選択します。
2

データセットに名前を付ける

Dataset name では、自動生成された名前をそのまま使用するか、任意の名前を入力します。データセットは、W&B Weave でこの project にログされたトレースの自己完結型スナップショットです。
3

ソースデータを選択する

Source data で、次のフィールドを設定します。
  • Project version: 対象のトレースを生成したプロンプトとルーティング方式を持つバージョンです。UI ではデフォルトで最新バージョンが選択されます。
  • Served by: トレーニングターゲットとして使用する応答を生成したモデルです。トレーニングデータを教師モデルの出力のみに限定するには、教師モデルを選択します。All models を選択すると、そのバージョンを提供したすべてのモデルの出力が混在し、ファインチューニング済みの生徒モデルの出力も含まれます。
  • After (UTC) と Before (UTC): トレースを選択する固定の時間ウィンドウです。UI には、直近 14 日間が固定タイムスタンプとしてプリフィルされます。
  • Maximum traces: フィルター適用後のランダムサンプルサイズです。デフォルトは 20,000、最大は 100,000 です。選択された各トレースが 1 つのデータセットエントリになります。
4

トレーニングとテストの分割を設定する

評価用に確保する行数は、Train / test split スライダーで指定します。デフォルトはトレーニング 90%、テスト 10% です。各トレースは丸ごと 1 つの分割に割り当てられるため、トレーニングデータとほぼ重複する行が評価に紛れ込むことはありません。
5

作成して確認する

Create Dataset を選択し、ステータスが Ready になるまで待ちます。トレーニング行とテスト行をいくつか確認してメッセージと出力が正確に取り込まれているかをチェックし、トレーニング前に使用できないエントリを削除します。
これで、データセットを再ラベル付け、ファインチューニング、評価に使用できるようになりました。
ワークフローを再実行しても同じソースウィンドウを対象とするように、固定タイムスタンプを使用してください。filters オブジェクトは UI の Source data フィールドに対応します。task_version は project のバージョン、resolved_provider と resolved_model の組み合わせは Served by のモデルに相当します。すべてのモデルを含めるには、これら 2 つのキーを省略します。
応答にはデータセット ID が含まれます。status が ready になるまでデータセットリソースをポーリングしてください。詳細については、データセットを作成するを参照してください。
最終更新日 2026年9月30日