> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Datasets クイックスタート

> project のトラフィックから再現可能なデータセットを作成し、そのトレーニング行とテスト行を確認します。

このクイックスタートでは、project にすでに記録されているトレースからデータセットを構築する方法を説明します。完成したデータセットは、再ラベル付け、ファインチューニング、評価に使用するトレーニング行とテスト行で構成されます。

<Note>
  開始する前に、代表的なトラフィックを project に送信しておいてください。UI では、その project 自体のトレースからデータセットを構築します。project の外部でログされた W\&B Weave の Call からデータセットを構築するには、[Datasets](/ja/model-distillation/studio/datasets#choose-a-source) で説明している API ソースを使用してください。手元にある JSONL ファイルからデータセットを構築する場合は、[データセットをアップロードする](/ja/model-distillation/studio/datasets-upload)を参照してください。
</Note>

<Steps>
  <Step title="project を開く">
    改善したい project を選択し、**Datasets** を開いて、**New Dataset** を選択します。
  </Step>

  <Step title="データセットに名前を付ける">
    **Dataset name** では、自動生成された名前をそのまま使用するか、任意の名前を入力します。データセットは、W\&B Weave でこの project にログされたトレースの自己完結型スナップショットです。
  </Step>

  <Step title="ソースデータを選択する">
    **Source data** で、次のフィールドを設定します。

    * **Project version:** 対象のトレースを生成したプロンプトとルーティング方式を持つバージョンです。UI ではデフォルトで最新バージョンが選択されます。
    * **Served by:** トレーニングターゲットとして使用する応答を生成したモデルです。トレーニングデータを教師モデルの出力のみに限定するには、教師モデルを選択します。**All models** を選択すると、そのバージョンを提供したすべてのモデルの出力が混在し、ファインチューニング済みの生徒モデルの出力も含まれます。
    * **After (UTC)** と **Before (UTC):** トレースを選択する固定の時間ウィンドウです。UI には、直近 14 日間が固定タイムスタンプとしてプリフィルされます。
    * **Maximum traces:** フィルター適用後のランダムサンプルサイズです。デフォルトは 20,000、最大は 100,000 です。選択された各トレースが 1 つのデータセットエントリになります。
  </Step>

  <Step title="トレーニングとテストの分割を設定する">
    評価用に確保する行数は、**Train / test split** スライダーで指定します。デフォルトはトレーニング 90%、テスト 10% です。各トレースは丸ごと 1 つの分割に割り当てられるため、トレーニングデータとほぼ重複する行が評価に紛れ込むことはありません。
  </Step>

  <Step title="作成して確認する">
    **Create Dataset** を選択し、ステータスが **Ready** になるまで待ちます。トレーニング行とテスト行をいくつか確認してメッセージと出力が正確に取り込まれているかをチェックし、トレーニング前に使用できないエントリを削除します。
  </Step>
</Steps>

これで、データセットを[再ラベル付け](/ja/model-distillation/studio/relabeling)、[ファインチューニング](/ja/model-distillation/studio/fine-tuning-quickstart)、[評価](/ja/model-distillation/studio/evaluations-quickstart)に使用できるようになりました。

<Accordion title="API: データセットを作成する (POST /tasks/{alias}/datasets)">
  ワークフローを再実行しても同じソースウィンドウを対象とするように、固定タイムスタンプを使用してください。`filters` オブジェクトは UI の **Source data** フィールドに対応します。`task_version` は project のバージョン、`resolved_provider` と `resolved_model` の組み合わせは **Served by** のモデルに相当します。すべてのモデルを含めるには、これら 2 つのキーを省略します。

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/tasks/ticket-classifier/datasets" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team" \
    --header "Content-Type: application/json" \
    --data '{
      "name": "recent-production",
      "params": {
        "query": {
          "source": "task",
          "after": "2026-08-01T00:00:00.000Z",
          "before": "2026-09-01T00:00:00.000Z",
          "filters": {
            "task_version": 1,
            "resolved_provider": "openai",
            "resolved_model": "gpt-5.6-sol"
          }
        },
        "sampling": {"strategy": "random", "limit": 20000},
        "split": {"val": 0.1, "by": "trace"}
      }
    }'
  ```

  応答にはデータセット ID が含まれます。`status` が `ready` になるまでデータセットリソースをポーリングしてください。詳細については、[データセットを作成する](/ja/model-distillation/reference/management/datasets/create-a-dataset)を参照してください。
</Accordion>
