> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Datasets 퀵스타트

> 프로젝트 트래픽으로 재현 가능한 데이터셋을 만들고 트레이닝 및 테스트 행을 검토합니다.

이 퀵스타트에서는 프로젝트에 이미 기록된 트레이스로 데이터셋을 구축하는 방법을 설명합니다. 완성된 데이터셋은 재레이블링, 파인튜닝, 평가에 사용할 트레이닝 행과 테스트 행으로 구성됩니다.

<Note>
  시작하기 전에 대표성 있는 트래픽을 프로젝트로 보내세요. UI는 프로젝트 자체의 트레이스로 데이터셋을 구축합니다. 프로젝트 외부에서 로깅된 W\&B Weave Call로 데이터셋을 구축하려면 [Datasets](/ko/model-distillation/studio/datasets#choose-a-source)에 설명된 API 소스를 사용하세요. 기존 JSONL 파일로 데이터셋을 구축하려면 [데이터셋 업로드](/ko/model-distillation/studio/datasets-upload)를 참조하세요.
</Note>

<Steps>
  <Step title="프로젝트 열기">
    개선하려는 프로젝트를 선택하고 **Datasets**를 연 다음 **New Dataset**을 선택하세요.
  </Step>

  <Step title="데이터셋 이름 지정">
    **Dataset name**에서 자동 생성된 이름을 그대로 사용하거나 원하는 이름을 입력하세요. 데이터셋은 W\&B Weave에서 이 프로젝트에 로깅된 트레이스의 독립적인 스냅샷입니다.
  </Step>

  <Step title="소스 데이터 선택">
    **Source data**에서 다음 필드를 설정하세요.

    * **Project version:** 원하는 트레이스를 생성한 프롬프트 및 라우팅 방식이 적용된 버전입니다. 기본적으로 최신 버전이 선택됩니다.
    * **Served by:** 응답을 트레이닝 타깃으로 사용할 모델입니다. 트레이닝 데이터를 교사 모델의 출력으로만 구성하려면 교사 모델을 선택하세요. **All models**를 선택하면 해당 버전을 서빙한 모든 모델의 출력이 섞이며, 여기에는 파인튜닝된 학생 모델도 포함됩니다.
    * **After (UTC)** 및 **Before (UTC):** 트레이스를 선택할 고정 시간 윈도우입니다. 기본적으로 최근 14일이 고정 타임스탬프로 미리 입력됩니다.
    * **Maximum traces:** 필터링 후 무작위로 추출할 샘플 크기입니다. 기본값은 20,000이고 최대값은 100,000입니다. 선택된 트레이스 하나가 데이터셋 항목 하나가 됩니다.
  </Step>

  <Step title="트레이닝 및 테스트 분할 설정">
    **Train / test split** 슬라이더로 평가용으로 남겨 둘 행의 수를 선택하세요. 기본값은 트레이닝 90%, 테스트 10%입니다. 각 트레이스는 통째로 하나의 분할에만 속하므로, 평가 데이터에 트레이닝 데이터와 거의 중복되는 항목이 섞이지 않습니다.
  </Step>

  <Step title="생성 및 검토">
    **Create Dataset**을 선택하고 상태가 **Ready**로 바뀔 때까지 기다리세요. 트레이닝을 시작하기 전에 트레이닝 행과 테스트 행을 몇 개 살펴보면서 메시지와 출력이 정확하게 반영되었는지 확인하고, 사용할 수 없는 항목은 삭제하세요.
  </Step>
</Steps>

이제 데이터셋을 [재레이블링](/ko/model-distillation/studio/relabeling), [파인튜닝](/ko/model-distillation/studio/fine-tuning-quickstart), [평가](/ko/model-distillation/studio/evaluations-quickstart)에 사용할 수 있습니다.

<Accordion title="API: 데이터셋 생성 (POST /tasks/{alias}/datasets)">
  워크플로를 다시 실행해도 동일한 소스 윈도우를 가리키도록 고정 타임스탬프를 사용하세요. `filters` 객체는 UI의 **Source data** 필드에 대응합니다. `task_version`은 프로젝트 버전이고, `resolved_provider`와 `resolved_model`은 **Served by** 모델에 해당합니다. 모든 모델을 포함하려면 이 두 키를 생략하세요.

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/tasks/ticket-classifier/datasets" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team" \
    --header "Content-Type: application/json" \
    --data '{
      "name": "recent-production",
      "params": {
        "query": {
          "source": "task",
          "after": "2026-08-01T00:00:00.000Z",
          "before": "2026-09-01T00:00:00.000Z",
          "filters": {
            "task_version": 1,
            "resolved_provider": "openai",
            "resolved_model": "gpt-5.6-sol"
          }
        },
        "sampling": {"strategy": "random", "limit": 20000},
        "split": {"val": 0.1, "by": "trace"}
      }
    }'
  ```

  응답에는 데이터셋 ID가 포함됩니다. `status`가 `ready`가 될 때까지 데이터셋 리소스를 폴링하세요. 자세한 내용은 [데이터셋 생성](/ko/model-distillation/reference/management/datasets/create-a-dataset)을 참조하세요.
</Accordion>
