Skip to main content
이 퀵스타트에서는 프로젝트에 이미 기록된 트레이스로 데이터셋을 구축하는 방법을 설명합니다. 완성된 데이터셋은 재레이블링, 파인튜닝, 평가에 사용할 트레이닝 행과 테스트 행으로 구성됩니다.
시작하기 전에 대표성 있는 트래픽을 프로젝트로 보내세요. UI는 프로젝트 자체의 트레이스로 데이터셋을 구축합니다. 프로젝트 외부에서 로깅된 W&B Weave Call로 데이터셋을 구축하려면 Datasets에 설명된 API 소스를 사용하세요. 기존 JSONL 파일로 데이터셋을 구축하려면 데이터셋 업로드를 참조하세요.
1

프로젝트 열기

개선하려는 프로젝트를 선택하고 Datasets를 연 다음 New Dataset을 선택하세요.
2

데이터셋 이름 지정

Dataset name에서 자동 생성된 이름을 그대로 사용하거나 원하는 이름을 입력하세요. 데이터셋은 W&B Weave에서 이 프로젝트에 로깅된 트레이스의 독립적인 스냅샷입니다.
3

소스 데이터 선택

Source data에서 다음 필드를 설정하세요.
  • Project version: 원하는 트레이스를 생성한 프롬프트 및 라우팅 방식이 적용된 버전입니다. 기본적으로 최신 버전이 선택됩니다.
  • Served by: 응답을 트레이닝 타깃으로 사용할 모델입니다. 트레이닝 데이터를 교사 모델의 출력으로만 구성하려면 교사 모델을 선택하세요. All models를 선택하면 해당 버전을 서빙한 모든 모델의 출력이 섞이며, 여기에는 파인튜닝된 학생 모델도 포함됩니다.
  • After (UTC) 및 Before (UTC): 트레이스를 선택할 고정 시간 윈도우입니다. 기본적으로 최근 14일이 고정 타임스탬프로 미리 입력됩니다.
  • Maximum traces: 필터링 후 무작위로 추출할 샘플 크기입니다. 기본값은 20,000이고 최대값은 100,000입니다. 선택된 트레이스 하나가 데이터셋 항목 하나가 됩니다.
4

트레이닝 및 테스트 분할 설정

Train / test split 슬라이더로 평가용으로 남겨 둘 행의 수를 선택하세요. 기본값은 트레이닝 90%, 테스트 10%입니다. 각 트레이스는 통째로 하나의 분할에만 속하므로, 평가 데이터에 트레이닝 데이터와 거의 중복되는 항목이 섞이지 않습니다.
5

생성 및 검토

Create Dataset을 선택하고 상태가 Ready로 바뀔 때까지 기다리세요. 트레이닝을 시작하기 전에 트레이닝 행과 테스트 행을 몇 개 살펴보면서 메시지와 출력이 정확하게 반영되었는지 확인하고, 사용할 수 없는 항목은 삭제하세요.
이제 데이터셋을 재레이블링, 파인튜닝, 평가에 사용할 수 있습니다.
워크플로를 다시 실행해도 동일한 소스 윈도우를 가리키도록 고정 타임스탬프를 사용하세요. filters 객체는 UI의 Source data 필드에 대응합니다. task_version은 프로젝트 버전이고, resolved_provider와 resolved_model은 Served by 모델에 해당합니다. 모든 모델을 포함하려면 이 두 키를 생략하세요.
응답에는 데이터셋 ID가 포함됩니다. status가 ready가 될 때까지 데이터셋 리소스를 폴링하세요. 자세한 내용은 데이터셋 생성을 참조하세요.
마지막 수정일 2026년 9월 29일