1
프로젝트 열기
개선하려는 프로젝트를 선택하고 Datasets를 연 다음 New Dataset을 선택하세요.
2
데이터셋 이름 지정
Dataset name에서 자동 생성된 이름을 그대로 사용하거나 원하는 이름을 입력하세요. 데이터셋은 W&B Weave에서 이 프로젝트에 로깅된 트레이스의 독립적인 스냅샷입니다.
3
소스 데이터 선택
Source data에서 다음 필드를 설정하세요.
- Project version: 원하는 트레이스를 생성한 프롬프트 및 라우팅 방식이 적용된 버전입니다. 기본적으로 최신 버전이 선택됩니다.
- Served by: 응답을 트레이닝 타깃으로 사용할 모델입니다. 트레이닝 데이터를 교사 모델의 출력으로만 구성하려면 교사 모델을 선택하세요. All models를 선택하면 해당 버전을 서빙한 모든 모델의 출력이 섞이며, 여기에는 파인튜닝된 학생 모델도 포함됩니다.
- After (UTC) 및 Before (UTC): 트레이스를 선택할 고정 시간 윈도우입니다. 기본적으로 최근 14일이 고정 타임스탬프로 미리 입력됩니다.
- Maximum traces: 필터링 후 무작위로 추출할 샘플 크기입니다. 기본값은 20,000이고 최대값은 100,000입니다. 선택된 트레이스 하나가 데이터셋 항목 하나가 됩니다.
4
트레이닝 및 테스트 분할 설정
Train / test split 슬라이더로 평가용으로 남겨 둘 행의 수를 선택하세요. 기본값은 트레이닝 90%, 테스트 10%입니다. 각 트레이스는 통째로 하나의 분할에만 속하므로, 평가 데이터에 트레이닝 데이터와 거의 중복되는 항목이 섞이지 않습니다.
5
생성 및 검토
Create Dataset을 선택하고 상태가 Ready로 바뀔 때까지 기다리세요. 트레이닝을 시작하기 전에 트레이닝 행과 테스트 행을 몇 개 살펴보면서 메시지와 출력이 정확하게 반영되었는지 확인하고, 사용할 수 없는 항목은 삭제하세요.
API: 데이터셋 생성 (POST /tasks/{alias}/datasets)
API: 데이터셋 생성 (POST /tasks/{alias}/datasets)
워크플로를 다시 실행해도 동일한 소스 윈도우를 가리키도록 고정 타임스탬프를 사용하세요. 응답에는 데이터셋 ID가 포함됩니다.
filters 객체는 UI의 Source data 필드에 대응합니다. task_version은 프로젝트 버전이고, resolved_provider와 resolved_model은 Served by 모델에 해당합니다. 모든 모델을 포함하려면 이 두 키를 생략하세요.status가 ready가 될 때까지 데이터셋 리소스를 폴링하세요. 자세한 내용은 데이터셋 생성을 참조하세요.