Skip to main content
데이터셋은 활용 가능한 모델 상호작용을 영구적으로 보존하는 스냅샷입니다. Model Distillation은 검사와 평가를 위해 entries를 Postgres에 저장하고, 트레이닝이 시작되면 이를 immutable 아티팩트로 내보냅니다.

첫 데이터셋 만들기

source 선택부터 행 검사까지 단계별 가이드를 따라 진행해 보세요.

소스 선택

UI는 프로젝트의 트래픽으로 데이터셋을 구축합니다. API는 기존 W&B 프로젝트를 소스로 허용하거나, 업로드하는 JSONL 파일도 허용합니다. 다음 섹션에서는 이 세 가지를 모두 설명합니다.

프로젝트 트래픽

프록시가 트래픽을 기록했을 때 현재 프로젝트의 트레이스를 사용하세요. UI에서 Create Dataset 대화 상자의 Source data 섹션으로 다음 설정을 선택할 수 있습니다:
  • Project version: 트레이스를 선택하는 데 사용된 프롬프트와 라우팅 체제를 고정합니다.
  • Served by: 한 모델이 서빙한 트레이스만 유지합니다. 트레이닝 데이터를 teacher-only로 유지하려면 teacher를 선택하세요. All models은 버전에 서빙한 모든 모델의 출력을 혼합합니다.
  • After (UTC) 및 Before (UTC): 고정된 시간 윈도우입니다. UI는 마지막 14일을 고정된 타임스탬프로 미리 채웁니다.
  • Maximum traces: 필터링 후 무작위 샘플 크기입니다. 기본값은 20,000이고 최대값은 100,000입니다.
API를 통해 filters는 스칼라 트레이스 메타데이터도 허용합니다. 프로젝트 소스 읽기는 프로젝트에 귀속된 에이전트 span을 사용하고 정확한 공급자 형태의 Chat Completion 요청과 응답을 재구성합니다.

기존 W&B 프로젝트

Model Distillation 프로젝트 ID가 없는 호환 가능한 Weave Call 중 직접 로깅한 Call을 임포트하려면, API request에서 source를 string "task" 대신 entity와 project가 포함된 객체로 설정하세요. 이 소스는 UI 대화 상자에서는 사용할 수 없습니다.

업로드한 파일

W&B에 로깅된 적이 없는 예시를 가져오려면 API를 통해 JSONL 파일을 업로드하세요. Model Distillation이 행을 검증하고 데이터셋을 자동으로 생성합니다. 자세한 내용은 데이터셋 업로드를 참조하세요.

Sampling and split

어떤 소스를 선택하든, 다음 설정은 데이터셋에 포함된 행 수와 해당 행이 트레이닝과 테스트로 어떻게 나뉘는지 제어합니다.
  • 최대 트레이스는 필터링 후 무작위 샘플을 제한합니다.
  • 트레이닝 / 테스트 분할은 평가 및 모델 비교를 위해 테스트 행을 예약합니다. 나머지 행은 트레이닝 데이터입니다. 기본값은 트레이닝 90%, 테스트 10%입니다.
분할 할당은 결정론적이며 시나리오, 에이전트 run, 대화 또는 트레이스별로 그룹화됩니다. 관련 예시는 트레이닝과 테스트 간에 누출되지 않으며, Model Distillation은 입력을 자동으로 중복 제거합니다.
고정된 날짜 범위를 사용하세요. 이동하는 윈도우는 동일한 데이터셋 설정이 나중에 다른 트레이닝 데이터를 생성하게 만듭니다.

행 검사 및 필터링

데이터셋 워크벤치에는 메시지, original 출력, 재라벨링된 출력, comparison-model 출력, 토큰 추정치, split, 행별 evaluation 결과가 표시됩니다. 필터는 다음 기준을 지원합니다:
  • input 또는 original 출력의 텍스트
  • train 또는 test split
  • 재라벨링 status
  • evaluation이 적용되었는지 여부
트레이닝 전에 유효하지 않은 entries를 삭제하세요. 행을 삭제해도 source trace는 변경되지 않습니다.

새 트래픽 추가

데이터셋을 점진적으로 확장하려면 이후 시점의 고정 범위를 지정하고 Append를 사용하세요. Model Distillation은 트레이스와 턴을 기준으로 중복 항목을 제거합니다. 데이터를 추가하면 데이터셋 리비전이 올라가며, 기존 재라벨링 또는 평가 결과의 적용 범위가 더 이상 일치하지 않으면 해당 결과는 오래된(stale) 상태가 됩니다.

제외되는 항목

에러가 발생한 트레이스, 불완전한 스트림, 유효하지 않은 Chat Completion 형태, 그리고 fidelity mapping이 불완전한 트레이스는 트레이닝 대상이 아닙니다.

데이터셋 삭제

데이터셋은 UI 또는 API를 통해 삭제할 수 있습니다. 데이터셋에 종속된 파인튜닝 모델이나 평가가 있으면 종속 항목과 함께 삭제할 수는 있지만, 데이터셋만 단독으로 삭제할 수는 없습니다. 대기 중이거나 실행 중인 파인튜닝, 라우팅이 활성화된 모델, 진행 중인 평가가 있으면 이들이 완료되거나 제거될 때까지 삭제할 수 없습니다. 진행 중인 임포트 또는 재라벨링 run은 삭제를 막지 않습니다. 해당 run은 다음 배치에서 중지되며, Model Distillation은 삭제가 시작된 후 도착하는 결과를 모두 폐기합니다.
데이터셋을 종속 항목과 함께 삭제하면 종속된 파인튜닝 모델의 트레이닝 아티팩트와 해당 모델을 사용하는 모든 결과도 함께 삭제됩니다.
UI에서 데이터셋을 삭제하려면 다음 단계를 따르세요.
  1. 데이터셋의 Settings를 열고 Delete dataset을 선택하세요.
  2. 데이터셋에 종속 항목이 있으면 Also delete the dependent fine-tunes and affected evaluations를 선택하고 표시된 영향 범위를 검토하세요.
  3. 데이터셋 이름을 입력하여 삭제를 확인하세요.
  4. 데이터셋에 종속 항목이 있으면 Delete Dataset and Dependents를, 그렇지 않으면 Delete Dataset을 선택하세요.
확인하면 삭제가 백그라운드에서 실행됩니다. 실제 삭제 작업이 시작되기 전에 실패하면 데이터셋을 다시 사용할 수 있습니다. 그 이후에 실패하면 재시도가 성공할 때까지 데이터셋이 잠긴 상태로 유지됩니다. 재시도하려면 삭제를 다시 확인하세요. 재시도는 최초 요청에 기록된 범위 내에서만 수행됩니다.
삭제는 한 번의 요청으로 이루어지며, 종속 항목과 차단 요인은 서버가 직접 확인합니다. 서버가 요청을 수락하는 시점에 존재하는 종속 파인튜닝 모델과 영향을 받는 평가도 함께 삭제하려면 cascade=true를 설정하세요. 이 설정이 없으면 종속 항목이 있는 데이터셋에 대해 유형이 dataset_in_use인 409 Conflict가 반환됩니다. 다음 요청은 데이터셋을 종속 항목과 함께 삭제합니다.
요청은 삭제 오퍼레이션과 그 상태를 포함한 202 Accepted를 반환합니다. 오퍼레이션이 대기 중, 실행 중 또는 완료 상태인 동안 요청을 반복하면 동일한 오퍼레이션이 반환됩니다. 반복 요청은 실패한 정리 작업도 최초 요청에 기록된 범위 내에서 재시도합니다. 데이터셋이 이미 삭제되었고 오퍼레이션도 없으면 요청은 204 No Content를 반환하며, 해당 데이터셋에 대한 GET은 404 Not Found를 반환합니다.삭제하기 전에 종속 항목과 차단 요인을 미리 확인하려면 GET /tasks/{alias}/datasets/{datasetId}/deletion-plan을 호출하세요. 미리 보기는 참고용이며, 실행 중인 삭제의 상태도 함께 알려 줍니다. 레퍼런스 세부 정보는 데이터셋 삭제 및 데이터셋 삭제 미리 보기를 참조하세요.
에이전트는 재라벨링, 트레이닝 또는 평가를 시작하기 전에 준비된 데이터셋 ID를 조회할 수 있습니다.
데이터를 생성하거나 추가하려면 Datasets 퀵스타트에 있는 요청 예시를 복사해 사용하세요. 이 오퍼레이션의 레퍼런스 세부 정보는 데이터셋 목록 조회를 참조하세요.
마지막 수정일 2026년 9월 30일