> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 평가 빠른 시작

> 레퍼런스 출력과 하나 이상의 후보 모델을 head-to-head 방식으로 비교 평가합니다.

정확한 텍스트 일치로 판단하기에는 기준이 지나치게 엄격한 개방형 작업이라면 head-to-head 평가로 시작하는 것이 가장 좋습니다.

<Note>
  시작하기 전에 검증 행이 포함된 데이터셋을 만들고, 비교하려는 모든 파인튜닝 모델 또는 공급자 모델을 추가하세요.
</Note>

<Steps>
  <Step title="데이터셋의 Evaluate 탭 열기">
    **New evaluation**을 선택하고 **Head to Head**를 고른 다음, 평가 내용을 알 수 있는 이름을 지정하세요.
  </Step>

  <Step title="레퍼런스 선택">
    원본 또는 재레이블링된 데이터셋 출력을 기본 참가자로 선택하세요. 후보 모델은 이 기대 동작을 기준으로 점수가 매겨집니다.
  </Step>

  <Step title="후보 모델 추가">
    먼저 데이터셋의 파인튜닝 모델을 추가한 다음, 비교하려는 기본 모델이나 공급자 모델을 추가하세요. 선택기에서 파인튜닝 모델은 기본 모델별로 묶여 표시됩니다.
  </Step>

  <Step title="평가자 설정">
    성능이 충분한 평가 모델을 선택하고, 이 작업에서 어떤 답변이 더 나은지 정의하는 지침을 작성하세요. 검증 행이 충분하다면 200개로 시작하세요.
  </Step>

  <Step title="실행 및 검토">
    평가를 시작하세요. 행이 완료될 때마다 점수가 업데이트됩니다. 개별 행을 열어 평가자의 설명을 확인하고, 실패 표시기로 공급자 오류나 파싱 오류를 검토하세요.
  </Step>

  <Step title="배포 여부 결정">
    점수 50%는 레퍼런스와 동등한 수준이라는 뜻입니다. 승리는 1, 무승부는 0.5, 패배는 0으로 계산됩니다. 최종 점수와 행별 동작이 기준값을 충족할 때만 승격하세요.
  </Step>
</Steps>

실패한 케이스는 최대 3회까지 자동으로 재시도됩니다. run이 안정화된 후 **Retry failed cases**를 사용하면 실패한 케이스만 다시 큐에 넣고 완료된 결과는 그대로 유지됩니다.

<Accordion title="API: 평가 생성 (POST /evals)">
  첫 번째 참가자가 기본 참가자입니다. 후보 모델 레퍼런스를 평가하려는 아티팩트 또는 공급자 모델로 바꾸세요.

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/evals" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team" \
    --header "Content-Type: application/json" \
    --data "{
      \"name\": \"ticket-classifier-comparison\",
      \"dataset_id\": \"$DATASET_ID\",
      \"spec\": {
        \"type\": \"h2h_judge\",
        \"judge_model_ref\": \"openai/gpt-5.6-sol\",
        \"judge_prompt\": \"Choose the more correct and helpful answer. Return a tie when they are equally good.\"
      },
      \"participants\": [
        {\"kind\": \"original\"},
        {\"kind\": \"model\", \"model_ref\": \"wandb-inference/your-fine-tuned-model\"}
      ],
      \"sample_size\": 200
    }"
  ```

  응답에는 평가 ID가 포함됩니다. 평가가 안정화될 때까지 `GET /evals/{evalId}`를 폴링하세요. 자세한 내용은 [평가 생성](/ko/model-distillation/reference/management/evaluations/create-an-evaluation)을 참조하세요.
</Accordion>
