> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 평가

> 고정된 검증 샘플로 출력을 비교하고, 실시간으로 갱신되는 잠정 결과를 확인하세요.

평가를 통해 후보 모델이 프로젝트에서 중요하게 여기는 동작을 그대로 유지하는지 확인할 수 있습니다. 평가는 고정된 검증 행을 사용하며, 항목과 참가자마다 하나의 영구적인 결과를 저장합니다.

<Card title="첫 번째 평가 실행하기" href="/ko/model-distillation/studio/evaluations-quickstart" arrow="true">
  head-to-head 평가자를 사용해 파인튜닝된 모델을 레퍼런스 출력과 비교해 보세요.
</Card>

<h2 id="evaluation-types">
  평가 유형
</h2>

<Accordion title="Head to Head">
  평가 모델이 각 후보 응답을 primary 출력과 비교합니다. 텍스트가 정확히 일치하는지로 판단하기에는 기준이 너무 엄격한 개방형 생성 작업에 사용하세요. 점수 = `(wins + 0.5 × ties) / completed rows`이며, 50%는 primary와 동등한 수준임을 의미합니다.
</Accordion>

<Accordion title="Exact Match">
  정규화된 assistant 출력을 결정론적으로 비교합니다. 의미가 같다면 출력도 동일해야 하는 구조화된 답변이나 이산형 답변에 사용하세요.
</Accordion>

<Accordion title="Categorization">
  불리언 필드를 조회하여 정밀도, 재현율, F1 및 혼동 행렬을 보고합니다. 읽을 수 없는 후보 출력은 정밀도와 재현율을 모두 떨어뜨리며, 읽을 수 없는 레퍼런스 출력은 건너뜁니다.
</Accordion>

<h2 id="choose-participants">
  참가자 선택
</h2>

head-to-head 평가에서는 원본 출력, 재레이블링 run, 튜닝된 모델, 공급자 모델(직접 연결)을 참가자로 사용할 수 있습니다. 첫 번째 참가자가 primary 참가자가 됩니다. 해당 데이터셋으로 만든 파인튜닝 모델은 목록 상단 근처에 기본 모델별로 그룹화되어 표시됩니다.

정확 일치(exact-match) 평가와 분류(categorization) 평가에는 별도의 레퍼런스가 필요하며, 모델 또는 공급자 후보를 사용할 수 있습니다.

<h2 id="read-live-results">
  실시간 결과 조회
</h2>

요청한 모든 행이 확정될 때까지 결과는 잠정적입니다. UI에는 다음 항목이 표시됩니다.

* 전체 행 대비 완료된 행 수
* head-to-head 참가자별 승, 무, 패 및 점수
* 실패한 행과 오류 메시지 요약(즉시 표시)
* 데이터셋 워크벤치의 행별 판정 결과

참가자를 추가하거나 설정을 변경하면 영향을 받는 작업만 다시 조정됩니다. 변경되지 않은 완료 사례와 재사용할 수 있는 모델 출력은 그대로 유지됩니다.

<h2 id="retries-and-failure">
  재시도 및 실패
</h2>

각 케이스는 최대 세 번까지 자동으로 시도됩니다. 이 한도에 도달하면 평가는 더 이상 재시도하지 않으며, 실패한 행이 남은 상태로 완료될 수 있습니다. 평가가 종료된 후 **Retry failed cases**를 사용하면 실패한 케이스만 포함된 새 배치가 생성됩니다. 이미 완료된 결과는 그대로 유지됩니다.

<Tip>
  공급자 모델과 파인튜닝된 모델을 비교할 때는 동일한 라우팅 매개변수를 사용하세요. 이미 프로젝트 대상으로 지정된 모델에는 일치하는 프로젝트 버전 중 가장 높은 버전의 매개변수 오버라이드가 자동으로 적용됩니다.
</Tip>

<Accordion title="API: 실패한 케이스 재시도 (POST /evals/{evalId}/retry)">
  평가가 종료될 때까지 기다린 다음, 실패한 케이스만 포함된 재시도 배치를 제출하세요. 완료된 결과는 보존됩니다.

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/evals/$EVAL_ID/retry" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team"
  ```

  생성 요청은 [Evaluations Quick Start](/ko/model-distillation/studio/evaluations-quickstart)를 참조하세요. 이 오퍼레이션에 대한 자세한 내용은 [실패한 평가 케이스 재시도](/ko/model-distillation/reference/management/evaluations/retry-failed-evaluation-cases)를 참조하세요.
</Accordion>
