> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 評価 クイックスタート

> 参照出力と 1 つ以上の候補モデルをヘッドツーヘッドで評価します。

ヘッドツーヘッド評価は、テキストの完全一致では判定が厳しすぎる自由回答形式のタスクに適した出発点です。

<Note>
  始める前に、検証用の行を含むデータセットを作成し、比較するすべてのファインチューンまたはプロバイダーのモデルを追加してください。
</Note>

<Steps>
  <Step title="データセットの Evaluate タブを開く">
    **New evaluation** を選択し、**Head to Head** を選んで、評価に内容がわかる名前を付けます。
  </Step>

  <Step title="参照を選択する">
    元のデータセット出力またはリラベルされたデータセット出力をプライマリとして選択します。候補は、この望ましい動作を基準にスコア付けされます。
  </Step>

  <Step title="候補モデルを追加する">
    まずデータセットのファインチューンを追加し、次に比較するベースモデルやプロバイダーのモデルを追加します。ファインチューンは、選択画面でベースモデルごとにグループ化されます。
  </Step>

  <Step title="判定モデルを設定する">
    十分な性能を持つ判定モデルを選択し、このタスクで何をより良い回答とするかを定義する指示を記述します。十分な行がある場合は、検証用の 200 行から始めます。
  </Step>

  <Step title="実行して確認する">
    評価を開始します。行の処理が完了するにつれて、スコアが更新されます。個々の行を開いて判定理由を読み、失敗を示す表示からプロバイダーまたは解析のエラーを確認します。
  </Step>

  <Step title="デプロイするか判断する">
    スコア 50% は参照と同等であることを意味します。勝ちは 1、引き分けは 0.5、負けは 0 として計算されます。完了後のスコアと行ごとの動作がしきい値を満たした場合にのみ、プロモートしてください。
  </Step>
</Steps>

失敗したケースは最大 3 回まで自動的に再試行されます。run が落ち着いたら、**Retry failed cases** を使用すると、完了済みの結果を保持したまま、失敗したケースだけをキューに入れ直せます。

<Accordion title="API: 評価を作成する (POST /evals)">
  最初の参加者がプライマリです。候補のモデル参照を、評価するアーティファクトまたはプロバイダーのモデルに置き換えてください。

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/evals" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team" \
    --header "Content-Type: application/json" \
    --data "{
      \"name\": \"ticket-classifier-comparison\",
      \"dataset_id\": \"$DATASET_ID\",
      \"spec\": {
        \"type\": \"h2h_judge\",
        \"judge_model_ref\": \"openai/gpt-5.6-sol\",
        \"judge_prompt\": \"Choose the more correct and helpful answer. Return a tie when they are equally good.\"
      },
      \"participants\": [
        {\"kind\": \"original\"},
        {\"kind\": \"model\", \"model_ref\": \"wandb-inference/your-fine-tuned-model\"}
      ],
      \"sample_size\": 200
    }"
  ```

  応答には評価 ID が含まれます。評価が完了するまで `GET /evals/{evalId}` を繰り返し確認してください。詳しくは [評価を作成する](/ja/model-distillation/reference/management/evaluations/create-an-evaluation) を参照してください。
</Accordion>
