> ## Documentation Index
> Fetch the complete documentation index at: https://docs.coreweave.com/llms.txt
> Use this file to discover all available pages before exploring further.

# 評価

> 安定した検証サンプルで出力を比較し、ライブで更新される暫定結果を把握します。

評価では、候補がユーザーの重視する project の動作を維持しているかどうかを確認します。評価には安定した検証行を使用し、エントリと参加者の組み合わせごとに永続的な結果を 1 つ保存します。

<Card title="最初の評価を実行する" href="/ja/model-distillation/studio/evaluations-quickstart" arrow="true">
  ヘッドツーヘッドの judge を使用して、ファインチューンを参照出力と比較します。
</Card>

<h2 id="evaluation-types">
  評価タイプ
</h2>

<Accordion title="ヘッドツーヘッド">
  judge モデルが、各候補の応答をプライマリの出力と比較します。テキストの完全一致では判定が厳しすぎる、自由形式の生成に適しています。スコアは `(wins + 0.5 × ties) / completed rows` で算出され、50% はプライマリと同等であることを示します。
</Accordion>

<Accordion title="完全一致">
  正規化されたアシスタントの出力を決定論的に比較します。等価な出力が同一になるはずの、構造化された回答や離散的な回答に適しています。
</Accordion>

<Accordion title="分類">
  ブール値フィールドを読み取り、適合率、再現率、F1、混同行列を報告します。候補の出力を読み取れない場合、適合率と再現率の両方が低下します。参照出力を読み取れない場合、その行はスキップされます。
</Accordion>

<h2 id="choose-participants">
  参加者を選択する
</h2>

ヘッドツーヘッド評価では、元の出力、リラベル run、チューニング済みモデル、プロバイダーのモデル (直接指定) を参加者として使用できます。最初の参加者がプライマリになります。データセットから作成されたファインチューンはリストの上部付近に表示され、ベースモデルごとにグループ化されます。

完全一致評価と分類評価では、別途リファレンスが必要です。候補にはモデルまたはプロバイダーを指定できます。

<h2 id="read-live-results">
  ライブ結果を確認する
</h2>

リクエストしたすべての行が確定するまで、結果は暫定値です。UI には次の内容が表示されます。

* 完了した行数と総行数
* ヘッドツーヘッドの各参加者の勝ち数、引き分け数、負け数、およびスコア
* 失敗した行と、エラーメッセージの即時サマリー
* データセットワークベンチでの行ごとの判定

参加者を追加したり設定を変更したりすると、影響を受ける処理のみがリコンサイルされます。変更のない完了済みのケースと再利用可能なモデル出力はそのまま保持されます。

<h2 id="retries-and-failure">
  再試行と失敗
</h2>

各ケースは最大 3 回まで自動的に試行されます。この上限に達すると評価は再試行を停止し、失敗した行を含んだまま完了することがあります。評価が確定した後に **失敗したケースを再試行する** を実行すると、失敗したケースのみを含む新しいバッチが作成されます。完了済みの結果はそのまま保持されます。

<Tip>
  プロバイダーのモデルとファインチューニングしたモデルを比較する場合は、同一のルーティングパラメーターを使用してください。すでに project のターゲットになっているモデルには、一致する project バージョンのうち最も上位のもののパラメーターオーバーライドが自動的に適用されます。
</Tip>

<Accordion title="API: 失敗したケースを再試行する (POST /evals/{evalId}/retry)">
  評価が確定するまで待ってから、失敗したケースのみを対象とする再試行バッチを送信します。完了済みの結果は保持されます。

  ```bash theme={"system"}
  curl --request POST \
    --url "https://distillation.training.wandb.ai/v1/evals/$EVAL_ID/retry" \
    --header "Authorization: Bearer $WANDB_API_KEY" \
    --header "Wandb-Entity: your-team"
  ```

  作成リクエストについては [評価 クイックスタート](/ja/model-distillation/studio/evaluations-quickstart) を参照してください。この操作の詳細については [Retry failed evaluation cases](/ja/model-distillation/reference/management/evaluations/retry-failed-evaluation-cases) を参照してください。
</Accordion>
