Skip to main content
ヘッドツーヘッド評価は、テキストの完全一致では判定が厳しすぎる自由回答形式のタスクに適した出発点です。
始める前に、検証用の行を含むデータセットを作成し、比較するすべてのファインチューンまたはプロバイダーのモデルを追加してください。
1

データセットの Evaluate タブを開く

New evaluation を選択し、Head to Head を選んで、評価に内容がわかる名前を付けます。
2

参照を選択する

元のデータセット出力またはリラベルされたデータセット出力をプライマリとして選択します。候補は、この望ましい動作を基準にスコア付けされます。
3

候補モデルを追加する

まずデータセットのファインチューンを追加し、次に比較するベースモデルやプロバイダーのモデルを追加します。ファインチューンは、選択画面でベースモデルごとにグループ化されます。
4

判定モデルを設定する

十分な性能を持つ判定モデルを選択し、このタスクで何をより良い回答とするかを定義する指示を記述します。十分な行がある場合は、検証用の 200 行から始めます。
5

実行して確認する

評価を開始します。行の処理が完了するにつれて、スコアが更新されます。個々の行を開いて判定理由を読み、失敗を示す表示からプロバイダーまたは解析のエラーを確認します。
6

デプロイするか判断する

スコア 50% は参照と同等であることを意味します。勝ちは 1、引き分けは 0.5、負けは 0 として計算されます。完了後のスコアと行ごとの動作がしきい値を満たした場合にのみ、プロモートしてください。
失敗したケースは最大 3 回まで自動的に再試行されます。run が落ち着いたら、Retry failed cases を使用すると、完了済みの結果を保持したまま、失敗したケースだけをキューに入れ直せます。
最初の参加者がプライマリです。候補のモデル参照を、評価するアーティファクトまたはプロバイダーのモデルに置き換えてください。
応答には評価 ID が含まれます。評価が完了するまで GET /evals/{evalId} を繰り返し確認してください。詳しくは 評価を作成する を参照してください。
最終更新日 2026年9月29日