最初の評価を実行する
ヘッドツーヘッドの judge を使用して、ファインチューンを参照出力と比較します。
評価タイプ
ヘッドツーヘッド
ヘッドツーヘッド
judge モデルが、各候補の応答をプライマリの出力と比較します。テキストの完全一致では判定が厳しすぎる、自由形式の生成に適しています。スコアは
(wins + 0.5 × ties) / completed rows で算出され、50% はプライマリと同等であることを示します。完全一致
完全一致
正規化されたアシスタントの出力を決定論的に比較します。等価な出力が同一になるはずの、構造化された回答や離散的な回答に適しています。
分類
分類
ブール値フィールドを読み取り、適合率、再現率、F1、混同行列を報告します。候補の出力を読み取れない場合、適合率と再現率の両方が低下します。参照出力を読み取れない場合、その行はスキップされます。
参加者を選択する
ヘッドツーヘッド評価では、元の出力、リラベル run、チューニング済みモデル、プロバイダーのモデル (直接指定) を参加者として使用できます。最初の参加者がプライマリになります。データセットから作成されたファインチューンはリストの上部付近に表示され、ベースモデルごとにグループ化されます。 完全一致評価と分類評価では、別途リファレンスが必要です。候補にはモデルまたはプロバイダーを指定できます。ライブ結果を確認する
リクエストしたすべての行が確定するまで、結果は暫定値です。UI には次の内容が表示されます。- 完了した行数と総行数
- ヘッドツーヘッドの各参加者の勝ち数、引き分け数、負け数、およびスコア
- 失敗した行と、エラーメッセージの即時サマリー
- データセットワークベンチでの行ごとの判定
再試行と失敗
各ケースは最大 3 回まで自動的に試行されます。この上限に達すると評価は再試行を停止し、失敗した行を含んだまま完了することがあります。評価が確定した後に 失敗したケースを再試行する を実行すると、失敗したケースのみを含む新しいバッチが作成されます。完了済みの結果はそのまま保持されます。API: 失敗したケースを再試行する (POST /evals/{evalId}/retry)
API: 失敗したケースを再試行する (POST /evals/{evalId}/retry)
評価が確定するまで待ってから、失敗したケースのみを対象とする再試行バッチを送信します。完了済みの結果は保持されます。作成リクエストについては 評価 クイックスタート を参照してください。この操作の詳細については Retry failed evaluation cases を参照してください。