Skip to main content
評価では、候補がユーザーの重視する project の動作を維持しているかどうかを確認します。評価には安定した検証行を使用し、エントリと参加者の組み合わせごとに永続的な結果を 1 つ保存します。

最初の評価を実行する

ヘッドツーヘッドの judge を使用して、ファインチューンを参照出力と比較します。

評価タイプ

judge モデルが、各候補の応答をプライマリの出力と比較します。テキストの完全一致では判定が厳しすぎる、自由形式の生成に適しています。スコアは (wins + 0.5 × ties) / completed rows で算出され、50% はプライマリと同等であることを示します。
正規化されたアシスタントの出力を決定論的に比較します。等価な出力が同一になるはずの、構造化された回答や離散的な回答に適しています。
ブール値フィールドを読み取り、適合率、再現率、F1、混同行列を報告します。候補の出力を読み取れない場合、適合率と再現率の両方が低下します。参照出力を読み取れない場合、その行はスキップされます。

参加者を選択する

ヘッドツーヘッド評価では、元の出力、リラベル run、チューニング済みモデル、プロバイダーのモデル (直接指定) を参加者として使用できます。最初の参加者がプライマリになります。データセットから作成されたファインチューンはリストの上部付近に表示され、ベースモデルごとにグループ化されます。 完全一致評価と分類評価では、別途リファレンスが必要です。候補にはモデルまたはプロバイダーを指定できます。

ライブ結果を確認する

リクエストしたすべての行が確定するまで、結果は暫定値です。UI には次の内容が表示されます。
  • 完了した行数と総行数
  • ヘッドツーヘッドの各参加者の勝ち数、引き分け数、負け数、およびスコア
  • 失敗した行と、エラーメッセージの即時サマリー
  • データセットワークベンチでの行ごとの判定
参加者を追加したり設定を変更したりすると、影響を受ける処理のみがリコンサイルされます。変更のない完了済みのケースと再利用可能なモデル出力はそのまま保持されます。

再試行と失敗

各ケースは最大 3 回まで自動的に試行されます。この上限に達すると評価は再試行を停止し、失敗した行を含んだまま完了することがあります。評価が確定した後に 失敗したケースを再試行する を実行すると、失敗したケースのみを含む新しいバッチが作成されます。完了済みの結果はそのまま保持されます。
プロバイダーのモデルとファインチューニングしたモデルを比較する場合は、同一のルーティングパラメーターを使用してください。すでに project のターゲットになっているモデルには、一致する project バージョンのうち最も上位のもののパラメーターオーバーライドが自動的に適用されます。
評価が確定するまで待ってから、失敗したケースのみを対象とする再試行バッチを送信します。完了済みの結果は保持されます。
作成リクエストについては 評価 クイックスタート を参照してください。この操作の詳細については Retry failed evaluation cases を参照してください。
最終更新日 2026年9月30日