workspace レベルのサマリー メトリクス、折れ線グラフ、ピン留めした run、またはベースライン run で run を比較するには、run のピン留めと比較 を参照してください。Eval Table は、ログされた表内の整列された examples と Eval Table 固有のスコアを比較します。
- プロジェクトの Workspace にアクセスします。
- Eval Tables パネルまでスクロールします。
- + ボタンを選択します。
- 追加する run を選択します。
input_columns を使用する場合、W&B はそれらの列を Inputs セクションにまとめて表示します。W&B は同様に、共有する output_columns と score_columns を Outputs セクションと Scores セクションにグループ化します。
次のスクリーンショットは、summer-butterfly-9 と gentle-flower-8 の run を比較する Eval Table を示しています:

参照 run を設定する
複数の run を比較する場合、W&B はデフォルトで一番左の run を参照 run に指定します。参照 run は、スコアの差分を計算する際のベースラインとなります。 別の run を参照 run にするには、対象の run にカーソルを合わせてメニューを開き、Set as reference を選択します。集計スコアを表示
W&B は、選択された各 run の各スコア列に対して集計値を計算します。計算はスコアのデータタイプによって異なります。
次のスクリーンショットは、correct と 信頼度 のスコアの集計値を強調表示しています。

スコアの差分を比較
各スコア列について、W&B は参照 run と選択された他のすべての run との差分を計算します。 W&B は各差分を次のように計算します。summer-butterfly-9 が参照 run で、gentle-flower-8 が比較 run であるとします。W&B は信頼度 差分 を次のように計算します:
正の差分は、比較 run の値が参照 run より高いことを意味します。負の差分は、値が低いことを意味します。
次のスクリーンショットはスコア 差分 を強調表示しています:
